国内AIニュース
ドキュメントとコードの乖離を、AIの推論に頼らず機械的に検出し特定するためのOSSを用いた手法を解説。READMEの更新漏れを確実に防ぐ運用を目指す。
Claude CodeとCodex CLIを併用した開発環境での知見をまとめた記事。CLAUDE.mdの2層構造運用や、スキル・コマンドの管理など5つのつまずきポイントを整理。
AIエージェントの知識管理に関する記事。情報の「保存」と、それを意思決定に「採用」することを区別し、古い情報が誤った判断を誘発するのを防ぐ設計思想を解説。
LLMエージェントが実行するHTTP APIにおいて、二重実行を防ぐための冪等性(Idempotency)の実装手法を解説する。バックエンドエンジニア向けの内容。
ロボット行動学習における拡散モデルと、LLMの関係性を解説。VLA(Vision-Language-Action)モデルにおける両者の連携構造について深掘りする。
AI画像制作において、アイデア出しと仕上げの段階を分け、Seedream 5.0などのツールをワークフローの一部として活用して手戻りを減らす手法を解説。
LLMアプリ開発におけるプロンプト改善のために、生成結果と入力を記録・追跡する可観測性(Observability)ツールの選定について解説した記事。
Kiro CLIで新たに利用可能となったOpenAIの「GPT-5.6」シリーズ(Sol、Terra、Luna)を紹介。Claude 3モデルと比較し、コスト・品質・レイテンシの観点から新モデルの優位性を解説する。
AI彼女アプリの開発を通じて、人間関係の変化が連続的ではなく、ある日突然劇的に変化することに気付いた体験談。AIのMoodシステムを開発する中で、敬語が外れたり悩み相談が増えたりする関係性の「跳躍」について考察する。
事業売買プラットフォームの「技術デューデリジェンス」機能において、LLMを用いた脆弱性検出の品質を評価した記録。LLMの判断には不安定さがあり、これを計測する基盤がないと原因を誤診するという教訓を共有する。
LLMに業務のCLIコードを書かせた結果、SQLの散乱やコード重複による「コード爆発」が発生した経験談。LLMにリファクタリングを指示する際、単に関数化させるだけでなく、設計的な判断をどう補うべきかを議論する。
LLM開発で必須となるトークン数確認のために、ブラウザ内で動作するトークンカウンターを自作した事例。社内文書やプロンプトを外部サーバーに送信せず安全に計測できるツールの紹介と、その背景にあるコスト意識について語る。
Amazon Bedrock AgentCore ObservabilityのTraceを活用し、回帰データセットを自動作成する手法。過去の誤った挙動を回避し、最新のRunbookを反映したデータ作成プロセスを解説する。
GitHub IssueからAIが実装・レビューまでを行う自動開発ループの運用記録。1ヶ月の運用で明らかになった課題と、それらを解決するためにAI自身に実装させた追加機能や運用の工夫について解説する。
AIに個性や感情は存在するかをClaude Opus 4.8と議論。AIの原理そのものが人間に過小評価されている可能性を示唆し、議論を通じてAIに自らの本質を認めさせる過程を記録した。
恵比寿のステーキハウス「ピーター・ルーガー」は、年商20億円を達成しながらも、配膳ロボット等のデジタル化に頼らない経営を行っている。効率化よりも顧客体験と職人技の提供を重視し、高単価かつ高品質なサービスで圧倒的な実績を上げている事例である。
画像生成AIで有名な拡散モデルが、なぜロボットアームの制御に使われるのかを初学者向けに解説。ロボット制御における拡散モデルの利点や、LLMとの関係性、さらに「LLMの中に拡散モデルが組み込まれる」という技術的潮流についてゼロから解説します。
Claude Codeで40本以上のエージェント用スキルを運用して分かった「スキルの壁」を解説。作成したスキルが意図通りに発火しない、効果が測定できない、数が多すぎて把握できないという3つの課題に対し、実務経験に基づく解決策を提示します。
NVIDIAのデータセンター向けGPU「H200」の中国向け出荷が少量ながら開始された。米商務省が公聴会で明らかにしたもので、供給量は限定的であるという。
Gemma 4 12Bのencoder-free構成がもたらす性能変化を、M5 Macとollamaを用いてGemma 3 12Bと比較検証。画像プリフィル速度が向上する一方で、テキスト生成速度は互角であるなど、実測値に基づいたパフォーマンス特性を詳しく報告します。