国内AIニュース
履歴書生成UIにおける状態管理の設計メモ。事実確認、職種提案、承認などのプロセスを「生成ボタン」に集約せず、各ステップを個別の状態として分離することで、修正と検証を容易にするアーキテクチャを提案。
AIアプリの設計を「意見統合型」から「主体が回答し副体が検算する型」へ変更した事例。対照実験の結果、統合するより後から指摘させる方が精度が高いというデータが得られたため、設計を反転させている。
AWSインフラ構築におけるAIと人の役割分担を解説。IaC生成やコスト最適化はAIで効率化し、IAM権限設計や障害復旧の最終判断は人が担うという、現場で実践可能な運用の基準を明確にします。
Sakana AIがオーケストレーション型モデル「Fugu Max」「Fugu Ultra v2」をリリース。複数のAIモデルを束ねる構成で性能と価格の最適化を実現する。
3名のエンジニアがAIエージェントを使い同じリポジトリを開発した110日間の記録。AGENTS.mdによる規約管理の限界と、成果物要件と検証手順の重要性を、1,572コミットの実績データから分析。
AIの出力を評価・修正するための「監督力」を養う学習法。基礎知識なしではAIのバグを見抜けません。AIをパートナーとして動かし、目的の成果物を生み出すための構造的思考と判断力の重要性を説きます。
デザイン業務におけるAI活用の基準を解説。要件の壁打ちや実装補助など地味なタスクにAIを活用し、情報の優先順位や意思決定は人間が行うという使い分けの哲学を共有する。
仕様書をテストコードに変換可能な形式で記述する手法。自然言語の依頼からテストケースの集合となる仕様を生成・編集するSkillの活用により、仕様書とテストコードの不一致を解消し、継続的な検証を自動化します。
コードとドキュメントの乖離問題を解決するため、LLMを用いて両者の差分を自動検出し、仕様の劣化を防ぐ手法を導入した。担当者交代時のコスト削減や、最新ドキュメントの維持管理方法について解説する。
AIエージェントの性能を測るため、実際の企業プライベートコードベースを用いた新しいベンチマーク指標「Real-SWE」を紹介。実社会の複雑なコードに対してもAIが機能するのかを検証する。
LangChainを用いたエージェント実装の入門ガイド。LLMにツールを持たせ、外部情報を検索・計算させる実践的な手法を、ReActパターンの解説やPythonコードとともに解説する。
Claude Codeの「Skill」をプロンプトと呼ぶことへの違和感を整理する記事。Skillを「自然言語で書いたコード」や「手順書」と定義し、責務に応じて設定を分割する現代的なプロンプト設計を提案する。
AIエージェントに外部ツールを繋ぐ標準プロトコル「MCP」を個人環境で導入するのは容易だが、組織で運用する場合のセキュリティや権限管理の難しさを考察する。エージェントが何を参照し、何を操作すべきかというガバナンスの課題について論じている。