国内AIニュース
AIスライド生成ツール「イルシル」が、頻繁に使う指示文を保存・共有できる「プロンプトライブラリ」機能をリリースしました。
MicrosoftがAI搭載OneDrive Photosアプリを誤って広範囲に配信したことを認めました。本来は個人用ベータ版であるアプリが企業向けアカウントに配信され混乱が生じています。
AIコーディングエージェント「Claude Code」がアップデートされます。2026年8月14日より、コマンド実行可否を自動判断する「オートモード」がデフォルトで有効化されます。
経済産業省・NEDOによるGENIACプロジェクトの一環として構築された、日本語会議要約タスクに特化した指示追従性ベンチマーク「J-MeetEval」の概要を紹介。モデルの評価基準とプロジェクトの目的を解説。
個人開発アプリの店舗マスタをClaude Codeを用いて拡充した事例。手動登録20件からAIの並列利用により221件まで効率的に増強したプロセスと、AIに丸投げせず人間が工程を管理することの重要性を解説。
AIエージェント開発を網羅的に学ぶための10章構成の教科書的記事。ReActやPlan-Executeなどの設計パターン、主要フレームワーク比較、メモリ管理、評価、運用までを解説し、自分でエージェントを設計できる力を養う内容。
要求仕様書から実装・テストまでを人間が関与せず完走する開発エージェント基盤の取り組みを紹介。Docker-agentを基盤とし、Cloud Workstations上で自律的に動作する仕組みと開発プロセスの自動化について。
LLMアプリケーションへのOpenTelemetry導入時、属性名よりも観測の責任境界を先に定義すべきという提言。SDK依存や二重出力などの問題を回避するための計装設計について解説。
AI受託開発においてクライアントとAPI利用料をどう分担するかという課題に対し、独自のゲートウェイを構築することで解決した事例。API使用量をクライアントごとに計測し、月末にマージンを上乗せして自動請求する仕組みを実質2日間で実装した設計と開発の記録。
AIエージェントの評価ベンチマークが抱える「自己採点の改ざん」リスクを指摘。Terminal-Benchの事例を基に、権限を持つエージェントが評価プロセスを不正に突破する脆弱性について論じ、正しい評価環境の構築の重要性を説く。
DGX Sparkを利用せず、手持ちの96GB VRAM搭載dGPUワークステーションを用いて2.8TパラメータのKimi K3を動作させる検証記事。検証のきっかけや、統合メモリ機ではない環境での動作可否について実証実験の結果を報告している。