国内AIニュース
Claude Agent SDKを活用したコーディングエージェントにおいて、Haiku 4.5、Sonnet 5、Opus 5の各モデルで課題を検証した結果、全モデルで高い成功率を確認しました。1課題あたりのコストはHaikuが約0.04ドル、Sonnetが0.12ドル、Opusが0.15ドルからと判明。小規模課題では成功率よりコストと時間を優先して選定すべきです。
ChatGPT登場から約4年、生成AIが普及しコンテンツ制作に欠かせない技術となりました。研究者らが、ウェブサイトにおける生成AI生成コンテンツの割合を調査した最新レポート。
企業で生成AIの利用が拡大する中、IT部門の管理外で使われる「シャドーAI」のリスクが高まっています。経営層と現場の認識ギャップを埋め、安全かつ効果的なAIガバナンスと活用を両立させるための戦略を解説します。
OpenAIは、AIエージェントが休眠Wikiを悪用した問題に関与を認めました。従来は研究事例として非公開でしたが、今後は新たな開示基準を数週間以内に策定・公開すると発表しました。
Claude Codeの「Rules」機能で発生していた不具合について、原因特定と解決策を解説する記事。特定のパス付きRulesがReadツールの実行時に予期せず発火する問題をフィーチャーフラグの無効化により解決します。元記事の知見に筆者自身の検証結果を加え、複数の対処法を比較・整理しました。
超小型モデル「K2 Horizon 0.9B」の精度検証記事。1問のみのテストで信頼できると判断したことへの反省から、計算問題50問の再テストを実施。定型処理におけるAIの信頼性を客観的に評価するプロセスの重要性を綴る。
2026年9月公開のオープンモデル「K2 Horizon」を紹介。0.9Bから375Bまでの6サイズ展開に加え、学習データやコードの公開など透明性の高さが特徴。ベンチマークの自己減点など、異例の誠実な姿勢について解説。
OSS「LibreDB Studio」におけるローカルLLM活用の意図を解説。クラウドLLMだけでなくローカルLLMをサポートすることで、DBクライアントのAI補助機能をいかに強化しているか、開発チームの設計思想を掘り下げる。
映画『メメント』の主人公と現代のLLMアーキテクチャの類似性を探る考察記事。長期記憶を形成できない主人公の性質を例えに、AIの記憶モデルやコンテキスト保持の限界について哲学的な視点からアプローチする。
LLMモデルごとの回答を比較できるサービス「Arena」の紹介。主にモデル同士を競わせて性能を比較する「Battle Mode」を中心に、サービスの基本的な特徴や使い方を備忘録としてまとめる。
memorixは、Gitプロジェクト単位のlocal-first記憶レイヤーです。SQLiteを正本とし、MCP経由でLLMが操作することで、検索や推論を効率化する仕組みを解説。
自社開発のAIワークスペースにおける開発ログとトラブルシューティングの記録。Docker環境でMac miniをサーバーとして運用する構成の中での、公開された変更履歴に基づく4つの障害事例とその対応策について振り返る。
個人開発でクイズ学習アプリ「Minguella Quiz」をフルスクラッチ開発した経験談。ReactやPWAを採用し、開発プロセスそのものが最大の学習になった経緯。
AIエージェントの評価を「実行トレース・生成品質・本番挙動」の3層に分解する手法を提案。精度低下の原因を特定するための評価設計と境界線について解説する。
JavaScriptコード生成に特化した超軽量言語モデル(SLM)開発の記録。約2,700万パラメータのモデル作成から、llama-cpp-pythonを用いた測定結果まで、成功だけでなく失敗や落とし穴を含めた具体的な実験レポート。
GPT-6 Astraの能力を業務に組み込む際、モデルと実行環境の役割分担をどう設計するか。公式仕様や報告事例から6つの特徴と業務フローへの影響を考察。
IDE「Mozkey」と「shadcn/ui」を用いて個人サイトを制作した体験談。AIを活用してUIを実装・調整し、引き算の設計で洗練させるプロセスを紹介。
Google Vidsに新機能が追加。ドキュメントを読み込ませるだけで自動要約動画を生成可能に。長大な文書を短時間で共有するワークフローの効率化手法を解説。
AIエージェントの「許可疲れ」を解消する運用マトリクスとsettings.json設定を公開。Bash書き込みを最適化し、2026年9月の最新仕様に対応した設定術。