国内AIニュース
AIエージェントと生成AIの違いを解説する記事。生成AIがコンテンツ生成を主な役割とするのに対し、AIエージェントは目標達成まで自律的にタスクを実行できる点が決定的な違いである。両者の仕組みや使い分けの重要性を説く。
自動化ジョブの信頼性を高める設計手法。プロセス終了(exit 0)を成功の証とせず、入力・処理・公開結果を分離して状態管理することで、障害分析を容易にする運用方法を提案。
Dart & Flutter MCPサーバーを活用したFlutter開発の効率化を紹介。AIがアプリ状態の把握やanalyzeエラーの修正を自動で行うためのセットアップと活用手順を解説。
ドキュメントが形骸化する原因を「変更への追従」と「把握の限界」と分析。コード自体を正とする考え方への移行や、AIによるドキュメント管理の再構築という解決の方向性を提示。
RAG評価における既製フレームワーク(RAGAS、DeepEval、TruLens)と自作評価手法の比較検証結果。誤答の検出精度では自作手法が勝る一方、原因診断では既製フレームワークが優れた結果を示しました。メトリクスの使い分けや評価設計の最適化を検討するエンジニアに向けた実測レポートです。
ChatGPTやClaudeを使用して、英語論文を日本語で正確かつ迅速に読み解くコツを紹介。一括翻訳の失敗例を挙げ、専門用語や文脈を維持するための効果的なプロンプト手法を伝授。
日々進化するAIモデルのリーダーボードやベンチマークは、実際の業務での使用感と乖離を感じることがあります。本記事では、Claude、Gemini、ChatGPTを業務で並用する筆者が、2026年夏時点での実務的視点から、これら3つのAIモデルの得意・不得意を、独自の体感に基づきスナップショットとして比較・解説します。
AIモデルの真偽を検証する研究「One Token Is Enough」を解説。APIで指定したモデルが実際にその通りかを確認するため、1トークンの出力分布を利用してモデルを指紋認証のように特定する手法を紹介する。
Palantir Foundryを物理データから逆引きでドメインモデルを構築する手法として捉え、AIエージェントとの相性の良さを論じる。PostgresとClaude Agent SDKを用いた実務的な実装アプローチを紹介する。
AIによるコーディングで個人アプリを1時間で作成できるようになったが、「動く」ことと「公開して安全」であることは別問題です。サポートエンジニアとして現場を見てきた筆者が、AI生成コードをセキュリティ監査した結果、致命的な脆弱性が複数発見された事例を紹介し、公開前の監査の重要性を説きます。
Claude Codeで複数のセッションを同時に走らせる際、モノレポやDevContainerよりも「git worktree」を使うのが最も安価で効率的という結論に達しました。macOS環境を想定し、並行開発におけるディレクトリ管理の最適解として、なぜworktreeが壊れにくいのか、その構築手法を解説します。
AIサブエージェントを最大6並列させ、人間がコードを書かずに12日でフリーランスマッチングサービスを本番リリースした事例。本稿では、AI開発が破綻しなかった技術的な設計思想に焦点を当てます。人間チームの当たり前をルール化し、AIに徹底させるプロセスの重要性を詳解します。
Cloudflare Accessはゼロトラスト型のアクセス制御サービスです。インターネット公開サービスの手前に配置することで、アプリ側に認証機能がなくてもアクセス制限が可能。今回はブラウザ利用と並行して、サービストークンを用いたアプリ間通信も許可する「サービス認証」の実装方法を紹介します。
グラフエンジニアリングの次に来る概念として「判定エンジニアリング」を提唱。長年製造業で培われてきた検査工程のノウハウを応用し、判定基準の作成や誤判定時の記録、判定精度の管理という工学的なアプローチを、AI開発における「判定」設計に応用する考え方について解説します。
Oktaが2万社以上の匿名化されたアクセスデータを調査し、企業におけるAIツール利用実態を公開した。調査によると、企業内でのAIツール導入が進む中、Anthropicの利用成長率が最も高い結果となった。
AIエージェントOSSを読み解く連載の第10回。今回は学習型エージェント「Agent0」に焦点を当てます。第7章までの内容を前提に、Agent0が単なる実行エージェントではなく「訓練フレームワーク」であることを、実際のソースコードとプロンプトを引用しながら解説し、エージェント作成の基礎を養います。
AIエージェントの自動コード生成で発生したABORT(自動中断)の原因を調査した体験記。当初はAIの挙動を疑ったが、振り返りを通じて真因が自身の設計や環境設定にあったことを突き止める過程を詳解します。AIエージェント運用の反復やエラーに悩む開発者へ向けたトラブルシューティングの知見です。
Appleのコンテナ技術における実測値と特性を解説。コンテナ1つにつきVMが立ち上がる仕組みや、Dockerと比較した際の起動速度、ボリュームの制限など、既存のDocker Compose代替として使用する場合の設計的な不利点と注意点を、実測データをもとに分析・考察します。
Claude Agent SDK開発でClaude Pro認証を活用する際の注意点を共有。個人開発やPoCにおいてコストを抑えつつ開発する際に直面する「知っておくべき落とし穴」と、業務エージェント開発の実践的な知見を解説する。
AIのPoC失敗の原因の多くは評価指標の解釈不足にある。RAGを題材に「指標の定義」「計測」「解釈」の3要素に分解し、事業判断へつなげるためのインクリメンタルな評価・開発手法を提案する。