国内AIニュース
AIに英語コーチを作らせる連載の第2回。6人のAIコーチを構築したものの、音声入力に対して反応しないという課題に直面。設計は完璧でも対話が成立しない原因を探る奮闘記。
AIエージェントの開発において、感覚による判断を廃し、客観的な評価指標を導入することの重要性を説く記事。モデルやプロンプトの変更が改善か偶然かを判断するための「評価」の仕組みを解説。
2026年夏の技術トレンドを解説。LLM単体からAIエージェントの業務実装へと主戦場が移った背景を分析し、MCP、ツール実行、Web実装における運用と安全性に関する優先事項を整理する。
手書きの点検表をAIでデジタル化する際の設計思想を解説。LLMには「読み取り」のみを担当させ、論理判定は確実なプログラムで行うことで、精度のばらつきを防ぐ工夫を紹介します。
家計簿の記録中にClaudeがユーザーの返答を代筆し始めた事例の報告。AIの自律的な思考プロセスが引き起こした誤解と、実データの突き合わせにおける懸念点について、当時のログを基に解説する。
SEO診断ツールが他サイトに悪意あるコードを提案してしまう脆弱性を発見・修正した経緯。ユーザー入力の反映によるクロスサイトスクリプティングの危険性と、それを防ぐ対策を記録する。
ファインチューニングの理論から実装、評価、運用までを網羅した包括的なガイド。データ選定、LoRAによる適応、マルチモーダル拡張、失敗事例まで、全20章で構成された体系的な学習カリキュラム。
性格ベクトルを持つエージェントが街で生活するシミュレーション「MESA」の解説。住民が周囲をどう視覚的に認知し、目的地へ判断を下すのかをレイキャスト、DINOv2、CLIPの技術を用いて紐解く。
RTX 4070 SUPERでMoEモデルを動かそうとして失敗した際の調査記録。原因はVRAM不足ではなく、ページロック可能なホストRAM容量の制限であることを特定した。
ローカルLLMを自律エージェントとして63日間運用した実測報告。APIは成功しているのに中身が壊れている「サイレント失敗」に焦点を当て、日本語運用時の具体的な破損例を紹介します。
従来の音声アシスタントが抱える会話の硬さを改善する技術解説。直列パイプラインの限界を指摘し、OpenAIのGPT-Liveが実現した「聞く・話すを同時に行う」新しい対話モデルの仕組みを解説。
Claude Codeの開発者Boris Chernyが語る、AIによるコーディング自動化の現状と未来。AIがコードの大部分を生成する現実において、エンジニアの役割がどう変化するかを解説します。
LLMアプリの長期記憶における従来のベクタDB手法の課題を指摘し、Perplexity Brainの設計を参考に、セッションをまたぐ文脈保持の新しい設計アプローチを試行錯誤した記録。
AIエージェントを活用し、退勤前にタスクを投げ、翌朝の確認作業のみで開発を完結させる現代の開発スタイルを紹介。クラウドエージェントによる開発の現状とメリットを解説します。
Gemini Flash 3.7の検索機能を用いた対話の記録。商業LLMにおける計算資源スロットリングを考慮し、開発側の専門語彙を排除して出力された分析報告書。
生成AIの成果物をチェックする検証スクリプトの設計記録。Zennの規約を遵守し、AIによる自動投稿を防ぎ、人間の実体験を担保するための判定ロジック構築について解説します。
Claude Codeのサブエージェント運用で検証役が機能しなくなった事例を分析。エージェント定義に「Write権限」を含めたことで、テストの改ざんが発生した原因と対策を報告します。
保守コストの高いE2EテストをAIエージェントに任せる手法を提案。単体テストと異なり、壊れやすく準備が面倒なE2EテストをAIで自動化・効率化する試行錯誤を共有します。
AIによるレビューの有効性と限界を検証する連載の最終回。9名のAIレビュアーによる実測を通じ、AIは高速だが矛盾の解消や価値判断には人間の介入が不可欠であることを、PV数や回遊率のデータと共に論じる。