国内AIニュース
LLMと人間の能力の違いを考察。高いタスク遂行能力を持つAIに対し、人間特有の「自律的な問題発見」や「目標設定」の重要性を説き、将来的なAIエージェントの役割と限界について論じる。
低ビット量子化されたLLMの性能評価における落とし穴を指摘。トークン生成速度の向上だけでなく、推論に必要なトークン数が増加する「Token Inflation」のコストを考慮した評価の重要性を説く。
RAGの中核となるEmbeddingとベクトル検索について解説。キーワード検索では捉えきれない意味的な類似性を実現する技術の仕組みと、自社データ活用における利点を実装視点で紹介する。
オープンウェイトLLMで日本語業務プロンプトを実走した際に発生した出力崩れを修正する手法を検証。壊れた9本のプロンプトに対し、アドバイザー役による修正や構造化プロンプトの利用など3つの方法を試し、修正成功率の違いを測定しました。
JTCで企画職として働く著者が、エンジニアの視点を学ぶために個人開発を始めた経緯を語ります。システムやコードの実装をエンジニアに依存する中で抱いた「作る側の苦悩や面倒事を本当に理解できているか」という問いを通じ、企画者と実装者の相互理解の重要性に迫るエッセイ。
OpenAIの新モデル「GPT-6 Astra」に採用された「再帰的深さ(recurrent depth)」技術を考察。従来のTransformerが層を一度ずつ通すのに対し、同一層をループさせて深く考える仕組みが、テスト時計算量(Test-Time Compute)をスケーリングさせる次世代AIの鍵となる。
AIの自己改善ループを実運用する際に発生する「泥臭い現実」に焦点を当てる。設計段階では見えにくいログ管理やエラーの蓄積といった、実装後に突き当たる3つの課題と対処法について解説する。
中古のTesla V100 32GBとDGX Sparkの推論速度を比較検証。生成速度は同等ながら価格差は8倍以上という結果が出た。検証はLLMに推論サーバ構築から測定まで実行させ、そのログを基に結論を導き出している。
OpenAIのAPIキー不正利用により1日で約270ドルが消費された被害体験。警告メールを8日間放置した反省点や、鍵削除後も15分間リクエストが通り続けた仕様について共有し、APIキー管理の重要性とセキュリティ対策の教訓を伝える。
Claude Fable 5.1の性能を、QAエンジニアの視点で検証。観点作成や多文書読解の精度を従来モデルと比較し、実測データを用いてモデル差し替えによる影響を評価する。
チームに導入した常駐AIエージェントが直面する「コールドスタート問題」への対処法。履歴データのない導入初日から、いかにチームの言語や役割を理解させるかを整理する。
ローカルLLMの推論速度に影響を与える5つの要素を解説。PrefillとDecodeの仕組みから、KV Cache、量子化、Runtime、Speculative Decodingまでを網羅。
PowerShellからLLM APIを叩いた際に発生した「413 Payload Too Large」の解決録。原因はPowerShellのGet-Content仕様による意図しないデータ付与にあった。
Azureネイティブスタックを用いたハイブリッドRAGと、過去のNeo4j×LangChain構成を比較検証。Azure AI Searchのセマンティックランカーやチャンク分割手法を駆使し、設備保全ナレッジベース構築におけるシステム性能や構成上の最適解を探る。
AIコーディングエージェントの提案を「黙って断る」ことで生じる機会損失を分析。3.7ヶ月分のClaude Codeの提案ログを分類し、採用されなかった提案がなぜ繰り返されるのか、開発者がフィードバックを記録する重要性と改善策を提示する。