国内AIニュース
公開したOSS診断ツールにおいて、低評価の回答が重なっても高スコアが出てしまう挙動を分析。設問設計の難しさと、AI導入現場における現実的な評価のあり方を考察する。
自動運転技術を手掛けるWaymoが、2023年10月から続いていたUberとのロボタクシー提携を解消する方向で調整中です。両社の今後の戦略転換や市場への影響が注目されています。
AIが生成する「もっともらしい間違い」を防ぐ手法を解説。自身の思い込みでAIを見逃さないための、人間とAIによるクロスチェック体制(執筆AIと検収AIの分離)の重要性を説く。
Claude Codeの「--effort」パラメータによるコードレビュー品質の違いを検証。9個の既知バグを含むコードを使い、思考レベルの変化がバグ検出率にどう影響するかを実証する。
Opus 5リリースに伴い、AIコーディング環境の運用を刷新。モデルの使い分け場所を「セッション単位」から「オーケストレーター内の選択箇所」へ移した実例と判断基準を記録する。
AI活用による1年間の成果(映画制作、講師、イベント運営等)を紹介。単なるツール利用にとどまらず、多分野でのアウトプットを実現するAI活用の考え方と実績を公開する。
AIオーケストレーションツールTAKTを用い、モデルの強度(高・中・低)がコストや収束速度に与える影響を検証。実装とレビューでの最適なモデル配分についての実証結果。
Claude Code、Cursor、GitHub Copilotを活用するための指示設計フレームワーク。成果を出すための5原則と、そのまま使える実践テンプレート10選を紹介。
AIとの協働時代を見据えて設計された実験的研究言語「Jacquard」の紹介。人間のレビューを前提とした設計思想と、AI生成コードに対する新しいアプローチを解説。
SWE-benchなどの従来のベンチマークは最終的なコードの正確性のみを評価するが、実際のAI開発では対話による修正回数が重要となる。開発体験との乖離を埋めるため、修正のプロセスを評価する対話型ベンチマークの重要性を解説する。
AIエージェントがツール利用で誤動作する原因は、モデルの能力不足ではなくツールの説明文(description)の不備にある。エージェントに社内APIなどを安全に使わせるための、正確な実行条件の定義方法を解説する。
筆者が長年考えてきた「意識」に関する仮説を整理した記事。頭の中の「私」という語り手の正体を探求し、記事の最後ではAIエージェント120体を用いた、この仮説を検証するための実験について紹介する。
自己学習する開発環境を作るシリーズの第3回。AIレビューの指摘を資産化し、次回以降のミスを減らすための手法を解説。スキル定義ファイルやサブエージェントを活用し、開発プロセスを自動化・効率化する仕組みを紹介する。
Google DeepMindのGemma 4 E2B(通常版・QAT版)をローカル環境で実行し、Pythonから比較実験した記録。QAT版の小型化と回答精度の両立を検証し、ローカルLLM活用のためのプログラムを紹介する。
AIコーディングツールによる開発速度向上と、自身のコードへの理解度低下というパラドックスを考察。AIに丸投げすることの弊害を指摘し、コードの構造を把握し続けるための知見を40年前の論文を引用しつつ探求する。
VTuber事務所「ハコネクト」に所属する明堂しろねが、北米最大の特化型コンベンション「OffKai EXPO」に出演することが決定しました。海外の大型イベントへの出演を通じ、VTuberとしての新たな活動の場を広げます。
2026年7月にリリースされたClaude Opus 5の性能とコスト効率について考察。Claude Maxの新たな主力モデルとしての位置づけや、デバッグ・根本原因分析能力に強みを持つ特性を解説し、AIエージェント開発への影響を分析する。
AIネイティブ開発への移行によるQCD(品質・コスト・納期)の変化を、直近2週間の実測データに基づき報告。「人間が書きAIが補助する」体制から「AIが自走する」体制へ移行したことによる、具体的な生産性の改善効果を分析する。
Microsoftが2026年初頭に実施したGitHub Copilot CLIとClaude Codeの大規模導入に関する実態調査を解説。数万人規模のエンジニアがAIエージェントをどう活用したか、導入効果と実際の利用データから得られた知見を紹介する。
「AI Dev Day 2026」のイベントレポート。大手町で開催された当イベントから、特に「AIエージェントをチームにどう浸透させるか」というテーマに焦点を当て、現場でのAI活用のバラつきや実践的な導入手法について解説する。