国内AIニュース
OpenAIのweb_search機能を使っても出典が明記されない問題に対し、プロンプトの微調整で改善する手法を紹介。モデルはツールを渡されていても使わない場合があるため、指示を具体化して正解の質を高める工夫を解説します。
2026年7月21日のパッケージリリースにより、Microsoft Agent Frameworkの「ハーネス(HarnessAgent)」が実験的機能から安定版へ昇格しました。本記事ではその変更点と概要を解説します。
自作Rust製推論エンジンでllama.cppとPPLが乖離する問題を追跡。単一のバグではなく、評価順序や削減順序など「計算経路の違い」が原因であることを特定し、実装におけるLLM推論の複雑性を論じる。
LLMの回答品質を左右する「プロンプト」の役割を解説。魔法の呪文ではなく、AIへの「仕事の依頼書」として捉えることで、情報の整理や回答形式の指定がいかに重要かを専門知識なしでも理解できるよう構成しています。
ローカル環境でLLMを実行・管理できるツール「Ollama」の導入ガイド。インターネット接続なしでの利用が可能で、データプライバシーを保護しつつ様々なモデルを試せるOllamaの特徴とインストール方法を解説します。
AIの普及により、専門外のスキルを低コストで補うことが可能になりました。「自分には無理」という諦めが「試してみよう」という挑戦へ変わり、エンジニアがバックエンドの修正を行ったり、PdMがバグを特定・修正したりする事例が増えています。自身の専門分野をAIに任せ、領域を広げるメリットについて、読者へ同様の変化があるか問いかけています。
ByteLevelのハイブリッドモデル「H-Net(Mamba+Transformer)」が提案されました。英語や中国語での学習実績があるモデルですが、著者は日本語メインでの学習に挑戦しようとしています。ByteLevelモデルへの関心と、最新のMambaアーキテクチャへの理解を深めることが目的です。日本語特有の文字体系における課題と実装への試みが記されています。
2026年「AI事業者ガイドライン」第1.2版に基づく、AIエージェントの安全性設計指針。人間の判断介在(HITL)を実装へ落とし込むための技術的アプローチを解説。
2025年施行の「AI推進法」全28条から、エンジニアが読むべき3条を厳選。法律、ガイドライン、自社実装を紐付けるための法的知識と一次ソースの取得方法を解説。
Amazon Bedrockで一般提供されたGPT-5.6 Sol、Terra、Lunaの利用手順を紹介。AWS公開の実践手順を基に、最新モデルの活用法を解説する。
日本語業務スキル(SKILL.md)の効果を実測。社内規程QAや議事録作成において、スキルを定義することでモデルの出力品質や期日誤り率がどう改善するかを数値で検証。
SB IntuitionsのOCRモデルをApple Silicon(MLX)へ移植した際の技術的知見を共有。モデルアーキテクチャの混成構造と、自前実装のポイントを解説。
Anthropicが推奨するコンテキスト処理パターンを、ローカルLLMで比較検証。TODO統合タスクにおける「full」vs「パターン適用」の実時間と正答率の実測結果。
主モデルの出力を監督モデルが再検査する「二段構成」の効果を実測。監督の選び方によって品質が向上する場合と低下する場合があり、適切な選択と自己検査の有効性を解説。
存在しない漫画の1コマbotのキャラクター「狐鳴紺子郎」が、ワンダーフェスティバル2026夏で立体化されました。狐耳や忍者など多数の属性を盛り込んだキャラクターの造形が会場で公開されました。
金融時系列モデルの精度を左右するラベル設計について解説。特に固定ホライズンのリターン予測など、不適切な設計がモデルに与える悪影響を考察します。
バイブコーディングの高速実装を維持するための設計手法を解説。GitHub Issueを用いたタスクの細分化と計画策定について提案します。
Microsoft Agent Framework v1.14.0で正式提供された「HarnessAgent」の機能を検証し、API変更への対応方法を紹介します。