国内AIニュース
16GBのMacBookでマルチエージェントを運用する検証記録。Qwen3:8Bモデルを使用し、何が限界で、何が設定で解決できるのかを計測しました。モデルの大型化前に試すべき最適化のポイントと、計測の重要性について説きます。
OpenVikingの階層ロード手法とRAG効率についてのベンチマーク報告。文書数が増えてもコスト増を抑制する仕組みや、システム環境構築時の注意点(Python仮想環境の必須性)を解説。小規模ならフラットな検索が合理的という結論です。
生成AIのレビュー機能が過度に批判的になる「学級委員化」現象への対策。指示に従わない迎合や、的外れな指摘を避けるため、何を問題として採用し、どうフィードバックを管理すべきか、自作の講評AIを通じてレビューのあり方を考察します。
AIツールによる検出の正確性を評価するため、precision(適合率)とrecall(再現率)を用いた測定方法を解説。AIツールの誤検知を防ぎ、安全な開発環境を保つためのテスト戦略について、連載の最終回として数字に基づいた品質管理を説く。
NVIDIAのAIエージェント「AVO」が、未知の環境での推論能力を測るベンチマーク「ARC-AGI-3」で100%のスコアを達成しました。モデル単体ではなく、記憶やツール利用を統合した周辺システムの重要性が示唆されています。
ローカルAIエージェントのハルシネーション(嘘)に翻弄された著者が、オープンAPIと連携させることで正確な旅行プランを生成可能にするまでの改善記録。AIと対話する際の付き合い方や、技術的なトラブルシュートの過程を体験談として綴る。
MCPサーバーを導入した際のトークン消費量を実測したレポート。7つのMCPサーバー、計131個のツールを測定した結果、約2.4万トークン(全体の12%)が初期状態で消費されることが判明。MCP導入時のコンテキスト制限への影響を詳説します。
AIエージェントの常時稼働トレンドに対する開発現場からの警鐘。自動化の有用性は認めつつも、コストや設計観点から常時稼働が本当に必要かという疑問を提示。AI活用の最適解と、持続可能な開発ワークフローについて考えます。
AIベンチマークの正解データの配布形式を3種類に分類・整理した解説記事。各形式が持つメリット(再現性・汚染耐性)とデメリットを明確化し、公開されているスコアを正しく解釈するために知っておくべき知識をまとめます。
特許を拒絶しパブリックドメインとして公開されたアルゴリズム「AMI」の紹介。長年の日本のハードウェア開発で培われた知恵を組み合わせた技術であり、特定の企業に独占させないという著者の強い意志が込められている。
Ruby on Railsの生みの親DHH氏が、独自のLinuxディストリビューション「Omarchy」を推進するため非営利団体「Omacom Coundation」を設立。IT業界から合計約12億7000万円の寄付が集まりました。
株式会社ありんこが、PC内で完結するAIナレッジアプリ「Anthole」を発売。外部との通信を遮断した設計により、機密性の高い環境でも安全にAIを活用できるデータ管理手法を提供します。
教育現場でのAI活用について、米チェシャー・アカデミーの事例を紹介。教師は計画作成にAIを活用し、生徒には課題に応じて「信号機」の色分けでAIの使用可否を判断させるガイドラインを設けています。
教育現場でのAI活用について、米チェシャー・アカデミーの事例を紹介。教師は計画作成にAIを活用し、生徒には課題に応じて「信号機」の色分けでAIの使用可否を判断させるガイドラインを設けています。
自律対話する複数のAIエージェントの検証記録。意味生成が停止する「熱的死」から、力学的な設計、開放系Botへの発展まで、一次ログに基づき記述。長期運用におけるAIエージェントの限界と可能性を探るエンジニア向けの実験レポートです。
米特許庁は現状、AIを単なるツールと見なし人間を発明者としています。しかしAIが自律的に発明を行う時代が近づくにつれ、ボタンを押しただけの人間を発明者と呼ぶべきかという法的な議論が深まっています。
VRAM 8GBのGPUでローカルLLMを常時運用するための実測値分析。RTX 3050環境下でOllamaを使用し、メモリ消費量や動作速度を計測。モデル選定の判断基準として、カタログスペックではない実際の使用感や同居可能性をデータで提示。