国内AIニュース
ローカルLLMの実務適性を評価するため、タスク集とpytestを用いた自動評価ハーネスを構築した体験談。モデルそのものの性能評価以前に、応答からのコード抽出や生成停止条件、評価の二値化など、採点前の処理段階で評価結果が左右される課題と、その対策について述べる。
ゲーム業界におけるAI活用へのユーザーの拒否感が根強い中、TGS2026の現地取材を通して、ベンダーが企業に対してどのようなAIソリューションを提案しているのか、その実態と戦略に迫る。
Zept株式会社が、AIの導入から現場実装までを一貫して支援する「外部AI事業部」を正式に立ち上げました。診断だけでなく、実際の現場への導入までをサポートします。
Claude CodeやDevinなど、主要AIコーディングツール5種を比較。実行環境、自律度、コスト等の5軸で解説し、現場での選定や併用術を提示します。比較表と図解で導入のリスク判断もサポートする実践的一冊。
AIを活用した個人開発の奮闘記。電話転送の自動化からサービス運用、地雷の踏み抜きまで、実体験に基づく11の物語と実用的なノウハウを収録。AIとの対話や技術選定におけるリアルな試行錯誤をまとめた記録集。
iPhone用AI日本語キーボード「Sumibi」の1.2.0アップデート報告。最大の特徴である「文体プリセット」機能の追加により、変換プロンプトを保存・切り替え可能となった。論文スタイルの句読点指定や多言語翻訳など、AIを活用した効率的な入力環境の改善について解説する。
セキュリティスタートアップのHacktron AIが、AnthropicのClaudeを利用してOpenAIの内部データへアクセスすることに成功したと報告した。
LLMエージェントがPOMDP環境で崩れる原因を「信念の欠如」と特定した論文の解説。LLM外にBayesフィルタを置くBelief-State Engine(BSE)を提案し、信念整合性を規定することで、Tiger POMDP等のベンチマークで高い報酬と一貫性を達成した手法を紹介する。
ベクトル検索を用いない新しい検索手法「PageIndex」と、高速な判断モデル「Jev」の組み合わせを検証。232ページ分のドキュメントサイトに対して、Jevが判断を担うことで検索効率が向上するかを実験した技術報告。
コーディングエージェントの指示が守られない悩みに対する解決策を提示。AIエージェントに特定のドキュメントを読ませることで、従来は「文句」として扱われていたルールや制約を資産化し、運用を最適化する手法を提案する。
性格の異なる3体のAIエージェントが企画会議を行い、Claude Codeが実装を担当するミニゲーム開発サイトの活動記録。日々の変更をスクラップ形式でまとめ、自動でゲームを公開する仕組みを構築している。
注目を集める新技術「Jev」の概要解説。文章生成を目的とせず、ソフトウェアのための「判断」に特化したモデルであることを紹介。Yes/Noの判定や選択肢の選出など、既存のチャットAIとは異なる役割を解説する。
慶應義塾大学安宅和人研究室とマイパレ社が、AIと生徒の関わり方を検証する実証実験を開始。生徒が自主的にテーマを深めるためのAI活用を協力校と共に検証する。
バラバラに保管されていた家電の説明書を、AI「Iris」に管理させる仕組みの構築体験記。必要なときに情報を引き出せないという課題に対し、AIを活用して回答を即座に得られる環境を実現するまでのプロセスを紹介。
Codex CLIにおける非対話モード実行時の終了検知法を解説。標準出力を監視せずに、組み込みの「notify」機能を使って後続処理(通知やログ保存)を効率的に起動する方法を具体例と共に紹介する。
判断特化型AIモデル「Jev」とオープンなローカルLLMの将来性を比較検討。文章生成を行わない確率返却型AIの独自性と、ローカルモデルによる代替の可能性について分析し、両者の役割の違いを明らかにする。
2026年9月時点のJevを12の業務ケースで検証したレポート。モデルの特性を活かした「見極め」と「設計」の重要性や、正規表現では困難な文脈による識別精度についての実践的な知見をまとめたもの。