国内AIニュース

LLMの生成コードをpytestで自動採点する——ハーネスは採点の手前で3回壊れた
Zenn LLM 中級 5日前 約1分
ローカルLLMの実務適性を評価するため、タスク集とpytestを用いた自動評価ハーネスを構築した体験談。モデルそのものの性能評価以前に、応答からのコード抽出や生成停止条件、評価の二値化など、採点前の処理段階で評価結果が左右される課題と、その対策について述べる。
東京ゲームショウと生成AI ゲームの祭典で商談見込むベンダーたち
ITmedia AI+ 中級 5日前 約1分
ゲーム業界におけるAI活用へのユーザーの拒否感が根強い中、TGS2026の現地取材を通して、ベンダーが企業に対してどのようなAIソリューションを提案しているのか、その実態と戦略に迫る。
診断だけでは終わらせない。Zept株式会社、AI活用課題を現場実装する「外部AI事業部」を正式ローンチ
ASCII.jp 中級 5日前 約1分
Zept株式会社が、AIの導入から現場実装までを一貫して支援する「外部AI事業部」を正式に立ち上げました。診断だけでなく、実際の現場への導入までをサポートします。
AI開発エージェント使い分けガイド 2026 — Claude Code・Devin・Codex・OpenClaw・Pencil の選び方
Zenn AI 中級 5日前 約1分
Claude CodeやDevinなど、主要AIコーディングツール5種を比較。実行環境、自律度、コスト等の5軸で解説し、現場での選定や併用術を提示します。比較表と図解で導入のリスク判断もサポートする実践的一冊。
AIにコピペさせるだけでOK!読む必要なし!電話受付AI【CiS】 構想~実装・修正・発展の過程
Zenn AI 入門 5日前 約1分
AIを活用した個人開発の奮闘記。電話転送の自動化からサービス運用、地雷の踏み抜きまで、実体験に基づく11の物語と実用的なノウハウを収録。AIとの対話や技術選定におけるリアルな試行錯誤をまとめた記録集。
日本語入力システムSumibiの開発 part24: iPhone版Sumibi 1.2.0で「文体プリセット」を追加しました
Zenn LLM 入門 5日前 約1分
iPhone用AI日本語キーボード「Sumibi」の1.2.0アップデート報告。最大の特徴である「文体プリセット」機能の追加により、変換プロンプトを保存・切り替え可能となった。論文スタイルの句読点指定や多言語翻訳など、AIを活用した効率的な入力環境の改善について解説する。
ハッカーがAnthropicのClaudeを使ってOpenAIに侵入
GIGAZINE 上級 5日前 約1分
セキュリティスタートアップのHacktron AIが、AnthropicのClaudeを利用してOpenAIの内部データへアクセスすることに成功したと報告した。
見えないものを信じる──BSEがLLMエージェントにPOMDPの最適性保証を取り戻す仕組み
Zenn LLM 上級 5日前 約1分
LLMエージェントがPOMDP環境で崩れる原因を「信念の欠如」と特定した論文の解説。LLM外にBayesフィルタを置くBelief-State Engine(BSE)を提案し、信念整合性を規定することで、Tiger POMDP等のベンチマークで高い報酬と一貫性を達成した手法を紹介する。
Jev で文書検索を作る、PageIndex 風の木探索と総当たりの比較
Zenn AI 上級 5日前 約1分
ベクトル検索を用いない新しい検索手法「PageIndex」と、高速な判断モデル「Jev」の組み合わせを検証。232ページ分のドキュメントサイトに対して、Jevが判断を担うことで検索効率が向上するかを実験した技術報告。
Jev で AI と快適にコミュニケーションする試み
Zenn AI 中級 5日前 約1分
コーディングエージェントの指示が守られない悩みに対する解決策を提示。AIエージェントに特定のドキュメントを読ませることで、従来は「文句」として扱われていたルールや制約を資産化し、運用を最適化する手法を提案する。
AI討論 MAGI Games 開発記 #1 — 性格の違うAI3体に毎日ケンカさせてミニゲームを作らせる
Zenn AI 入門 5日前 約1分
性格の異なる3体のAIエージェントが企画会議を行い、Claude Codeが実装を担当するミニゲーム開発サイトの活動記録。日々の変更をスクラップ形式でまとめ、自動でゲームを公開する仕組みを構築している。
文章を生成しないAI「Jev」とは? 100ms級で判断する"System One Model"
Zenn AI 中級 5日前 約1分
注目を集める新技術「Jev」の概要解説。文章生成を目的とせず、ソフトウェアのための「判断」に特化したモデルであることを紹介。Yes/Noの判定や選択肢の選出など、既存のチャットAIとは異なる役割を解説する。
生徒が自分のテーマを楽しみながら自走できるようになるには?慶應義塾大学 安宅和人研究室とマイパレ社、AIの「関わり方」の違いを検証する実証実験の協力校・生徒を募集
ASCII.jp 入門 5日前 約1分
慶應義塾大学安宅和人研究室とマイパレ社が、AIと生徒の関わり方を検証する実証実験を開始。生徒が自主的にテーマを深めるためのAI活用を協力校と共に検証する。
「あの家電の説明書、どこだっけ」をIrisに聞くだけにした話
Zenn AI 入門 5日前 約1分
バラバラに保管されていた家電の説明書を、AI「Iris」に管理させる仕組みの構築体験記。必要なときに情報を引き出せないという課題に対し、AIを活用して回答を即座に得られる環境を実現するまでのプロセスを紹介。
codex execの完了をnotifyで検知する: 効く設定・効かない設定
Zenn AI 中級 5日前 約1分
Codex CLIにおける非対話モード実行時の終了検知法を解説。標準出力を監視せずに、組み込みの「notify」機能を使って後続処理(通知やログ保存)を効率的に起動する方法を具体例と共に紹介する。
JevはローカルLLMに代替されていくのか?
Zenn AI 上級 5日前 約1分
判断特化型AIモデル「Jev」とオープンなローカルLLMの将来性を比較検討。文章生成を行わない確率返却型AIの独自性と、ローカルモデルによる代替の可能性について分析し、両者の役割の違いを明らかにする。
Jev を試す前に決めること──12 ケースの検証で見えた、モデルの精度より時間を使ったもの
Zenn AI 上級 5日前 約1分
2026年9月時点のJevを12の業務ケースで検証したレポート。モデルの特性を活かした「見極め」と「設計」の重要性や、正規表現では困難な文脈による識別精度についての実践的な知見をまとめたもの。