国内AIニュース
TypeSafe AIが公開した「Jev」は、文章生成をしないAIモデル。設問に対し確率でマークを返すため、安価かつ高速に構造化データを出力可能です。コストは100万トークンあたり$0.042と非常に低価格です。
LLMのSkill選択を、実行LLMではなく専用のJevに任せることで、LLMの入力を効率化できるか検証。LLM方式とJev方式で同じ依頼文を用いて比較実験を行い、その結果を整理しました。
AIエージェントの会話が後半に進むほどエラーが減るという説を検証。約1万件のログを分析した結果、一見改善しているように見えるグラフは、エラーの多いセッションが早期終了していただけのバイアスだと判明しました。
AIコード納品時のリスクを防ぐ、品質ゲートの3条件。機械的な再現、境界確認、秘密保持の観点から、受託開発現場で確実に納品レベルへ引き上げるための現実的な手法を解説します。
TypeSafe AIが提供する新しいAIモデル「Jev」について解説。テキストを生成しない独自のモデルとして注目されており、Cloudflare Workers AIでの利用方法や仕様の詳細を紹介しています。
AIによるコード生成が普及した現代において、DDD(ドメイン駆動設計)をどう再定義すべきかを考察。コード生成の価値が変化する中で、人間が維持すべき「Truth Asset」の重要性を説いています。
個人開発におけるLLM APIのコスト管理術を紹介。すべてのリクエストに高性能モデルを使わず、タスクに応じてモデルを使い分けることで、品質を維持しながらコストを削減する手法をまとめました。
判定と確率のみを返すAIモデル「Jev」を模したシステムをGoogle Cloud上で3方式構築し、8,453回の試行で検証しました。結論として、低遅延なモデルは精度が低く、高精度なGemini 3.8 Flashはコスト面で大きな課題があることが判明。また、曖昧な表現が含まれるだけで人手なしでの自動処理率が急落する現実も浮き彫りとなりました。
OpenAIの軽量モデル「gpt-6-luna」を検証。コストは半分ですが、リーダーボード上の正答率は前モデルより低いとの報告も。実際に動画編集の台本作成で比較検証を行い、結論を導き出しています。
AI企業で求人が増えている職種「FDE(Forward Deployed Engineer)」について、その役割を考察。従来のSEやERPエンジニアとの違いを6つの疑問を通じて深掘りした個人の調査記録です。
広告動画のAI生成における評価指標の混乱を避けるヒント。台本・声・映像などの要素を一度に変えず、要素ごとに分けて検証・調整することで、効率的に広告候補を作成するフローを紹介します。
著者が初めてLLMに触れた際の実体験を綴ったエッセイ。SFのような知性とは程遠い「確率的な計算機」であるという現実に直面し、AIの本質や可能性について再考する深い考察となっています。
GitKrakenのAxosoftがAI利用実態レポートを公開。開発者の生産性向上は実感されているものの、その具体的な効果測定における難しさが浮き彫りとなりました。開発現場でのAI活用と定量的な評価手法が問われています。
Excelマクロが作成者以外に理解不能なブラックボックス化することは保守の大きな課題です。AI活用による保守効率化に挑んだ企業の事例を通じて、技術的負債を解消し、属人化を防ぐための具体的な解決策を探ります。
AIコーディングツールで接続先変更が反映されないトラブルを防ぐ手順。設定後の確認方法や、クライアントごとの挙動の違い、問題の切り分け方法についてOfox運営チームが解説します。
2026年9月リリースの「Claude Opus 5.5」について、初級者目線で解説。Claude Codeとの違いや使い分け方など、Anthropicの公式情報を基に分かりやすくまとめています。
トランプ米大統領は国連総会で、AIを「Super Intelligence(SI)」と呼称変更し、公文書でも採用すると発表。国際的な管理枠組みを拒否し、地球温暖化論争になぞらえ脅威論を一蹴。AI開発競争での主導権を強調しました。
Andrej Karpathy氏が提唱する「LLM Wiki」パターンをSpec Kitで実装する手法の紹介。プロジェクトへの導入事例を交え、LLMを活用した知識管理の効率化について解説します。
Agent Flowの概念とUnity環境での実装事例を紹介。Agent FlowとはAIエージェントが自律的に計画・実行・評価・再計画を繰り返し、目標達成を目指す仕組みです。外部からの課題に対し、ループ構造を構築して目的を果たすまでのプロセスを解説します。
Claude Codeの利用時に生成される各種ログやトークン情報の保存場所を徹底調査。クレジット、エラー、会話内容、動作、コンテキストの5つの観点から、1回のセッションでどのようなデータがファイルへ書き込まれるかを検証し、運用の最適化を目指します。