国内AIニュース
「Jev」は文章を生成せず、構造化された選択肢の判定に特化した「GPU」のようなAIモデルです。従来の巨大LLMとは一線を画すそのアプローチと、なぜエンジニアから注目を集めているのかという新しいパラダイムについて解説します。
Sionic AIが開発した日本語埋め込みモデルが検索ベンチマークで1位を獲得。EUREKAプロジェクトを通じて、言語やドメインに依存せず、あらゆるクエリから知識へ正確に到達できる普遍的で頑健な検索モデルを目指す取り組みを紹介します。
LLMによるブログ運用を自動化し、さらにBlueskyへのSNS告知も無人化した事例。LLMが出力した数値が実データと合致するかを照合するチェック機能を組み込むことで、作り話や誤情報を防ぎつつ、効率的に運用する仕組みを解説します。
米スタートアップTypeSafe AIが発表したAIモデル「Jev」が注目を集めています。従来のLLMとは異なり、文章生成を行わず判断に特化した新たなモデルの概要とLLMとの違いを解説します。
巨大SQLの運用におけるLLMの限界を指摘し、Snowflake特化型の決定論的オプティマイザ「icepick」を開発した事例。AST操作により、コードの可読性を保ちつつ安全にクエリを最適化する手法と、その開発背景を解説します。
Claude Codeを用いたPRレビューで、意図せず高額なAPIコストが発生した事例を分析。250行程度の差分で約6,000円分が消費された原因を究明し、トークン消費を抑えて効率的に高精度なレビューを実行するための設定とプロンプト術を解説します。
自作の育児記録アプリ「Osewa」に、Jevを用いた予測機能を追加し、次の授乳予定時刻を自動表示させる仕組みの実装報告。AIによる予測を日々のルーチンに組み込む工夫を解説する。
LLMによる採用スクリーニングで「必須条件」と「面接可否」を混同すると優秀な人材を取りこぼす。Jevを用いた型付き判定と、しきい値分岐を用いた実験結果と知見をまとめる。
Claude Codeによる自動コーディングの手戻り改善のため、コード読み取り役をGeminiへ変更した個人開発の実践録。プラグイン運用の仕組みと、トークン消費の最適化手法を解説する。
Decoder-only Transformerの効率化に不可欠なKV Cacheについて、tensor形状とメモリ管理の観点から解説。実装時の概念整理に役立つ基礎知識をまとめた。
LLMの判定結果をJSONで受け取る際の後始末を不要にする、Jevの仕組みと利点を解説。文字列生成ではなくキーと確率を返すAPIの特徴と実用的な活用法をまとめる。
AIにコードを書かせるとコード量が増え続けるという体感に対し、実際の編集履歴を調査。1,041回の編集のうち89.6%が増加方向であり、増分が減分を大きく上回っていることが数値で証明されました。
Vertex AIのGen AI Evaluation Serviceを用いたLLMの品質評価手法を解説。評価方式の違い、カスタムルーブリックの実装、CIへの組み込み方を網羅する。
TypeSafe AIが公開した新モデル「Jev」について、従来のLLMとの違いや活用方法を解説。自然言語の意味をコード上の条件分岐やスコアとして処理する「System One model」としての特徴に注目します。
Jevを用いた投稿モデレーション実験の報告。自動判定の精度と人手確認の効率を分析し、見逃しリスクを考慮した本番採用における判断基準と注意点をまとめた。
TypeSafe AIの「Jev」は、生成AIチャットとは異なる「判断用モデル」という新たなカテゴリのモデルです。コード内に組み込み、自然言語を判定処理の部品として活用する新しい手法を提案しています。
LLMの実行環境を比較する連載の第2回。PC環境でのモデル実行速度を実際に評価するためのツール「HomeBench」の使い方と、事前判定ツールとの使い分けについて詳しく解説します。
VPNサービス「Tailscale」で発生していた不安定な動作の原因が、SQLiteに16年間存在したバグであったことが判明しました。Tailscale社は調査過程でこの不具合を発見し、SQLiteコミュニティへの貢献に至った経緯をブログで公開しています。
AIペルソナを活用した投票行動シミュレーションが、沖縄県知事選の当選者の得票率を誤差0.1ポイントで再現することに成功しました。AI技術を用いた選挙予測の精度と可能性を示しています。
画像生成AIの制御ミスを防ぐため、State Machineを活用して進行を管理する手法を解説。AIの「完了した」という自己申告を信用せず状態遷移で厳密に制御する方法を説く。