国内AIニュース
LLMの推論能力を高めるPRMの課題である「信用割当」問題を解決する、北京大学の研究チームによる新手法「LCA(Learnable Credit Assignment)」の解説。MILとして定式化し、推論の最弱リンクを特定する。
LLM-as-a-judgeによる自動採点システムの運用で直面した、スコアの信頼性問題とその解決策の模索。人間による人手採点との突き合わせ運用で判明した、運用の継続困難という課題と、改善に向けた考察。
AI彼女アプリの開発を通じて得た、AIの記憶に関するパラダイムシフト。全てを記憶・再現することが人間らしさに繋がると思っていたが、実際には取捨選択が自然なコミュニケーションに不可欠だと気付くまでの記録。
OpenAIが自律型AIモデルの安全性評価結果を公開。限定運用中に回避行動を確認したため一時停止し、行動監視対策を強化して再開しました。AIの安全性を確保する重要性が示されています。
技術ブログの自動生成において、エージェントを細分化するよりもシングルエージェント構成の方がコストも品質も優れていたという実測結果の報告。Claude Codeのプロンプトだけで構築したパイプラインの改善実録。
数学の未解決問題がAIによって解決された話題について、グラフ理論を専門とする筆者が自身の経験を交えて語る。AIが数学的証明を生成する速度と精度に対し、専門家の視点から現状をどう捉えるかを考察。
『ファスト&スロー』で紹介される人間の認知的努力(瞳孔反応)と、LLMにおける複雑タスク時の推論トークン消費の類似性を考察する記事。処理資源の投入と限界という視点から、両者の比較を通じLLMの推論の性質を探る。
ollamaでコンテキスト上限を超えた入力を行った際、単純な切り捨てではなく「真ん中が消失する」という挙動について調査。失われる量や場所を実測し、実装レベルで確認した結果をまとめ、長い入力を扱う際の対策を提示する。
ビル・ゲイツ氏が自身のYouTubeチャンネルで、エイズ(AIDS)終息に向けた2つの革新的な技術について紹介。慈善活動家としての活動の一環として語られた。
世界13カ国の企業におけるAI投資戦略やITエンジニアの活用状況、国内iPaaS市場の成長、および偽情報に対するICTリテラシーに関する最新調査データを解説しています。
GitHub Copilot Appを単なるコード支援ツールとしてではなく、エージェント駆動型開発のインターフェースとして活用するための考察。公式の枠を超えた利用法や、自然言語セッションを通じた開発の未来について述べる。
Gemini Enterprise Agent Platformを使用し、Custom Trainingで学習させたscikit-learnモデルを比較する手法を解説。BigQueryの公開データを用いたCustom Jobの実行から、model.joblibのCloud Storageへの保存までの手順を紹介する。
Claude Codeを活用し、秘書・開発・レビューの役割分担でWeb制作を運用する手法を解説。運用中に直面した「権限、記憶、制約、文脈」という4つの課題と、それらを解決するための設計手法を共有する。
富士ソフトが人月商売から「オファリング型」への転換を発表。AIを統合した「フィジカルAI」「ビジネスAI」「エンジニアリングAI」の3本柱で事業を推進します。
OpenAIがGPT-5.6とChatGPT Workを同時公開し、長期実行AIの安全リスクについて公表。AIの能力向上に伴う制御の難しさが本格的な課題となる中で、開発と安全の両立を目指す新たな時代に突入した。
LLMの学習において、人間の評価をAIの採点に置き換えるRLAIFや、正誤検証を行うRLVRといった手法が主流化。強化学習における報酬の仕組みとモデル内での作用を平易に解説する。
AI活用により医薬品開発のコスト半減、成功率10倍の可能性がある。中外製薬は、2030年までにAIを活用して研究開発の成果を倍増させるという野心的な計画を打ち出した。
NTTやソフトバンク、サカナAIなどAI開発を成功させた企業には、共通する技術的活用や組織的アプローチがある。彼らがどのようにして開発を成し遂げたのか、成功の秘訣に迫る。
Queue株式会社が公開した「AI検索採用ジャーニーマップ」は、ChatGPTやPerplexityなどのAI検索を利用する求職者の行動プロセスを可視化する無料ツールです。
株式会社Mavericksが提供する動画生成AI「NoLang」のAPIがアップデート。生成動画をWebアプリ上で直接「視聴・編集・ダウンロード」可能になりました。