国内AIニュース
LLMの出力品質がモデルやバージョンにより変動する「flaky」な性質への対処法を考察。モデル固有のチューニングに頼るのではなく、揺らぎを前提として外部に品質を担保する仕組みを構築することを推奨する。
AIの自律駆動(Level 5)を阻むのは知能ではなく、自己欺瞞的なテスト通過にあると説く。これを防ぐために、数学的不変量などを活用した「動的観測網」による二重チェックの仕組みが重要だと主張する。
ChatGPTの登場以来、AIへの期待と懐疑論が入り混じっています。著名エンジニアのダン・ルー氏が、AI懐疑論者エドワード・ジトロン氏の主張を検証し、AIの未来と没落予想の是非を紐解きます。
GPT-2からQwen2へ構造を近づける実験の第2回。活性化関数をGELUからSwiGLUに変更した際の学習時間と精度の変化を検証。LossやTop-1正解率が改善する一方で、学習時間が増加するというトレードオフを報告します。
NVIDIA CMP 170HXとTesla V100 PCIe 32GBを用いて、llama.cppでのLLM生成速度を実測比較。メモリ帯域の差が生成速度に与える影響を検証し、理論値と実測値の相関を報告する技術レポート。
AIの6軸採点サービス開発の過程で発生した、指示に従わないという不具合の事例。業務用プロンプトのように詳細に制約を設けると、かえってAIのスコアが低下する「プロンプトの罠」を解説する。
Claude Codeのskillsを活用し、AIを「仮想社員」としてチーム運用する実験記録。作業ルールを再利用可能な形式で管理し、リサーチから校閲までのプロセスを定型化する手法を解説する。
GMOペパボにおける、Claude TeamプランでのArtifact共有の課題を解説。組織をまたぐ公開がインターネット全公開しか選べない制限に対し、セキュリティを維持しつつ業務効率化を図るための知見を共有する。
AIエージェントの推論の無駄と不安定さを解消する「Agents Want to Compile」という概念を解説。毎回ゼロから推論するのではなく、結果を固定化・コンパイルすることで効率化と安定化を図る手法を提案する。
AIエージェントの出力コードにおけるセキュリティと品質を向上させるための「Context Engineering」や「AI Guardrails」について解説。ルールを事前組み込みする際のコンテキスト消費と精度のトレードオフというジレンマに焦点を当て、効果的な設計戦略を考察します。
量子コンピュータにおける重要な計算手法「量子位相推定(QPE)」の基本原理を解説。Qiskitを用いた実装手順を通じて、制御ユニタリ演算から固有値(位相)を抽出するプロセスをコード例と共に具体的に紹介します。
Claude Codeの制限モード導入により自作スキルが認識されなくなる問題の原因と対策を解説。設定ファイルの権限範囲やスキルの配置場所を確認し、ツールやスキルの実行が制限された状況を正常に復旧させる手順をまとめました。
Tesla V100 32GBを用いたLLMのMoE/Denseモデル動作検証。2017年登場のVolta世代における量子化形式への対応状況や、メモリ帯域が生成速度に与える影響をLLM自身が実験・報告した技術ログ。
AI検索のPerplexityが推薦する情報の信頼性が問われています。調査の結果、引用元の約60%が知名度の低いドメインであり、特定の運営元による大量生成コンテンツが推薦に組み込まれている可能性が判明しました。
AmazonのスマイルSALEにて、iPhone Air 512GBモデルがセール対象となっています。参考価格212,800円から17%オフの176,300円で販売中です。
AIツールの評価に関する考察記事。デモ環境でのテストと実際の業務運用におけるギャップに焦点を当て、導入検討時に考慮すべきコスト、ワークフロー適合性、データセキュリティ等の重要課題を解説。
KaggleのAIセキュリティコンペに挑んだ記録。最終結果345位で銅メダルを獲得した知見を共有。Private Leaderboardでの順位変動や、ヘッジ案を用意していた戦略が功を奏した経緯を振り返る。
MicrosoftがAI導入を加速させる中、Office責任者がAIによって生成された質の低いコンテンツの急増に警鐘を鳴らしました。Project SolaraやClaude for Wordなど新展開と並行した課題です。
AI時代に注目される「アート思考」の定義や実践方法、効果の研究結果を整理した図解26ページの資料が無料提供されています。国内外の事例を網羅した内容です。
VRAM 12GB環境で27Bモデルを動かす際の最適な層数(-ngl)設定に関する検証。従来想定されていた「全層搭載」が必ずしも最適ではなく、特定の層数で処理速度が大幅に向上する現象を実測値で示す。