AIモデルの劣化が噂される現状に対し、単なるサンプリング誤差と実証的な能力低下の境界線を議論。「ペリカンテスト」などの高度な空間理解を問うテストを軸に、モデルの性能評価を定量化する方法を検討し、主観に頼らないAI能力の測定における課題と、開発における本質的な検証の必要性を論じる。