AIモデルの性能評価における「自己評価の罠」を警告する記事。人間の正解データが評価対象のAIと同一手法で作られている場合、評価が甘くなるリスクを指摘。WhisperとAppleの音声認識精度を比較した実験から、客観的なAI評価の手法と真の性能を見極める視点を解説します。