AIエージェントの安全性評価実験における計測手法の重要性を解説。480回の試行で有意差なしという結論に至る過程で、計測プログラムのバグにより誤った有意差を導き出す危機に直面した体験談。LLMの安全性評価にはモデルそのものより、計測側のロジックの正当性を担保する慎重さが不可欠であると説く。