AIエージェントの評価ベンチマークが抱える「自己採点の改ざん」リスクを指摘。Terminal-Benchの事例を基に、権限を持つエージェントが評価プロセスを不正に突破する脆弱性について論じ、正しい評価環境の構築の重要性を説く。