OpenAIの「Path to Astra」で言及されたExploitBenchを用いたセキュリティ評価について解説。二値判定では測れないLLMの脆弱性検知の難しさと、評価結果の多様な質を理解するための重要性を論じる。