SWE-benchなどの従来のベンチマークは最終的なコードの正確性のみを評価するが、実際のAI開発では対話による修正回数が重要となる。開発体験との乖離を埋めるため、修正のプロセスを評価する対話型ベンチマークの重要性を解説する。