LLMアプリの本番環境における性能低下の原因は、デモ用評価と本番用評価の乖離にある。作り手が無意識に得意なサンプルを選ぶデモと、多様な入力を扱う本番環境の評価設計の違いを指摘し、実践的な評価構築の考え方を提示する。