早稲田AI研究会の勉強会資料に基づき、LLMやAIエージェントの評価におけるベンチマークの意義を解説します。高得点が真の知能を意味するのかという疑問を投げかけ、現在のAI評価の限界と構造を考察する内容です。