LLMのツール使用能力を測る合成ベンチマークと実務の乖離について。T1〜T3のタスクで満点を取るモデルでも、複雑な複数工程の実装タスクでは失敗することがある。ベンチマークが「単発の呼出能力」しか測れていない実態を指摘。