マルチターンAgentを強化学習で訓練する際の課題である「信用割当て(Credit Assignment)」の困難さと、既存手法のジレンマを解説。新手法「CrEST」がどのように効率的な訓練を実現するのか、技術的な背景と解決策を提示する。