マルチターンエージェントの強化学習における、スパース報酬の帰属問題(クレジット・アサインメント)を解決する手法「AgentOPSD」を解説。Critic不要の再帰的自己蒸留により、決定的なターンを特定し、log-odds空間で信念を更新する技術について論じる。