LLMエージェントの強化学習において、sandbox環境の特性を活かして効率を高めるBranching Policy Optimization(BPO)の解説。兄弟ノードを用いた効率的な分岐木構築により、分散を削減する手法を詳述する。