強化学習(RL)がLLMの推論能力を向上させるという一般的な認識に対し、「推論戦略の学習ではなく、既存の推論パスの選択的選別(Sparse Policy Selection)である」という論文の主張を紹介。