長CoT強化学習における報酬配分問題に対し、トークン単位の信用度を再定義する手法「CSCR」が提案されました。従来の均等分配の不備を指摘し、推論の正否に直結するトークンを特定することで、モデルの推論能力向上を目指す研究グループの成果です。