Alibabaが提案する新RLアルゴリズム「GSPO」を解説。GRPOが抱えていたtokenレベル重要性比の統計的不備を、シーケンスレベルの評価へと変更することで、訓練の不安定さと崩壊を根本的に解決する手法。