LLM推論のポストトレーニングにおいて、GRPOの代替手法としてEvolution Strategies(ES)の有効性を実証。ESはPass@1は劣るものの、Pass@Kで一貫してGRPOを上回り、エントロピーコラプスや破滅的忘却を防ぐ。パラメータの劇的な変化にもかかわらず機能的スパース性により性能を維持する、効率的な学習手法の可能性を示した。