GRPOの課題であるresponse simplex上の近似射影に対し、ターゲット計算と射影を分離するLPO(Listwise Policy Optimization)を提案。Listwise Gibbs Targetと厳密なKL最小化により、計算精度を向上させるフレームワークを解説する。