生成型報酬モデル(GRM)が強化学習(RL)で期待ほどの性能を発揮できない問題を解決する手法「RRC」を紹介する記事。GRMの持つ比較性能を維持しつつ、RLに必要なスカラー報酬へ変換する仕組みとして、同一プロンプト内の順位やアンカー応答を利用する手法(SCR・AGR)を解説します。