DPO(直接選好最適化)の仕組みを解説。報酬モデルやPPOを用いず、chosen/rejectedの対比較からモデルを直接更新する方法を説明する。token単位のcross entropyではなく、policyとreference modelのlog probabilityを用いる実装の要点を整理。