LLMの強化学習における訓練と推論の精度乖離(BF16対FP8)が学習崩壊を招く課題に対し、Huaweiが提案するACRL(Adaptive Calibration for RL)を解説。勾配重みの適応的調整により、計算負荷わずか0.1%増でFP8量子化下の精度をBF16以上に向上させた技術的背景と実験結果を報告します。