GPT-2-likeからQwen2-likeへのモデル構造変更実験の第4回。今回はMulti-Head Attention(MHA)をGrouped Query Attention(GQA)へ変更した際の検証結果を報告します。モデルサイズは4.47%軽量化されましたが、学習速度には予想外の変化が見られました。