GPT-2 Smallモデルを用い、累計50億トークンの学習による性能変化を検証。25億トークン学習済みのモデルに対し、さらにデータ構成を変えて25億トークンの継続学習を行った結果を報告します。モデル性能向上におけるデータの質と量の影響について考察し、継続学習の有効性を分析しました。