RTX 5060 Tiと3060の構成で、LLMの推論速度向上を検証した事例。512-token入力で30.11 tok/s、8192-token入力でも28.76 tok/sを達成し、メモリ使用量も削減。特別な高速化手法を用いず、baselineとビット単位で一致する高い再現性を確認した。