Gemma 4をApple Neural Engineで高速化するCore MLバンドルの実装解説。ロスレスな投機デコードやKVキャッシュのディスク永続化により、精度を落とさず高速化を実現した手法を紹介。実装上の要点や実機での実測データを通じ、最適化の詳細を公開します。