5年以上前のPC(Core i5-10400、RTX 2060 Super)で、llama.cppを使いMoEモデルを効率的に動かす手法を解説。VRAMとメインメモリにリソースを振り分けることで、チャットで実用的な20 t/sを実現する最適化戦略の記録。