FreeToken 0.1.2は、MoEモデルのexpertをホストRAMに置き、必要分のみGPUへキャッシュして推論するエンジン。VRAM不足でも巨大なMoEモデルを実用的な速度で動作させることを目指しています。