vLLMにおいてspeculative decodingとprefix cachingを併用した際の速度低下問題について解説。キャッシュヒット率の低下がTTFTを悪化させる実例を挙げ、併用時の注意点と最適化の難しさを技術的視点から紐解きます。