DeepSeek-v4をvLLMを用いて2ノード構成で分散処理する環境構築の記録。TP=2による高速推論に加え、投機的デコード(k=5)やKVキャッシュ圧縮技術を活用し、100万トークンを超えるコンテキスト長を処理する高効率な構成例を紹介しています。