Qwen3.8 27BなどのLLMを単一GPUで動かす際の問題と対策を解説。vLLMを用いた推論サービング環境におけるTensor ParallelとPipeline Parallelの適切な選択と使い分けを論じる。