LLMの専門用語「KV cache」の仕組みを解説。Attention機構におけるQとK/Vの非対称性を説明し、MQA・GQA・MLAといった技術がなぜK/Vキャッシュの最適化に注力するのかを紐解く。