2枚の異なるGPU(RTX 5060 Tiと2060 SUPER)を用いたLLM環境で、モデルの分割ロードに関する誤解が発生した顛末を記録。バックエンドの違いによる制約と、運用の難しさについての実体験レポート。