Qwen3-VL等の最新Vision-Language Modelを活用し、画像内の部品情報や位置を構造化データ(JSON)として抽出する手法を解説。物体検出モデルとは異なるオープン語彙検出の利点と、実務で重要となる座標系の取り扱いについても整理します。