Qwen3.5-9BのGPT-4超えという噂をM1 Max環境で検証。定量評価の困難さを認めつつ、量子化モデルを実機で動かした際の実測値を公開し、モデル検証における評価指標の妥当性とローカル実行環境の実態を解説します。