Metaのオープンウェイトモデル「Muse Glimmer 30B」を実務タスク(要約、台本生成等)で評価した記録。ベンチマークではなく実際の運用に焦点を当て、ローカルLLM投入の可能性を検証。結果として、モデル性能以上に「実務に特化した評価手法」の重要性を強調する。