LLMの出力品質を評価する「LLM-as-a-judge」を人手の評価に近づけるための比較実験について解説。Few-shotやプロンプト最適化など、限られたラベル数でどの手法が有効かを検証する試みです。