Claude Codeを用いたチーム開発において、AIが自ら発見した「合格が出る確認」の自動化手法を紹介します。特にLLMの評価軸における出力形式の変化が、判定のばらつきに与える影響を定量的に検証するスクリプトの実装例を解説。AIによる自己申告の仕組みと判定精度を保つためのテスト戦略を共有します。