AIエージェント開発において、従来のAPIテスト手法である単純なレスポンス検証は通用しません。出力のゆらぎやツール利用が多様だからです。Amazon Bedrock AgentCore Evaluationsを活用し、エージェント特有の評価手法を構築する方法を提案します。