RAG評価における既製フレームワーク(RAGAS、DeepEval、TruLens)と自作評価手法の比較検証結果。誤答の検出精度では自作手法が勝る一方、原因診断では既製フレームワークが優れた結果を示しました。メトリクスの使い分けや評価設計の最適化を検討するエンジニアに向けた実測レポートです。