生成AIエージェントの非決定的な失敗やプロンプト改善の評価難という課題に対し、信頼性フレームワーク「Tensile」を検証。中の人が実際に手を動かして試した記録を通じて、失敗の数値化や信頼性向上のためのアプローチを紹介する。