実装タスク外注モデルのベンチマーク企画。親エージェントにClaude-Opus-5、子エージェントにGPT-6 Astraを配置し、異なる条件設定下での性能変化を検証します。最高スコアと最悪のコスト効率を同一モデルが記録するという興味深い結果を詳細に分析します。