ClaudeとOpenAI Codexを使い、OSSコードレビューを8ラウンド繰り返した比較実験。指摘内容の重複の少なさや「mergeable」判定の相違を検証し、AIレビューの特性と使い分けに関する実証的な知見を共有します。