Anthropicの「Jacobian Lens」論文の手法を用い、日本語モデルの中間層から特定の概念を読み出す実験を紹介。モデルの内部解釈可能性を高め、ステアリングや概念抽出の可能性を探る研究プレビューです。