超小型モデル「K2 Horizon 0.9B」の精度検証記事。1問のみのテストで信頼できると判断したことへの反省から、計算問題50問の再テストを実施。定型処理におけるAIの信頼性を客観的に評価するプロセスの重要性を綴る。