検索やサジェストへLLMを組み込む際、高コストなモデルを全リクエストに通すのは非現実的です。本記事では、安価なモデル(Haikuなど)で事前に候補をスクリーニングし、必要な場合のみ高性能モデルへ送るコスト最適化設計と、その検索精度を維持する具体的な運用ルールを解説します。