生成AIの費用を下げる方法として、単価の安いモデルへ一括変更する案があります。しかし、難しい処理まで同じモデルへ任せると、再試行や人間の修正が増え、結果的に高くなることがあります。
解決策は、処理の難度と検証結果に応じてモデルを切り替える「モデルルーティング」です。
30秒でわかる結論
- 仕事を「抽出・生成・検証」に分解する
- 簡単で件数の多い工程ほど低価格モデルへ寄せる
- 出力を自動検査し、不合格だけを上位モデルへ送る
- モデル名をコードへ固定せず、設定表で切り替える
- 単価だけでなく、合格1件あたりの費用を測る
まず仕事を分解する
たとえば一次情報から記事を作る処理は、一回の長いプロンプトへまとめず、次の工程へ分けられます。
- 公式ページから本文を取得する
- 製品名、料金、制限、更新日を構造化する
- 根拠の重複や期限切れを検査する
- 構成と本文を生成する
- 各主張が保存済み根拠に対応するか検証する
項目抽出や形式チェックは低価格モデルまたは通常のコードで処理しやすい工程です。複数の根拠を読みやすく構成する工程だけ、標準モデルへ任せます。
3段階のモデルルーティング
第1段階:低価格モデル
分類、短い要約、固有表現抽出、JSON化を担当します。必須項目、文字数、JSON Schema、禁止語などを機械的に検査します。
第2段階:標準モデル
第1段階で不合格になった項目、複数資料の統合、読者向け本文を担当します。ここでも、根拠IDのない主張を許可しないなど、出力条件を固定します。
第3段階:上位モデルまたは人間
再試行しても規則を満たさない案件、法務・医療・金融など高リスクな内容、設計上の重大判断だけを送ります。公開前の重大例外だけを人間へ通知すれば、日常運用の介入を減らせます。
品質を守る自動検査
- JSONが指定スキーマへ一致するか
- URLのドメインが許可済み一次情報か
- 記事内の数値に根拠IDがあるか
- 同じslugやテーマが既に公開されていないか
- 最低根拠件数と信頼度を満たすか
- PR表記と更新日が入っているか
検査結果を理由コード付きで保存すると、どのモデルがどの工程で失敗しやすいかを集計できます。
「最安モデル」ではなく「合格単価」を測る
比較すべき指標は、100万トークン当たりの価格だけではありません。
合格単価 = (初回生成費用 + 再試行費用 + 上位モデル費用 + 人間修正費用)÷ 合格件数
単価が安くても再試行率が高いモデルは、合格単価で負ける場合があります。逆に、形式が明確な抽出処理なら、低価格モデルでも高い合格率を出せます。
設定をSSOT化する
モデルID、APIの接続先、温度、最大トークン、上位へ切り替える条件を設定表へ集約します。これにより、モデルの廃止や価格変更があっても、ワークフローのコードを編集せずに切り替えられます。
さらに、モデル系列と提供事業者を別項目で管理すると、同じモデル系列を直接APIとルーター経由で使う場合も区別できます。
まとめ
AI費用を抑える鍵は、全処理を最安モデルへ移すことではありません。簡単な工程を低価格モデルへ寄せ、検証不合格だけを上位へ送ることです。合格単価を記録し、設定をSSOT化すれば、価格やモデル構成が変わっても継続的に改善できます。
コメント