この記事で分かること
- 業務を頻度×複雑度で4象限に分類し、象限ごとにモデルを割り当てる方法
- 単一モデルをすべての業務に当てた場合に、コストと品質のどちらが先に壊れるか
- 分類を自動振り分けとして運用に載せる手順
01トークンコスト最適化とは何か
AIのコストを下げようとするとき、最初にモデルの比較表を作っていないでしょうか。
私は、その順序が逆だと考えています。下げるべきなのはモデルの単価ではなく、業務とモデルの対応関係のほうだからです。
トークンコスト最適化とは、業務ごとに求められる品質水準を満たす範囲で、処理単価が最も低い構成を選び続ける運用を指します(トークンは、AIが文章を処理するときの分量の単位です)。
「最も安いモデルを使う」ことではありません。品質水準を満たさない構成は、出力の確認・修正に人の時間を消費するため、単価が下がっても総コストは下がりません。逆に「最も高性能なモデルを常に使う」ことでもありません。品質要件が低い業務に高性能な構成を当てると、超過分がそのまま無駄になります。
最適化の対象は、モデルの選択そのものではなく、業務とモデルの対応関係です。したがって作業の順序は、モデルの比較検討ではなく、業務の分類から始まります。
02単一モデルをすべての業務に当てると何が起きるか
社内のAI利用を1つの構成に統一する方針は、管理が単純で、導入初期には合理的です。問題は利用が定着したあとに現れます。
宅配便の仕分けを想像してください。全国に送る荷物を、大きさも重さも中身も見ずに、すべて同じ便で運んだらどうなるか。封筒1通を大型トラックで運び、精密機器を普通便に載せる。どちらか片方だけでも成り立ちません。
AIの構成も同じです。壊れ方が2通りあります。
高性能な構成に統一した場合、コストが先に壊れます。業務量の大半は、判断を要しない定型的な処理です。この部分に高価な構成を当てると、支出の増加が業務量に比例して進みます。TechCrunchが2026年6月に伝えたところによれば、Uberは2026年の年間AI予算を4カ月で使い切り、その後コーディングツール1つあたり・従業員1人あたり月1,500ドルの利用上限を導入しました(同社自身の公表資料は未確認のため、報道内容として扱います)。単価ではなく総量の想定が外れた事例です。
低コストな構成に統一した場合、品質が先に壊れます。判断や長い文脈の保持を要する業務で出力品質が落ちると、人が確認・修正する時間が増えます。この時間は見積書に現れないため、単価の削減だけを見て「成功した」と判断されがちです。
どちらの失敗も、原因は同じです。業務が均質だという前提に立っていることです。実際の業務は頻度も複雑度も大きく異なり、必要な品質水準も異なります。
03頻度×複雑度マトリクスとは何か
頻度×複雑度マトリクス(Genspark版)は、業務を発生頻度と判断の複雑度の2軸で4象限に分け、象限ごとに構成を割り当てるための分類です。
軸の定義を先に固めます。
頻度:単位期間あたりの処理件数。高頻度の業務は、単価の差が総額に直結します。
複雑度:判断の要否と、参照すべき文脈の量。複雑度が高い業務は、品質不足が修正労働に直結します。
この2軸を選ぶ理由は、コストと品質のどちらが支配的になるかが、この2つで決まるからです。頻度が高い象限ではコストが支配的になり、複雑度が高い象限では品質が支配的になります。両方が高い象限では両方が問題になり、両方が低い象限ではどちらも問題になりません。
4象限
| 象限 | 頻度 | 複雑度 | 支配的な制約 | 業務例 |
|---|---|---|---|---|
| A | 高 | 低 | コスト | 定型的な分類、要約、書式変換、一次振り分け |
| B | 高 | 高 | コストと品質の両方 | 問い合わせ一次回答、見積の下書き、日次のレポート作成 |
| C | 低 | 低 | どちらも問題にならない | 不定期の単純な照会 |
| D | 低 | 高 | 品質 | 契約条件の解釈、複雑な調査、例外案件の判断 |
図1:頻度×複雑度マトリクス(Genspark版)。縦軸は頻度(処理件数)、横軸は複雑度(判断の要否・参照文脈の量)。象限ごとに支配的な制約が変わるため、割り当ての着手順は象限A→象限B→象限D(Cは対象外)となる。
04象限ごとにモデルを割り当てる
象限A(高頻度・低複雑)——処理単価を最優先する。業務量の多くがここに入ります。品質要件は「決められた形式で正しく出力できる」ことなので、小型・低単価の構成で足ります。ここに高性能な構成を当てているかどうかが、支出の大きさを決めます。
象限B(高頻度・高複雑)——最も設計が必要な象限。単価も品質も両方が効くため、単純な選択がありません。実務的な解は3つです。第一に、参照情報の整備で複雑度そのものを下げる(社内の規程や履歴に到達できれば、モデルに求める処理の量が減ります)。第二に、工程を分割し、判断を要する部分だけを高性能な構成に回す。第三に、要修正率を測り、修正労働を含めた総額で構成を比較する。
象限C(低頻度・低複雑)——最適化の対象外。ここを最適化しても総額は動きません。象限Aと同じ構成に寄せて管理を簡素にするのが合理的です。
象限D(低頻度・高複雑)——品質を優先し、単価は問わない。件数が少ないため、高性能な構成を当てても総額への影響は小さくなります。ここで単価を削ると、誤りの影響が大きい業務で品質を落とすことになります。
割り当ての優先順位
着手順は象限A、象限B、象限Dです。象限Aは効果が最も大きく、変更のリスクが最も小さい。象限Bは設計が必要なため時間がかかる。象限Dは総額への影響が小さいため後回しにできます。
象限間の評価に使う考え方
象限内で複数の構成を比較するとき、単価と品質のどちらか一方だけを見ると判断を誤ります。品質水準を満たす構成のうち最も安いものを選ぶ、という制約付きの選択になります。図にすると、品質を縦軸・単価を横軸に取ったときの「その品質水準でこれより安い選択肢がない」線上の点を選ぶ形になります。
この比較を行うには、品質を測る手順が必要です。評価タスクの集合、採点の基準、採点者を決めないまま品質スコアを並べても、比較の根拠になりません。品質の測定手順を先に決めてください。
05割り当てを運用に載せる——自動振り分けの設計
分類ができても、利用者が毎回どの構成を使うかを選ぶ運用では定着しません。分類を運用に載せる必要があります。
入口を業務単位にする。利用者が「モデルを選ぶ」のではなく、「業務を選ぶ」形にします。業務が決まれば象限が決まり、象限が決まれば構成が決まります。
例外の経路を用意する。象限Aとして処理された結果が不十分だった場合に、象限Bまたは象限Dの構成で再実行できる経路を残します。この再実行の発生率が、分類の精度を測る指標になります。
利用実績を象限別に記録する。どの象限にどれだけの処理量が流れているかが分からなければ、分類の見直しができません。記録すべきは象限別の処理件数、再実行率、要修正率です。
06導入の3ステップ
ステップ1:業務の棚卸しと分類。対象業務を列挙し、直近1カ月の処理件数(頻度)と、判断の要否・参照文脈の量(複雑度)で4象限に振り分けます。この作業に外部データは不要です。
ステップ2:象限Aの構成を切り替える。最も件数が多く、最もリスクが小さい象限から着手します。切り替え前後で、処理件数・要修正率・単価を記録します。
ステップ3:象限Bの設計に入る。参照情報の整備、工程の分割、要修正率の測定を並行して進めます。ここが最も時間のかかる工程です。
以下は、分類の効果を試算する手順を示すための例です。
【ダミーデータ】以下の表の処理件数・単価・象限別の構成比はGensparkの実測値ではなく、算出手順を示すための架空の前提値です。
| 象限 | 月間処理件数 | 1件あたり単価(切替前) | 1件あたり単価(切替後) | 月間費用の差 |
|---|---|---|---|---|
| A | 8,000件 | 40円 | 8円 | −25.60万円 |
| B | 1,500件 | 40円 | 40円(据え置き) | 0円 |
| C | 300件 | 40円 | 8円 | −0.96万円 |
| D | 200件 | 40円 | 90円 | +1.00万円 |
| 合計 | 10,000件 | — | — | −25.56万円 |
この試算の要点は2つです。第一に、削減のほぼ全部が象限Aから出ています。第二に、象限Dで単価を上げても総額への影響は小さい。分類をすると、どこを削り、どこを厚くすべきかが分かれます。
なお、象限Bを据え置きにしているのは、この象限の判断には要修正率の実測が必要だからです。実測なしに象限Bの単価を下げると、修正労働の増加が削減分を上回る可能性があります。
07なぜ日本企業では分類が先に必要なのか
第一に、稟議のためです。日本企業の投資承認では、支出の内訳と削減の根拠を事前に示すことが求められます。象限別の配分表は、この説明にそのまま使えます。「安いモデルに変える」という提案は根拠を示しにくく、「業務量の8割を占める象限Aの単価を下げる」という提案は根拠が示せます。
第二に、利用の偏りがあるためです。総務省『令和8年版 情報通信白書』第Ⅰ部第2章第1節(2025年度企業向け調査、図表Ⅰ-2-1-7)によれば、日本企業の業務類型別の生成AI活用は「議事録・メール作成補助」が約7割で最も高く、「営業・販売」が約6割、「社内ヘルプデスク」が約5割でした。作成補助の多くは象限Aまたは象限Bに入る業務です。つまり多くの日本企業では、支出の重心が象限Aにあり、そこが未分類のまま単一構成で処理されている可能性が高い。分類の効果が出やすい状態にあります。
第三に、参照情報の整備が遅れているためです。同白書(図表Ⅰ-2-1-5)は、環境整備において他国との差が最も大きい項目として「生成AIに社内データを学習させたり、生成AIが参照可能なデータベースを構築したりしている」を挙げ、他国では5割を超える一方で日本は大幅に低いとしています。象限Bの複雑度を下げる手段が、日本市場では最も未着手だということです。象限Bの最適化に取りかかる前に、この整備が必要になります。
08まとめ
トークンコストは、モデルを比較して下げるものではなく、業務を分類して下げるものです。分類しない状態では、単価を下げれば品質が落ち、品質を上げれば支出が膨らむという二択にしかなりません。
頻度×複雑度で4象限に分ければ、削るべき象限(A)、設計が必要な象限(B)、放置してよい象限(C)、厚くすべき象限(D)が分かります。
冒頭の問いに戻ります。モデルの比較表を作る前に、やることがあります。最初の作業は、対象業務の件数を数えることです。私は、ここを飛ばしたまま行う構成の比較には、判断の根拠がないと考えています。今日、自部門で最も件数の多い処理が何かを1つ挙げられるなら、そこが象限Aの入口です。
09FAQ
Q1. 既に単一モデルで全社契約している場合、どう移行すればよいですか。
契約の見直しより先に、象限Aの業務を特定して件数を測ってください。移行の判断材料は、象限Aが業務量の何割を占めるかです。この比率が小さければ、移行の効果も小さくなります。契約形態の交渉は、この数字を持ってから行うのが順序です。
Q2. 象限Aの構成を下げると品質が落ちませんか。
落ちる場合は、その業務が象限Aではなかったということです。分類の誤りは再実行率として現れます。切り替え後に再実行率を測り、想定より高ければ象限Bに移してください。分類は一度で正解にする必要はなく、指標を見て直せる形にすることが重要です。
Q3. 小規模な利用でも効果がありますか。
総額の削減効果は処理件数に比例するため、件数が少なければ金額の効果は小さくなります。ただし、分類そのものは規模に関係なく有効です。象限Dの業務に低品質な構成を当てているケースは規模を問わず起こり、これは金額ではなく業務品質の問題です。
Q4. 象限Bにはどう取りかかるべきですか。
単価の比較ではなく、要修正率の測定から始めてください。要修正率と1件あたり修正時間が分からないかぎり、象限Bの構成比較は成立しません。並行して、参照情報の整備で複雑度自体を下げる作業を進めます。