ホーム/インサイト/コスト設計

コスト設計2026.09.219 min read

トークンコスト最適化とは何か

業務を頻度×複雑度で分類してモデルを割り当てる

この記事で分かること

  • 業務を頻度×複雑度で4象限に分類し、象限ごとにモデルを割り当てる方法
  • 単一モデルをすべての業務に当てた場合に、コストと品質のどちらが先に壊れるか
  • 分類を自動振り分けとして運用に載せる手順

01トークンコスト最適化とは何か

AIのコストを下げようとするとき、最初にモデルの比較表を作っていないでしょうか。

私は、その順序が逆だと考えています。下げるべきなのはモデルの単価ではなく、業務とモデルの対応関係のほうだからです。

トークンコスト最適化とは、業務ごとに求められる品質水準を満たす範囲で、処理単価が最も低い構成を選び続ける運用を指します(トークンは、AIが文章を処理するときの分量の単位です)。

「最も安いモデルを使う」ことではありません。品質水準を満たさない構成は、出力の確認・修正に人の時間を消費するため、単価が下がっても総コストは下がりません。逆に「最も高性能なモデルを常に使う」ことでもありません。品質要件が低い業務に高性能な構成を当てると、超過分がそのまま無駄になります。

最適化の対象は、モデルの選択そのものではなく、業務とモデルの対応関係です。したがって作業の順序は、モデルの比較検討ではなく、業務の分類から始まります。

02単一モデルをすべての業務に当てると何が起きるか

社内のAI利用を1つの構成に統一する方針は、管理が単純で、導入初期には合理的です。問題は利用が定着したあとに現れます。

宅配便の仕分けを想像してください。全国に送る荷物を、大きさも重さも中身も見ずに、すべて同じ便で運んだらどうなるか。封筒1通を大型トラックで運び、精密機器を普通便に載せる。どちらか片方だけでも成り立ちません。

AIの構成も同じです。壊れ方が2通りあります。

高性能な構成に統一した場合、コストが先に壊れます。業務量の大半は、判断を要しない定型的な処理です。この部分に高価な構成を当てると、支出の増加が業務量に比例して進みます。TechCrunchが2026年6月に伝えたところによれば、Uberは2026年の年間AI予算を4カ月で使い切り、その後コーディングツール1つあたり・従業員1人あたり月1,500ドルの利用上限を導入しました(同社自身の公表資料は未確認のため、報道内容として扱います)。単価ではなく総量の想定が外れた事例です。

低コストな構成に統一した場合、品質が先に壊れます。判断や長い文脈の保持を要する業務で出力品質が落ちると、人が確認・修正する時間が増えます。この時間は見積書に現れないため、単価の削減だけを見て「成功した」と判断されがちです。

どちらの失敗も、原因は同じです。業務が均質だという前提に立っていることです。実際の業務は頻度も複雑度も大きく異なり、必要な品質水準も異なります。

03頻度×複雑度マトリクスとは何か

頻度×複雑度マトリクス(Genspark版)は、業務を発生頻度と判断の複雑度の2軸で4象限に分け、象限ごとに構成を割り当てるための分類です。

軸の定義を先に固めます。

頻度:単位期間あたりの処理件数。高頻度の業務は、単価の差が総額に直結します。

複雑度:判断の要否と、参照すべき文脈の量。複雑度が高い業務は、品質不足が修正労働に直結します。

この2軸を選ぶ理由は、コストと品質のどちらが支配的になるかが、この2つで決まるからです。頻度が高い象限ではコストが支配的になり、複雑度が高い象限では品質が支配的になります。両方が高い象限では両方が問題になり、両方が低い象限ではどちらも問題になりません。

4象限

Table 1 — 頻度×複雑度マトリクスの4象限
象限頻度複雑度支配的な制約業務例
A高低コスト定型的な分類、要約、書式変換、一次振り分け
B高高コストと品質の両方問い合わせ一次回答、見積の下書き、日次のレポート作成
C低低どちらも問題にならない不定期の単純な照会
D低高品質契約条件の解釈、複雑な調査、例外案件の判断

図1:頻度×複雑度マトリクス(Genspark版)。縦軸は頻度(処理件数)、横軸は複雑度(判断の要否・参照文脈の量)。象限ごとに支配的な制約が変わるため、割り当ての着手順は象限A→象限B→象限D(Cは対象外)となる。

04象限ごとにモデルを割り当てる

象限A(高頻度・低複雑)——処理単価を最優先する。業務量の多くがここに入ります。品質要件は「決められた形式で正しく出力できる」ことなので、小型・低単価の構成で足ります。ここに高性能な構成を当てているかどうかが、支出の大きさを決めます。

象限B(高頻度・高複雑)——最も設計が必要な象限。単価も品質も両方が効くため、単純な選択がありません。実務的な解は3つです。第一に、参照情報の整備で複雑度そのものを下げる(社内の規程や履歴に到達できれば、モデルに求める処理の量が減ります)。第二に、工程を分割し、判断を要する部分だけを高性能な構成に回す。第三に、要修正率を測り、修正労働を含めた総額で構成を比較する。

象限C(低頻度・低複雑)——最適化の対象外。ここを最適化しても総額は動きません。象限Aと同じ構成に寄せて管理を簡素にするのが合理的です。

象限D(低頻度・高複雑)——品質を優先し、単価は問わない。件数が少ないため、高性能な構成を当てても総額への影響は小さくなります。ここで単価を削ると、誤りの影響が大きい業務で品質を落とすことになります。

割り当ての優先順位

着手順は象限A、象限B、象限Dです。象限Aは効果が最も大きく、変更のリスクが最も小さい。象限Bは設計が必要なため時間がかかる。象限Dは総額への影響が小さいため後回しにできます。

象限間の評価に使う考え方

象限内で複数の構成を比較するとき、単価と品質のどちらか一方だけを見ると判断を誤ります。品質水準を満たす構成のうち最も安いものを選ぶ、という制約付きの選択になります。図にすると、品質を縦軸・単価を横軸に取ったときの「その品質水準でこれより安い選択肢がない」線上の点を選ぶ形になります。

この比較を行うには、品質を測る手順が必要です。評価タスクの集合、採点の基準、採点者を決めないまま品質スコアを並べても、比較の根拠になりません。品質の測定手順を先に決めてください。

05割り当てを運用に載せる——自動振り分けの設計

分類ができても、利用者が毎回どの構成を使うかを選ぶ運用では定着しません。分類を運用に載せる必要があります。

入口を業務単位にする。利用者が「モデルを選ぶ」のではなく、「業務を選ぶ」形にします。業務が決まれば象限が決まり、象限が決まれば構成が決まります。

例外の経路を用意する。象限Aとして処理された結果が不十分だった場合に、象限Bまたは象限Dの構成で再実行できる経路を残します。この再実行の発生率が、分類の精度を測る指標になります。

利用実績を象限別に記録する。どの象限にどれだけの処理量が流れているかが分からなければ、分類の見直しができません。記録すべきは象限別の処理件数、再実行率、要修正率です。

06導入の3ステップ

ステップ1:業務の棚卸しと分類。対象業務を列挙し、直近1カ月の処理件数(頻度)と、判断の要否・参照文脈の量(複雑度)で4象限に振り分けます。この作業に外部データは不要です。

ステップ2:象限Aの構成を切り替える。最も件数が多く、最もリスクが小さい象限から着手します。切り替え前後で、処理件数・要修正率・単価を記録します。

ステップ3:象限Bの設計に入る。参照情報の整備、工程の分割、要修正率の測定を並行して進めます。ここが最も時間のかかる工程です。

以下は、分類の効果を試算する手順を示すための例です。

【ダミーデータ】以下の表の処理件数・単価・象限別の構成比はGensparkの実測値ではなく、算出手順を示すための架空の前提値です。

Table 2 — 象限別の配分と単価の試算【前提値はすべてダミーデータ/架空】
象限月間処理件数1件あたり単価(切替前)1件あたり単価(切替後)月間費用の差
A8,000件40円8円−25.60万円
B1,500件40円40円(据え置き)0円
C300件40円8円−0.96万円
D200件40円90円+1.00万円
合計10,000件——−25.56万円

この試算の要点は2つです。第一に、削減のほぼ全部が象限Aから出ています。第二に、象限Dで単価を上げても総額への影響は小さい。分類をすると、どこを削り、どこを厚くすべきかが分かれます。

なお、象限Bを据え置きにしているのは、この象限の判断には要修正率の実測が必要だからです。実測なしに象限Bの単価を下げると、修正労働の増加が削減分を上回る可能性があります。

07なぜ日本企業では分類が先に必要なのか

第一に、稟議のためです。日本企業の投資承認では、支出の内訳と削減の根拠を事前に示すことが求められます。象限別の配分表は、この説明にそのまま使えます。「安いモデルに変える」という提案は根拠を示しにくく、「業務量の8割を占める象限Aの単価を下げる」という提案は根拠が示せます。

第二に、利用の偏りがあるためです。総務省『令和8年版 情報通信白書』第Ⅰ部第2章第1節(2025年度企業向け調査、図表Ⅰ-2-1-7)によれば、日本企業の業務類型別の生成AI活用は「議事録・メール作成補助」が約7割で最も高く、「営業・販売」が約6割、「社内ヘルプデスク」が約5割でした。作成補助の多くは象限Aまたは象限Bに入る業務です。つまり多くの日本企業では、支出の重心が象限Aにあり、そこが未分類のまま単一構成で処理されている可能性が高い。分類の効果が出やすい状態にあります。

第三に、参照情報の整備が遅れているためです。同白書(図表Ⅰ-2-1-5)は、環境整備において他国との差が最も大きい項目として「生成AIに社内データを学習させたり、生成AIが参照可能なデータベースを構築したりしている」を挙げ、他国では5割を超える一方で日本は大幅に低いとしています。象限Bの複雑度を下げる手段が、日本市場では最も未着手だということです。象限Bの最適化に取りかかる前に、この整備が必要になります。

08まとめ

トークンコストは、モデルを比較して下げるものではなく、業務を分類して下げるものです。分類しない状態では、単価を下げれば品質が落ち、品質を上げれば支出が膨らむという二択にしかなりません。

頻度×複雑度で4象限に分ければ、削るべき象限(A)、設計が必要な象限(B)、放置してよい象限(C)、厚くすべき象限(D)が分かります。

冒頭の問いに戻ります。モデルの比較表を作る前に、やることがあります。最初の作業は、対象業務の件数を数えることです。私は、ここを飛ばしたまま行う構成の比較には、判断の根拠がないと考えています。今日、自部門で最も件数の多い処理が何かを1つ挙げられるなら、そこが象限Aの入口です。

09FAQ

Q1. 既に単一モデルで全社契約している場合、どう移行すればよいですか。

契約の見直しより先に、象限Aの業務を特定して件数を測ってください。移行の判断材料は、象限Aが業務量の何割を占めるかです。この比率が小さければ、移行の効果も小さくなります。契約形態の交渉は、この数字を持ってから行うのが順序です。

Q2. 象限Aの構成を下げると品質が落ちませんか。

落ちる場合は、その業務が象限Aではなかったということです。分類の誤りは再実行率として現れます。切り替え後に再実行率を測り、想定より高ければ象限Bに移してください。分類は一度で正解にする必要はなく、指標を見て直せる形にすることが重要です。

Q3. 小規模な利用でも効果がありますか。

総額の削減効果は処理件数に比例するため、件数が少なければ金額の効果は小さくなります。ただし、分類そのものは規模に関係なく有効です。象限Dの業務に低品質な構成を当てているケースは規模を問わず起こり、これは金額ではなく業務品質の問題です。

Q4. 象限Bにはどう取りかかるべきですか。

単価の比較ではなく、要修正率の測定から始めてください。要修正率と1件あたり修正時間が分からないかぎり、象限Bの構成比較は成立しません。並行して、参照情報の整備で複雑度自体を下げる作業を進めます。

Gensparkについて

本記事の論点は、ツールの選定より前に決めておく事項です。そのうえで基盤側に求められるのは、業務ごとに構成を選べること、社内の情報に接続できること、企業として説明できるガバナンスが揃っていることで、Gensparkは70以上のLLMを横断して使える法人向けAIプラットフォームとして、Workspaceでの成果物作成、Salesforce・Google Workspace・Microsoft 365との連携、Enterpriseプランでの権限設定とガバナンス機能を提供しています。

本記事の主題である業務ごとの割り当てについては、Gensparkは横断利用できる70以上のLLMのうち30以上のAIモデルを組み合わせるMixture-of-Agentsで「各タスクに適したモデルにデータをルーティングし、複雑さを背後で処理」する構成をとっています。同社が技術ブログで示している考え方も「重要な指標は成功タスクあたりのコストであり、目的はトークンの最小化ではない」というもので、本記事の分類の考え方と方向は同じです。ただし何を高頻度・高複雑度とみなすかは業務ごとの判断であり、象限の定義そのものは自社で決める必要があります。Enterpriseプランでは利用可能なLLMモデルを組織内で制限することもできます。

自社の要件に照らした実現可否は、既存システムと社内規程を前提に個別の検討が必要です。カスタム導入、契約条件、セキュリティ要件については営業担当にご相談ください。

合わせて読む

コスト設計  ·  11 min read

AIコストガバナンスとは何か

予算・利用・成果の3層モデルで、支出と成果の関係を保つコスト管理の仕組み。

コスト設計  ·  14 min read

AIの総所有コスト(TCO)とは何か

料金表だけで投資判断が外れる理由と、TCOの5項目の分解。

導入相談はこちらから