- 目次
1.AI時代のコスト管理は従来と何が違うのか?
生成AIの利用が広がる中、AIコストの管理は従来のテクノロジーコスト管理とは異なる難しさを持つようになっています。
特にAIエージェントでは、ユーザーから見える1回の依頼の裏側で複数のモデル呼び出しや検索、ツール実行、推論、再試行などが行われます。そのため同じように見える処理でも、利用するモデルやコンテキスト、処理の進め方によってコストが大きく変わります。
またコストが高いからといって必ずしも「使いすぎ」とは限りません。難しい業務を高い品質で完了するために必要なコストである可能性もあれば、不要なコンテキストや再試行によって発生したコストである可能性もあります。
そのためAI時代のコスト管理では、「いくら使ったか」だけでなく、「何に使い、どのような成果につながったのか」まで捉えることが重要になります。
表1:従来のテクノロジーコスト管理とAIエージェントのコスト管理
| 観点 | 従来のテクノロジー コスト管理 |
AIエージェントのコスト管理 |
|---|---|---|
| 主な変動要因 | 利用者数、処理件数、稼働時間、容量 | コンテキスト、推論量、モデル選択、ツール呼び出し、再試行、エージェント間の呼び出し |
| 観測する単位 | アカウント、サービス、リソース | 従来の単位に加え、リクエスト、モデル呼び出し、タスク、ワークフロー、エージェント |
| 主な最適化プラン | 稼働率、容量、料金プラン、配置 | キャッシュ、モデルルーティング、コンテキスト設計、ループ制御 |
| コスト評価の視点 | 予算、単価、利用率、サービス・事業への貢献 | 従来の視点に加え、業務・タスクを完了するまでの総コスト、品質、応答時間、業務成果 |
2.AI時代のコスト管理を支えるTokenomics
前章で述べた背景をふまえ、TokenとEconomicsを組み合わせた造語としてTokenomicsという考え方が生まれました。また2026年6月には、Linux FoundationがAIインフラの経済性に関する標準化、ベストプラクティスの確立を目的とするTokenomics Foundationの設立方針を発表。同年8月4日に正式に発足しました。Tokenomics Foundationは、FinOps Foundationと連携しながら、AIにおけるトークンの生産、消費、収益化を含む経済性を扱う標準やフレームワークの整備を進めています。
2026年9月1日に公開されたTokenomics Foundationによる「Tokenomics Draft Definition v0.5.2」では、AI Tokenomicsを、「エネルギーと資本をAIの能力へ変換し、その知能を組織全体で効率的に利用して、測定可能なビジネス価値を実現するための規律」と定義しています(※2)。対象はトークンの計数にとどまらず、AIの供給から利用、価値への変換までの全体です。
表2:Tokenomicsが捉える3つの領域
| 領域 | 管理上の問い | 主な対象 |
|---|---|---|
| Production 生産 | AIの能力をどの資源とコストで生み出すか | 電力、半導体、データセンター、計算資源、容量 |
| Consumption 消費 | 生み出されたAIをどの業務でどのように使うか | モデル、トークン、キャッシュ、ツール呼び出し、ライセンス |
| Value 価値 | AIの出力をどの成果や収益へつなげるか | 需要、価格、収益、業務プロセス、労働への影響 |
重要なのは、トークンを最小化することではなく、必要な品質、安全性、応答時間を満たしたうえで、投入したコストに見合う成果を得ることです。少ないトークンで同じ成果を得られれば改善ですが、より多くのトークンを使っても、それ以上の価値が生まれるのであれば、合理的な投資になり得ます。
Tokenomics Foundation[What is AI Tokenomics?]
3.TokenomicsとFinOpsの関係
Tokenomics以前から、FinOpsと呼ばれるテクノロジーコストの管理・最適化手法が提唱されていました。FinOpsとTokenomicsの違いをまとめると、下記の通りです。
FinOps:AIを含むテクノロジー投資全体について、コスト・利用量・予算・責任主体・ビジネス価値を横断的に管理する運用フレームワーク(※3)
Tokenomics:AIに焦点を当て、エネルギーや半導体から推論、モデル、エージェント、最終的なビジネス価値まで、AI固有の技術的・経済的な因果関係を掘り下げる規律
FinOpsは、クラウドのコスト最適化を起源としつつAIの投資までカバーしているのに対し、Tokenomicsは、AIについてより深く見ている部分が異なります。FinOps Foundationの見解では、どちらか一方を選ぶというより、システム全体としてFinOpsとTokenomicsを組み合わせて活用するのが望ましいとされています(※4)。
ただ、AIに関するこれはFinOpsで、あれはTokenomicsで…と分けると、コミュニケーション上煩雑になるため、AIに関する投資や経済性全般をFinOpsの領域を含め、Tokenomicsと便宜上呼ぶことにしたいと思います。
FinOps Foundation[FinOps Framework]
FinOps Foundation[FinOps and Tokenomics: How do they fit together?]
4.トークンを管理するレイヤー
実際にAIのコストと価値を最適化するには、システムのどこに着目すればよいのでしょうか。 AIのコストはモデルの利用料金だけで決まるものではなく、その基盤となる計算資源や推論処理、モデルの選択、リクエストの振り分けなど、複数の要素によって変化します。
Tokenomics Foundationは、こうした最適化の対象をFive-Layer Tokenomics Stackとして5つのレイヤーに整理しています。(※5)
表3:Five-Layer Tokenomics Stackのレイヤー
| 階層 | 対象 | 何を決めるか | 代表的な管理レバー |
|---|---|---|---|
| L1 | Silicon | トークン当たりコストの下限 | 処理に適した半導体やアクセラレーター |
| L2 | Capacity | 実効コストと供給余力 | 容量、稼働率、リージョン、スケーリング |
| L3 | Inference Stack | 推論処理の効率 | キャッシュ、バッチ処理、サービングエンジン |
| L4 | Model and Quantization | 品質とモデルコストのバランス | モデルの適正化、量子化、適応 |
| L5 | Routing and Governance | 各依頼の経路と消費の上限 | モデルルーティング、予算、クォータ、再試行・階層の上限、サーキットブレーカー |
NTT DATAが掲げるSmart AI Agent®では、上記に加え、アプリケーションに近い層での取り組みも必要と考え、Tokenomics Stackの下位層を統合・再配置したうえで、新しい層を加え、7つのレイヤーに整理しています。
表4:NTTデータによる7層のTokenomics Stack
| 階層 | Tokenomics 視点の名称 |
代表キーワード |
|---|---|---|
| L7 | Business / AI Economics | タスク単価、成功単価、トークン予算、ROI、AI/ルール/機械学習/検索の使い分け、予算ポリシー |
| L6 | Application / Token Shaping | 出力長の制御、構造化出力、会話要約、差分入力、プロンプト削減 |
| L5 | Agent / Execution Efficiency | エージェントのステップ数削減、ツール呼び出し削減、早期終了、ルーティング、並列実行、決定論的ワークフロー |
| L4 | Context / Token Efficiency | コンテキストエンジニアリング、RAG上位K件、再ランキング、コンテキスト圧縮、重複排除、メモリ、セマンティックキャッシュ |
| L3 | Model / Intelligence Economics | モデルルーティング、小規模モデル、推論予算、適応的推論、蒸留、品質・コストルーティング |
| L2 | Inference / Token Serving | プレフィックスキャッシュ、KVキャッシュ、KVキャッシュ対応ルーティング、バッチ処理、投機的デコーディング、量子化、P/D分離 |
| L1 | Compute / Token Infrastructure | GPU、NPU、TPU、AI ASIC、CPU、FPGA、アクセラレータ選定、HBM、RDMA、オートスケーリング、スポットインスタンス、トークン/秒、トークン/ドル、トークン/ワット |
Tokenomics Foundation[The Five-Layer Tokenomics Stack]
このように、AIのコストを左右する要素は、計算基盤やモデルだけではなく、コンテキスト、AIエージェント、アプリケーションなど、さまざまなレイヤーに存在します。
Tokenomicsでは、こうした複数のレイヤーからAIのコスト構造を捉え、課題に応じた改善ポイントを考えることができます。
では、こうしたTokenomicsの考え方を、実際のAI利用にどのように取り入れていけばよいのでしょうか。
5.Tokenomicsの始め方
まず1つのAIサービスを選び、次の3つの問いを明確にします。
- 1.成果の単位は何か
問い合わせの解決、受け入れられたコード変更、審査の完了など、費用を割る際の分母を定めます。成功条件も合わせて決めます。 - 2.守るべき条件は何か
品質、安全性、応答時間、法令や社内規程など、コスト削減のために下げてはいけない条件を定めます。 - 3.誰が何を決めるか
財務は予算と配賦、業務・プロダクトは成果、エンジニアリングは技術レバーを担い、定期的に同じ指標を確認します。その後、請求、実行トレース、タスクの結果、ビジネス成果を結びつけ、支出と単位当たりコストの変化を継続的に確認します。予算差異が出たときは、まず原因を特定し、品質と価値を確認したうえで、どのレイヤーを変更するかを決めます。
6.まとめ
AIエージェントの普及により、AIのコストはモデルの利用量だけでなく、コンテキストや推論、ツール呼び出し、エージェントの設計など、さまざまな要素によって変化するようになっています。そのため、AI時代のコスト管理では、「いくら使ったか」だけでなく、「何に使い、どのような成果につながったか」まで捉えることが重要になります。
Tokenomicsは、こうしたAI固有のコスト構造を捉え、単なるコスト削減ではなく、AIへの投資とそこから得られる価値のバランスを継続的に最適化していくための考え方です。まずは利用状況を可視化し、問題のある箇所を改善しながら、その成果まで確認していくことが実践の第一歩になります。
一方で、Tokenomicsはまだ発展途上の領域であり、特にAIへの投資から生まれた価値をどのように測り、評価するかについては、これからさらに実践知を積み重ねていく必要があります。
NTT DATAでも、複数の組織が連携してTokenomicsの取り組みを進めています。今後も、実践や勉強会などを通じて得られた知見を共有しながら、AI時代のコストと価値をより適切に捉えるためのプラクティスを蓄積していきます。

