マスログ

バリューマキシングとは?|トークン消費量を競うとAIの成果が減りうるのはなぜか

公開日

2026年9月24日

更新日

2026年9月24日

バリューマキシング(valuemaxxing)とは、AIのトークン消費量ではなく、AIを使って届けた成果を最大化しようという考え方のことです。2026年前半のシリコンバレーでは、社員がトークン消費量のランキングを競い、上位者が称賛される風潮が広がりました。その反動として出てきた言葉です。

この記事では、トークンを評価の目標にしたときに価値がどれだけ目減りするかを、グッドハートの法則を式にして計算します。後半では、OpenAIが公開したROIの試算例を分解し、同じ業務データでも前提の置き方次第でROIが赤字から数倍の黒字まで振れることを確かめます。

この記事のポイント

  • トークンは投入量とコストの指標であり、それだけでは成果を表しません。
  • トークン量を評価目標にすると、数字だけを増やす行動が合理的になり、成果と指標が離れます。
  • 本文の相関係数やROIの幅は仮定モデルです。OpenAIの245%も公式ページ上の仮想例です。

トークンマキシングからバリューマキシングへ何が起きたのか

トークンマキシング(tokenmaxxing)は、AIのトークン消費量を生産性の代理指標とみなし、たくさん使うほど良いとする風潮です。日本では@ITが2026年4月27日に紹介しています。Metaには社員のClaudeのトークン使用量をランキング化する「Claudenomics」というダッシュボードがあり、上位250名にはRPG風の称号が与えられ、8万5000人以上の従業員がトークン消費を競っていたといいます。NVIDIAのジェンスン・フアンCEOは、年収50万ドルのエンジニアが年25万ドル分のトークンを使っていなければ深く懸念する、と発言しています。

2026年5月ごろから流れが変わります。Fortuneは5月28日の記事で、Metaが社員の作った非公式のリーダーボードを取り下げたこと、Amazonでトークン使用量の統計を保つために無意味なタスクをAIエージェントに回す社員がいたこと(Financial Timesの報道として)を伝えました。

Uberは2026年のトークン予算を最初の4か月で使い切り、COOのアンドルー・マクドナルド氏は「ユーザーに届ける機能にどれだけつながっているか直接の線を引けないなら、トークンのコストは正当化しにくい」と述べています。SalesforceのベニオフCEOは、Anthropicへの支払いが年に約3億ドルになる見込みだと示しました。

そこで出てきたのがバリューマキシングです。IBMは6月25日の記事「Tokenmaxxing is dead, long live valuemaxxing」で、この言葉を最近言い出したのはNebiusのCROマーク・ボロディツキー氏だと紹介しました。問うべきは、完了したタスクの数、開発者が節約した時間、解消した脆弱性の数、避けられた手戻りの量だといいます。

IBMコンサルティングのニール・ダー氏の「本当の指標がないなかで組織は利用量のリーダーボードを作り、人々はすぐにそれを攻略することを覚えた」という言葉も引かれています。トークン消費はコストのシグナルであって、価値の指標ではない、というのがバリューマキシングの出発点です。

トークン消費量を評価の目標にすると価値はどれだけ減るのか

「指標が目標になると、良い指標ではなくなる」という経験則は、経済学者チャールズ・グッドハートの名前をとってグッドハートの法則と呼ばれます。

ここからは実測データではなく、仕組みを分かりやすくするための仮定モデルです。

仕事時間を1として、行動を2種類に分けます。ひとつは、AIを使って実際に機能を作ったりバグを直したりする成果につながる行動で、1単位あたり価値1とトークン1を生むとします。もうひとつは、意味のないエージェントを回す、必要以上に長い出力を何度も生成するといったトークンだけ増える行動で、価値は0、トークンは成果につながる行動のk倍(kは1より大きい)とします。後者に割く時間の割合をwとすると、価値Vとトークン量Tは次のようになります。

V = 1 − w

T =(1 − w)+ w × k

トークンあたりの価値 = V ÷ T =(1 − w)÷(1 − w + w × k)

トークン量を評価に使うと、成果につながらない消費を増やす誘因が生まれます。ここでは、その結果wが大きくなる場合を考えます。評価に使う前のwを0.05(5%)、k=4という仮想の数字を置いて、wを振った早見表が次の表です。

トークンだけ増える行動の割合 w トークン量(元の何倍) 価値(元の何倍) トークンあたり価値(元の何倍)
5%(評価に使う前) 1.00倍 1.00倍 1.00倍
10% 1.13倍 0.95倍 0.84倍
20% 1.39倍 0.84倍 0.61倍
30% 1.65倍 0.74倍 0.45倍
40% 1.91倍 0.63倍 0.33倍
50% 2.17倍 0.53倍 0.24倍

wが40%になると、ダッシュボード上のトークンはほぼ2倍に増えているのに、届いた価値は4割近く減っています。仕事時間は変わらないので、トークンだけ増える行動に時間を取られた分、成果の行動が削られるからです。トークン量が伸びているという事実だけでは、成果が伸びたのか減ったのか区別できません。kは仮定なので実際の倍率は職場によって違いますが、kが1より大きい範囲では、wが増えるとトークン量が増え、価値が減るという関係が成り立ちます。

リーダーボードの上位は本当に成果を出した人か

1,000人の組織を仮想的に作り、各人の能力、wのばらつき、日々の変動に乱数を入れて、トークン量と成果の相関と、ランキング上位10%の顔ぶれがどれだけ一致するかを1,000回シミュレーションしました。

w の平均 トークンと成果の相関係数 トークン上位10%のうち成果でも上位10%の人
5% 0.81 64%
20% 0.50 39%
40% 0.18 18%
60% −0.03 9%

誰もトークンを意識していない段階では、トークン消費の上位者の6割強は成果でも上位にいて、トークンは悪くない代理指標でした。ところがwが増えるにつれて一致率は落ち、wの平均が60%では9%と、無作為に10%を選んだときの一致率(10%)と変わらなくなります。この仮定モデルでは、リーダーボードは成果との一致が低い順位表になります。

OpenAIのROI試算は前提次第でどれだけぶれるのか

成果の側の測り方として、OpenAIは2026年9月16日の記事「How to connect AI usage to business value」で、改善したい成果を決める、現状を測る、AI導入後と比べる、それで何ができるようになるかを考える、投資に見合うかを判断する、という5つのステップを示しました。その営業チームの試算例を分解します。

営業20名が週2件ずつ顧客調査の資料を作り、1件あたり3時間(手作業4時間がAIとレビューで1時間に)短縮され、年46週働くとします。節約時間は20×2×3×46で年5,520時間です。OpenAIはこのうち50%が生産的な仕事に回ると仮定し、時給換算75ドルを掛けて20万7,000ドル、初年度コスト6万ドルに対してROI 245%としています。節約時間をH、活用率をu、時給をP、コストをCとし、本記事では「申告された節約時間のうち実際に実現している割合」rを加えます。

ROI =(H × u × r × P − C)÷ C

rを加えたのは、METRの研究があるからです。経験豊富なオープンソース開発者16名が246件の課題に取り組んだ2025年のランダム化比較試験では、AIを使うと完了時間が19%長くなった一方、開発者自身は20%速くなったと感じていました。営業資料の作成に同じずれがあるとは限りませんが、節約時間が自己申告なら、体感と実測のずれを前提に入れておく必要があります。uとrを振った感度分析が次の表です。

活用率 u \ 実現率 r r=100% r=67% r=33%
u=25% 73% 16% −43%
u=50%(OpenAIの仮定) 245% 131% 14%
u=75% 418% 247% 71%

OpenAIが示した仮想例の基本条件を保ったまま、追加で置いた活用率と実現率を変えると、ROIは−43%から418%まで動きます。損益分岐はu×rがおよそ14.5%になるところで、「浮いた時間の半分を別の仕事に回し、申告どおりの節約の3割が実現している」程度だと、ほぼ収支トントンです。ROIの数字そのものより、uとrをどう確かめたかのほうが重要です。OpenAI自身も、この試算は推定上の余力の価値で、受注率の向上などは含まないと断っています。

この記事の表はいずれも仕組みを示すための仮想例で、特定企業の実データではありません。個人単位のシミュレーションでは、能力を対数正規分布(σ=0.5)、wを平均を指定したベータ分布とし、成果とトークンにそれぞれ対数正規の変動(σ=0.2、0.3)を加えました(乱数シード42)。実現率rも仮定で、METRの結果を営業業務に当てはめたものではありません。

なぜトークンは成果の代わりにならないのか

理由の一つは、トークンが「投入量」だからです。成果を出さずにトークンだけを増やす方法はいくらでもあり、しかもそれは成果を出すより簡単です。評価に使われる指標は、成果につながらない行動でも増やせる場合があります。この仮定モデルでは、その行動が増えるほどwが大きくなります。

もう一つは、トークン消費が利用コストに関係する点です。従量課金では消費量が増えるほど費用も増えやすくなりますが、単価はモデルや入出力の種類、契約によって異なります。トークン消費量を評価に使うと、コストの増加が評価上の利点になりえます。トークン量はAIの利用量を示しますが、それだけでは投資額も、得られた成果も分かりません。

とはいえ、成果の定義も簡単ではありません。タスク数も、目標にすればタスクを細かく分割する行動が増えます。バリューマキシングもグッドハートの法則から自由ではなく、違いは、分子が「届いた成果」に近いほど、攻略する行動と成果を出す行動が重なりやすいことです。AIで作った成果物が受け手の手間を増やす問題は、ワークスロップの記事で計算しています。

バリューマキシングを実践するには何を測ればよいか

まず、トークン量は評価に使わず、コスト管理にだけ使います。個人やチームの評価には結びつけず、ランキングも作りません。本文では、評価によってトークンだけを増やす行動が促され、wが大きくなる場合を仮定しました。

分子は「ユーザーに届いた成果」で定義します。リリースされた機能、解消された不具合、顧客に送った提案書の数など、組織の外や後工程に届いたものを数え、社内で作られただけの中間成果物は数えません。節約時間は、アンケートの自己申告とチケットの完了時間やリードタイムなどの記録を並べて、実現率rを推定します。両者がずれていたら、そのずれ自体が重要な発見です。

ROIは1つの数字でなく幅で報告します。活用率と実現率を振った表を作り、損益分岐の条件を添えれば、前提の楽観がそのまま意思決定に入り込むのを防げます。研修投資の回収を同じ考え方で計算した例は、AIスクールのROIの記事にまとめています。

AIをどの業務に使い、何を成果として測るかは、ツールの導入より先に決めておきたいことです。和からの生成AI法人研修では、業務ごとにAIの使いどころと効果の測り方を設計します。効果測定の比較や相関の読み方を基礎から身につけたい場合は、法人向けの統計研修もご利用いただけます。

よくある質問

バリューマキシングとトークンマキシングの違いは何ですか

トークンマキシングはAIの利用量(トークン消費量)を最大化しようとする考え方で、バリューマキシングはAIで生んだ成果を最大化しようとする考え方です。前者は投入量を、後者は産出量を目標にします。

トークン消費量を見ること自体が悪いのですか

悪くありません。トークン量はコストの把握や、AIが業務に浸透しているかの確認には役立ちます。問題は、それを個人の評価やランキングの目標にすることです。本記事の仮想モデルでも、誰も意識していない段階ではトークンと成果の相関は0.81と高く出ています。

成果が数えにくい仕事ではどう測ればよいですか

後工程が受け取った時点の指標を使うのが現実的です。たとえば資料なら差し戻し率、コードならレビュー後の修正回数やリリースまでの日数です。完璧な指標はないので、2〜3個を組み合わせ、どれか1つだけを目標にしないようにします。

OpenAIのROI 245%は信用できますか

試算の手順としては妥当ですが、OpenAI自身が「例示」としている数字です。活用率50%と節約時間3時間という前提が自社で成り立つかを確かめないまま使うと、本記事の表のように大きく外れる可能性があります。

監修/和から株式会社 堀口智之

Xでシェア Facebookでシェア LINEで送る

同じことを生成AIに頼むなら、どう書けば思ったとおりに返ってくるのか。そのまま貼って使える「話しかけ方」を30個、A4・7ページにまとめました。資料づくり・メール・数字の整理・学び直しの、4つの場面別です。

和からのメルマガに登録すると、この資料を含む3本をまとめてお送りします。登録はメールアドレスだけ、30秒で終わります。

3つのPDFを無料で受け取る

新着記事

同じカテゴリーの新着記事

同じカテゴリーの人気記事

この記事に関連する教室: 数学教室 →   社会人の学び直し講座 →

CONTACTお問い合わせ

遠方に在住の方や自宅で講義を受けたい方はオンライン講座をご用意しております。よくある質問はこちら