生成AIを使う企業にとって、次の論点は「導入するか」ではなく「どう持続的に運用するか」です。背景にあるのは、生成AIが従来の席課金(シート課金)型ソフトウェアとは異なり、従量課金(消費量ベース)の色合いを強めていることです。Gartner Newsroomの2026年6月24日付記事では、AI関連ツールで席課金から消費量ベースの価格体系への移行が進み、トークン消費の増加がコスト予測やROI管理を難しくしていると指摘されています。さらに、Gartner Newsroomの2026年3月25日付記事では、エージェント型AIは従来型の生成AIチャットより1タスクあたり5〜30倍のトークンを必要とする場合があるとも述べられています。

  1. 生成AIは席課金だけではなく、従量課金でコストが膨らみやすい

  2. その結果、企業にはトークン制御と可視化が求められる

  3. Gleanはコンテキスト理解によって、その両立を支えるアプローチを取っています

Index

なぜ今「トークン制御」か

企業にとって問題なのは、AIの利用回数そのものではありません。回答が少しずれるたびに、再検索(必要な情報を探し直すこと)や再生成(回答を出し直すこと)が起き、そのたびにトークンが積み上がることです。利用が広がるほど、コストはID数よりも、処理の重さと手戻りの多さに左右されます。だからこそ今、必要なのは「たくさん使うこと」ではなく、「少ないやり直しで成果に結びつけること」です。

業界の潮流

この流れは、2026年の主要カンファレンスでもはっきり示されていました。Snowflake Summit 2026 Opening Keynoteでは、AIとデータを別々のスタックで扱うとサイロが再発し、ガバナンスとコストが悪化すると語られています。また、AIを機能させるには、企業固有のデータとコンテキスト、そしてそれらを統制するコントロールプレーンが必要だと強調されています。

Databricksの Data + AI Summit Keynote 2026 | Day 1 でも、メッセージは同じでした。Databricksは「AIは知能の問題ではなく、コンテキストの問題だ」と述べたうえで、企業でAIを機能させるには、コンテキスト、ガバナンス、コスト管理、そして選択の自由が欠かせないと整理しています。さらに、エージェントがライブに情報を探索し続ける方式は、時間もコストもかかり、品質も落ちやすいと説明しています。

トークン制御の本質と設計原則

トークン制御は、入力をただ短くする話ではありません。本質は、不要な情報を減らしながら、必要な情報を外さないことにあります。設計原則としては、次の3点に整理できます。

  1. 必要なコンテキストだけを使う

  2. 再検索や再生成を減らす

  3. ガバナンスを保ったまま、使う情報を絞る

この3つがそろって初めて、精度とコスト効率を両立しやすくなります。

Gleanのアプローチと効果

ここでGleanが効いてきます。Gleanは、ユーザーや組織のコンテキストを理解したうえで、必要な情報だけを必要なタイミングで扱う設計を取っています。情報を大量に投げ込むのではなく、検索と回答の両方でコンテキストを活用することで、初回から目的に近い答えを出しやすくし、無駄な再検索や再生成を減らします。

公開情報でも、Gleanは2026年5月13日公開のブログ『Context makes the Coworker: Glean preferred ~2.5x as often as off-the-shelf MCP tools, which consumed 30% more tokens in Claude Cowork』で、一般的なMCPツールと比べてトークン使用量を30%削減した結果を示しています。加えて、2026年6月3日公開の『How to optimize token efficiency in agentic systems』や『How IT leaders can optimize AI investments beyond seat count』では、トークン効率はモデル価格だけでなく、コンテキスト設計、オーケストレーション、ガバナンスで改善できるテーマだと整理されています。単に安くするのではなく、精度を上げながら手戻りを減らし、その結果としてコストも抑える。そこがGleanの価値です。
その考え方を具体化しているのが、Gleanの検索特化モデルであるWaldoです。Waldoは、検索計画を先に軽量な特化モデルで処理し、必要な情報が揃ってからフロンティアモデルに引き渡す設計を取っています。つまり、すべての問い合わせを最初から高コストなモデルに載せるのではなく、必要な処理だけを高性能モデルに回すことで、品質を維持したまま無駄なトークン消費を抑える考え方です。公開情報では、この設計によってGlean全体でトークン使用量を約25%削減し、レイテンシも約50%削減できたとされています。さらに、約半分のクエリは高速経路のまま処理できるため、毎回フロンティアモデルのフル性能を使わずに済みます。

まとめ:持続可能なAI運用へ

これからのAI基盤選定で問われるのは、どのモデルが一番賢いかだけではありません。企業のデータや業務のコンテキストを踏まえ、少ないトークンで仕事に使える答えへどれだけ早く近づけるかが重要です。まず見るべきなのは、自社のAI活用でどこに再検索や再生成が多いのか、その結果としてどこでトークン消費が膨らんでいるのかです。社内では「再検索・再生成比率」や「1問あたり平均トークン」を主要KPIとして可視化し、改善を回していくことが有効です。トークン制御は、節約の話ではなく、企業が生成AIを持続可能に使うための設計思想になりつつあります。

カテゴリー

タグ

お気軽にご相談ください。

Exhibitions & Seminarsイベントセミナー

資料ダウンロード

関連ソリューション・関連製品

ProLabs(プロラボス)
ProLabs(プロラボス)
ProLabsは高品質かつ低価格のサードパーティ製光トランシーバーを提供いたします。業界標準規格品やベンダー互換品など豊富な製品ラインナップを揃えております。

ProLabsは高品質かつ低価格のサードパーティ製光トランシーバーを提供いたします。業界標準規格品やベンダー互換品など豊富な製品ラインナップを揃えております。

っっさあ

テキスト