SkillogyQiitaを読む
コラム一覧に戻る

生成AI APIの料金はどう決まる?トークン課金の仕組みと月額の試算方法

ChatGPTやClaude、Geminiといった生成AIを自社のシステムや業務ツールに組み込む場合、多くはAPIを通じて利用します。APIの料金は月額固定ではなく、使った量に応じて請求される従量課金が基本です。

従量課金は小さく始められる反面、「月にいくらかかるのか」が事前に分かりにくいという難しさがあります。社内で試したときは数百円だったのに、全社に展開したら請求額が桁違いになった、という話は珍しくありません。逆に、費用を心配しすぎて性能の低いモデルを選び、業務で使えない品質になってしまうこともあります。

加えて、生成AIのAPIはモデルの追加や価格改定が頻繁に行われます。ある時点で調べた単価が数か月後には変わっていることも多いため、単価そのものを覚えるより、料金がどう決まるかの仕組みと、自社の使い方から月額を見積もる方法を理解しておく方が役に立ちます。

この記事では、トークン課金の仕組み、主要なAPIの料金体系の違い、割引や追加料金の考え方、月額の試算手順、費用を抑える設計のポイントを、発注・導入を判断する立場の方向けに解説します。

生成AI APIの課金はトークン単位で決まる

生成AI APIの課金はトークン単位で決まる

生成AIのAPIは、文字数やリクエスト回数ではなく「トークン」という単位で課金されます。トークンは、モデルが文章を処理する際の区切りの単位で、単語や単語の一部、記号などに相当します。料金表では「100万トークンあたり何ドル」という形で示されるのが一般的です。

課金の対象になるトークンは、大きく入力と出力に分かれます。

  • 入力トークンは、モデルに渡す指示文(システムプロンプト)、ユーザーの質問、参照させる社内文書、会話の履歴など
  • 出力トークンは、モデルが生成した回答の文章

多くのモデルでは、出力トークンの単価が入力トークンの数倍に設定されています。そのため、長い回答を生成させる用途ほど費用が膨らみます。また、推論の過程で内部的に考える「思考(thinking)」機能を持つモデルでは、その思考部分も出力トークンとして課金される場合があります。たとえばGoogleのGemini APIの料金表では、出力料金に「思考トークンを含む」と明記されています。

見落としやすいのが、入力トークンに含まれるものの多さです。チャット形式のアプリケーションでは、会話が続くたびにそれまでの履歴を毎回モデルに送り直します。社内文書を検索して回答させる仕組み(RAG)では、検索で見つかった文書の本文も入力になります。ユーザーが入力した質問は短くても、実際に課金される入力トークンは数千から数万に達することがあります。

もう一点、同じ文章でもモデルによってトークン数が変わることにも注意が必要です。トークンへの分割方法(トークナイザー)はモデルごとに異なり、日本語は英語よりも文字あたりのトークン数が多くなりやすい傾向があります。Anthropicの料金ページでは、Claude 4.7以降のモデルは新しいトークナイザーを採用しており、同じ文章でトークン数がおよそ30%増えると説明されています。単価が同じでも、トークン数が変われば請求額は変わるということです。正確な数を知りたい場合は、各社が提供するトークン数の計測機能で、自社の実際の文章を測るのが確実です。

参考:Pricing/Anthropic

参考:Gemini Developer API pricing/Google AI for Developers

主要APIの料金体系を比べる(2026年10月時点)

主要APIの料金体系を比べる(2026年10月時点)

ここでは、Anthropic、OpenAI、Googleの公式料金ページで2026年10月3日時点に確認した単価の一部を紹介します。いずれも米ドル建て、100万トークンあたりの標準料金です。各社とも価格改定やモデルの入れ替えが頻繁にあるため、導入時には必ず公式ページで最新の値を確認してください。

提供元 モデル 入力(100万トークンあたり) 出力(100万トークンあたり)
Anthropic Claude Sonnet 5.5 2ドル 10ドル
Anthropic Claude Haiku 4.5 1ドル 5ドル
OpenAI gpt-6.1-sol(短いコンテキスト) 2ドル 10ドル
OpenAI gpt-6-luna(短いコンテキスト) 0.10ドル 0.50ドル
Google Gemini 3.1 Pro Preview(プロンプト20万トークン以下) 2ドル 12ドル
Google Gemini 3.8 Flash(2026年12月31日まで) 0.75ドル 3.75ドル

この表からも分かるように、同じ提供元の中でも、上位モデルと軽量モデルで単価に数倍から数十倍の差があります。また、表の単価がそのまま適用されない条件もあります。

  • OpenAIの料金表は短いコンテキストと長いコンテキストで単価が分かれており、gpt-6.1-solの長いコンテキストでは入力4ドル、出力15ドルになる
  • Gemini 3.1 Pro Previewは、プロンプトが20万トークンを超えると入力4ドル、出力18ドルになる
  • Gemini 3.8 Flashは、2027年1月1日から入力1.50ドル、出力7.50ドルへの変更が予告されている
  • AnthropicはClaude 4.6以降のモデルで、100万トークンのコンテキスト全体を標準料金で提供している

このように、長い文書を扱うかどうか、いつまで使うかによって実際の単価は変わります。料金を比較するときは、表の数字だけでなく、自社の使い方がどの条件に当たるかを確認することが大切です。

また、Gemini APIには無料枠がありますが、料金表では無料枠で送信した内容は「製品の改善に使用される」とされ、有料枠では使用されないと記載されています。業務データを扱う場合は、無料枠で試す段階から送信する内容に注意してください。

参考:Pricing/OpenAI

請求額を左右する割引と追加料金

請求額を左右する割引と追加料金

トークン単価に加えて、各社はいくつかの割引の仕組みと追加料金を設けています。設計段階でこれらを使えるかどうかで、同じモデルでも請求額が大きく変わります。

仕組み 内容(2026年10月時点) 向いている用途
バッチ処理 結果をすぐに返さない非同期処理で、Anthropic、OpenAI、Googleとも標準料金の50%で利用できる 夜間の一括要約、大量文書の分類など、即時性が不要な処理
プロンプトキャッシュ 毎回同じ前半部分(指示文や参照文書)を再利用し、入力単価を下げる。Anthropicではキャッシュ読み出しが基本の入力単価の0.1倍(一部モデルはさらに低い)、書き込みは5分保持で1.25倍、1時間保持で2倍 長いシステムプロンプトや同じマニュアルを繰り返し参照するチャット
Web検索などのツール トークン料金とは別に回数で課金される。AnthropicのWeb検索は1,000回あたり10ドル、Gemini 3系のGoogle検索連携は月5,000回の無料分を超えると1,000回あたり14ドル 最新情報を調べさせる用途。検索回数の上限設定が重要
データ所在地の指定 処理する地域を指定すると割増になる。AnthropicはUS限定の推論で1.1倍、OpenAIは地域処理エンドポイントで10%増(2026年3月5日以降に公開されたモデル) データの処理地域に社内規程や契約上の制約がある場合

プロンプトキャッシュは、うまく使えば効果の大きい仕組みです。たとえば社内規程を毎回参照させるチャットボットでは、規程の本文をキャッシュしておけば、2回目以降はその部分の入力料金が大きく下がります。ただし、キャッシュには保持時間があり、利用間隔が空くと再び書き込み料金がかかります。利用頻度が低い用途では、思ったほど下がらないこともあります。

バッチ処理は、即時の応答が不要な処理であれば、ほぼそのまま半額になる分かりやすい割引です。顧客対応のように待たせられない処理は通常料金、社内向けの集計や分類は夜間にバッチ処理、と処理の性質で使い分けるのが基本です。

月額の試算方法と計算例

月額の試算方法と計算例

APIの月額は、次の手順で試算できます。

  • 1回の処理あたりの入力トークン数と出力トークン数を見積もる
  • 1か月あたりの処理回数を見積もる
  • 入力と出力それぞれのトークン総数に単価を掛けて合計する
  • キャッシュやバッチの割引、ツールの利用料、為替を反映する

1回あたりのトークン数は、机上で推測するより、実際の質問と回答のサンプルを10件程度用意してトークン数を測る方が確実です。とくに入力側は、指示文、参照文書、会話履歴を含めた合計で測ってください。

ここでは仮の利用状況として、社内規程に答えるチャットボットを考えます。以下の利用量は計算方法を示すための仮定で、実在の事例ではありません。

前提(仮定) 値
1日の質問数 200件
1回あたりの入力トークン(指示文、検索した規程、質問の合計) 8,000トークン
1回あたりの出力トークン 600トークン
月の稼働日数 20日

この場合、月の処理回数は4,000回です。入力トークンの合計は3,200万トークン、出力トークンの合計は240万トークンになります。

2026年10月時点のClaude Sonnet 5.5の標準料金(入力2ドル、出力10ドル)で計算すると、入力が32×2ドルで64ドル、出力が2.4×10ドルで24ドル、合計88ドルです。同じ条件でClaude Haiku 4.5(入力1ドル、出力5ドル)なら、入力32ドル、出力12ドルで合計44ドルになります。仮に1ドル=150円と置くと、それぞれ月1万3,200円、6,600円程度です。為替は変動するため、予算化する際は自社の想定レートで計算してください。

この計算から分かるのは、この用途では入力トークンが費用の大半を占めているということです。費用を下げたいなら、出力を短くするよりも、毎回送る参照文書の量を減らすか、キャッシュを使う方が効果があります。用途によってどちらが大きいかは変わるため、試算では入力と出力を分けて見ることが重要です。

また、この試算は本番運用の分だけです。開発中のテスト、精度評価のための繰り返し実行、エラー時の再試行もトークンを消費します。予算を組む際は、本番分の試算に一定の余裕を上乗せしておくと安全です。

料金を抑える設計と見落としやすいコスト

料金を抑える設計と見落としやすいコスト

APIの料金は、モデルの選び方と処理の設計で大きく変わります。判断の基準は次のように整理できます。

状況 おすすめの設計
分類、抽出、定型的な要約が中心 軽量モデルで精度を評価し、十分なら軽量モデルを採用する
難しい質問と簡単な質問が混在する 簡単な処理は軽量モデル、難しい処理だけ上位モデルに振り分ける
同じ長い指示文や文書を毎回送る プロンプトキャッシュを前提に、変わらない部分を先頭にまとめる
即時の応答が不要な大量処理 バッチ処理で標準料金の半額にする
会話が長く続く 古い履歴を要約して圧縮するか、一定数で打ち切る

モデル選びでは、最初から最上位モデルを使うのではなく、実際の業務データで複数のモデルを評価し、必要な品質を満たす中で最も安いものを選ぶのが基本です。評価用の質問と期待する回答のセットを作っておけば、価格改定や新モデルの登場時にも、同じ基準で乗り換えを判断できます。

一方で、見落としやすいコストもあります。

  • エージェント型の処理で、モデルが自律的にツール呼び出しを繰り返し、1回の依頼で何十回もAPIが呼ばれる
  • エラー時の自動再試行で、同じ処理が何度も課金される
  • Web検索などのツール利用料がトークン料金とは別に積み上がる
  • モデルの提供終了に伴い、より高い後継モデルへの移行が必要になる

こうしたリスクに備えるため、運用開始前に、APIの管理画面で利用額の上限やアラートを設定し、アプリケーション側でも1回の処理で呼べる回数や出力の長さに上限を設けておきましょう。利用量を処理の種類ごとに記録しておけば、どこで費用がかかっているかを後から分析できます。

明日からできることは、自社で想定している用途について、実際の質問と回答の例を10件集めることです。それがあれば、トークン数を測り、本記事の手順で月額を試算し、モデルごとの比較を始められます。

まとめ

まとめ

生成AI APIの料金は、入力トークンと出力トークンの量に、モデルごとの単価を掛けて決まります。入力には指示文や参照文書、会話履歴まで含まれるため、ユーザーの質問の長さだけで見積もると過小評価になります。

単価はモデルによって数十倍の差があり、長いコンテキストの割増、期間限定の価格、バッチ処理やプロンプトキャッシュの割引、ツールの利用料など、表の単価以外の条件も請求額を左右します。2026年10月時点の単価を本記事で紹介しましたが、各社とも改定が頻繁なため、導入時には公式の料金ページで確認してください。

試算は、実際の質問と回答のサンプルでトークン数を測り、処理回数を掛けるところから始まります。入力と出力を分けて見れば、どこを削れば費用が下がるかも見えてきます。品質の評価基準を用意したうえで、必要な品質を満たす最も安いモデルを選ぶことが、費用と品質を両立させる近道です。