Azure OpenAIの料金は、処理したテキスト量(トークン数)に応じた従量課金制です。2026年10月時点では、GPT-5.4・GPT-5.5・GPT-5.6・GPT-6系といった新しい世代のモデルが中心で、モデルごとに入力・出力の単価が異なります。さらに、推論モデルでは「考える」ために使うトークンも出力として課金される点に注意が必要です。本記事では、最新モデルの料金の考え方、公式ツールを使った料金シミュレーションの手順、トークンを節約して運用コストを抑える具体的な方法をお伝えします。
この記事で分かること
- Azure OpenAIの従量課金制とトークンの仕組み(推論トークンを含む)
- 最新モデルの一覧と、公式サイトで料金を確認する手順
- 公式計算ツールを用いた料金シミュレーションの手順
- 出力上限・推論の強度・バッチ処理・キャッシュでコストを抑える方法
【ご注意】Azure OpenAIのモデルと料金は頻繁に更新されます。本記事では、確認が取れていない金額は掲載せず、具体的な単価は必ず公式サイトでご確認ください。確認先は、Azure OpenAI Service の価格ページとAzure 料金計算ツールです。
Azure OpenAIの料金体系の基本と特徴
Azure OpenAIの料金は、使用した分だけ費用が発生する従量課金制が基本です。初期費用はかからず、利用規模に合わせて柔軟にスケールアップできます。なお、Microsoft Learnでは現在、モデルの提供基盤を「Microsoft Foundry」と呼んでいますが、価格ページでは「Azure OpenAI Service」の名称も使われています。ここでは、料金の計算基準となる仕組み、最新モデルの価格の考え方、OpenAI社が直接提供するAPIとの違いを解説します。
従量課金制の仕組みとトークンの概念
Azure OpenAIの言語モデルにおける従量課金は、トークンと呼ばれるテキスト処理の単位に基づいて計算されます。
トークンは文字数や単語数と完全に一致するわけではなく、英語の場合は1トークンが数文字程度に相当します。日本語は英語に比べて1文字あたりの消費トークン数が多くなる傾向があるため、同じ内容でも日本語で処理する方がコストが高くなりやすい点に注意が必要です。
料金は「100万トークンあたり〇〇ドル」のように設定されており、ユーザーがAIに送信する「入力(プロンプト)」と、AIが生成する「出力」のそれぞれに個別の単価があります。あわせて、次の3点も料金に影響します。
- 推論トークン:推論モデルが回答の前に「考える」ために使うトークンは、出力トークンとして課金されます。回答が短くても、長く考えた分だけ費用が増えます(Microsoft Learn)
- キャッシュされた入力:同じ内容の入力を繰り返す場合、キャッシュ読み取り分の入力は割引単価で課金されます
- 入力の長さによる単価の区分:GPT-5.6やGPT-6系では、入力トークン数に応じて「短いコンテキスト」と「長いコンテキスト」の料金区分が分かれます(Microsoft Learn)
詳細な見積もり手順については、後述の「Azure OpenAIの料金シミュレーション方法」で解説します。
最新モデルの一覧と料金の考え方
Microsoft Learnに掲載されている主な最新モデルは次のとおりです。リリース日と、入力・出力を合わせたコンテキストウィンドウを整理しました。
| モデルシリーズ | 主なモデル | リリース日 | コンテキストウィンドウ |
|---|---|---|---|
| GPT-6.1 | gpt-6.1-sol | 2026年9月29日 | 約105万トークン |
| GPT-6 | gpt-6-astra、gpt-6-luna、gpt-6-sol | astra:2026年9月3日/luna・sol:2026年9月22日 | 約105万トークン |
| GPT-5.6 | gpt-5.6-sol、gpt-5.6-terra、gpt-5.6-luna | 2026年7月9日 | 約105万トークン |
| GPT-5.5 | gpt-5.5 | 2026年4月24日 | 約105万トークン |
| GPT-5.4 | gpt-5.4、gpt-5.4-pro | 2026年3月5日 | 約105万トークン |
| GPT-5.4(軽量) | gpt-5.4-mini、gpt-5.4-nano | 2026年3月17日 | 40万トークン |
これらのモデルは、推論の強度(reasoning effort)を設定でき、Responses APIとChat Completions APIの両方で利用できます。
各モデルの単価(100万トークンあたりの入力・キャッシュ入力・出力)は、更新が頻繁なうえ、モデルやデプロイ方式によって異なります。そのため本記事には金額を載せていません。次の手順で、公式サイトの最新の金額をご確認ください。
- Azure OpenAI Service の価格ページを開きます。
- 利用したいモデル名(上の表のモデル)と、デプロイ方式(Global・Data Zone・Regional)の項目を探します。
- 入力・キャッシュ入力・出力それぞれの単価と、通貨・リージョンを確認します。
- 価格が「準備中」などと表示されているモデルは、公式に金額が確定するまで見積もりに入れず、Azure営業窓口や料金計算ツールで確認します。
一般に、モデルの性能が高いほど単価は高くなります。コストを最適化するためには、タスクの難易度に応じてモデルを使い分けることが重要です。たとえば、難しい推論にだけ上位モデルを使い、要約や分類には軽量モデル(miniやnano)を使う方法があります。
【旧モデルの提供終了に注意】Microsoft Learnのモデル提供終了スケジュール(2026年9月21日更新)では、GPT-4o(2024-05-13版)が2026年12月9日、GPT-4o(2024-08-06版・2024-11-20版)とGPT-4o miniが2027年4月14日に提供終了予定です。画像生成のDALL-E 3など、そのほかの旧モデルの提供状況は、公式のモデル提供終了スケジュールで確認してください。旧世代のモデルを使っている場合は、新しいモデルへの移行を計画してください。
OpenAI本家のAPI料金との違い
ChatGPTの開発元であるOpenAI社も直接APIを提供しています。Azure OpenAIとの単価の差は、モデルやデプロイ方式、時期によって変わる可能性があるため、本記事では比較していません。両者を比べる場合は、Azureの価格ページとOpenAIの公式価格ページを見比べてください。
Azureにはデプロイ方式が「Global」「Data Zone(地域単位)」「Regional(リージョン指定)」の種類があり、データの保管・処理場所の指定によって単価が変わる場合があります。データの所在地に要件がある場合は、公式の価格ページで該当のデプロイ方式の金額を確認してください。
異なるのは、エンタープライズ向けの環境やセキュリティ要件です。Azure OpenAIは、Microsoft Azureのクラウドインフラ上で提供されるため、以下の点で企業利用に適しています。
- 入力したデータがAIのモデル学習に利用されないことが明言されている
- Microsoft Entra IDによる高度なアクセス制御が可能
- SLA(サービス品質保証)が適用され、一定の稼働率が保証される
セキュリティやガバナンスを確保するための付加価値がAzure OpenAIには含まれています。そのため、機密情報を扱うビジネス用途ではAzure OpenAIが選ばれる傾向にあります。
Azure OpenAIの料金シミュレーション方法
Azure OpenAIの導入を検討する際は、自社の利用規模に応じたコストを事前に把握することが不可欠です。ここでは、公式ツールを用いた具体的な見積もり手順と、テキスト生成および画像生成のコストの考え方を解説します。
公式の価格計算ツールを使った見積もり手順
Microsoftが提供するAzure 料金計算ツールを使用することで、利用予定のモデルやデータ量に基づいた月額費用のシミュレーションが可能です。以下の手順で見積もりを作成します。
- Azure 料金計算ツールにアクセスし、検索窓に「Azure OpenAI」と入力してサービスを追加します。
- 追加された項目で、利用するリージョンとデプロイ方式(Global・Data Zone・Regional)を選択します。
- デプロイ予定のモデル(GPT-5.5、GPT-5.4 miniなど)と、想定される月間の入力・出力トークン数を入力します。
- 必要に応じて、ファインチューニングのホスティング時間や学習時間などの追加オプションを設定し、算出された推定月額料金を確認します。
入力するトークン数は、実際のプロンプトの長さやユーザーとのやり取りの頻度を考慮して少し多めに見積もることで、運用開始後の予算超過を防ぐことができます。推論モデルでは、出力トークンに推論トークンが含まれるため、出力は回答の長さより多めに見積もりましょう。
テキスト生成における利用コストの計算方法
テキスト生成モデルの料金は、100万(1M)トークンあたりの単価で設定されています。月額の目安は、次の式で計算できます。
- 月額の目安 = 月間の入力トークン数 ÷ 100万 × 入力単価 + 月間の出力トークン数 ÷ 100万 × 出力単価
- 推論モデルでは、出力トークンに推論トークンが含まれるため、出力は多めに見積もる
- キャッシュされた入力には割引単価が適用されるため、繰り返し送る固定の指示文が多い場合は別枠で計算する
単価は、公式のAzure OpenAI Service の価格ページで確認した金額を当てはめてください。トークン数の見積もりでは、日本語は英語より1文字あたりの消費トークンが多くなりやすい点に注意が必要です。実際のプロンプトでトークン数を測り、少し多めに見積もると安全です。
画像生成モデル利用時の料金シミュレーション
画像生成では、Microsoft Learnで、GPT-Image-2.5-Sunburst、GPT-Image-2.5-Flare、GPT-Image-2が一般提供(GA)として紹介されています。利用できるモデルは変わることがあるため、最新の一覧は公式で確認してください。
画像生成の料金は、1枚あたりの固定額ではなく、トークンを基準に計算されます。画像のサイズや品質によって消費するトークン数が変わるため、1枚あたりの費用は設定次第で変動します。Microsoft Learnには具体的な金額の記載がなかったため、本記事では単価を示していません。見積もりは、料金計算ツールで利用するモデルを選び、想定する生成枚数と設定で試算してください。
画像生成は試行錯誤により生成回数が増えやすいため、1日あたりの生成上限枚数を想定しておくと、正確なコストシミュレーションが可能です。
Azure OpenAIの料金を抑えるトークン節約のポイント
Azure OpenAIの課金は、リクエストで送信する入力トークンと、AIが生成する出力トークン(推論トークンを含む)の合計で決まります。そのため、利用料金を削減するにはトークン消費量をいかに抑えるかが重要です。
プロンプトを最適化して入力トークンを減らす方法
入力トークンを減らす最も直接的な方法は、プロンプト(指示文)を簡潔かつ明確にすることです。AIに背景情報を与えることは精度向上に役立ちますが、不要な装飾語や冗長な説明を含めると、それだけでトークンが消費されてコストが増加します。
具体的には、以下の点に注意してプロンプトを作成します。
- 挨拶や丁寧すぎる表現(「こんにちは」「〜していただけますでしょうか」など)を省く
- 英語で指示を出す(日本語は英語に比べてトークン数が多くなりやすいため)
- 必要な情報だけを箇条書きで整理して渡す
英語プロンプトの活用は特に効果的です。同じ意味の文章でも、日本語よりも英語の方が消費トークン数が少なくなる傾向があるため、コスト削減につながります。入力時は英語で指示し、出力だけを日本語に指定するといった工夫も有効です。
出力の上限と推論の強度を設定する
最新の推論モデルでは、出力の上限を指定するパラメータが従来と異なります。従来の「max_tokens」は、推論モデルではサポートされていません(GPT-6 Astraを除く)。代わりに、Chat Completions APIでは「max_completion_tokens」、Responses APIでは「max_output_tokens」を使います。Microsoft Learnの推論モデルの解説によると、この上限は、推論トークン、画面に表示される回答のトークン、書式のトークンのすべてを含みます。
| 設定項目 | 目的 | 設定のポイント |
|---|---|---|
| max_completion_tokens/max_output_tokens | 出力(推論を含む)の上限設定 | 推論トークンも上限に含まれるため、小さすぎると回答が途中で切れるおそれがあります。余裕を持たせて設定しましょう |
| reasoning_effort | 推論の強度の指定 | none、minimal、low、medium、high、xhigh、maxなどが用意されています。強度が高いほど推論トークンが増えるため、簡単なタスクは低めに設定します |
| stop | 特定の文字列で生成を停止 | 「以上」「まとめ」などのキーワードを指定し、不要な続きの生成を防ぎます |
用途に合わせてこれらのパラメータを調整することで、必要な情報だけを少ないトークン数で得ることが可能になります。
過去の会話履歴の保持を最小限にする工夫
チャット形式のシステムを構築する場合、文脈を維持するために過去の会話履歴をAPIに毎回送信する必要があります。しかし、会話が長くなるほど送信する履歴データが蓄積し、入力トークン数が雪だるま式に増加してしまいます。
この問題を解決するためには、システム側で保持・送信する履歴の量に制限を設ける仕組みが必要です。
- 直近の数回分(例:過去3〜5往復)の会話のみを送信するようシステムを構築する
- 古い会話履歴を定期的に要約モデルにかけ、短いテキストに圧縮してから送信する
- タスクが切り替わるタイミングで、ユーザーにセッションをリセット(新規チャットを開始)させるUIにする
特に、業務用の社内アシスタントなどを開発する際は、会話履歴の保持件数をシステム側で強制的に制限することが、コスト肥大化を防ぐ上で必須の対策となります。
バッチ処理とプロンプトキャッシュで節約する
プロンプトの工夫に加えて、Azure側の仕組みを使うとコストを下げられます。
- バッチAPI:即時の応答が不要な大量処理は、24時間以内に結果が返るバッチAPIで、Global Standardの価格から50%割引になります(Azure公式の価格ページに記載)
- プロンプトキャッシュ:先頭の1,024トークン以上が同一のプロンプトを繰り返し送る場合、キャッシュ読み取り分の入力トークンは割引料金で課金されます(Microsoft Learn)。固定の指示文や参考資料は、プロンプトの先頭にまとめると効果的です。キャッシュの割引率や課金の条件はモデルによって異なるため、公式の価格ページで確認してください
- モデルの使い分け:難しい推論にだけ上位モデルを使い、要約や分類にはminiやnanoを使います
大規模で継続的な運用では、時間単位で処理能力を確保する「プロビジョンドスループット(PTU)」や、予約による割引もあります。利用規模が大きい場合は、従量課金との比較を検討しましょう。
よくある質問(FAQ)
Azure OpenAIの料金は日本円で支払うことができますか
Azure OpenAI Serviceの利用料金は日本円で支払うことが可能です。Azureアカウントの設定時に日本円(JPY)を基本通貨として選択することで、為替変動の影響を直接受けずに日本円での請求書発行やクレジットカード決済が行われます。支払い方法には、クレジットカードのほか、一定の条件を満たす法人であれば請求書払い(口座振込)も選択できます。
Azure OpenAIに無料枠はありますか
Azure OpenAI Service自体には、毎月更新されるような恒久的な無料枠は設けられておらず、利用したトークン数に応じた完全従量課金制が適用されます。ただし、Azureの無料アカウントを新規作成した際に付与される無料クレジット(サインアップから30日間有効な約200米ドル相当)を、Azure OpenAIの利用料金に充当することは可能です。このクレジットの有効期限が切れるか、使い切った後は通常の従量課金へと移行します。
Azure OpenAIの料金上限を設定することは可能ですか
Azure標準の機能では、指定した金額に達した時点で自動的にサービスを停止する「ハードリミット」を直接設定することはできません。しかし、Azure Cost Managementの予算機能を利用することで、利用金額が設定した予算の一定割合(例:80%や100%)に達した際に、メールでアラート通知を受け取ることが可能です。
さらに厳密な上限管理を行いたい場合は、予算アラートをトリガーとしてAzure Logic AppsやAzure Functionsを実行し、自動的にAzure OpenAIのリソースを停止・無効化する仕組みを独自に構築する必要があります。
Azure OpenAIの料金確認はどこから行えますか
利用料金の確認は、Azureポータル内の「コストの管理と請求(Cost Management + Billing)」メニューから行います。この画面では、日々の利用コストの推移や、リソースごとの内訳を視覚的に把握できます。
| 確認できる主な項目 | 説明 |
|---|---|
| 累積コスト | 現在の請求期間における総利用金額 |
| リソース別のコスト | Azure OpenAIやその他のAzureサービスごとの料金内訳 |
| 予測コスト | 現在の利用ペースに基づいた月末時点の着地予想金額 |
最新の上位モデルの利用料金が高額になるのを防ぐにはどうすればよいですか
上位の推論モデルは、入力・出力の単価が高く、推論トークンも出力として課金されるため、意図しない高額請求を防ぐ対策が重要です。APIリクエスト時のパラメータ設定とAzure側の管理機能を組み合わせることで、コストをコントロールできます。
- 出力上限の設定:max_completion_tokens(またはmax_output_tokens)で、推論を含む出力の上限を制限します。
- 推論の強度の調整:簡単なタスクではreasoning_effortを低めにして、推論トークンを抑えます。
- プロンプトの最適化:システムプロンプトや過去の会話履歴を必要最小限に絞り込み、入力トークン数を削減します。
- 予算アラートの設定:Azure Cost Managementで日次または月次の予算を設定し、想定外の利用急増を早期に検知します。
- モデルの使い分け:複雑な推論が必要なタスクにのみ上位モデルを使い、単純な要約やテキスト整形にはminiやnanoを利用します。
まとめ
Azure OpenAIの料金体系やシミュレーション方法、コストを抑えるポイントについて解説しました。従量課金制であるため、利用するモデルやトークン数によって費用が変動します。
- 料金は消費トークン数に基づく従量課金制で、推論モデルでは推論トークンも出力として課金される
- 最新モデルは世代・サイズごとに単価が異なるため、タスクに合わせて使い分け、金額は公式サイトで確認する
- 公式の価格計算ツールを活用することで、事前に具体的な利用コストの目安を把握できる
- 出力上限・推論の強度の調整、履歴の最小化、バッチ処理、プロンプトキャッシュでトークン消費を節約できる
まずは公式の価格計算ツールを使って、自社の要件に合わせた料金シミュレーションを実践してみましょう。適切な設定と運用で、コストを抑えながらAzure OpenAIを効果的に活用してください。










