*この記事は「さくらのAI検定( https://www.sakura.ad.jp/ai-certification/ )」教材として作成しています。

ここでは、さくらのAI Engineの料金体系の考え方を理解します。 

トークン、チャンク、ベクトル埋め込みといった基本要素が、どのように利用量やコストに関係しているのかを整理しながら、課金の仕組みを確認します。 

また、コントロールパネルでの利用量・料金確認方法を通して、コストを意識した使い方を学びます。 

 
あわせて、API利用時の注意点やコスト効率を高めるための考え方にも触れ、実運用を見据えた理解を深めます。

さくらのAI Engineにおけるコスト設計のポイント

ここでは、「トークン」「チャンク」「プラン」の知識を活用して、さくらのAI Engineを実際に利用することでどの程度のコストが発生するのか、コスト設計を行う上でのポイントを学習します。

APIエンドポイント別のリクエスト消費ルール

さくらのAI Engineでのチャットモデルでは、利用するAPIの種類によって「チャット」と「埋め込み」のカウンターが連動して動きます。用途に合わせて最適なAPIを選択することが、コスト設計の第一歩です。

  • 通常のチャット(/chat/completions)
    • チャット:1回 / 埋め込み:消費なし
    • 検索を行わない純粋な対話用です。最もシンプルなカウント方式です。
  • ベクトル検索のみ (/documents/query)
    • チャット:消費なし / 埋め込み:1回
    • 「資料の中から関連箇所を探す」ことだけに特化したAPIです。回答文を生成しないため、埋め込みモデルのみが消費されます。
  • RAG検索による回答生成 (/documents/chat)
    • チャット:1回 / 埋め込み:1回
    • 質問文のベクトル変換(埋め込み)と、回答の生成(チャット)をセットで処理するAPIです。

「検索から回答生成まで一括で行う」なら/documents/chatを前提に見積もります。一方、「さくらのAI Engineでベクトル検索のみを行い、回答生成は外部のLLMを組み合わせる」といった設計なら、検索に特化した/documents/queryをベースに見積もることができます。

このように、どのようなシステム構成にするかによって利用するエンドポイントとコストが変わるため、設計段階での正確な切り分けが重要です。

コスト効率を高めるための注意点

同じ目的のシステムを構築しても、設計の考え方一つで運用コストに大きな差が生じます。ここでは、コストパフォーマンスを最適化するために意識すべき4つの視点を学びます。

  • タスクに応じたモデルの使い分け

すべての処理に最高性能のモデルを使用する必要はありません。例えば、単純な分類や定型的な変換には低単価な小型モデルを選択し、複雑な推論が必要な場面にのみ高性能モデルを割り当てることや、前処理を安価なモデルで行うなどの設計を行うことで、全体のコストを抑えることが可能です。

  • 入力トークン増大への対策(コンテキスト管理)

チャット形式では、過去の会話履歴をどこまで保持するかがコストに直結します。履歴をすべて累積させると、会話が続くほど入力トークンが雪だるま式に増加します。直近の数往復分に履歴を絞るなど、送信する情報量を適切に管理しましょう。

  • RAG検索における「参照資料」の加算

RAG検索による回答生成を行う場合、チャットモデルへの入力トークンには、ユーザーからのプロンプトだけでなく、検索結果として得られた資料(チャンク)の本文が加算されます。例えば、50文字の質問であっても、裏側で1,500文字の資料が参照されれば、合計1,550文字分の入力コストが発生することを前提に見積もる必要があります。

  • リトライ(再試行)による重複コストの防止

エラー応答などイレギュラーケースが発生した場合に、システムが自動でリクエストを繰り返すと、消費トークンが膨らむリスクがあります。無制限なリトライ設定を避け、実行回数の上限設定や、ユーザーの意思で再試行させるUI設計など、意図しないリクエストの連発を防ぐ工夫が必要です。

コスト算出のための検討フロー例

① 用途の確定(APIの選定)

まず、実現したい内容からどのモデルを使用するかを特定し、消費されるリクエストの種類(トークン・秒数・チャンク)を明確にします。

  • 高度な推論・コード開発
  • マルチモーダル・画像理解
  • RAG検索(ドキュメント検索・回答)
    • 検索+回答生成(/documents/chat)
    • 検索のみ(/documents/query)
  • 音声書き起こし

②データ量の予測(トークンの見積もり)

1リクエストあたりの「ユーザー入力」「参照資料」「会話履歴」の合計トークンを算出します。さらにRAGの場合は、「登録する全資料の総量(チャンク数)」把握します。さくらのAI Engineでは、チャンク数を元に資料が多いほど初期登録および月額の保管コストに影響します。

③頻度の予測(リクエスト数の見積もり)

利用人数 × 1日の平均質問数から、月間の総リクエスト数を出し、各モデルの無償プラン枠(例:月3,000リクエスト)に収まるか、従量課金がいくらになるかを確認します。

④バッファの設定(リトライ・エラー対策)

ネットワークの不安定さや再実行、精度の再調整による予期せぬ消費を考慮し、算出した見積もりに20%〜30%程度の余裕(バッファ)を持たせます。

このように、用途ごとに「何が課金対象になるか」を正しく選定することで、実運用に即した精度の高いコスト試算が可能になります。まずは小規模な検証で実際の消費量を計測し、検証しながら構成を設計することで、運用開始後に予算を大幅に超過するといった事態を防ぐことができます。

まとめ

ここでは、さくらのAI Engineの料金が「トークン」「チャンク」「プラン」という複数の要素の組み合わせによって決まることを確認しました。
特にRAGを利用する場合は、チャット生成の回数だけでなく、埋め込みモデルの利用回数やドキュメントの保管料が継続的に発生する点に注意が必要です。


これらの仕組みを理解したうえで、APIの選択や参照データ量、利用頻度を整理することで、実運用を見据えた適切なコスト設計が可能になります。

さくらのAI検定について

「さくらのAI検定」は、AIに取り組む企業や AIの学びを深めたい学校の先生、次世代を担う学生など、広範囲に渡るAI人材育成のためにさくらインターネットが設立した検定です。本コースでは、まず AI をさまざまな場面で使いこなすための基本知識を学ぶ「AI基礎」を提供します。そのうえで、さくらインターネットが提供する AI サービスの構成を理解し、さらに多様なハンズオンを通じて AI を実践的に学べる内容となっています。  

本教材は、体験と理論を段階的に紐づけ、AIサービスの仕組みと活用方法を体系的に学べる構成としています。

なお、本教材に掲載している内容は、教育目的でその利用方法を紹介するものであり、さくらインターネット株式会社が当該技術の権利を有するもの、または公式に提供・保証するものではありません。 

さくらのAI検定「AI実践」 目次

さくらのAI Engine 実践

  • さくらのAI Engine 利用開始の手順
    • さくらのAI Engine 利用開始の手順  
  • Playgroundを使ったチャット
    • Playgroundを使ったチャット  
  • ドキュメント連携とRAG
    • RAGの概要
    • Playgroundを使ったRAGの実行
    • APIを使ったRAGの実行
  • 音声文字起こしAPI実践
    • 音声文字起こしAPIの概要
    • 音声文字起こしAPIの実行
    • 応用編1:長時間音声の文字起こし
    • 応用編2:文字起こし結果のサマリー作成
  • MCP構成設計
    • MCPの概要 
    • MCPを使った外部ツール連携
    • クライアントへのMCP Server組み込み
  • マルチモーダルAPI実践
    • マルチモーダルAPIの概要
    • さくらのAI EngineにおけるマルチモーダルAPI  
    • マルチモーダルAPIを使った画像認識
  • さくらの AI Engine料金体系
    • さくらのAI Engineにおけるコスト計算の概要
    • さくらのAI Engineにおけるコスト設計のポイント(本記事)

高火力DOK実践

  • 高火力DOKの概要
    • 高火力DOKの概要
  • ノートブックによる画像生成
    • ノートブックによる画像生成  
  • 音声合成
    • OpenVoiceを使った音声合成実践
  • Open WebUI実践
    • Open WebUIを使ったLLM環境の構築
  • タスクによる画像生成
    • タスクによる画像生成
  • LoRA(軽量追加学習)実践
    • LoaRAを使った画像生成実践

\ シェア /