Craft RAG利用時のAIトークン消費量の目安
このページの使い方
Craft RAGとCraft AI Modulesを組み合わせた会話シナリオ(FAQボットなど)の、AIトークン消費量の目安を記載したものです。
正確な見積もりには、ご自身のプロンプト・会話例・データ量で数十〜数百件ほど試行し、実測した入出力トークン数の平均を取る必要があります。 本ページは、設計段階で概算の消費量を把握するために、代表的なシナリオごとに目安を示しています。
掲載している数値はすべて参考値であり、実際の消費量を保証するものではありません。
Craft RAGを使わないCraft AI Modulesの消費量目安(コンテンツ生成の単発利用・対話エージェント、CMSへのRerank、コーパス投入時のEmbeddingなど)は、Craft AI Modules利用時のAIトークン消費量の目安をご確認ください。
前提
AIトークンレートと課金の考え方
本ページでは、実測値または計算例から消費量の目安を示しています。 以降で参照するAIトークンレートや課金の考え方は、すべて Craft AI Modules の AIトークンとコスト に基づきます。
シナリオ別の見積もり例
Craft RAGを組み合わせる代表的な2つのシナリオを紹介します。
| シナリオ | 想定ユースケース | 使う機能(API) |
|---|---|---|
| A. RAG FAQボット | Craft RAGでドキュメントを検索しながら応答するチャット | コンテンツ生成(gcpGeminiGenerateContent)+ Craft RAG |
| B. RAG FAQボット + Rerank | シナリオAと同じ条件で Rerank を有効化。方式は LLM による Rerank とランキング専用モデルによる Rerank の2種類 | コンテンツ生成(gcpGeminiGenerateContent)+ Craft RAG + Rerank |
以下、各シナリオの想定・平均トークン数・AIトークン消費の目安を掲載しています。 ご自身のユースケースに近いシナリオを参考に、想定する利用量からトークンの消費量を算出してください。
シナリオA・B
シナリオAはコンテンツ生成(とRAG検索)のみの見積もりです。シナリオBは同条件にRerank分を上乗せした見積もりで、Rerank分の目安は「シナリオB」に掲載しています。
LLMのトークンの種類
シナリオA・Bのコンテンツ生成では、消費されるトークンを次の2つの要素に分けて掲載しています。
| 種類 | 何を数えるか |
|---|---|
| 入力トークン | LLMに送ったテキスト全体(システムプロンプト・会話履歴・RAGの検索結果を含む) |
| 出力トークン | 回答(表示される文)と推論(内部処理。画面には出ない)の合計 |
推論トークンは、モデルやプロンプトによって消費量が大きく変わり、事前に正確な見積もりはできません。 本ページのシナリオ表では、複数回実行した結果の平均値を参考として掲載しています。
入出力トークン数はAPIレスポンスの usageMetadata から確認できます(フィールドの詳細は Craft RAG を利用する のレスポンス例を参照)。
Geminiモデル例
コスト比較のため、料金レートの異なる3つのモデル例を使っています。 実際のモデルごとのレートはCraft AI Modules の AIトークンとコストをご確認ください。
| モデル例 | 入力のレート | 出力のレート | 種類 |
|---|---|---|---|
| モデル① | 2.5 | 15 | 低コストモデル(Flash Lite 相当) |
| モデル② | 15 | 90 | 標準モデル(Flash 相当) |
| モデル③ | 20 | 120 | 高品質モデル(Pro 相当) |
シナリオA・Bで使う入力・出力トークン数は同じで、モデルが違うとAIトークンへの換算結果だけが変わります。
AIトークンの計算式
AIトークン — 上記のトークン数にモデルレートを掛けて換算した、Craft AI Modulesにおけるコスト計算の共通の基準単位です。
各シナリオの表は、次の計算式で換算しています。
入力側の AIトークン = 入力トークン数 × 入力のレート出力側の AIトークン = (回答トークン数 + 推論トークン数)× 出力のレート
1会話あたりの AIトークン = 入力側の AIトークン + 出力側の AIトークン
月間の AIトークン = 1会話あたりの AIトークン × 月間会話数各シナリオの表は1会話あたりの目安です。月間の消費量を見積もる場合は、1会話あたりのAIトークンに、想定する月間会話数を掛けて算出してください。
シナリオA. RAG FAQボット
Craft RAGでドキュメントを検索し、検索結果を参考に応答するFAQボットの例です。
本シナリオの条件
- 計上単位: 1会話(5回のやりとり)
- topK(ベクトル検索の取得件数): 5
- 会話履歴も入力に含む(入力量の大半はRAGの検索結果)
- システムプロンプトで1回答250文字以内を指定
- トークン数は、次のシステムプロンプトと5回分のやりとりを行った検証の実測平均
システムプロンプト
あなたは KARTE Craft Developer Portal のドキュメント案内AIです。検索結果として渡されたコンテキストのみを根拠に、日本語で簡潔に回答してください。コンテキストに含まれない事項は「ドキュメントで確認できませんでした」と正直に答えてください。1回答は250文字以内で簡潔に答えてください。会話例
応答は先頭のみ掲載しています。括弧内は応答全体の文字数の目安です。
| 回 | ユーザー入力 | チャットの応答 |
|---|---|---|
| 1 | Craft Functionsからシークレットを扱うにはどうすればいいですか? | Craft Secret Managerにシークレットを登録し、ファンクション内でMODULES.secret.getを使って取得します。詳細はCraft Secret Managerのドキュメントをご確認ください…(以下省略、約220文字) |
| 2 | KVSの容量上限や使い方を教えてください | Craft Key-Value Store(KVS)はキーと値のペアを保存するストアです。容量上限やAPIの使い方は、Craft Key-Value Storeのドキュメントに記載されています…(以下省略、約200文字) |
| 3 | Craft Functionsの実行時間の上限はどのくらいですか? | HTTPタイプは3,600秒(60分)、イベント駆動タイプは540秒(9分)が上限です。タイプごとの詳細はCraft Functionsの仕様ドキュメントをご確認ください…(以下省略、約180文字) |
| 4 | HTTP Functionsのエンドポイントはどうやって作成しますか? | HTTPタイプのファンクションを作成すると、エンドポイントURLが自動発行されます。ファンクション詳細画面の「設定」タブで確認できます…(以下省略、約210文字) |
| 5 | Craft SitesのキャッシュTTLはどのように設定しますか? | KARTE管理画面の「Craft」>「サイト」からキャッシュTTL(生存期間)を設定・変更できます。設定手順はCraft Sitesのドキュメントをご確認ください…(以下省略、約230文字) |
1会話あたりのトークン数の目安
1会話あたりのトークン数(目安)
| 入力トークン | 出力トークン |
|---|---|
| 約1.6万 | 回答: 約370 推論: 約2,000 |
AIトークン消費の目安(Geminiモデル例のレートで換算)
| モデル例 | 入力のAIトークン | 出力のAIトークン | 合計のAIトークン |
|---|---|---|---|
| モデル① | 1.6万 × 2.5 = 4万 | (370 + 2,000) × 15 = 3.6万 | 約8万 |
| モデル② | 1.6万 × 15 = 24万 | (370 + 2,000) × 90 = 21万 | 約45万 |
| モデル③ | 1.6万 × 20 = 32万 | (370 + 2,000) × 120 = 28万 | 約60万 |
シナリオB. RAG FAQボット + Rerank
シナリオAと同条件で、Rerankを使わない場合と使う場合を比較しています。Rerankの内容についてはCraft RAG の Rerankをご確認ください。
本シナリオの条件
- 計上単位: 1会話(5回のやりとり)
- 実行するシナリオはシナリオAと同条件
合計(コンテンツ生成 + Rerank 分)
コンテンツ生成分はシナリオAと同じ値です。Rerank分を上乗せした合計を掲載しています。
| モデル例 | Rerank 無し(= シナリオA)のAIトークン | Rerank 有り(LLM による Rerank)のAIトークン | Rerank 有り(ランキング専用モデルによる Rerank)のAIトークン |
|---|---|---|---|
| モデル① | 約8万 | 約8万 + 約4万 = 約12万 | 約8万 + 約5万 = 約13万 |
| モデル② | 約45万 | 約45万 + 約4万 = 約49万 | 約45万 + 約5万 = 約50万 |
| モデル③ | 約60万 | 約60万 + 約4万 = 約64万 | 約60万 + 約5万 = 約65万 |
各列は、シナリオAのコンテンツ生成分に、下記「Rerank分の目安」の値を上乗せした合計です。
Rerank分の目安
LLM による Rerank
LLMによるRerankの実測平均値です。 LLMによるRerankは、コンテンツ生成と同様に使用したトークン数に応じて計上されます。今回は入力のレート2.5、出力のレート15のモデル(Flash Lite相当)を例としています。実際のレートはCraft AI Modules の AIトークンとコスト — Geminiモデルをご確認ください。
- Rerankの実行回数: 1回のやりとりで1回の実行
- 並べ替え件数: 5(ベクトル検索の取得件数と同じ)
- 1会話(5回のやりとり)あたりのAIトークン: 約4万AIトークン
ランキング専用モデルによる Rerank
ランキング専用モデルによるRerankの値です。 ランキング専用モデルによるRerankは、クエリの回数に応じてAIトークンが計上されます。1クエリあたり1万AIトークンのレートを例としています。実際のレートはCraft AI Modules の AIトークンとコスト — Rerankをご確認ください。
- Rerankの実行回数: 1回のやりとりで1回の実行
- 並べ替え件数: 5(ベクトル検索の取得件数と同じ)
- 1会話(5回のやりとり)あたりのAIトークン: 1万 × 5回 = 約5万AIトークン