本文へ移動
Claude Tips

コストを抑える

Claude Code のコストの見方と、個人・組織・クラウド別の支出管理、トークン使用量を減らす方法をまとめます。

Claude Code は API のトークン消費量に応じて課金されます。サブスクリプション(Pro・Max・Team・Enterprise)の料金は Anthropic の料金ページにあります。開発者ごとのコストは、モデルの選び方・コードベースの大きさ・複数インスタンスや自動化の使い方で大きく変わります。

  • 現在のセッションの使用量は /usage で見る
  • 組織の支出は、契約形態(Teams/Enterprise・Console・クラウド)ごとに見る場所と上限の掛け方が違う
  • コンテキストを小さく保ち、モデルと thinking を使い分けるとトークンが減る
  • 長いセッションで使用量が膨らむ原因は決まっている

公式ドキュメントによると、企業での導入全体の平均は 1 開発者・1 稼働日あたり約 13 ドル、月あたり 150〜250 ドルで、ユーザーの 90% は 1 稼働日あたり 30 ドル未満です。自分のチームの見積りは、小さな試験導入で基準値を取ってから広げます。

コストを確認する#

/usage コマンド#

/usage 上部の Session ブロックに、現在のセッションのトークン使用量が出ます。ドル額は、modelPricing が有効でなければ、トークン数から定価でローカル計算した見積りです。請求の正式な値は Claude Console の Usage ページで見ます。

補足

Session ブロックは API 利用者向けです。Max・Pro のサブスクライバーは使用量がサブスクリプションに含まれるため、セッションのコストは請求とは無関係です。代わりに同じ画面にプランの使用量バーなどが出ます。

text
Total cost:            $0.55
Total duration (API):  6m 20s
Total duration (wall): 6h 33m 10s
Total code changes:    0 lines added, 0 lines removed
Usage by model:
   claude-sonnet-4-6:  1.2k input, 5.3k output, 940.0k cache read, 50.0k cache write ($0.55)
  • 合計は /clear で新しいセッションになるとリセットされ、0 ドルから数え直します。v2.1.211 より前は、プロセスが続くあいだ /clear をまたいで累積していました
  • 1.1 倍のデータ所在地料金が適用された API 応答は、定価のトークン額を 1.1 倍して計上します。同じ合計がステータスラインのコスト欄に出て、--max-budget-usd の計算にも入ります。v2.1.239 より前は 1.1 倍を掛けておらず、表示が請求より低くなっていました

プロンプトキャッシュの統計#

メイン会話の最初の API 応答のあと、Session ブロックに Prompt cache (main) の行が加わります(v2.1.251 以降)。リクエスト数・キャッシュから供給された入力トークンの割合・ミス・キャッシュが温かいかを示します。

text
Prompt cache (main):   14 requests · 91% of input tokens from cache · 2 misses (last 6m 10s ago, 310.2k tokens re-cached) · 1 expected rebuild (compaction or tool-result clearing) · warm (1h TTL, last activity 40s ago)
項目 意味
Misses キャッシュが持っていた内容を再処理したリクエスト。最後のミスの時刻と再キャッシュしたトークン数が出る。原因を特定できると likely cause: tool definitions changed のように添える(v2.1.260 以降)
Expected rebuilds 圧縮(compaction)や古いツール結果の消去で Claude Code 自身が会話を書き換えた場合の同種のミス。1 回以上起きたときだけ出る
Warm / cold キャッシュ済みの先頭部分が有効期間内か。TTL も出る。冷えているときは放置時間が出る。キャッシュトークンの報告が無い応答だけだと no prompt caching reported by the API で終わる
  • 数はキャッシュトークンの項目から取るので、どのプロバイダ・ゲートウェイでも動きます。メイン会話だけが対象で、サブエージェントは含みません。/clear でリセットされます
  • ステータスラインのスクリプトからは prompt_cache オブジェクトで同じ数を読めます。キャッシュの仕組みはコンテキストとプロンプトキャッシュを参照してください

プラン使用量の内訳#

Pro・Max・Team・Enterprise では、/usage にプランの上限に数えられる内訳も出ます。

項目 内容
Attribution 最近の使用量を、スキル・サブエージェント・プラグイン・個別の MCP サーバーに割り当てた割合。MCP サーバーの割合は、そのツール結果を使ったリクエストだけを数える(v2.1.222 より前は、1 回呼ぶとその後の全リクエストをそのサーバーに割り当てて過大に見えた)
Behavior flags 長いコンテキストやキャッシュミスなどの振る舞い。最近の使用量の 10% 以上を占めると旗が立つ
Loops 最近動いた /loop などの定期実行のうち重いものを、トークン合計順に 1 行ずつ。残りは件数で示す。実行間隔・実行回数・合計と 1 回あたりのトークン・最終実行を出す。行はタスクのプロンプトで束ねるので、止めて作り直しても 1 行のまま(v2.1.242 以降)

d と w で直近 24 時間と直近 7 日を切り替えます。数値は概算で、このマシンのローカルのセッション履歴から計算するため、他のデバイスや claude.ai の使用量は含みません。VS Code 拡張では「Account & usage」ダイアログに Day/Week の切り替え付きで出ますが、Loops 行はありません。定期実行と /loopも参照してください。

使用クレジットの支出#

使用クレジット(usage credits)が有効なあいだ、/usage にその行が出ます。

プラン 行の内容
Pro・Max 今月の支出。月次の支出上限を設定していればそれに対する割合。未設定なら Unlimited と表示され、支出額は出ない
Team・Enterprise 自分の今月の支出。自分に適用される組織設定の上限があればそれに対する割合。組織全体の上限は行に出ない。自分の上限が無ければ支出だけ出る。使用クレジットがオフなら行は出ない

上限があるときは、使用クレジットがオンになった時点で行が出て、初めて使うまで 0% です。v2.1.236 より前は Pro・Max のみで、上限付きの行は使うまで隠れていました。

使用量の取得に失敗したとき#

プランの上限の取得に失敗した場合(多くは使用量エンドポイントのレート制限)、このマシンで過去 60 分以内に読み込んだ最後のバーを Showing last-known usage の注記つきで表示します。r で再試行でき、成功すると最新に置き換わります。60 分以内の記録が無いときは、レート制限中と表示して同じ再試行を案内します。

使い方の傾向を分析する#

/insights は、トークン量ではなく仕事の仕方についてのレポートです。このマシンの最近のセッションを分析し、取り組んだ内容・誤解された依頼やバグなどの摩擦・改善の提案を HTML にまとめます。

  • 1 回の実行で、まだ見ていないセッションを最大 200 件まで分析し、ごく短いものは飛ばします。除外があると、見出しに 200 sessions (412 total) のように件数が出ます
  • auto mode が使えるのに最近のセッションがほぼ使っていなければ、auto mode が処理できた権限確認の推定件数も載ることがあります
  • 最新のレポートは ~/.claude/usage-data/report.html に書かれ、実行ごとの時刻付きコピーも同じディレクトリに残ります。ほかのセッションデータと同じ周期で、起動時に cleanupPeriodDays(既定 30 日)より古いものが消えます
  • どのプラン・プロバイダでも使えます。分析も通常のセッションと同じ経路で動き、トークンはプランや API の使用量に数えられます。他のデバイスや claude.ai のセッションは含まれません

サブスクリプションに使用クレジットを足す#

使用クレジットを使うと、プランの使用上限を超えて作業を続けられます。/login で claude.ai のサブスクリプションにサインインしたあと /usage-credits で管理します。API キー認証では使えません。セルフサーブの Enterprise 組織・Enterprise のトライアル・AWS Marketplace 経由で請求される Enterprise 組織では v2.1.248 以降が必要で、それ以前は Unknown command: /usage-credits になります。

役割 /usage-credits の動作
Pro・Max の契約者 ブラウザで claude.ai の「Settings > Usage」を開く。「Usage credits」欄でオン・オフ、残高、今月の支出、月次上限を確認できる
請求権限のある Team・Enterprise メンバー 組織の「Organization settings > Usage」をブラウザで開く
請求権限のない Team・Enterprise メンバー 確認のあと、組織の管理者へ依頼を送る(v2.1.211 より前は確認なしで送信)
  • 請求権限のないメンバーの確認は対話セッションのみです。-p の非対話モードとリモートコントロールでは依頼を送らず、対話セッションで実行するよう案内します
  • 管理者の対応待ちに再実行すると、送信済みと表示し重複して送りません。管理者が依頼を却下したあとの再実行は新しい依頼になります(v2.1.222 より前は、却下済みの依頼が新規依頼を妨げていました)
  • Pro・Max で使用クレジットが残っているのに支出上限へ達すると、CLI を離れずに上限を引き上げ・撤廃するよう促されます。サーバーが変更を拒否した場合はエラー一覧を見ます

組織のコストを管理する#

使える手段は、組織が Claude Code にどう接続するか(Claude for Teams/Enterprise・Claude Console・クラウドプロバイダ)で決まります。Teams/Enterprise では各メンバーの席の枠から消費され、Console とクラウドではトークン単位で組織に課金されます。サインイン方法が混在する組織では、各開発者は認証に使った方法で計測されます。個人の Pro・Max は管理する組織が無いので、自分の使用クレジットの支出(fast mode の分を含む)を上の節で追います。

構成 支出を見る 上限を掛ける ユーザー別の数字
Claude for Teams / Enterprise 組織分析の Spend report 管理設定の spend limits Spend report の CSV。Enterprise は Enterprise Analytics API も
Claude Console(API) Console の usage ページ ワークスペースの spend limits Console ダッシュボード、Claude Code Analytics API
Amazon Bedrock・Google Cloud の Agent Platform・Microsoft Foundry クラウドの課金コンソール クラウドの予算管理 OpenTelemetry または LLM ゲートウェイ

OpenTelemetry のエクスポートはどの構成でも使え、ユーザー別のトークンとコストの指標をほぼリアルタイムで自前の可観測性基盤へ流せる唯一の方法です。

契約単価で支出を報告する#

既定では、/usage・ステータスライン・OpenTelemetry のコストはすべて定価で計算されるため、契約単価で支払う組織では請求と合いません。管理設定の modelPricing に契約単価を入れると合わせられます。変わるのは Claude Code の報告だけで、Anthropic の請求は変わりません(v2.1.242 以降)。

  1. 契約書の 100 万トークンあたりの単価を用意する。Claude Code は Console から取得しないので、契約が変わったら設定も更新する
  2. multiplier を 1 未満(一律割引)または 1 超(上乗せ。v2.1.271 以降)にするか、モデルごとの 4 種類のトークン単価を overrides に並べるか、両方使う。形は設定キー一覧の modelPricing を見る
  3. 管理設定として配る:サーバー管理設定・MDM ポリシー・managed-settings.json・ポリシーヘルパー。ユーザー・プロジェクト・ローカル設定と --settings ではこのキーは無視される

ヒント

反映の確認は、管理設定を受け取ったセッションで /usage を開き、Total cost の行に at your organization's configured rates の注記があるかを見ます。値は見積りで請求書ではなく、/model ピッカーの 100 万トークンあたり価格は定価のままです。

Claude for Teams と Enterprise#

各メンバーの Claude Code の使用量は、5 時間のローリング枠と週枠で戻る席ごとの許容量から消費されます。許容量は Claude chat・Cowork と共有で、大きさは席のティア(Standard か Premium)で決まります。管理は Claude Console ではなく claude.ai の管理コンソールで行います。

  • 支出を見る:組織分析の Spend report にユーザー別・モデル別の推定支出が毎日更新で出て、CSV 出力もできる。対象は使用クレジットの支出で、使用クレジットをオンにすると現れる。席の許容量内の使用はドルで計測されない
  • 導入状況を見る:分析ダッシュボードに日次のアクティブユーザー数・セッション数・貢献指標が出る(貢献データは CSV 出力可)。詳細はチーム利用の分析
  • 上限を掛ける:席の許容量が既定の天井。超えて続けさせるには使用クレジットをオンにし、組織・グループ・個人の単位で spend limits を設定する
  • ユーザー別の数字を取る:Enterprise は Enterprise Analytics API が Claude Code を含む各サーフェスのユーザー別使用量とコストを返す。キーは Primary Owner が read:analytics スコープで作る。Teams は Spend report の CSV をエクスポートする

補足

管理者向けの予算計画には Claude Enterprise の consumption guide があります。chat・Claude Code・Cowork で消費の仕方が違い、1 回のデバッグセッションが chat の 1 日分を超えうるため、コーディング席は chat 席より多めに見積もるよう書かれています。

Claude Console#

API 組織はワークスペースで Claude Code の支出を管理します。Claude Code の総支出にワークスペースの spend limit を設定し、Console でコストと使用量のレポートを見られます。

補足

Console アカウントで初めて Claude Code を認証すると、「Claude Code」というワークスペースが自動で作られます。コスト追跡を一元化するためのもので、このワークスペースの API キーは作れません。独自のレート制限を持つ組織では、このワークスペースのトラフィックも組織全体の API レート制限に数えられます。Console の Limits ページでワークスペースのレート制限を設定すると、Claude Code の取り分を抑えて他の本番ワークロードを守れます。

ユーザー別には、Console ダッシュボードがメンバーごとの支出と受け入れた行数を表示します。同じ日次のユーザー別指標は、Admin API キーを使って Claude Code Analytics API からも取れます。

レート制限の推奨値#

チーム向けに TPM(毎分トークン数)と RPM(毎分リクエスト数)を設定するときの、1 ユーザーあたりの推奨値です。

チーム規模 ユーザーあたり TPM ユーザーあたり RPM
1〜5 人 200k〜300k 5〜7
5〜20 人 100k〜150k 2.5〜3.5
20〜50 人 50k〜75k 1.25〜1.75
50〜100 人 25k〜35k 0.62〜0.87
100〜500 人 15k〜20k 0.37〜0.47
500 人超 10k〜15k 0.25〜0.35

たとえば 200 人なら、1 人あたり 20k TPM を見て合計 400 万 TPM(200×20,000)を申請します。大きい組織ほど同時に使う人の割合が小さいため、1 人あたりの TPM は下がります。制限は組織単位で掛かるので、ほかの人が使っていないあいだ個人は割り当て以上を一時的に使えます。

補足

大人数のライブ研修など、同時利用が極端に多い場面が見込まれるときは、ユーザーあたりの TPM をより高く確保する必要があります。

クラウドプロバイダ#

Amazon Bedrock・Google Cloud の Agent Platform・Microsoft Foundry では、Claude Code はクラウドのアカウントにトークン単位で課金され、支出の管理もクラウド側の課金コンソールで行います。クラウドの指標は Anthropic に送られないので、分析ダッシュボードや Claude Code Analytics API の対象外です。プロバイダの設定はクラウドプロバイダを見てください。

ユーザー別の費用の割り当てには3つの方法があります。

  • OpenTelemetry:各開発者のマシンから指標を自前の可観測性基盤へ出す。プロバイダに関係なく、ユーザー別のトークン数・コスト・ツール活動が得られる
  • Claude apps gateway:セルフホストのClaude apps gatewayが、ユーザー別の使用量の割り当て・トークン数入りの OTLP 指標・ユーザー別の spend limit を提供する
  • LLM ゲートウェイ:Claude Code の通信をすべてプロキシ経由にし、キー別に支出を追う。大企業のいくつかが LiteLLM(オープンソース)を使っていると報告されている。このプロジェクトは Anthropic と無関係で、セキュリティ監査もされていない。ネットワークと LLM ゲートウェイも参照

開発者から上限について聞かれたとき#

開発者が当たった天井の種類を見分けると対応が決まります。

表示 意味と対応
「You've hit your session limit」「weekly limit」 購読プランの席ベースの使用枠で、全モデル共通。/model で切り替えても回復しない。リセット時刻がメッセージに出る
「You've hit your Opus limit」「Sonnet limit」 モデル系統ごとの枠。ほかの系統のモデルに /model で切り替えれば作業を続けられる
「individual spend limit」「org's monthly spend limit」「team's shared budget」 使用クレジットで課金される要求が、設定した spend limit に達した。管理者が「Organization settings > Usage」でメッセージが指す上限を上げれば続けられる。プランのリセット時刻が併記されていればそれまで待つ手もある
Claude apps gateway の spend limit のメッセージ セルフホストのゲートウェイに設定した上限を超えた。期間のリセットか上限の引き上げまで拒否される
コンテキストや auto-compact の警告 使用上限ではない。会話が auto-compact ウィンドウに近づいている。下の「トークン使用量を減らす」を案内する
API・クラウドプランで支出が想定外に多い 多くは、クリアしていない長いセッションか、既定のままの Opus が原因。タスクの合間の /clear とモデルの使い分けが効果的

上限に達した開発者が待つあいだにできることです。

  • 使用クレジットをオンにしていれば、/usage-credits で許容量を超える分を依頼する
  • v2.1.234 以降は、リセット後に中断したタスクを自動で続けて待てる。Claude Code が自動で待ちを始める条件は対話モードにあり、/rate-limit-options で選ぶ場合もある。全社で自動で待つかどうかは、管理設定の autoContinueAtUsageLimit で決める

エージェントチームのトークンコスト#

エージェントチームは複数の Claude Code インスタンスを起動し、それぞれが自分のコンテキストウィンドウを持ちます。トークン使用量は、動いているチームメイトの数と稼働時間に比例して増えます。

  • チームメイトには Sonnet を使う(連携タスクで能力とコストのバランスが良い)
  • チームは小さくする(使用量はほぼチームの人数に比例する)
  • 起動時のプロンプトは絞る(CLAUDE.md・MCP サーバー・スキルは自動で読み込まれ、起動プロンプトの内容も最初からコンテキストに載る)
  • 仕事が終わったチームメイトは止める(終了するかセッションが終わるまでトークンを使い続ける)
  • エージェントチームは既定で無効。有効にするには settings.json か環境で CLAUDE_CODE_EXPERIMENTAL_AGENT_TEAMS=1 を設定する

チームメイトが plan mode で動くと、標準のセッションより約 7 倍のトークンを使います(各メンバーが別の Claude インスタンスとして自分のコンテキストを持つため)。チームのタスクは小さく自己完結させます。

トークン使用量を減らす#

トークンのコストは、処理するコンテキストの量に比例します。Claude Code は、システムプロンプトなど繰り返す内容のコストを下げるプロンプトキャッシュと、上限に近づくと履歴を要約する自動圧縮で、すでに最適化しています。以下は、コンテキストを小さく保ってメッセージあたりのコストを減らす方法です。

コンテキストを先回りして管理する#

/usage で現在の使用量を確認するか、ステータスラインに常時表示します。

  • タスクの合間にクリアする:無関係な作業へ移るときは /clear で新しく始める。古いコンテキストは以降のメッセージごとにトークンを無駄にする。クリアの前に /rename で名前を付けておけば、あとで /resume で戻れる(セッションの再開)
  • 圧縮の指示を足す:/compact Focus on code samples and API usage のように、要約で残す内容を伝える

プロジェクトルートの CLAUDE.md にも圧縮の方針を書けます。

markdown
# Compact instructions

When you are using compact, please focus on test output and code changes

モデルを選ぶ#

ほとんどのコーディング作業は Sonnet で十分こなせ、Opus より安く済みます。Opus は複雑な設計判断や多段階の推論に取っておきます。/model でセッション中に切り替え、既定は /config で決めます。Opus への切り替えは、セッションのモデルを継承するサブエージェントにも及びます。単純なサブエージェントのタスクは、サブエージェント設定で model: haiku を指定します。詳しくはモデル・effort・fast modeとサブエージェントを参照してください。

MCP サーバーの負荷を減らす#

MCP のツール定義は既定で遅延読み込みされ、Claude が特定のツールを使うまでは、ツール名とサーバーの指示だけがコンテキストに入ります。/context で何が場所を取っているか見られます。MCP サーバーをつなぐも参照してください。

  • 使えるなら CLI ツールを優先する:gh・aws・gcloud・sentry-cli などは、ツールごとの一覧を足さないため MCP サーバーよりコンテキスト効率が良い。Claude はコマンドを直接実行できる
  • 使わないサーバーは無効にする:/mcp で設定済みのサーバーを見て、使っていないものを無効にする

型のある言語にはコードインテリジェンスのプラグインを入れる#

コードインテリジェンスのプラグインは、テキスト検索の代わりに正確なシンボル移動を Claude に与え、慣れないコードを調べるときの無駄なファイル読み込みを減らします。「定義へ移動」1 回が、grep と複数の候補ファイルの読み込みの代わりになります。言語サーバーは編集後に型エラーも自動で報告するので、コンパイラを走らせずに間違いに気づけます。プラグインを使うを参照してください。

フックとスキルへ処理を逃がす#

フックで、Claude が見る前にデータを前処理できます。1 万行のログを Claude に読ませる代わりに、フックで ERROR を grep して該当行だけ返せば、コンテキストを数万トークンから数百に減らせます。スキルは領域の知識を与え、構造を知るために複数ファイルを読む手間を省けます。たとえば「codebase-overview」スキルにアーキテクチャ・主要ディレクトリ・命名規則を書いておけます。

次の PreToolUse フックは、テスト出力を失敗分だけに絞る例です。まず settings.json で Bash の実行前にフックを走らせます。

json
{
  "hooks": {
    "PreToolUse": [
      {
        "matcher": "Bash",
        "hooks": [
          {
            "type": "command",
            "command": "~/.claude/hooks/filter-test-output.sh"
          }
        ]
      }
    ]
  }
}

mkdir -p ~/.claude/hooks で作ったフォルダに次のスクリプトを filter-test-output.sh として保存し、chmod +x で実行可能にします。コマンドがテストランナーなら、失敗だけを出すように書き換えます。

bash
#!/bin/bash
input=$(cat)
cmd=$(echo "$input" | jq -r '.tool_input.command')

# If running tests, filter to show only failures
if [[ "$cmd" =~ ^(npm test|pytest|go test) ]]; then
  filtered_cmd="$cmd 2>&1 | grep -A 5 -E '(FAIL|ERROR|error:)' | head -100"
  echo "$input" | jq --arg filtered "$filtered_cmd" \
    '{hookSpecificOutput: {hookEventName: "PreToolUse", permissionDecision: "allow", updatedInput: (.tool_input + {command: $filtered})}}'
else
  echo "{}"
fi

確認は、/hooks を開いて PreToolUse の下にフックが出ているかを見ます。claude --debug-file ./claude-debug.txt で起動して npm test を実行させると、フックが書き換えたときログに modified tool input keys の行が出て、command などの Bash 入力フィールドが並びます。

CLAUDE.md の指示をスキルへ移す#

CLAUDE.md はセッション開始時にコンテキストへ読み込まれます。PR レビューやデータベース移行のような特定の作業の細かい指示が入っていると、無関係な作業中もそのトークンが載ります。スキルは呼び出されたときだけ読み込まれるため、専門的な指示をスキルへ移すと基本のコンテキストが小さくなります。CLAUDE.md は要点だけにして 200 行未満を目安にします。

extended thinking を調整する#

extended thinking は複雑な計画・推論の性能を大きく上げるため、既定で有効です。thinking のトークンは出力トークンとして課金され、既定の予算はモデルによっては 1 リクエストあたり数万トークンになりえます。

深い推論が要らない単純な作業では、/effort か /model で effort レベルを下げるか、/config で thinking を無効にするとコストを減らせます。Opus 5.5・Sonnet 5.5・Fable 系のモデルは常に extended thinking を使い、オフにできません。

thinking の予算が固定のモデルでは、環境変数 MAX_THINKING_TOKENS(例:MAX_THINKING_TOKENS=8000)で予算を下げることもできます。適応的推論のモデルは 0 でない予算を無視するので、そちらは effort レベルを使います。

冗長な作業はサブエージェントに任せる#

テストの実行・ドキュメントの取得・ログの処理は、コンテキストを大きく消費します。サブエージェントに任せると、冗長な出力はサブエージェントのコンテキストに留まり、要約だけがメイン会話へ戻ります。ただしサブエージェント自身のリクエストも使用量に数えられます。減らすには、サブエージェントに小さいモデルを選ぶか、すべてのサブエージェントを 1 つのモデルで動かします。

具体的なプロンプトを書く#

「このコードベースを改善して」のような曖昧な依頼は、広い走査を招きます。「auth.ts のログイン関数に入力検証を足して」のように具体的に頼むと、読み込むファイルが少なく済みます。

複雑な作業を効率よく進める#

  • plan mode を使う:Shift+Tab でplan modeに切り替えてから実装に入る。Claude がコードベースを調べて方針を示し、承認を求めるので、最初の方向が違ったときの高くつくやり直しを防げる
  • 早めに軌道修正する:違う方向に進み始めたら Esc ですぐ止める。/rewind か Esc の2回押しで、会話とコードを前のチェックポイントへ戻せる(チェックポイント)
  • 検証の目標を渡す:テストケース・スクリーンショット・期待する出力をプロンプトに入れる。Claude が自分の成果を検証できると、修正を頼む前に問題に気づく
  • 少しずつテストする:1 ファイル書いてテストしてから進める。直すのが安いうちに問題が見つかる

バックグラウンドのトークン使用#

Claude Code は、待機中にも一部の機能でトークンを使います。

  • 会話の要約:claude --resume のために過去の会話を要約するバックグラウンドの処理
  • コマンドの処理:/usage など、状態確認のためにリクエストを出すコマンドがある

こうした処理は、操作が無くても少量のトークン(通常 1 セッションあたり 0.04 ドル未満)を使います。

プロンプトの提案がオンのとき、Claude の応答後に、セッションが使っているモデルへ短いリクエストを送って次のプロンプトを提案します。このリクエストは会話のプロンプトキャッシュを再利用するので、ほとんどがキャッシュ読み取りと少量の出力トークンです。アカウントが使用上限に近いか達しているあいだは送りません。止めるには、対話モードでプロンプトの提案をオフにします。

長いセッションで使用量が増える理由#

何時間も開いたままのセッションは、操作の量から想像するよりプランの上限を多く使うことがあります。主な理由は次のとおりです。

  • 長いコンテキスト:Claude Code は毎回のリクエストで会話全体を送り、ツールを使うたびにそのツール結果を載せた別のリクエストを送る。プロンプトキャッシュでは、その履歴をキャッシュトークンの単価で読み直すので、1 日開いたセッションでの一行の質問でも会話全体ぶんの使用量が出る
  • キャッシュミス:キャッシュの有効期間より長い休憩のあとの最初のメッセージはキャッシュに当たらず、コンテキスト全体を再処理する。有効期間は、サブスクリプションなら 1 時間、使用クレジットを使っているあいだは 5 分に下がり、API キーやクラウドプロバイダでは既定で 5 分。使用クレジットを使いながら 1 時間を保つには TTL を自分で選ぶ。Pro・Max で大きなセッションを長い休憩のあとに再開すると、要約から再開する案内が出て、以降のリクエストが全履歴を運ばずに済む(セッションの再開)
  • 定期実行:定期実行は、セッションが待機中でも間隔どおりに動き、毎回コンテキスト全体を送る
  • セッション間のメッセージ:自分の別セッションからのメッセージは、このセッションが待機中だと新しいターンとして届き、毎回コンテキスト全体を送る。受信を保留するには crossSessionInbound を hold にする
  • ゴールの確認:バックグラウンドの作業が有効なゴールを待たせているあいだ、セッションが待機中でも Claude にその作業を確認させ、コンテキスト全体を送る新しいターンを始める。確認は、プロンプトの合間に 1 ゴールあたり最大 3 回まで(v2.1.246 より前は上限なし)。無効にするには CLAUDE_CODE_GOAL_CHECKIN_MINUTES を 0 にする。待機中の確認は v2.1.236 以降
  • サブエージェントとワークフロー:サブエージェントも、ワークフローが起動する各エージェントも、メイン会話とは別に自分のリクエストを送る。サブエージェントの割合は、上の Attribution で見える
  • エージェントのチームメイト:動いているチームメイトは、終了するまでトークンを使い続ける
  • 圧縮:/compact は要約する会話を読むので、大きなコンテキストの圧縮はそれ自体が大きなリクエストになる。連続性が要らず新しく始めたいなら、/clear はコストがかからない

Pro・Max・Team・Enterprise では、/usage の内訳が、最近の使用量の 10% 以上を占める長いコンテキストやキャッシュミスなどの振る舞いに旗を立て、減らすコツを添えます。

Claude Code の挙動の変化と問い合わせ#

Claude Code は定期的に更新され、コスト表示を含めて機能の動きが変わることがあります。いまのバージョンは claude --version で見ます。

アカウント固有の請求の質問は、製品内のメッセンジャーから Anthropic のサポートに問い合わせます。

  • サブスクリプションプラン(Pro・Max・Team・Enterprise):claude.ai にサインインし、左下のイニシャルから「Get help」を選ぶ
  • Console(API)の請求:platform.claude.com にサインインし、イニシャルから「Get help」を選ぶ

公式ドキュメント(英語)

2026年10月5日時点の内容をもとに、日本語でまとめています。

ページの一覧