料金・プラン

Claude Codeのトークンの仕組み入力・出力・キャッシュと課金

Claude Codeのトークンとは何か、入力・出力・キャッシュの違い、会話が長いほど消費が増える理由を、公式のコスト管理ドキュメントをもとに初心者向けに整理します。使用量の確認方法も紹介します。

公的機関・公式資料などの一次情報と照合して作成しています。このサイトについて

Claude Codeのトークンの仕組みとは

トークンとは、AI が文章を処理するときの、文字を細かく区切った単位です。Claude Code の費用や利用量は、このトークンの量で決まります。公式のコスト管理のページには、「Claude Code は API のトークン消費量に応じて課金される」「トークンの費用は、文脈(コンテキスト)の大きさに比例する」と書かれています。

サブスクリプション(Pro や Max)の場合は、金額ではなく、利用上限の減り方としてトークンの消費が現れます。どちらの場合も、「何がトークンを消費するのか」を知っておくと、無駄な消費を避けられます。

基本(トークンの種類)

Claude Code の /usage コマンドで表示されるセッションの内訳には、次の種類のトークンが並びます。

種類 意味
input(入力) Claude に送る内容。質問、ファイルの内容、会話の履歴など
output(出力) Claude が返す内容。回答、コード、考える過程(thinking)を含む
cache read 以前に送った内容を、キャッシュ(再利用の仕組み)から読み込んだ分
cache write 内容をキャッシュに書き込んだ分

公式のページでは、拡張思考(extended thinking)で使われるトークンは出力トークンとして課金されると説明されています。また、既定でオンになっていて、複雑な計画や推論で性能が上がる代わりに、1回のリクエストで数万トークンに達することもあるとされています。

具体例(なぜ会話が長いと消費が増えるのか)

公式のページには、Claude Code はやり取りのたびに、会話の全体を送ると書かれています。ツールを使うたびに、その結果を載せた新しいリクエストが追加で送られます。

状況 起きること
1往復目の質問 会話が短く、送る量が少ない
数十往復した後の一言の質問 一言でも、それまでの会話全体を毎回送る
ファイルを何本も読ませた後 読み込んだ内容が会話に残り、以降の全リクエストに含まれる
休憩して戻った後の最初のメッセージ キャッシュの有効期間が切れ、全文を再処理する

キャッシュの有効期間は、サブスクリプションで1時間、API キーやクラウド経由では既定で5分と説明されています(いずれもメインの会話の場合。サブエージェントなどは既定で5分)。追加の利用分(usage credits)を使うときは、サブスクリプションでも5分になります。キャッシュが効いている間は、同じ内容の再読み込みが安い扱いになるので、全体の消費が抑えられます。

公式のプロンプトキャッシュのページによると、モデルの切り替え、多くの場合の努力レベルの変更、MCP サーバーの追加・削除(ツールの遅延読み込みが効いていない場合)、Claude Code の更新などは、キャッシュを無効にすることがあります。作業の途中でモデルを何度も切り替えると、そのたびに会話全体の読み直しが起きます。

Claude Codeのトークンの仕組みの実践ステップ

  1. /usage を開き、セッションの内訳(input、output、cache read、cache write)を確認する。
  2. サブスクリプションの場合は、利用量のバーと、何が上限を使っているかの内訳を見る。
  3. 内訳に「長いコンテキスト」や「キャッシュミス」の警告が出ていないか確認する。
  4. 話題を切り替えるときは /clear で会話を分ける。
  5. 長くなった会話は /compact で要約する。
  6. 作業が終わったセッションは、そのまま放置せず閉じる。

Claude Codeのトークンの仕組みの注意点

  • /usage の金額は、手元でトークン数からリスト価格で計算した推定値です。請求の根拠にはなりません。API の請求は Console で確認します。
  • サブスクリプションの /usage の内訳は、この端末の履歴から計算した概算です。他の端末や claude.ai の利用分は含まれません。
  • 拡張思考は、簡単な作業では不要なことがあります。努力レベル(/effort)を下げる方法があります。ただし、一部のモデルでは思考をオフにできません。
  • 背景の処理(会話の要約など)でも、少量のトークンが使われます。公式は、通常は1セッションあたり0.04ドル未満と説明しています。

Claude Codeのトークンの仕組みでよくあるミス

  • 「短い質問だから消費も少ない」と考える。会話が長ければ、短い質問でも全体を送ります。
  • 休憩後に、大きな会話をそのまま再開する。キャッシュが切れて、全体の再処理が発生します。
  • 使っていない連携(MCP サーバー)を有効にしたままにする。ツールの一覧が、毎回の文脈に含まれます。
  • /compact を、既に大きくなった文脈に実行し、その実行自体の消費が大きいことを知らない。公式によると、キャッシュが効いている間の /compact は比較的軽く、休憩でキャッシュが切れた後の実行が最も重くなります。

Claude Codeのトークンの仕組みのチェックリスト

  • /usage で、input、output、キャッシュの内訳を見たか。
  • 話題が変わるときに /clear を使っているか。
  • 長い会話を /compact で整理しているか。
  • 不要な連携を無効にしているか。
  • 費用の確認先(Console)を知っているか。

Claude Codeのトークンの仕組みのFAQ(よくある質問)

Q. 1トークンは何文字ですか。
A. 文字数との対応は、言語やモデルで変わります。公式のコスト管理のページに、文字数への換算は示されていません。実際の量は /usage で確認してください。

Q. キャッシュは自分で設定できますか。
A. 通常は自動で動きます。有効期間の選択方法は、公式のプロンプトキャッシュのページに説明があります。

Q. トークンを減らすには、何が最も効きますか。
A. 公式は、会話を適切に区切ること、モデルを用途に合わせること、不要な連携を減らすことを挙げています。具体的な方法は Claude Codeの使用量の節約 にまとめています。

筆者の見解(Claude Codeのトークンの仕組み)

私見では、トークンの仕組みで押さえるべきは「今の質問の長さ」ではなく「会話全体の長さ」と「キャッシュが効いているか」の2つです。見落としやすいのは後者で、休憩明けの最初の一言や、作業途中のモデル切り替えが、会話全体の読み直しになる点だと考えます。そのため、長い休憩の前に区切りのよいところで /clear するか、モデルと努力レベルはセッションの最初に決めておくほうが、細かい単価を計算するより実務では効くと考えます。数字を追うなら、/usage の内訳で「長いコンテキスト」や「キャッシュミス」の指摘が出ていないかを、ときどき確認する程度で十分だと考えます。

Claude Codeのトークンの仕組みの関連項目

出典(一次情報)

本記事は一般的な情報の提供を目的としています。Claude Code の料金・利用上限・機能・エラーメッセージ・コマンドは頻繁に更新されるため、最新の内容は Anthropic の公式ドキュメントとお使いのバージョンで必ずご確認ください。契約・請求・セキュリティに関する判断は、公式サポートや社内の担当部門にご相談ください。「筆者の見解」は一つの考え方です。