HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

フロンティアモデルの本当の価格。トークン * 価格、ですよね?

The real prices of frontier models. Tokens * Price, right? (playcode.io)

137 pointsby ianberdin68 コメント

要約

この記事は、AIモデルの価格設定における「トークンあたりの価格」という指標の誤解を指摘しています。実際には、モデルごとに同じテキストが異なる数のトークンに分割されるため、同じ「トークンあたりの価格」でも、実際の請求額は大きく異なる可能性があることを、具体的な例を挙げて解説しています。

全文翻訳

すべてのモデルの価格ページには、比較のために示される1つの数字があります:100万トークンあたりのドルです。2つを並べると、一方が安く見えます。その比較は壊れています - そして、AIコーディングエージェントで構築する場合、それは最も高価な方向に壊れています。 価格はトークンごとですが、「トークン」は固定量のテキストではありません:各モデルのトークナイザーは、同じファイルを異なる数のピースに分割し、あなたはピースごとに支払います。請求書に記載される数字です。全く同じTypeScriptファイルが、GPT-5.xでは681トークン、Claudeの最新トークナイザーでは1,178トークンになります。Claude自身の以前のトークナイザーから31%増、価格差がゼロの状態でです。開発者としてのあなたの実際のワークロードは基本的にTypeScriptであり、TypeScriptはまさにギャップが最も広い場所です。(英語の文章はより穏やかな約1.4倍です - なぜかは後述します。) 価格ページが隠す数字 モデルの請求額は、2つの数字を掛け合わせたものです:コスト = (あなたのコンテンツがなるトークン数) x (トークンあたりの価格) 価格ページは2番目の数字を示し、最初の数字を定数として扱います。それは定数ではありません。それはモデルのトークナイザーのプロパティです - モデルが実際に請求する単位にテキストを分割するコンポーネントです。2つのモデルが同じ「5.00ドル/100万入力トークン」を宣伝していても、一方が段落をより多くのトークンに分割するため、同じ段落に対して異なる請求額を提示する可能性があります。誰もコンテンツあたりのトークン数を印刷しないので、誰もそれを比較しません。それがすべての幻想です。本当の価格を見るには、トークナイザーを測定し、それを掛け戻す必要があります。 レートカードが隠す2つのフロア レートカードは1つの価格を示し、その下に2つのコスト層を隠しています。どちらも以下で測定され、どちらも請求書に記載されますが、価格ページには表示されません。2つのベースラインを明確にしてください。なぜなら、それらは異なる比較であり、数字はそれらを正しく行わないと一致しないからです。 フロア1 - 同じステッカーのステルス値上げ。 これはAnthropicの新しいトークナイザーを、それ自身の以前のものと比較したものです - 同一ベンダー間での比較です。Claude Opus 4.6とOpus 4.8は全く同じ5.00ドル/25.00ドルのレートカードを持っていますが、4.8は新しいトークナイザーを搭載しており、同じコードを約29-32%多くのトークンに分割します:TypeScriptで+31%(898から1,178)、Rustで+29%(1,019から1,312)。「同じ価格、新しいモデル」は、静かに約30%多く請求され、その増加は請求書に項目として表示されることはありません。 フロア2 - あなたが実際に書く言語で最悪になります。 その約30%は平均です。次に、新しいClaudeトークナイザーを、市場で最もスリムなもの - GPTのo200k - とTypeScriptで比較します。TypeScriptはAIコーディングエージェントが生成するものの大部分です。ギャップは73%です(1,178対681 = 1.73倍)。これはベンダー間の比較であり、AnthropicはGPTとのトークンパリティを主張していませんでした - だからそれを非難ではなく増幅器として読んでください:それは抽象的な「$/Mtok」をあなたの特定のワークロードでの実際の損害に変えるものです。レートカードはどちらのフロアも表示できません。 測定方法 私たちは、英語の文章、HTMLページ、JavaScript、Python、TypeScript、Rustファイル、JSONツールスキーマとツール結果、中国語のチャットと文章、記号が多いテキストのブロック、そして私たち自身のライブエージェントシステムプロンプトという16個の実際のフィクスチャを取り上げ、各ファイルをバイト単位で、各モデルの実際のトークナイザーの下でカウントしました。生成なし、請求見積もりなし:トークン数のみです。 Anthropic (Claude) - Anthropicの公式count_tokensエンドポイントでカウントしました。これは権威があり、Anthropicが請求するのと同じカウントです。 OpenAI (GPT) - tiktoken経由でOpenAIの文書化されたo200k_baseトークナイザーでカウントしました。最新モデルについては、それを鵜呑みにしませんでした:GPT-5.1、GPT-5.5、GPT-5.6 Solに実際の最小API呼び出しを行い、ライブ使用量トークン数を読み取り、長いものから短いものを引くデルタを使用してリクエストのフレーミングをキャンセルしました。3つすべてがo200k_baseと正確に一致しました(比率1.0000)。トークナイザーは検証されており、仮定されていません。 Google (Gemini) と xAI (Grok) - 各プロバイダー自身のトークンカウントエンドポイントでカウントしました。GPTのo200kを1.00倍の基準として使用し、すべてのベンダー間比率は「トークン対o200k」として読み取られます。それは正しい定規です。なぜなら、それは動きません:o200kは長時間凍結され、公開文書化されているため、安定した、確認可能な尺度です - Claudeのトークナイザーは変化し続ける部分です。 比較テーブルから意図的に除外した2つのモデル:DeepSeekとGLM。それらについては、実際のトークナイザーではなく、おおよその4文字あたりの推定値しかありません。そして、この投稿が存在する理由である、でっち上げの数字はまさにそれです。それらは推定値として、または全く記載されていません。 発見1:最初のフロア、同じステッカーのステルス値上げ データセットの中で最もクリーンなケースであるフロア1を完全に示します。なぜなら、レートカード上の何も移動しないからです - トークナイザーのみです。Claude Opus 4.6とOpus 4.8は全く同じ5.00ドル/25.00ドルのステッカーを共有しています。4.8は単に新しいトークナイザーを搭載しており、同じコードに対して静かに多く請求します。以下は、すべてのフィクスチャにわたる新しいトークナイザーと古いトークナイザーの比較です - 各行で同じバイト、同じベンダー、Anthropic自身のcount_tokensエンドポイントで測定されています。 | コンテンツ (同一バイト) | 旧トークナイザー (Sonnet 4.6 / Opus 4.6) | 新トークナイザー (Sonnet 5 / Opus 4.8 / Fable 5) | 変化 | |---|---|---|---| | 英語の文章 (2,115文字) | 476 | 636 | +34% | | HTMLページ (3,195文字) | 1,131 | 1,302 | +15% | | JavaScript (1,933文字) | 659 | 794 | +20% | | Python (2,251文字) | 831 | 1,022 | +23% | | TypeScript (2,888文字) | 898 | 1,178 | +31% | | Rust (2,924文字) | 1,019 | 1,312 | +29% | | JSONツールスキーマ (9,948文字) | 2,631 | 3,306 | +26% | | 私たちのレンダリングされたエージェントシステムプロンプト (42,661文字) | 10,761 | 14,953 | +39% | | 中国語の文章 (379文字) | 435 | 433 | ~0% | 実際の剤が構成される方法で、これらをブレンドします - 主に英語のシステムプロンプト、ツールスキーマ、コード、JSON - そして新しいトークナイザーは全体のリクエストで約+32%実行されます。最後の行に注意してください:中国語では、新しいトークナイザーはほとんど何も変更しませんでした。+32%は英語とコードの効果です。 これは、価格引き下げに見えた見出しを再構築します。Claude Sonnet 5は、Sonnet 4.6の3.00ドル/15.00ドルを下回る2.00ドル/10.00ドルでローンチしました。しかし、その導入価格は2026年8月31日までしか有効ではなく、その後標準の3.00ドル/15.00ドルに戻ります。導入期間中は、低いステッカーがインフレをわずかに上回ります:Sonnet 5は4.6よりも約32%多くのトークンを生成しますが、2.00ドルではトークンあたりの価格が3分の1安いため、全体としてはわずかに安くなります。導入が終わる日、ステッカーは3.00ドルに戻りますが、+32%のトークンインフレはそのまま残ります - そのため、同じコードはSonnet 5で4.6よりも約32%高くなります。ステッカーは全く同じ3.00ドルです。割引は移行クッションであり、永続的なカットではありません。 実際の請求書を読みます、最も高価なモデルを含めて トークンカウンターは、請求されるまで約束にすぎません。そのため、count_tokensで止まりませんでした - 実際の、請求されたリクエスト(max_tokens: 1)を送信し、プロバイダーが実際に請求したusage.input_tokensを読み取りました。同一のコンテンツに対して、Opus 4.6は2,541入力トークンを請求し、Opus 4.8は3,191を請求しました - それぞれがcount_tokensの予測に正確に一致しました。同じステッカーの値上げは、推定値のアーティファクトではありません。請求書に記載されており、ここでも同じバイトに対して約4分の1多くトークンが使用されています。最も高価なモデルで余分な呼び出しを行いました。なぜなら、「同じトークナイザー、特別なものなし」は、この投稿が疑うべき主張だからです。Fable 5は、そのコンテンツに対して3,191入力トークンを請求しました - Opus 4.8およびSonnet 5と同一です - そのため、Fableは同じ新しいトークナイザーを使用し、隠されたトークンあたりの追加料金なしで正確なカウントを請求します。Fableはステッカー(10ドル/50ドル)で高価であり、秘密のトークン税ではありません。検証全体のコストは約0.08ドルでした:カウンターは正直であり、インフレは現実であり、最も高価なモデルでさえそれをまっすぐに行います。 発見2:フロアの下のフロア、あなたが書くコードで最悪 これはベンダー間の比較であり、ここではGPTのo200kが1.00倍の基準です。各セルは、同一ファイルに対するGPTの倍数としてのそのモデルのトーク数です - だから1.20倍はGPTよりも20%多くのトークンを意味します。Claudeの古いトークナイザーと新しいトークナイザーを並べて表示するため、両方のフロアが1つのビューに収まります - ClaudeがすでにGPTをどれだけ上回っていたか、