Skip to content
Published on

GPT-5.6とコストパフォーマンスの限界 — 曲線の上で自分のワークロードの位置を見つける方法

シェア
Authors

はじめに — リリース3週間での80%値下げが語るもの

2026年7月30日、OpenAIがGPT-5.6 Lunaの価格を80%下げました。100万トークンあたり入力1ドル・出力6ドルから、入力0.20ドル・出力1.20ドルになりました。中位ティアのTerraは20%下がって入力2ドル・出力12ドルになり、最上位のSolは入力5ドル・出力30ドルのままです。GPT-5.6系列が正式リリースされたのが7月9日ですから、3週間での調整ということになります。

同じ日に発表された二つ目の項目が、その性格をより明確に示しています。従来のPriority processingがFastモードへ改名され、Solに限って標準比で最大2.5倍の速度を標準価格の2倍で提供します。OpenAIのAPIドキュメントはこれを「知能の変化なしに速度だけ」と明示しています。つまり下のティアは値を下げて物量を守り、上のティアはレイテンシを別商品として切り出して売り始めたということです。

背景としてよく引用される数字が一つあります。CNBCの報道を引いた複数のメディアが、OpenRouter基準で米国エンタープライズのトークン使用量の46%を中国製モデルが持っていったと伝えました。私はこの数値の元の集計方法を確認できなかったので、報じられた主張としてのみ扱います。ただし値下げ幅の非対称性(下は80%、上は0%)がどこを狙ったものかは、あえて説明する必要もなさそうです。

この記事の主題は値下げのニュースではありません。能力あたり単価は何年も曲線を描いて下がり続けており、個々の値下げはその曲線上の一点です。役に立つ問いは一つだけです — 自分のワークロードはその曲線のどこにあり、今回の移動はその位置を実際に動かしたのか。

7月9日と7月30日の間に変わったもの

Artificial Analysisがリリース時点で集計した指標と今回の値下げを一つの表に置くとこうなります。指数課題1件あたりコストの値下げ後の値は、私が値下げ率をそのまま適用して計算した値で、トークン消費量が同一だと仮定したものです。

ティアリリース価格(入力/出力、100万トークン)7月30日以降Intelligence IndexCoding Agent Index指数課題1件のコスト(リリース価格 → 値下げ後)
Sol5ドル / 30ドル変動なし59801.04ドル → 1.04ドル
Terra2.50ドル / 15ドル2ドル / 12ドル55770.55ドル → 約0.44ドル
Luna1ドル / 6ドル0.20ドル / 1.20ドル51750.21ドル → 約0.042ドル

同じ指数でClaude Fable 5の最大強度スコアは60と集計されています。つまりSolは総合知能で1点後ろにいながら指数を走り切るコストは3分の1程度だ、というのがリリース当時のArtificial Analysisの要約でした。

表を縦に読むともっと面白いです。知能指数は59、55、51と4点ずつ下がるのに、指数課題1件あたりのコストは1.04ドル、0.44ドル、0.042ドルと一桁ずつ落ちます。知能指数4点を買うのにかかるお金が区間ごとに十倍ずつ違います。曲線という言葉を使う理由がこれです。上の端ではほんの少しの能力に非常に多くのお金がかかり、下では同じお金でずっと多くの能力が買えます。

曲線の傾き — そしてベンダーの効率主張

能力あたり単価が下がる速度についての引用はあふれていますが、ほとんどは出典が曖昧です。その中で比較的よく引用される整理は、特定のベンチマーク水準を固定したとき、その性能の価格が年間で一桁倍から十倍程度に下がってきた、というものです。今回の値下げはその趨勢線上の一点であり、3週間という間隔が異例なだけで方向そのものは新しくありません。

ここでベンダーの主張を一つ検証してみる価値があります。GPT-5.6のリリース当時、OpenAI側は特定の課題でトークン効率が54%改善したという趣旨の説明をし、複数のメディアがそれを伝えました。これは「特定の課題」という但し書きが付いたベンダーの主張です。一方、独立集計側の数字はずっと穏当です — Artificial Analysis基準でSolが指数課題1件を処理するのに使った出力トークンは15,000個で、前世代のGPT-5.5の16,000個に対して約6%少ないだけです。

二つの数字は矛盾ではありません。54%は選んだ課題で、6%は総合指数全体で出た値だからです。しかし実務計画に入れられるのは後者です。ベンダーが「特定の課題で」という但し書きを付けたら、その但し書きがそのまま一般化禁止の印です。自分の課題でのトークン消費は直接測るしかなく、その測定こそがモデル交換の前に必ずやるべきことです。

ヘッドライン価格ではなくミックスで計算せよ — ところが今回はミックスが効かない

普通、二つのモデルを比べるときの最初の落とし穴は入力価格だけを見ることです。ベンダーごとに出力対入力の倍率が違うので、同じ二つのモデルでもワークロードのトークンミックス次第でコストの順位がひっくり返ります。

ところが今回の値下げは、その落とし穴をGPT-5.6系列の中では消してしまいました。値下げ後の三つのティアの単価を並べると、入力は5、2、0.20で出力は30、12、1.20です。両軸ともちょうど25対10対1です。

Sol   : 入力 5    出力 30      -> Luna比 25倍
Terra : 入力 2    出力 12      -> Luna比 10倍
Luna  : 入力 0.20 出力 1.20    -> 基準

どの(入力トークン, 出力トークン)の組み合わせを入れても総額比は 25 : 10 : 1 に固定される。
ミックスはティア選択に何の情報も与えない。

系列の中でミックスが順位を変えられないなら、ティア選択は別の軸で決まらなければなりません。その軸は誤答コストです。実際のワークロードで計算してみます。

ワークロード — 商品説明100万件の分類
  リクエストあたり入力4,000トークン / 出力300トークン

  Luna  : (4,000 x 0.20 + 300 x 1.20) / 1e6 = 0.00116 ドル/件 -> 1,160 ドル
  Terra : 上の10倍                                            -> 11,600 ドル
  Sol   : 上の25倍                                            -> 29,000 ドル

  ここに誤答を人が直すコスト c(件あたり)を足す。
  Lunaの誤答率4%、Terraの誤答率2%と仮定すると

  Luna  総コスト =  1,160 + 0.04 x 1e6 x c
  Terra 総コスト = 11,600 + 0.02 x 1e6 x c

  二つの式が等しくなる点:
  10,440 = 0.02 x 1e6 x c   ->   c = 0.522 ドル

読み方はこうです。誤答一つを直すのに0.52ドルより少なく済むならLunaが有利で、それより多くかかるならTerraが有利です。人の手が一件に1分かかる作業なら、人件費はすでに0.52ドルを軽く超えています。逆に誤答が単に再試行で解決するパイプラインなら、再試行のコストは0.00116ドルなのでLunaが圧倒的に有利です。

この計算が与える教訓は単純です。トークン単価10倍の差が総コストの差として現れる区間は、誤答コストがトークンコストと同じ桁のときだけです。ほとんどの社内ワークフローでは誤答コストがトークンコストより二桁も三桁も大きいです。そういうワークロードで価格表を比べながら何時間も使うのは、誤った軸で最適化する行為です。

キャッシングが曲線を動かす区間、そして動かせない区間

GPT-5.6系列のキャッシュポリシーは読み取り90%割引、書き込みは入力価格の1.25倍、最小保持30分です。Terraに40,000トークンの固定プレフィックスを使う場合で計算してみます。

プレフィックス40,000トークン、Terra入力2ドル/1M基準

  キャッシュなし      : 40,000 x 2.00 / 1e6 = 0.080 ドル(毎回の呼び出し)
  キャッシュ書き込み(1回) : 40,000 x 2.50 / 1e6 = 0.100 ドル
  キャッシュ読み取り  : 40,000 x 0.20 / 1e6 = 0.008 ドル

  N回呼び出しの損益分岐:
  0.100 + (N-1) x 0.008  <=  N x 0.080
  0.092 <= 0.072 N   ->   N >= 1.28   ->  二回目の呼び出しから得

損益分岐は二回目の呼び出しです。本当の制約は損益分岐ではなく30分です。同じプレフィックスが30分以内にもう一度来なければ、書き込みプレミアムだけ払って何も得られません。つまりキャッシングが実効的かどうかを決めるのは割引率ではなくプレフィックスごとのリクエスト密度です。ユーザー1万人がそれぞれ違うプレフィックスで一日二回ずつ呼ぶサービスでは、キャッシングはコストを増やします。

そして割引率がそのまま削減率ではないという点をもう一度押さえます。上のワークロードでは出力300トークンのコストが0.0036ドルなので、入力が総額の95%を占めます。キャッシュが完全に効けば一件あたり0.0836ドルから0.0116ドルへ86%減ります。逆に出力偏重のワークロード(入力2,000 / 出力10,000)では入力が総額の3%しかないので、同じ90%割引が総額を3%も減らせません。同じポリシーがワークロードによって86%と3%に分かれます。この計算の一般形はLLM APIコストを実際に下げる方法でプロバイダーごとの価格表を使って追いかけました。

Fastモード — レイテンシに別の価格表が付いた

Fastモードは、モデル選択と直交する軸ができたという合図なので別に見る価値があります。APIドキュメントによるとservice_tierパラメータにfast(または後方互換用のpriority)を入れればよく、現在の対象はgpt-5.6-solです。ロングコンテキスト、ファインチューニング済みモデル、埋め込みは除外されます。ドキュメントは「標準比で最大2.5倍速く、レイテンシがより一定だ」と説明し、倍率は明示せず価格ページに送ります。発表資料によればプレミアムは標準価格の2倍です。

計算は簡単です。2倍の値を払って2.5倍の速度を買う取引なので、レイテンシ1秒の価値がそのリクエストのトークンコストの半分より大きい場合にのみ得です。ユーザーが画面の前で待つ対話型の経路ならおおむね成立し、夜間バッチやキューに積んでおくパイプラインなら絶対に成立しません。この区別をコードレベルでやらずにプロジェクト設定で一括適用すると、バッチトラフィックまで2倍の値を払うことになります。ドキュメントがリクエスト単位の設定とプロジェクト単位の設定の両方を提供している点を確認し、デフォルトは標準にしておくほうが安全です。

「知能の変化なしに」という文言もそのまま受け取ってよいものです。ただしこの文が保証するのはモデルの重みが同じだということであって、負荷状況でテールレイテンシがどうなるかではありません。一定のレイテンシが必要でこのオプションを買うのなら、平均ではなくp99を測ってください。

ベンチマークが捉えられないもの

最後に、この記事の数字が捉えられないものを整理します。順位がベンチマークごとにひっくり返るという事実からしてそうです。公開された集計を見ると、SWE-Bench ProではSolが64.6%、Terraが63.4%なのに対しClaude Fable 5が80.0%で前に出ています。一方Terminal-Bench 2.1ではSolが88.8%(ultraモードで91.9%)と最高水準で、Agents' Last Examでは53.6でFable 5を13.1点上回ったと報告されています。三つのベンチマークが三つの順位を出します。ここから「誰が1位か」を取り出そうとする試みそのものが誤った問いです。

そしてどのベンチマークも測らない項目があります。

  • 長いセッションでの指示遵守。ほとんどのベンチマークは単発の課題で、実サービスは数十ターンのセッションです。20ターン目にシステムプロンプトの制約を忘れるかどうかは指数に入りません。
  • ツール呼び出しスキーマの信頼度。スキーマを外して埋める比率はエージェントパイプラインの実質的な失敗率を決めますが、集計スコアには成功か失敗かとしてしか反映されません。
  • 自分のドメインでの拒否率と過剰安全。医療・金融・セキュリティのドメインで正常なリクエストが拒否される比率は、ベンダーが公開せずベンチマークも測りません。
  • テールレイテンシとレートリミット。平均応答速度はどこにでもありますが、トラフィックが集中したときのp99と429の比率は自分で測るしか知る方法がありません。
  • 測定条件と実際の設定の乖離。上の表の指数スコアはすべて最大推論強度で測った値です。プロダクションでその強度を使うトラフィックは多くなく、強度を下げたときのスコア曲線は公開されていません。

おわりに — 曲線は下がり続けるが、自分の位置は自分で測らないと分からない

この3週間でGPT-5.6の下の二つのティアの価格は80%と20%下がり、上のティアは据え置きのまま速度だけが別売りになり始めました。価格曲線はこれからも下がるでしょうし、そのたびに値下げのニュースが出るでしょう。しかしこの記事で計算した三つの数字は値下げと無関係に残ります。

第一に、値下げ後の三つのティアの単価比は両軸とも25対10対1に固定されているので、系列の中ではトークンミックスがティア選択に何の情報も与えません。第二に、だから実際の判断は誤答一つを直すコストが決め、例示したワークロードではその損益分岐が一件あたり約0.52ドルでした。第三に、キャッシングは入力が請求書を支配するワークロードでは86%を削りますが、出力偏重のワークロードでは3%も削れません。

三つの計算はどれもベンダーが代わりにやってはくれません。必要な入力は自分のログにある三つの数字 — リクエストあたり入力・出力トークンの中央値、プレフィックスごとの30分以内の再利用率、誤答一件を処理する実際のコストです。次の値下げのニュースが来たとき、読むべきはヘッドラインではなく、その三つの数字を入れ直した表です。