更新日:
14/8/2026

GPT-5.6 SolのUltrafastとは?最大14倍の速度・料金・提供状況を解説

blog header image

目次

この記事のポイント

GPT-5.6 SolのUltrafastは、Standard処理に対して最大14倍の速度をうたう新しいAPIサービス階層
Cerebrasの推論基盤を使い、生成開始後の出力速度は最大毎秒750トークン
2026年8月14日時点では、OpenAI APIの一部顧客を対象とする限定プレビュー
ChatGPTでの提供、Plus・Proユーザーへの開放、Ultrafastの料金、一般提供日は未発表
APIのFast、CodexのUltra、xhigh reasoning、Sol・Terra・Lunaはそれぞれ選択する対象が異なる

「GPT-5.6 Solが最大14倍高速化」という見出しを見れば、ChatGPTの回答がすぐ14倍速くなると受け取る人がいても不思議ではありません。

しかし、OpenAIの発表対象はChatGPTの一般向け機能ではなく、OpenAI APIに追加される新しい処理階層です。

しかも、誰でもAPIの設定を変えれば使える段階には達していません。

OpenAIの発表では、2026年8月13日から一部顧客に限定プレビューとして提供し、処理能力の拡大に合わせて対象を広げると説明しています。

具体的な一般提供日と料金は示されず、ChatGPTや通常のCodex利用者への展開にも触れていません。

もう一つ誤解しやすいのが「14倍」の対象です。

OpenAIが示したのはStandardと比べた最大処理速度であり、検索、ツール呼び出し、外部サービスの応答、人による確認まで含めた仕事全体が14分の1で終わるという意味ではありません。

この違いを理解しないと、導入効果を過大に見積もってしまいます。

GPT-5.6 SolのUltrafastとは

GPT-5.6 Sol専用の新しいAPIサービス階層

Ultrafastは、新しいAIモデルの名前ではありません。

GPT-5.6シリーズで最も高い能力を担うSolを、Cerebrasの推論インフラで高速に処理するサービス階層です。

モデル自体をSolから小型モデルへ切り替えるのではなく、同じSolをどの推論基盤・処理優先度で動かすかを変えます。

OpenAIによると、UltrafastはStandard処理より最大14倍高速で、最大毎秒750の出力トークンを生成します。

開始場所はOpenAI APIで、発表当日から選定された顧客が試す限定プレビューです。

容量の拡大に応じて利用対象を広げる方針は示されたものの、申し込めば必ず利用できるとは案内されていません。

GPT-5.6 Solがシリーズ内でどのような役割を担うかは、GPT-5.6 Sol・Terra・Lunaの基本的な違いで詳しく整理しています。

Solは複雑な推論やコーディングを担う上位モデルであり、Ultrafastはそのモデル選択とは別に速度を上げる仕組みです。

現在分かっていること・分かっていないこと

以下の表は、OpenAIの発表とAPIドキュメントから確認できる範囲をまとめたものです。

未発表の項目は、既存のFast料金や過去のプレビュー事例から推測せず、未発表として扱います。

項目 2026年8月14日時点の状況 情報の扱い
発表日 2026年8月13日 OpenAI公式発表
対象モデル GPT-5.6 Sol Terra・Lunaへの提供は未発表
最大速度 最大750出力トークン/秒 出力生成速度の最大値
Standard比 最大14倍 常時14倍を保証する数字ではない
提供場所 OpenAI APIで先行 利用方法の一般向け仕様は未公開
対象ユーザー 選定された一部顧客 限定プレビュー
料金 未発表 Standard・Fastの料金から推定不可
ChatGPT対応 未発表 Plus・Pro契約だけでは利用不可
一般提供時期 未発表 容量拡大に合わせて対象を拡大予定

ここから読み取れるのは、Ultrafastが完成済みの一般向け商品というより、実運用で価値が出る場面と必要容量を確かめる段階にあることです。

OpenAIはコーディング、コマース、金融リサーチ、サポートなどの企業と検証し、その知見を今後の展開に反映するとしています。

ChatGPT、Plus・Pro、Codexでは使えるのか

2026年8月14日時点では、ChatGPTにUltrafastが提供されたという公式発表はありません。

PlusまたはProのモデル選択画面にSolや速度関連の設定が表示されていても、それだけでAPI限定プレビューのUltrafastを利用できることにはなりません。

Codexについても同様です。

CerebrasのベンチマークはCodex上で実行されていますが、それは評価環境の説明であり、一般のCodex利用者へUltrafastが開放された証拠ではありません。

Codexには既存のFastモードがありますが、名称が似ているだけで、今回発表されたUltrafastとは別の提供枠です。

最大14倍・毎秒750トークンの意味

毎秒750トークンは「回答を書き出す速さ」

トークンは、AIが文章を処理・生成するときの単位です。

英単語や日本語の文字数と一対一では対応しないため、毎秒750トークンを「日本語750文字」と読み替えることはできません。

OpenAIが発表した数値は最大のoutput tokens per secondで、主に回答の生成が始まった後、どれだけ速く出力を続けられるかを示します。

最大値がそのまま出ると仮定すれば、1,000出力トークンは約1.3秒、3,000出力トークンは約4秒で生成される計算です。

ただし、これは単純にトークン数を750で割った理論値にすぎません。

リクエスト送信から最初の文字が返るまでの待ち時間、入力の読み込み、推論、混雑、安全確認、ツールの処理時間は含みません。

最大14倍はStandardの出力処理との比較

「最大14倍」は、他社モデルや人間の作業速度との比較ではなく、GPT-5.6 SolをStandard処理で動かした場合との比較です。

同じSolでも、推論を実行する基盤をCerebrasへ切り替えることで、出力を大幅に速めるという位置づけになります。

一方、AIエージェントの仕事は文章生成だけで完結しません。

たとえば競合調査なら、検索結果を待ち、複数ページを取得し、必要に応じてコードを実行し、結果を検証してからレポートを組み立てます。

Ultrafastが直接短縮するのは主にモデル側の処理であり、検索サイトや外部APIの応答、ファイルの転送、ブラウザー操作、人の承認まで14倍になるわけではありません。

業務全体では5.6倍だったというCerebrasの評価

Cerebrasは、経済価値のある知識労働を測るGDP-Valで、StandardのGPT-5.6 SolとUltrafastをCodex内、medium reasoningで比較し、エンドツーエンドの処理が5.6倍速かったと報告しています。

測定日は2026年7月31日です。「14倍」より小さい5.6倍という結果は、業務全体ではモデルの出力以外にも時間がかかることを示す例として参考になります。

ただし、これはCerebras自身が実施した評価であり、独立した第三者機関の再現試験ではありません。

同社は品質低下がなかったと説明していますが、公開記事だけでは、すべての用途・入力条件で同じ品質になるとまでは確認できません。

導入時には自社の代表的なタスクで、正確性、再現性、所要時間を測る必要があります。

HLEの11時間11分と78時間27分をどう読むか

CerebrasはHumanity’s Last Exam(HLE)の2,500問を処理する試験も公表しました。

GPT-5.6 Sol UltrafastとCodex、xhigh reasoningの組み合わせは11時間11分、Claude Fable 5とClaude Code、xhigh reasoningの組み合わせは78時間27分で、正答精度は同程度だったと報告しています。

比較対象、実行環境、実施日が異なるため、この結果だけであらゆる課題におけるモデルの優劣を断定するのは適切ではありません。

7倍近い完了時間の差が生じた事例ではあるものの、Cerebrasによる自社基盤の評価であり、OpenAIが示した「Standard比で最大14倍」とも別の比較です。

Standard・Fast・Ultrafast・Ultra・xhighの違い

まず「何を選ぶ設定か」を分ける

名称が混乱する理由は、同じ画面やAPIで使う言葉が、異なる層を指しているためです。

Sol・Terra・Lunaはモデルの選択、Standard・Fast・Ultrafastは主に処理基盤やサービス階層の選択、xhighやUltraはCodexなどでの推論量・実行方法の選択です。

車にたとえるなら、Sol・Terra・Lunaは車種、Standard・Fast・Ultrafastは走行レーン、xhighは目的地までの検討をどこまで入念に行うか、Ultraは入念な検討に加えて複数の担当へ仕事を分ける運転計画に近い関係です。

速いレーンを選ぶことと、難しい問題へ多くの計算を使うことは両立しますが、同じ設定ではありません。

名称 何を変えるか 対象 速度への影響 料金・消費 提供場所 利用者 推論量への影響 提供状況
Standard 通常のAPI処理階層 対応APIモデル 比較の基準 GPT-5.6 Solは短いコンテキストで入力100万トークン5ドル、出力30ドル OpenAI API API利用者 直接は変えない 一般提供中
Fast 優先度と処理速度 GPT-5.6 Solなど対応モデル APIではSolが最大2.5倍 APIはStandardの2倍。CodexのFastは別のクレジット倍率 OpenAI API、Codex 対応アカウント 直接は変えない 一般提供中。地域・条件あり
Ultrafast Cerebras基盤による新しいAPI処理階層 GPT-5.6 Sol Standard比で最大14倍、最大750出力トークン/秒 未発表 OpenAI APIで先行 選定された一部顧客 直接は変えない 限定プレビュー
xhigh モデルが推論へ使う計算量 対応モデル 一般に深く考えるほど待ち時間は増えやすい 出力・推論トークンや利用枠の消費が増える場合がある API、Codexなど 対応環境の利用者 増やす GPT-5.6 Solで利用可能
Ultra 最大推論と自動タスク委任 ChatGPT Work・Codexの対応モデル 並列化できる複雑な仕事は所要時間を縮められる場合がある 高い推論量と複数エージェントで消費が増えやすい ChatGPT Work、Codex 対応プラン・環境の利用者 最大級。必要に応じてサブエージェントを使う 対応環境で提供中

APIのFastとCodexのFastも条件が違う

OpenAI APIのFastモードは、GPT-5.6 SolをStandardより最大2.5倍高速にし、APIのトークン単価は2倍です。

短いコンテキストのSolなら、Standardが入力100万トークン5ドル・出力30ドルなのに対し、Fastは入力10ドル・出力60ドルとなります。

27万2,000トークンを超える長い入力には別の長文料金が適用されます。

一方、ChatGPTアカウントで使うCodexのFastは公式ドキュメント上で1.5倍速く、GPT-5.6ではStandardの2.5倍のクレジットを消費します。

APIキーでCodexを使う場合はAPI料金が適用されます。同じ「Fast」でも、APIの最大2.5倍・料金2倍と、Codexの速度1.5倍・クレジット2.5倍を混ぜないことが大切です。

Ultrafastの価格が未発表である以上、Fastより何倍高いか、どの処理量から採算が合うかはまだ計算できません。既存モデルを含む費用比較は、Sol・Terra・Lunaの料金と費用対効果も参考にしてください。

SolのUltraとxhighは「速く配信する設定」ではない

ChatGPT Work/Codexの公式モデル説明では、xhigh(Extra high)は複雑な問題へより多くの推論を使う設定です。

処理を深くするため、一般には応答時間とトークン消費が増えやすくなります。

Ultraはモデル選択画面上では推論レベルの一つですが、単一エージェントの推論量を上げるだけではありません。

公式説明では「最大推論+自動タスク委任」とされ、分割できる複雑な仕事をサブエージェントへ並列に任せます。

したがって、Ultrafastが一つのSolの出力を高速化するのに対し、Ultraは仕事の進め方そのものを変える設定です。

HLE評価で「Ultrafast+xhigh」が使われたことからも、両者を同時に設定できる別軸だと分かります。

深い推論に要する待ち時間を高速な基盤で短くする、という組み合わせです。

Terra・Lunaは速度モードではなく別モデル

Terraは能力とコストのバランス、Lunaは低コスト・大量処理を重視して個別に訓練・提供されるモデルです。

SolをLunaへ切り替えると、処理基盤だけでなくモデル自体が変わります。

短い定型処理ならUltrafastを待つよりLunaの方が合理的な可能性がありますが、Sol級の判断力と短い待ち時間を同時に必要とする場面がUltrafastの対象です。

Cerebrasでなぜ高速化できるのか

推論速度を遅くする「データ移動」

大規模言語モデルの推論では、計算回数だけでなく、モデルの重みと呼ばれる大量の数値データを計算装置へ運ぶ時間が速度を左右します。

一般的なGPUシステムでは、チップ上の高速メモリだけで巨大モデルのすべてを保持しにくく、外部メモリから必要なデータを繰り返し読み出します。

計算器が高速でも、データ到着を待つ時間が長ければトークン生成は伸びません。

Cerebrasの説明では、フロンティアモデルの高速推論は計算能力だけの問題ではなく、メモリ帯域とデータ移動の問題です。

そこで同社は、通常なら多数の小さなチップへ切り分けるシリコンウェハーを、ほぼ全面のまま一つの巨大なプロセッサとして使うWafer-Scale Engine(WSE)を採用しています。

44GBのSRAMへ重みを置き、トークンを流す

Cerebrasによると、ウェハーサイズの各チップには44GBのSRAMが搭載されています。

SRAMはチップ上で高速にアクセスできるメモリです。

モデルの重みをチップ上に保つことで、GPU構成で起こりやすいオンチップメモリと外部ストレージの往復を減らします。

モデルが一枚のウェハーに収まらない場合は、モデルの層を複数のウェハーへ分け、生成中のトークンをパイプラインのように順番に流します。

一つのトークンが前段から後段へ進む一方で、後続のトークンも前段の処理を始められるため、連続出力の間隔を短くできます。

この設計が毎回、あらゆる処理で同じ倍率を出すわけではありません。

Cerebras自身も、GPUシステムに対する速度改善は、ワークロード、構成、測定日、比較モデルによって変わると注記しています。

入力長、推論レベル、同時利用量、ネットワーク、ツール構成、安全確認なども実測値へ影響します。

Ultrafastで何が変わるのか

価値が大きいのは「待っている間にも状況が変わる仕事」

Ultrafastの価値は、同じ文章を数秒速く受け取れることだけではありません。

回答を待っている間に障害が広がる、市場や在庫が変わる、顧客が電話を切る、開発者が別作業へ注意を移すといった場面では、遅延そのものが損失になります。

高い推論能力が必要で、なおかつ結果をすぐ次の判断へつなぐ仕事ほど、高速化の効果が積み上がります。

OpenAIは、システム障害時のログ・トレース分析、金融市場や不審取引の評価、複雑な音声サポート、在庫確認と購入支援、ライブ調査・実験を例示しています。

社内検証では、一晩かけて実験結果を確認していた研究サイクルを、勤務時間中に複数回回せる可能性があると説明しました。

これは確定した全社実績ではなく、プレビュー段階でOpenAIが示した利用像です。

コーディングでも、コード生成そのものより「修正する、テストする、結果を読み、次の修正を出す」という反復に効きます。

各ループのモデル待ち時間が短くなれば、人が作業の文脈を保ったまま判断を返しやすくなります。

ただし、ビルド、テスト環境の起動、依存パッケージの取得、レビュー承認は別の時間です。

用途 適性 判断理由 代替候補・注意点
一般的なチャット 低い 数秒の短縮が料金差に見合いにくい Standard、Terra、Lunaで十分な場合が多い
短文・メール作成 低い 出力が短く、削減できる絶対時間が小さい モデル選択を先に最適化
大量の定型処理 条件付き 締切が厳しければ有効だが、単価の影響が大きい Luna、Batch、Standardとの費用比較が必要
複雑な音声AI 高い 会話中の沈黙が体験を損ない、複数システム照会も発生する 音声・外部API側の遅延も測定
障害・攻撃対応 高い 判断の遅れが停止時間や被害拡大へ直結する 最終判断とデプロイは人が担う
長時間の調査エージェント 高い 多数の推論ループで短縮時間が積み上がる 検索・取得時間が支配的なら効果は下がる
コーディングとテスト反復 高い 生成、検証、修正の待ち時間を繰り返し削減できる ビルドやテスト自体の時間は別

一般ユーザーには現時点で直接の必要性は低い

日常の質問、要約、短い文章作成が中心なら、Ultrafastは利用できないだけでなく、将来開放されても過剰になりやすい機能です。

待ち時間が数秒減る便益より、料金や利用枠の差が大きければ、TerraやLunaの方が使いやすいでしょう。

ただし、一般ユーザーに無関係というわけでもありません。

Cerebras基盤でSolの能力を保ちながら低遅延化できることが実運用で確認されれば、将来のChatGPTや音声機能、コーディング体験の設計に反映される可能性があります。

OpenAIはプレビューの知見を今後の製品へ生かすと述べていますが、ChatGPTへの搭載を約束したわけではない点は分けて考える必要があります。

個人開発者は料金発表後に実測で判断する

個人開発者にとっては、利用資格と料金が判明するまで待つのが現実的です。

開放後も、デモの見栄えだけで選ばず、最初の出力までの時間、出力速度、ツール待ち、タスク完了時間、成功率、1件当たり費用を同じ入力で比較します。

短文中心ならFastでも十分な可能性があり、定型の大量処理はLunaや非同期処理の方が低コストです。

企業は「1分短縮の価値」から逆算する

企業では、Ultrafastの単価だけでなく、遅延が生む損失と比較する必要があります。

障害復旧が1分早まる価値、電話対応の保留時間短縮、カート離脱の抑制、研究・開発サイクルを一日に何回増やせるかを数値化すると、追加料金を払う条件が見えます。

導入テストでは、平均値だけでなく95パーセンタイルなど遅い側の応答時間も確認すべきです。

リアルタイムサービスは、平均が速くても一部のリクエストだけ大きく遅れると利用体験が崩れます。

精度、エラー率、容量制限、地域、データ処理条件も含め、正式な料金と契約条件が出た段階でFastと比較してください。

用途ごとのモデル選択は、Sol・Terra・Lunaを仕事別に使い分ける方法で整理しています。

まずモデルを選び、そのうえで待ち時間が事業成果を左右する部分だけFastやUltrafastへ振り分ける設計が合理的です。

最大14倍より「どの待ち時間が減るか」で判断する

GPT-5.6 SolのUltrafastは、Solの能力を使いながら、Cerebrasの推論基盤によって出力を最大毎秒750トークン、Standard比で最大14倍まで高速化する新しいAPIサービス階層です。

小型モデルへ切り替えて速度を稼ぐのではなく、高い能力と低遅延を同時に狙う点に今回の発表の意味があります。

一方、2026年8月14日時点では、選定された一部顧客だけが使える限定プレビューです。

ChatGPT、Plus・Pro、一般のCodex利用者への提供、Ultrafastの料金、一般公開日、Terra・Lunaへの展開は発表されていません。

導入判断では「14倍」という最大値だけを見ず、モデルの出力が業務時間の何割を占めるかを測る必要があります。

障害対応、音声AI、ライブ調査、コーディングの反復など、待ち時間の短縮が損失回避や試行回数の増加へ直結する処理ほど価値が高まります。

正式提供と料金発表後に、自社タスクの完了時間・品質・1件当たり費用をStandard、Fast、Terra、Lunaと再比較するのが次の判断になります。

他の記事も読む

X account logo
Xアカウントをフォロー!
最新の情報をいち早くゲット!
フォローする
back to article page
記事一覧に戻る
シェア
share link icon
‍無料会員登録
支持投票やブックマークなど、すべての機能にアクセスできます。
登録はほんの数秒で完了します!
無料会員登録
ログイン