
GPT-6 AstraとClaude Fable 5.1はどちらも単発の質問回答より、複数ステップを含む長時間の実務を強く意識した最上位クラスのモデルです。
両モデルとも100万トークン級のコンテキストと128Kの最大出力を持ち、APIの基本価格も入力10ドル/100万トークン、出力50ドル/100万トークンで並びます。
では、1時間以上かかる調査、ブラウザ操作、資料作成、コード修正を任せるならどちらが強いのでしょうか。
結論から言うと、PC操作や業務自動化を中心に選ぶなら、現時点ではGPT-6 Astraが有力です。
一方、Claude Fable 5.1は長時間のエージェント作業、コーディング、既存成果物のレビュー・改善で非常に強く、単純に「Astraが上だから乗り換え」で終わる比較ではありません。
ベンチマークの条件も異なるため、最終的には仕事の種類、途中介入のしやすさ、失敗時の復旧、総コストで選ぶ必要があります。
GPT-6 AstraはOpenAIが2026年9月に発表した最上位モデルで、複雑な推論、コーディング、Computer Use、調査、ドキュメント作成などのend-to-end workを主用途にしています。
APIでは1,050,000トークンのコンテキスト、128,000トークンの最大出力に対応し、入力10ドル、出力50ドル/100万トークンです。
Claude Fable 5.1もAnthropicが長時間のagentic work向けとして提供しているモデルで、1Mコンテキスト、128K最大出力、入力10ドル、出力50ドル/100万トークンです。
価格と長文容量だけを見ると非常に近い構成です。
大きな違いはモデル単体の数字より、それぞれがどの実行環境と結び付いているかです。
AstraはChatGPT Work、Codex、APIのComputer Useや各種ツールと組み合わせる設計が強く、Fable 5.1はClaudeのエージェント環境や開発ワークフローの中で長時間の推論・編集を継続する使い方が中心になります。
OpenAIのGPT-6 Astra発表ページでは、Computer Use関連の評価としてOSWorld 2.0で72.6%、ScreenSpot-Proで92.7%が掲載されています。
OSWorldはデスクトップ環境で複数ステップの操作を完了できるか、ScreenSpot-Proは画面上の対象を正しく認識・特定できるかを見る代表的な評価です。
ただし、ここでClaude Fable 5.1と単純な横並び比較はできません。
AnthropicはFable 5.1のOSWorld 2.0評価について、2026年8月版タスクを使っており、以前公開された別バージョンの結果とは直接比較できないと明記しています。
また、安全策が介入したタスクではゼロ点扱いになる条件も説明しています。
つまり「Astra 72.6%、Claudeは別の数字だからAstraの勝ち」とするのは危険です。
同じベンチマーク名でも、タスクセット、ツール、推論設定、安全策、実行ハーネスが違えば数字の意味が変わります。
それでもAstraについてはOpenAIがComputer Useを主要な強みとして前面に出し、OSWorld、ScreenSpot、Agents' Last Examなど複数の操作系評価で改善を示しているため、PC操作を最優先するユーザーにとって有力な選択肢です。
ブラウザ調査では検索結果を読む能力だけでなく、複数サイトを移動し、条件を照合し、途中で情報を整理し、最終成果物へまとめるまでの一連の流れが重要です。
AstraはOpenAIの発表でBrowseComp 91.5%を記録し、調査・ブラウジングを強みとして掲げています。
さらにWork環境では、ブラウザ、ファイル、各種接続先をまたぐ長い作業を任せる用途が想定されています。
Fable 5.1もAnthropic公式が「multistep research」「document, spreadsheet, and slide work」を主要用途として明記しており、単なるチャットモデルではありません。
特に、既存の資料やプロジェクトを読み、問題点を見つけ、構成を保ちながら改善するような作業との相性が良いモデルです。
実務で比較するなら、調査回答の正答率だけでなく次の項目を見るべきです。
・指定した情報源を最後まで確認したか
・同じ条件で複数候補を比較できたか
・途中で条件を忘れていないか
・引用元と結論が対応しているか
・最終成果物まで作れたか
・人間が修正する回数は何回だったか
モデルが1回で賢い回答を出すことと、30〜90分の作業を最後まで壊さず完了することは別の能力です。
長時間タスクでは、最初の計画が優れていても途中で失敗します。
サイト構造が変わる、ファイルが見つからない、権限確認が入る、コードのテストが落ちる、資料の形式が想定と違う、といった例外処理が必ず発生します。
そのため評価すべきなのは「成功したか」だけではありません。
重要なのは、失敗を検知できるか、原因を説明できるか、途中成果を残せるか、そこから再開できるか、人間が指示を差し込めるかです。
GPT-6 AstraはOpenAIがend-to-end workとComputer Useを中心に設計しており、複数アプリやツールをまたぐ仕事で優位性が期待できます。
Claude Fable 5.1はAnthropicがlong-horizon agentic workを明確な用途としており、長い推論、計画、コードや文書の継続編集に強みがあります。
したがって、ファイル整理、ブラウザ操作、Webフォーム、資料収集など“画面を動かす工程”が多い仕事はAstra寄り、巨大なコードベースや長い文書を読みながら考えて直す工程が中心ならFable 5.1も非常に有力です。
PC操作が強いモデルが、そのままコーディングでも常に最適とは限りません。
開発では、リポジトリ理解、変更計画、実装、テスト、失敗原因の切り分け、既存設計との整合性、レビューまで含めて評価する必要があります。
AstraはOpenAIがsoftware engineeringを主要な強みとして位置付け、Codexと組み合わせた長時間の開発作業を想定しています。
一方、Fable 5.1もAnthropic公式でlong-running agentic codingを主要な改善点として掲げています。
ここでは公開ベンチマーク1つで決めるより、自分の実リポジトリで同じ課題を与える方が有効です。
例えば「既存機能の仕様を壊さずバグを修正し、テストを追加し、変更理由を説明する」という同一タスクを両方に与え、次の5項目を記録します。
・最初のテスト成功率
・変更ファイル数と不要変更の有無
・人間の追加指示回数
・完了までの時間
・消費トークン/クレジット
この方法なら、一般的なランキングより自分の開発環境に近い判断ができます。
長時間エージェントでは、能力差以上にUXが効きます。
例えば、50分進んだ作業が権限確認で停止した場合、どこまで終わったのかが分からなければ再開コストが高くなります。
逆に、実行ログ、作成ファイル、変更内容、残タスクが明確なら、人間が短い指示を入れて再開できます。
比較時は次の点を確認してください。
・危険な操作の前に承認を求めるか
・承認回数が多すぎて自動化の利点を失っていないか
・途中で追加指示を入れられるか
・失敗後に同じ工程を最初からやり直さないか
・成果物やログが残るか
・誤操作した時に元へ戻せるか
この領域はモデルのAPI仕様だけでは分からず、ChatGPT Work、Codex、Claude側の実行環境まで含めて評価する必要があります。
APIの基本料金は両モデルとも入力10ドル、出力50ドル/100万トークンで、コンテキストも約1M、最大出力も128Kです。
表面上はほぼ同条件です。
ただし、実際の1タスク総コストは同じになりません。
キャッシュ料金、長文料金、ツール呼び出し、再試行回数、推論量、実行時間が異なるからです。
GPT-6 Astraは入力が272Kを超えるAPIリクエストで、原則として入力・キャッシュ関連が2倍、出力が1.5倍になる長文料金があります。
長いコードベースや大量資料を毎回丸ごと送る場合は、この境界を意識する必要があります。
Claude Fable 5.1はAnthropic公式でFable 5と同じ基本入出力価格を維持しつつ、キャッシュ読み取りコストを引き下げたと説明されています。
長時間エージェントでは同じ前提やコードを繰り返し参照するため、キャッシュ設計が総コストに効きます。
したがって「1Mトークン単価」だけでなく、同じ実務タスクを完了するまでに何ドルかかったかで比較するのが正解です。
PC・デスクトップ操作:
GPT-6 Astraを優先。
Computer Useを主戦場としている。
ブラウザをまたぐ調査:
Astraが有力。
Fable 5.1も長時間調査に強く、実タスク比較推奨。
既存文書のレビュー・改善:
Fable 5.1が有力。
長い文脈を保った批評・編集と相性が良い。
巨大コードベースの修正:
両方試す価値あり。
Codex環境を使うならAstra、Claude中心の開発フローならFable 5.1。
複数アプリをまたぐ事務作業:
Astra寄り。
長い計画・分析・継続推論:Fable 5.1も非常に強い。
100万トークン級の大量入力:
両方対応。
ただしAstraは272K超の料金条件を確認。
現時点では、1つに完全統一するより、役割分担した方が合理的なケースがあります。
例えば、Astraにブラウザ調査やPC操作を任せ、取得した資料やコードをFable 5.1にレビューさせる方法です。
逆にFable 5.1で計画やレビューを作り、Astraで実際のPC操作を進める方法もあります。
特に重要な業務では、同じ結論を2モデルでクロスチェックするだけでも誤りを見つけやすくなります。
ただし二重実行はコストも増えるため、すべてのタスクで行う必要はありません。
高リスクな判断、長時間作業、再実行コストが大きい作業に限定すると効果的です。
GPT-6 AstraはComputer Use、ブラウジング、業務自動化を含むend-to-end workで大きく伸びており、PCを実際に動かす仕事を任せたいユーザーには有力な選択肢です。
一方、Claude Fable 5.1も1Mコンテキストと128K出力を持ち、長時間のエージェント作業、コーディング、複数ステップ調査、文書・表計算・スライド作業を主用途としているため、単純に置き換える必要はありません。
選ぶ時は、ベンチマークの最高点ではなく、自分の1時間タスクを最後まで完了できるかで判断してください。
完遂率、所要時間、追加指示回数、誤操作、復旧性、総コストを同じ条件で測れば、どちらを残すべきかが見えやすくなります。

