GPT-6 AstraとClaude Fable 5.1を比較:長時間Agentに合うのはどちらか

独立総合指数はFable、複数のツール作業はAstraが優位です。仕事、実行環境、キャッシュ、レビュー費用で選びます。

Buda Team
ブログに戻る
GPT-6 AstraとClaude Fable 5.1を比較:長時間Agentに合うのはどちらか

GPT-6 AstraとClaude Fable 5.1を比較:長時間Agentに合うのはどちらか

GPT-6 AstraとClaude Fable 5.1の表面的な仕様はよく似ています。約100万トークンのコンテキスト、最大12.8万トークンの出力、Standard API価格は100万トークンあたり入力10ドル、出力50ドルです。

しかし、同じ仕事に同じように使えるわけではありません。

結論は明確です。難しい推論、多段階の調査、大きなキャッシュ済みプレフィックスを繰り返し読む仕事ではFable 5.1を先に評価します。実際のソフトウェアを操作し、長いツール処理を復旧しながら成果物まで作る仕事ではAstraを先に評価します。 最終的なルートは一つのランキングではなく、自社の合格タスクで決めます。

仕事別にGPT-6 AstraとClaude Fable 5.1を比較

独立総合評価ではFable 5.1が先行

Artificial AnalysisのIntelligence Indexでは、最大effortのClaude Fable 5.1が66、GPT-6 Astraが61です。Coding Agent IndexでもFable 5.1は70、Astraは67です。

同じ評価方法で測った独立指標として有用ですが、すべての仕事でFableが勝つという意味ではありません。Fableの設定には最大effortとdefault fallbackが含まれます。Coding Agent Indexの実行環境もClaude CodeとCodexで異なります。これは単独モデルではなく「モデルとAgent実行環境」の結果です。

Artificial AnalysisによるAstraの評価も一方向ではありません。GPT-5.6 Solよりtoken効率が大きく改善し、Coding Agentの費用効率は高い一方、一般知能タスクでは値上げが効率改善を上回り、タスク費用が上がりました。

OpenAIの表ではAstraが複数のツール作業で優位

評価GPT-6 AstraClaude Fable 5.1注意点
Terminal-Bench 4.057.9%55.8%OpenAI表。Terminal Agent設定の影響あり
AutomationBench41.4%31.4%SaaSワークフロー実行
BenchCAD95.9%84.3%Claude値には文書化された変更あり
Terminal-Bench Science64.6%52.6%ツールを使う科学ワークフロー
Artificial Analysis Intelligence Index61.265.7OpenAI表が引用した独立指標
Artificial Analysis Coding Agent Index67.067.2この時点ではほぼ同等

Astraがコンピューター操作やTerminalで先行しながら、Fableが広い独立総合指標で先行することは両立します。

独立指標とベンダー別タスク評価の違い

同じ価格でも運用費用は違う

  • Astraのcached inputは1ドル/MTok、Fable 5.1のcache readは0.25ドル/MTokです。
  • Astraは入力が27.2万tokenを超えると、リクエスト全体の入力とcacheが2倍、出力が1.5倍になります。
  • 両方に50%のBatch割引があります。Astraには50%のFlexと、適用価格の2倍になるFastもあります。
  • Fable 5.1はadaptive thinkingが常時有効で、会話途中にeffortを変更できます。
  • Fable 5.1のdefault fallbackは実際に測るシステムを変えます。
  • ツール、再試行、拒否、レビュー、手戻りはtoken単価以上に総費用へ影響します。

100万tokenを入れられることと、毎回入れるべきことは同じではありません。検索と安定したcache設計は必要です。

減らしたい失敗で選ぶ

**Astraを先に試す仕事:**Browserやデスクトップ操作、Terminal・ファイル・Web・検証を横断する処理、長時間実行の方向修正と復旧、文書・表計算・スライド・Webサイトの完成品。

**Fable 5.1を先に試す仕事:**難しい推論、多段階調査、安定した大きなプレフィックスを繰り返す会話、thinking blocksを正しく扱う既存Claude環境、Claude Code中心の開発。

**安価なモデルを維持する仕事:**抽出、分類、整形など検証しやすい処理、小さいモデルですでに合格する処理です。

Astra、Fable 5.1、低価格モデルのルーティング

Harnessが結果を反転させる

CodexとClaude Codeは、prompt、tools、permissions、compaction、fallback、confirmation、stateの保存方法が異なります。Astraの改善には、過去のcontext windowを検索できるCodex側の変更も含まれます。Fable 5.1にも、forced tool choice非対応、旧モデルがthinking blocksを読めない、過去turnの編集でthinking blocksが無効になる、といった制約があります。

本番切替前に同じ合格タスクで、初回合格率、ツール復旧、所要時間、input/cache/reasoning/output、修正回数、モデルとharnessどちらの失敗か、合格タスクあたり総費用を記録します。

裸のAPIテストと完成したAgent製品を比べて、モデル順位と呼ぶべきではありません。

Budaでの考え方

モデルはAgent Workspaceの一部です。永続ファイル、実ツール、権限、見える実行、人のレビューが引き続き必要です。

GPT-6 AstraとClaude Fable 5.1は、まだBudaでは利用できません。提供開始後の対象範囲とCreditsは、Budaのモデル一覧と公開料金ページで案内します。

関連:GPT-6 AstraリリースガイドAI Agentに適したモデルの選び方Claude Fable 5.1の変更点

FAQ

AstraはFable 5.1より優れていますか

すべての仕事ではありません。Fable 5.1は現在のArtificial Analysis総合指標で先行し、Astraは複数のコンピューター操作、Terminal、自動化、科学タスクで先行しています。

どちらが安いですか

Standard入出力は同額です。Fable 5.1はcache readが安く、Astraは27.2万入力tokenを超えると割増になります。タスク全体で比較してください。

Context windowはどちらが大きいですか

Astraは105万、Fable 5.1は100万tokenです。実務では検索、cache、過去の判断を保持するharnessの方が重要です。

一つのbenchmarkでdefaultを決められますか

決められません。公開評価で候補を絞り、社内の安定した合格タスクでrouteを決めます。

出典