top of page

Claude Opus 5.5は本当に最高性能?GPT-6 Astraと第三者ベンチマーク・HS実務テストで比較【2026年9月】

2 時間前
読了時間: 12分

Answer First

Artificial AnalysisのIntelligence Indexでは、2026年9月26日時点でOpus 5.5 max-effort構成が58で首位。GPT-6 Astra maxは53。これは同社計測史上最高値です。ただし評価項目ごとに結果は異なり、Astraが上回る項目や同点もあります。HSが同一タスクで実施した実務文章テストでは、Astraが情報源への忠実性、Opus 5.5が文章の読みやすさで優位という「タスク依存」の結果が出ました。単一指標だけで乗り換えを判断するのは危険です。

1. 「最高性能」の定義を先に決める

「最高性能」という言葉は文脈なしでは意味を持ちません。本記事では次の3層で評価を分離します。

  1. 独立ベンチマーク(Artificial Analysis=第三者・非vendor)

  2. 公式ベンダー主張(Anthropic / OpenAIの公表値、vendor claimとして明示)

  3. HS自社実務検証(n=3、B2B文章タスク1種、blind評価)

この3層を混同しないことが、本記事のE-E-A-T上の前提です。

2. 独立ベンチマーク比較表(Artificial Analysis, 2026-09-26取得・全10評価)

図1:第三者ベンチマークとHS実務テストを1枚で整理。総合スコアと、HS文章タスクで見えた違いは分けて読みます。

評価項目

Claude Opus 5.5 (max)

GPT-6 Astra (max)

優位

AA-Briefcase

1822

1569

Opus

GDPval-AA v2.1

1846

1542

Opus

AutomationBench-AA

70%

68%

Opus(僅差)

Terminal-Bench 4.0

60%

59%

Opus(僅差)

SciCode

67%

56%

Opus

HLE

61%

55%

Opus

AA-Omniscience

46

43

Opus

AA-LCR v1.1

85%

81%

Opus

GDP.pdf

26%

31%

Astra

CritPt

32%

32%

引き分け

Intelligence Index(10評価の総合指標):Opus 5.5=58/GPT-6 Astra=53(Opusが上回る)

Astraとの直接比較では、Opus 5.5が10項目中8項目で上回り、Astraが1項目で上回り、1項目は同点です。一方、Artificial AnalysisはOpus 5.5が10評価中6つで全モデル中のleading scoreを記録したと説明しています。総合指数58は「AAが計測した中での最高値」であり、「あらゆるタスクでの勝利」ではありません。総合指標だけでは個別タスクの差が見えにくいため、本表のような項目別確認が必要です。

3. Astraが勝つ/並ぶ領域と総合指数の限界

GDP.pdfのような特定タスクでAstraが優位な点、CritPtでの同点は、総合指標だけでは個別タスクの差が見えにくいことを示します。推論設定(reasoning effort: low〜max)、ハーネス構成、製品面(API vs 実運用ツール統合)によってもスコアは変動しうるため、「集計1位=現場最適」は成立しません。

4. 公式ベンダー主張(明示ラベル付き)

Anthropic公式(vendor claim)

  • 2026-09-22リリース、Opusシリーズ最強モデルと位置付け

  • API: 入力$4 / 出力$20(100万トークンあたり)

  • 「通常ワークロードでOpus 5比約40%低コスト」=ベンダー主張

  • 「Opus 5比30%超の高速化」=ベンダー主張

  • 「文章クラリティ向上」=ベンダー/初期テスターの主張

OpenAI公式(vendor claim)

  • Astraは「最も難易度の高いエンドツーエンド作業向けの最上位モデル」と位置付け

  • 複雑推論・コーディング・コンピュータ操作・リサーチ・文書作成が対象

  • API(Standard・短いコンテキスト): 入力$10 / 出力$50。長いコンテキストでは入力$20 / 出力$75。コンテキスト1,050,000、最大出力128,000

  • reasoning effort: low/medium/high/xhigh/max

5. HS実務検証プロトコル

  • HS内部検証ログに記録し、独立した2系統のblind評価で確認

  • 同一フリーズ済みソースパック・同一文章タスク

  • 新規セッション、初回応答のみ採用、Web検索なし

  • Astra 3回 × Opus 5.5 3回、モデル名は評価者に非開示

  • n=3/モデルの小規模検証であり、統計的一般化はできません

6. HS実測結果テーブル

観点

結果傾向

ソース忠実性(事実的規律)

Astraが優位傾向

文章の読みやすさ・編集品質

Opus 5.5が優位傾向

未記載の因果・行動の補完傾向

Opus群でやや多い傾向

虚偽の数値・出典・事例・保証表現

両モデルとも検出なし

制約

n=3/モデル、B2B文章タスク1種、製品面・設定差異あり、人手編集時間未計測、ベースモデル単体への因果主張は不可、#557(Opus 5時点データ)とのプール不可

公開用サマリー: 「HSが同じSOURCE PACKと同じ文章タスクを各3回実施し、2系統でblind評価したところ、GPT-6 Astraは提供資料への忠実性、Claude Opus 5.5は文章の読みやすさ・編集品質で優位な傾向が確認された。一方、Opus 5.5では資料に明記されていない因果・行動表現が追加されやすい傾向も見られた。」

7. スペックからビジネス判断へ(今回のHS文章タスクから得た運用案)

図2:中小企業向けの使い分け早見表。文章品質、情報源への忠実性、併用運用を目的別に整理しています。

  • 今回のHS文章タスクから得た運用案として:Opus 5.5で下書き → Astraまたは人手でファクトゲートを通す運用が現実的(ソース制約型のB2B文章業務向け、universalな推奨ではありません)

  • 最難度のエンドツーエンド・エージェント作業(複雑な自動化・コーディング・研究支援など):実際のワークロードでAstraを評価すべき(本記事の文章タスク結果からは推測不可)

  • 本検証は文章生成タスク限定であり、コーディングや長期エージェントタスクへの外挿は不可

8. No-Go / 様子見

  • 単一ベンチマークスコアだけを理由にモデルを乗り換えない

  • ベンダー発表の性能改善率=自社の業務成果、とは限らない

  • n=3のHS検証結果を統計的一般則として扱わない

9. Devil's Advocate(反証的視点)

  • Artificial Analysisは数ある評価フレームワークの1つに過ぎない

  • reasoning effort設定・ハーネス構成・製品面(API直接 vs 統合ツール)でスコアは変動する

  • HS検証はn=3、1タスクに限定され、再現性の保証はない

  • Opus群の「因果・行動の補完傾向」は、文章の自然さと表裏一体である可能性があり、単純に欠点とは言い切れない

10. 2系統のblind評価は、どこまで一致したのか

HSの6出力はモデル名を伏せ、Codex系とClaude系の2系統で別々に評価しました。重要なのは、評価の厳しさは違っても方向が一致したことです。

blind評価

Astra 3本

Opus 5.5 3本

読み方

Codex系

3本ともSOURCE PACK準拠をPASS

3本とも未提示の因果・行動表現を厳しく指摘

事実規律を厳格に見る評価

Claude系

3本ともPASS

3本ともMINOR相当の補完を指摘

自然な推論との境界をやや広く見る評価

文章品質

Astra側は比較的フラット

Opus側を上位評価

読みやすさ・構造ではOpus側が優位傾向

つまり「Opus 5.5は事実を捏造した」という結果ではありません。両評価とも、架空の価格・数字・出典・顧客事例・成果保証は検出していません。差が出たのは、与えられた資料から一歩踏み込んで、もっともらしい因果や人の行動まで文章として補うかどうかです。

11. Opus 5.5で指摘された「自然な補完」とは

今回のSOURCE PACKには、生成AI研修の目的、扱う実在業務、入力情報ルール、人間確認、研修後の1アクションなどは含めました。一方で、「社員がどう行動するか」「研修後に何が起きるか」という因果までは与えていません。

blind評価ではOpus 5.5側の文章から、たとえば「活用は個人任せになる」「実行する人がいない」「持ち帰って決める人がいない」といった表現が指摘されました。いずれも文章としては自然ですが、今回のSOURCE PACKには明記されていません。

ここが実務上のポイントです。読みやすい説明文では、前後関係を補った方が読者には理解しやすい場合があります。しかし、法務・料金・顧客実績・製品仕様など「渡した根拠の範囲から出たくない文章」では、その自然な補完自体が編集リスクになります。今回の検証でAstraをファクトゲート候補とした理由は、この違いにあります。

12. 価格差より先に見るべき「1業務あたりの運用負担」

API単価だけを見ると、Opus 5.5は入力$4・出力$20です。AstraはStandardの短いコンテキストで入力$10・出力$50、長いコンテキストでは入力$20・出力$75です。ただし、モデル選定をトークン単価だけで決めると、再生成・事実確認・人間レビュー・ツール実行などの運用コストを落とします。

判断する業務

優先して見るもの

今回の記事から言えること

根拠資料に厳密なB2B文章

SOURCE PACK逸脱、確認工数

HS文章テストではAstraの資料忠実性が高い傾向

読みやすい初稿・構成づくり

文章品質、構造、説明の自然さ

2系統のblind評価でOpus 5.5側が高評価

コーディング・長期Agent

完了率、失敗復旧、権限、速度

今回の文章テストから優劣は決められない

大量API処理

単価、token量、cache、再試行

公式単価だけでなく実ジョブの総コストで比較が必要

したがって中小企業が見るべきなのは、「どちらが1位か」より「自社のその1業務で、生成から確認まで何回手戻りするか」です。本記事のHS実測は、そのうち文章業務の一断面だけを検証しています。

13. 自社で比較するなら、同じ1業務を固定する

図3:導入判断フロー。ベンチマーク順位だけで決めず、自社の代表1業務を同条件で小さく比較します。

ベンチマークを自社判断へ落とす場合、最初から全業務を比べる必要はありません。HSが今回使った考え方は、比較条件をできるだけ固定して同じ仕事を複数回出す方法です。

  1. 実際に使う1業務を選ぶ

  2. 入力資料と禁止事項を固定する

  3. 各モデルを新規セッションで同じ回数だけ実行する

  4. 事実逸脱と文章品質を分けて評価する

  5. モデル名を伏せられる評価工程があれば、先入観を減らす

  6. 最後に料金・速度・運用面を合わせて判断する

この方法でも「モデルそのものの絶対能力」を証明できるわけではありません。製品面、設定、ツール、コンテキスト、評価者によって結果は変わります。それでも、自社が実際に使う1業務で比較することで、総合スコアだけを見るより業務判断に近い材料を得られます。

14. ベンチマーク首位とHS実測の差は矛盾しない

Artificial AnalysisのIntelligence Indexは複数の評価をまとめてモデル能力を比較するための外部指標です。一方、HSテストは「与えられたSOURCE PACKから出ないB2B文章」という、非常に狭い1業務を見ています。対象が違うため、AAでOpus 5.5が首位でも、HS文章タスクの資料忠実性ではAstra側が高く評価されることは両立します。

むしろ企業利用では、このズレを確認することに意味があります。総合性能が高いモデルほど自社業務でも自動的に最適、と決めてしまうと、実際に重要な評価軸を落とす可能性があります。文章なら根拠忠実性、コーディングなら完了率や修正容易性、Agentなら権限管理や失敗復旧など、仕事ごとに見るべき項目は変わります。本記事で確認したのは、そのうち文章業務の一例です。

15. 企業で使うときは「誤りのコスト」で分ける

同じ文章生成でも、失敗したときの影響は同じではありません。社内アイデア出しと、料金・契約・顧客実績を含む公開文書では、許容できる補完の幅が異なります。

業務の種類

誤りが出た場合の影響

モデル選定で重視する点

運用上の考え方

アイデア・構成案

比較的小さい

発想、読みやすさ、速度

複数案を出して人が選ぶ

一般的な説明文

中程度

文章品質と根拠の両立

元資料との差分を確認

料金・仕様・実績を含む公開文

大きい

根拠忠実性、出典、更新日

SOURCE PACKとファクトゲートを固定

外部操作を伴うAgent

文章以上に別評価が必要

権限、実行結果、復旧性

本記事の文章テストから優劣を推測しない

この分け方をすると、「文章が上手いモデル」と「その業務で安心して使えるモデル」が必ずしも同じでなくても不思議ではありません。HSでは今回、初稿の文章品質と事実規律を別工程に分ける方が合理的という運用案になりました。

16. 今すぐ乗り換えない方がよいケース

Opus 5.5がAAのIntelligence Indexで首位だからといって、現在の業務をすべて切り替える必要はありません。既存モデルで品質・費用・確認工程が安定している業務、比較する実タスクをまだ決めていない場合、あるいはモデル変更による手戻りを測れない場合は、まず現状維持で構いません。

逆に、現在のモデルで文章修正が多い、根拠逸脱の確認に時間がかかる、長い作業の完了率を改善したいなど、具体的な不満がある場合は、その不満が出ている1業務だけを比較対象にします。「新モデルが出たから移行」ではなく、「既存業務のどの問題を解くために試すのか」を先に決める方が比較結果を使いやすくなります。

17. HSの結論が変わる可能性も残しておく

今回の結論は固定的なモデル評価ではありません。今後、別の文章タスクやコーディング、長期Agentで同条件テストを行えば、違う結果になる可能性があります。また、製品側のアップデートや推論設定、ツール統合が変われば、同じモデル名でも実務体験は変わり得ます。

さらに今回は人間の実編集時間を計測していません。そのため「Astraの方が最終的に安い」「Opus 5.5の方が修正時間を短縮する」といった結論は出していません。公開できるのは、2系統のblind評価で確認された資料忠実性と文章品質の方向差までです。

この限定を残すことで、将来の再検証で結果が変わったときも記事全体を守れます。HSとしては、ベンチマーク順位そのものを追いかけるより、同じ1業務を固定して再測定できる形を持つことを重視します。

18. 1ワークロード意思決定チェックリスト

  • タスクは情報源への忠実性が最優先か、文章の完成度が最優先か

  • コスト構造(Opus: $4/$20。AstraはStandard・短いコンテキストで$10/$50、長いコンテキストでは$20/$75)は自社ワークロードに合うか

  • エージェント的な長時間タスクか、単発の文章生成タスクか

  • 出力の事実検証を人手またはツールで行える体制があるか

  • 意思決定を単一ベンチマークではなく自社タスクでの試験結果に基づいて行っているか

19. FAQ

Q1. Opus 5.5は最高性能なのか? Artificial AnalysisのIntelligence Index(2026年9月26日時点)ではOpus 5.5 max-effort構成が58でAstra(53)を上回り、同社計測史上最高値です。ただし10評価中の集計であり、個別タスクすべてでの勝利を意味しません。

Q2. Astraに勝っていない項目は? 公開データではGDP.pdfというタスクでAstraがOpus 5.5を上回り(31% vs 26%)、CritPtでは32%同点でした。Astraとの直接比較では10項目中8項目でOpus 5.5が高く、GDP.pdfはAstra、CritPtは同点です。全項目制覇ではありません。

Q3. HS実測では何が違った? HSが同一ソースパック・同一文章タスクで各3回・blind評価した結果、Astraは情報源への忠実性、Opus 5.5は文章の読みやすさで優位傾向が見られました。ただしn=3の小規模検証です。

Q4. 中小企業はどう使い分ければよいか? 情報源に厳密に沿う必要があるB2B文章業務では、今回のHS文章タスクから得た運用案としてOpus 5.5で下書きしAstraまたは人手でファクトチェックする方法が候補になります。最難度のエージェント作業では自社の実ワークロードで別途評価すべきです。

Q5. 価格差はどのくらいか? Anthropic公式ではOpus 5.5が入力$4/出力$20(100万トークン)。OpenAI公式ではAstraのStandard料金は短いコンテキストで入力$10/出力$50、長いコンテキストで入力$20/出力$75です。コスト構造は業務量次第で結論が変わります。

Q6. この記事の結果を他のタスクに当てはめてよいか? 不可です。本検証はB2B文章生成タスク1種・n=3に限定されており、コーディングや長期エージェントタスクへの外挿はできません。

E. 出典付録(Source Appendix)

INDEPENDENT(第三者独立評価)

  • Artificial Analysis — Claude Opus 5.5 記事: https://artificialanalysis.ai/articles/claude-opus-5-5

  • Artificial Analysis — Claude Opus 5.5 vs GPT-6 Astra 比較: https://artificialanalysis.ai/models/comparisons/claude-opus-5-5-vs-gpt-6-astra

(2026-09-26取得。Opus 5.5 Adaptive Reasoning/Max Effort/Default Fallback構成、Astra max構成)

VENDOR(公式ベンダー、未独立検証の主張を含む)

  • Anthropic — Claude Opus 5.5: https://www.anthropic.com/claude-opus-5-5

  • Anthropic — Claude Opus: https://www.anthropic.com/claude/opus

  • OpenAI — GPT-6 Astraモデルページ: https://developers.openai.com/api/docs/models/gpt-6-astra

HS FIRSTHAND(HS一次データ)

  • HS内部テストプロトコル・結果要約:frozen SOURCE PACKを使ったB2B文章タスクを各3回実施し、独立した2系統のblind評価でクロスチェック。公開部分は検証条件・結果傾向・制約に限定し、生の運用詳細は非公開。

F. 著者ブロック(Author Block)

三宅 悠生(みやけ ゆうき)。FULMiRA Japan合同会社代表。奈良・大和西大寺のHSビル・ワーキングスペースを運営し、AIスタッフ運用・SEO/AIO・業務のAI設計を実務で実践している。

G. 関連リンクブロック(Related Links)

自社に必要なAIを3分で整理する

ベンチマークの順位だけでは、自社の仕事に合うAIは決まりません。現在の用途・契約・重視する作業を整理したい場合は、無料診断で「残すAI・見直すAI」を確認できます。

コメント


bottom of page