Claude Opus 5とは?フロンティア級の知能が半額に——ChatGPTとの正直な比較

2026年7月24日登場のClaude Opus 5。価格は$5/$25で据え置き、性能はFable 5に肉薄。GPT-5.6 Solとの本当の差を検証します。

Anthropicは、その最新モデルに「罠付きのパズル」を解かせてみました。

課題はこうです。機械部品の図面が与えられるので、エンジニアが実物のオブジェクトを設計するために使う無料ソフト「FreeCAD」で、その図面を3Dモデルとして再構築するコードを書いてください。ただし、重大な落とし穴があります。モデルには図面を「見る」手段が一切与えられていないのです。ビジョン機能なし。ただ、普通に開けないファイルが渡されただけです。

多くのAIモデルなら、そこで処理を中止するか、でたらめな答えを出力するところでしょう。しかし、Claude Opus 5はどちらも選びませんでした。代わりに、画像の生ピクセルを読み取り、輪郭や形状を検出し、技術的には「見えないはずの画像」から幾何学情報を引き出すための、独自の画像認識プログラムをゼロから書き上げたのです。そして、それを使って3Dモデルを再構築しました。これを実行しただけではありません。Anthropicによれば、同じ条件で5回試しても、競合する他のモデルはこれを解くことができなかったそうです。

この発表で本当に注目すべきは、価格やベンチマークの自慢話ではありません。モデルが壁にぶつかったとき、その壁を乗り越えるための「自分自身の道具」を構築したという事実です。では、Opus 5は実際どのようなモデルなのか、本当にどれくらい優秀なのか、そして本音でChatGPTとどう比較すべきか、一緒に見ていきましょう。

Claude Opus 5 は実際にどのようなモデルなのか

Claude Opus 5は、Claudeを開発するAnthropic社がリリースした最新モデルです。2026年7月24日に公開され、Claude.ai、Claude API、Claude Code、Claude Coworkですぐに利用可能です。

平たく言うと、Anthropicにはいくつかのモデル階層があります。Fable 5が最も頭脳明晰で高価な最上位モデル(フロンティアモデル)です。Opusはその一つ下の階層で、まだ非常に高性能ですが、むしろ「一日中使い続ける作業用ホースワーク」に定位しています。Opus 5のコンセプトは、Fable 5の知能に迫りながら、実行コストを大幅に抑えることです。Cursor創設者の一人はこれを「Opusの速度とコストで、Fable 5に迫る知能」と表現していました。

数字が気になる方のために整理しましょう。モデルIDは claude-opus-5 です。価格は入力トークン100万あたり5ドル、出力トークン100万あたり25ドルで、後継となるOpus 4.8と完全に同じです(トークンとは単語の約3/4に相当し、100万トークンは約75万語)。つまり「価格が半額」と言われるのは、最上位モデルとの比較であり、Opus 4.8よりも安くなっているわけではありません。Opus 5はClaude Maxのデフォルトモデルとなり、Claude Proプランで選べる最強モデルの座に就きました。

同時に、開発者がものづくりをする上で重要な2つの新機能も追加されました。Claudeプラットフォーム上で、会話を中断せずにモデルがアクセスできるツールを途中で切り替えられるようになりました。また、APIではOpus 5のリクエストに異常があった場合、自動的に旧版のOpus 4.8にフォールバックする機能が追加されました。ライブアプリ内でClaudeを運用している開発者には、心強いセーフティネットです。

Anthropic’s official Claude Opus 5 announcement page, dated July 24, 2026

Anthropic’s launch page, July 24, 2026 — Opus 5 is the new default on Claude Max and the strongest model on Claude Pro. Source: Anthropic.

新規課題の解決が重要な理由

多くのベンチマークは、モデルが「どれだけ知っているか」を測るものです。FreeCADの事例が測っているのは、それとは違う視点です。「いかにしてその場で工夫し、対応できるか」です。ビジョンツールが与えられていなかったので、モデル自身でそれを作り上げました。行き詰まりを「ここで終わり」と受け止めるのではなく、「回り道を engineered するべき課題」と捉えたのです。

Anthropicはこれを裏付けるため、ARC-AGI-3というベンチマークを用意しました。これはモデルがこれまで一度も見たことのない問題に対して、いかに推論できるかを試すものです。暗記で乗り切れない分野です。このテストで、Opus 5は2位以下のモデルの約3倍のスコアを記録しました。なぜこれが重要なのか? コードを書かない人でも関係あるからです。現実の職場では「新規課題」こそが日常だからです。どのマニュアルにも載っていない不思議な顧客クレーム、どのチュートリアルもカバーしていない形で壊れたスプレッドシート。定型パターンしか処理できないモデルは芸当でしかありませんが、誰も書いたことのないケースでも論理的に推論できるモデルは、本当に頼れるツールになるのです。

ベンチマーク結果を正直に解説する

どの発表資料も自社の勝利を強調しがちなので、ここではAnthropicが公開した数字を、注意書きもそのまま残して見ていきましょう。Anthropicは発表ページで、OpenAIの「Sol」バージョンであるGPT-5.6と直接比較しています。

Anthropic’s official benchmark table comparing Claude Opus 5 and GPT-5.6 Sol

Anthropic’s official comparison, with GPT-5.6 Sol in the right-hand column — Opus 5 leads most tests, but not all. Source: Anthropic.

表面だけ見ると、確かに良い結果です。Anthropicが選んだテストでは、Opus 5がGPT-5.6 Solのほとんどで上回っています。

  • エージェント型ターミナルコーディング(Frontier-Bench): 43.3% vs 34.4%
  • ナレッジワーク(GDPval-AA): 1,861 vs 1,736
  • 新規課題解決(ARC-AGI-3): 30.2% vs 7.8%
  • PC操作(OSWorld 2.0): 70.6% vs 62.6%
  • ビジネスワークフロー(AutomationBench): 26.0% vs 18.1%
  • エージェント型Web検索(BrowseComp): ほぼ同率、90.8% vs 90.4%

しかし、プレスリリースでは伏せられがちな重要な点もあります。開発者の多くが実際に作業するフィールドでは、GPT-5.6 Solが勝利しています。実世界のコーディングベンチマーク「DeepSWE」では、GPT-5.6 Solが72.7%、Opus 5が68.8%を記録しており、Opus 5だけでなくFable 5をも上回っています。さらに、専門的な医療テスト「HealthBench」でも60.5% vs 59.8%とOpus 5をわずかに上回っています。つまり「Opus 5がChatGPTを圧勝した」というのは、この表が示していることではありません。表が示しているのは、Anthropicが選んだテストではOpus 5がリードしているが、ChatGPTのモデルは特定のコーディング分野で本当に優れており、差は実は小さい、ということです。

これを安易に信じ込まず、前に進みましょう。2つの注意点を押さえておきましょう。第一に、テストの選択と対戦相手の設定はAnthropicが行っています。どのラボも自社の良いところで自分を評価するのは当然ですが、だからこそ外部の評価を待つのが賢明です。第二に、独立した評価機関はまだOpus 5を評価していません。AnthropicもOpenAIも属さない「Artificial Analysis」のインテリジェンス指数では、Fable 5が60、GPT-5.6 Solが59、Opus 4.8が56です。Opus 5はまだ載っていません。独立系のスコアが更新された時、それがベンチマークチャートよりも信頼できる数字になります。

また、「Opus 5はSWE-Bench ProでGPT-5.6に勝利した」という情報がSNSで拡散されていますが、Anthropicの表にSWE-Bench Proは含まれておらず、記載されているコーディングテストでもGPT-5.6 Solが上回っています。これは未確認の噂として扱うべきでしょう。

日本のメディアもこの比較に素早く反応し、「Opus 5 vs GPT-5.6 Sol、どちらが何に強いのか」といった比較記事を公開しています。これは、日本のチームが新しいモデルをプロダクションワークフローに切り替える前に、どのくらい慎重に評価しているかを反映していると言えます。

できないこと、そしてまだわからないこと

ここからは信頼を損なわないよう、正直に語りましょう。

Opus 5はAnthropicの最も強力なモデルではありません。その座はまだFable 5が占めています。Opus 5は「コストパフォーマンス重視」のモデルです。最上位の性能の大部分を、半額の費用で提供するという位置づけであり、頂点ではありません。数時間単位で自動実行されるプロジェクトには、Anthropicは今もFable 5を推奨しています。

一つ、意図的にバランスが取られている分野があります。サイバーセキュリティの分野です。Opus 5は、ソフトウェアの脆弱性を「発見する」能力において、専門モデルのMythos 5とほぼ同等です。しかし、その脆弱性を「実際に悪用するエクスプロイトを構築する」能力では、Mythos 5に大きく遅れを取ります。これは意図的な設計です。鍵のかかっていないドアを指摘できるモデルは欲しいですが、そのドアを強引にこじ開けるのが得意すぎるモデルは望ましくないからです。

还有一个不确定的点:コンテキストウィンドウの公式発表はまだありません。従来のOpusシリーズは長らく100万トークン(約75万語)のウィンドウをサポートしており、初期報道もOpus 5がそれを継承すると仮定していますが、Anthropicの公式ドキュメントではOpus 5の名前はまだ明記されていません。100万トークンは「可能性が高い」ものの、まだ未確認と捉えておきましょう。そして、上記の数字はすべてAnthropicが自社の選定テストで自己申告したものです。これは方向性を示すものであり、絶対的な正解ではありません。独立系の評価スコアは通常2週間以内に更新されますので、それまで待ってみる価値があります。

あなたにとっての意味

Claude ProまたはMaxをすでに契約しているなら、何も操作する必要はありません。自動的にアップグレードされています。Maxではデフォルトモデルに、Proでは最上位オプションにOpus 5が採用されています。次に取るべきアクションは、より複雑なタスク——雑然とした報告書やぐちゃぐちゃになったスプレッドシート——に対して、モデルを信頼して任せることです。すべてを細かなステップに分解する必要はありません。

文章を書く、計画を立てる、データを分析する仕事をしているなら、Opus 5は財務部門も驚かせないコストで、強力な日課ツールになります。さらに、テンプレートもなく明確な道筋も見えない「本当に珍しいタスク」の場合こそ、モデルが立ち止まるのではなく、論理的に推論して解決策を探るために設計されたのがOpus 5です。

コードを書いたり自動化を運用したりする方には、コーディングやエージェント性能の数字、そして会話中のツール切り替え機能が注目点です。おもちゃのようなデモではなく、実際のコードベースで本格的な検証を行う価値があります。その際、トークン使用量には気をつけてください。単価が安くても、タスクごとに長く思考すれば、結果としてコストがかかる場合もあるからです。

ClaudeとChatGPTのどちらを選ぶか迷っているなら、今週のベンチマーク結果だけで決めないでください。自分の作業スタイルにどちらがフィットするかで選んでください。インターフェース、書き方のトーン、すでに使い慣れているツールとの相性。純粋な能力値は互いに近く、2ポイントの差よりも「使いやすさ」の方が重要です。ClaudeとChatGPTの選び方で迷っている方には、生成AI完全入門コースが、いかなるモデルも自分の実際の作業を通じて評価する方法を指導しています。

まとめ

Opus 5が注目されるのは、地球上で最も頭脳明晰なAIだからではありません。実際、それは頂点に立たないモデルです。注目されるのは、フロンティアレベルの性能を作業用の価格帯まで引き下げたこと、そして「装備されていなかった課題」に対して、自分自身の手段を構築して乗り越えた実証をしたからです。多くの実務において、「半額のコストでフロンティアの大部分を手に入れる」ことは、「プレミアムを支払って絶対的最上位を手に入れる」ことよりも、はるかに合理的な選択肢です。

ChatGPTとの比較で決定的な優劣がついたわけでもありません。Anthropic自身の数字ではOpus 5が多くのテストでリードしていますが、GPT-5.6は特定のコーディング分野で上回っています。独立系の評価機関が決断を下すのもまだ先です。ですから、新製品の華やかな発表に流されてツールを切り替えるのは賢明ではありません。大切なのは、すでに使い慣れたツールをマスターし、新しいモデルを自分の実際の作業で素早く評価できるスキルを身につけることです。どのラボが今月勝ち残ろうと、モデルを実務で活用する力を身につけることこそが、最終的に報酬につながります。そのスキルを身につけるために設計されたのが、Claude Code Masteryコースです。


参考: Anthropic · fyve.co.jp · CNBC

Build Real AI Skills

Step-by-step courses with quizzes and certificates for your resume