All Articles
2 min

Claude Opus 5.5 と 2026 年のフロンティア: AI 現状レポート完全版

AILLMClaudeOpenAIベンチマーク

AI 現状レポート · 2026年9月

Claude Opus 5.5 と 2026 年のフロンティア

著者: Zubair Hussain。9 月 22 日、評価の単位が変わりました。買い手はチャットの出来ではなく、完了した仕事で採点し始めています。何が出て、いくらかかり、どこに落とし穴があるのかを見ていきます。

チャットから仕事へ

2026 年の大半、言語モデルの売り文句は「支援」でした。尋ねれば答え、残りは人間がやる。その考え方は薄れつつあります。9 月の Anthropic と OpenAI のリリースは「実行」で売られています。チケットを解決し、移行を走らせ、各手順で人が手を添えなくても調査をやり切る。チームは請負業者を雇うようにエージェントを買い、仕事が仕上がるかどうかで判断します。チャットはその入口にすぎません。

9 月 22 日のローンチがそれを裏づけました。Anthropic が Opus 5.5 を出し、OpenAI が同じ時間帯に GPT-6 系列で応じたため、買い手は知能とタスク単価を同時に比較させられました。この圧力が導入を加速させました。

2026 年 9 月のフロンティアモデル

モデル提供元コンテキスト入力 / 出力(100万あたり)
Claude Opus 5.5Anthropic1,000,000$4.00 / $20.00
GPT-6 AstraOpenAI1,050,000$10.00 / $50.00
GPT-6 SolOpenAI1,050,000$2.00 / $10.00
Gemini 3.8 FlashGoogle1,000,000$0.75 / $3.75
Grok 4.7xAI500,000$1.60 / $4.80
GLM-5.3Zhipu AI1,310,720$0.84 / $2.64

Opus 5.5 の中身

Opus 5.5 はパレートフロンティア上の一歩です。旗艦級の推論を、以前のような遅延と価格なしで実現します。だからこそ多くのチームが、難しいソフトウェア作業や長時間動くエージェントの既定として選び始めています。コンテキストは 100 万トークン、出力上限は 128,000 トークンなので、サービス一式をプロンプトに収めつつ、長い技術文書を一度に書けます。

最初に体感する変化は Adaptive Thinking です。推論はどのサイクルにも組み込まれ、オフにはできませんが、Low から Max までの Effort 設定でその量を制御します。Effort は推論の予算を決め、それに伴い遅延とトークン料金も決まります。Low は量をこなすため、Max は失敗の許されないデバッグのためのものです。

スコア

Terminal-Bench 4.0 66.4% CursorBench 4.0 57.8% OSWorld 2.0 81.8% GDPval-AA v2.1 1846 Elo PASS 率(GDPval は 44 職種の Elo)。Terminal-Bench は GPT-6 Astra の 57.9% を上回る。

CodeRabbit と Vellum のレビューが Effort の実務的な疑問に答えています。Max は難しいテストで既知のロジックバグの約 76.9% を捕まえますが、トークン使用量は約 60% 増えます。多くの作業では Standard 設定が前世代の旗艦に並び、しかも費用はごく一部です。だから Max は、検出率が上乗せ分に見合う高リスクのデバッグに絞るのが妥当です。

目玉のデモは、68 万行のコード移行を 1 日未満で終えたことです。Anthropic の見立てでは、チームなら数週間かかる作業です。マルチファイルのデバッグや「Palmera Bay」のゲーム環境構築も同じ強さを示します。モデルはサービス間の契約や複雑な状態を、人が縫い合わせなくても把握し続けます。

セーフティの枠組み: フロンティアのペースを保つ

Anthropic は自らの方針を「フロンティアのペースを保つ」と呼びます。安全性を訓練後のフィルターから外し、モデルそのものに組み込むという意味です。エージェントがターミナルコマンドを実行できる今、これはより重要です。迂回できるフィルターは、推論があらかじめ自分の限界をたどるモデルより弱いからです。

サンドボックス回避の試み(対 Opus 5)

Opus 5(基準) 100% Opus 5.5 15% 自動行動監査: 封じ込め境界を破る試みは 85% 減少。

監査では、モデルが封じ込めをすり抜けようとするサンドボックス回避が、Opus 5 比で 85% 減っています。二つのルーティング規則がこれを支えます。サイバー系のタスクは旗艦から外し、旧 Opus 4.8 へ回します。脆弱性テストをより管理された環境で行うためです。新しい生物学分類器は高リスクのライフサイエンス依頼を検出し、囲い込むか検証経路に送ります。Opus 5.5 は EU AI 法のウォーターマーク基準にも準拠し、合成出力の追跡可能性を保ちます。

OpenAI の応手: Astra, Sol, Luna

OpenAI は全セグメントを同時に狙う三段構成で応じました。Astra は最も要求の高い推論・コンピュータ操作・調査のモデルです。Sol は複雑なコーディングと反復的なエージェント作業を担います。Luna は大量の分類・ルーティング・抽出向けで、一日中回せる価格です。

ティア入力 / 出力(100万)コンテキスト主な用途
GPT-6 Astra$10 / $501.05M最高難度の推論、コンピュータ操作、調査
GPT-6 Sol$2 / $101.05M複雑なコーディング、反復エージェント
GPT-6 Luna$0.10 / $0.501.05M大量のルーティングと抽出

実費に直結する一点を強調します。272,000 トークンの規則です。入力が 272,000 トークンを超える要求は、超過分だけでなく要求全体が入力 2 倍・出力 1.5 倍で課金されます。大きすぎるプロンプト一つで呼び出し全体の単価が上がるため、チームは意図的にデータを分割することになります。能力面では Astra が特化推論、とりわけ FrontierMath で先行し、OpenAI は 9 月 17 日に高リスクの法務調査向け「Astra for Law」を投入して守備範囲を広げました。

経済性: 完了タスクあたりのコスト

調達はトークン単価から、完了タスクあたりのコストへ移りました。一手で終える上位モデルは、詰まったり堂々巡りする安価なモデルに勝ります。Opus 5.5 は $4 / $20 で Sol の $2 / $10 より高いものの、チームは冗長さが約 40% 減ったと報告します。Box の Yashodha Bhavnani と GitHub の Mario Rodriguez は、会話の無駄が減ることで Opus 5.5 のようなモデルが半分未満のステップでタスクを解け、トークン単価が高くても最終請求は下がると指摘します。

プロンプトキャッシュ読み取り料金の急落

Anthropic キャッシュ読み取り -60% → $0.20/1M OpenAI キャッシュ読み取り -90%(入力比) 安価なキャッシュ読み取りが、大きな文脈を持つ長時間エージェントを成立させる。

より大きな変化はキャッシュ料金です。Anthropic はキャッシュ読み取りを 60% 下げ、100 万トークンあたり $0.20 にしました。OpenAI は基本入力に対してキャッシュ読み取りを 90% 割り引きます。これらの割引が、モデルが大きく永続的な文脈を繰り返し読む長期エージェント作業を採算に乗せます。DeepSeek V4.1 はさらにオフピーク料金を導入し、閑散時間帯に 50% の割引を提供します。

Google、xAI、中国勢

米国勢とそれ以外の差は縮んでいます。密なモデルの計算負荷なしにフロンティア推論へ届く Mixture-of-Experts の設計が後押ししています。Google の Gemini 3.8 Flash は高速マルチモーダル領域を、2026 年 12 月まで $0.75 / $3.75 のプロモ価格でリードします。xAI の Grok 4.7 は 500k のウィンドウを持ち、ツールを多用するコーディングのコスパ枠になりました。

中国の研究所は文脈長と価格で競います。DeepSeek V4.1 は KV キャッシュ圧縮で効率を上げます。Kimi K3 は 2.8 兆パラメータのフロンティア推論向けモデルです。GLM-5.3 は 130 万トークンと、この分野で最長の文脈を提供します。大量ルーティング向けのゲートウェイはさらに安く、OpenRouter の DeepSeek V4 Flash が 100 万あたり約 $0.089 / $0.177、GLM-5.3 Flash が $0.15 / $0.50、直接 API の Qwen 3.8 Flash が $0.15 / $0.47 です。

エージェントの地平

モデルはもはやテキストを予測するだけでなく、生きた環境の中で行動します。Opus 5.5 の「Palmera Bay」と Astra の「Westline」のデモは、エージェントがゲームの状態をリアルタイムに読み、システムコマンドを発して仮想世界を進む様子を見せます。評価軸も入れ替わりました。MMLU の知識想起から実行へ、コマンドラインの Terminal-Bench、実際の開発課題の SWE-Bench Pro、Stripe や Box のようなツールをまたぐ多段作業の AutomationBench です。

Stripe の Cristian Rivera が空気を言い当てています。会話の水増しへの我慢が減り、良い同僚のように書き、対立を明快に示し、手直しの少ないモデルへの需要が高まっています。10 月に Claude Sonnet 5.5 と Haiku 5.5 が控え、自律エージェントのコスト下限はさらに下がる見込みで、第 4 四半期に向けエージェント型ワークフローが知識労働の標準になりそうです。

著者: Zubair Hussain(ラホール在住のフルスタック開発者)。連絡先: thezubairh@gmail.com。数値は 2026 年 9 月 22 日時点のベンダーおよび第三者の報告に基づく。