2026年5月末に公開されたAnthropicのClaude Opus 4.8が、実務に近いコーディング指標『SWE-Bench Verified』で88.6%を記録し、主要モデルの首位に立った。GPT-5.5(82.6%)やGemini 3.1 Pro(80.6%)を上回る数字だ。だが中小企業の現場でまず考えたいのは『どれが一番賢いか』ではなく『うちの仕事と財布に、どれが合うか』である。首位の数字と、あなたの会社にとっての正解は、必ずしも同じではない。今日はその見極め方を、価格・文脈長・得点という3つの軸で解きほぐす。
Opus 4.8は何が、どう強くなったのか
Opus 4.8は、答える前に考える時間を長く取る『推論モデル』と、素早く返す通常応答を1つにまとめた設計だ。長い資料を一度に読める文脈長は100万トークン(おおよそ日本語で数十万字ぶん)。SWE-Benchというのは、実際のGitHubの不具合をAIが自力でどれだけ直せるかを測る試験で、88.6%は『10件中およそ9件を直せた』という水準を意味する。さらに、高速応答の『Fast Mode』はOpus 4.7の頃より3倍安くなり、2.5倍速い版が100万トークンあたり10ドル/50ドルで使えるようになった。速さと賢さは本来トレードオフだが、その線を少し前へ動かした更新と言える。
| モデル | 料金 入/出(100万トークン) | 文脈長 | SWE-Bench |
|---|---|---|---|
| Claude Opus 4.8 | 5ドル / 25ドル | 100万 | 88.6% |
| GPT-5.5 | 非公表構成が中心 | 非公開幅 | 82.6% |
| Gemini 3.1 Pro | 2ドル / 12ドル | 200万 | 80.6% |
ベンチの数字が、隠していること
得点は便利だが、そのまま鵜呑みにはできない。第一に、公称の文脈長100万トークンと、精度を保って読める『実効文脈長』は別物で、長文を丸ごと入れると中盤を読み落とす癖はどのモデルにも残る。第二に、推論モデルは裏で大量に『考える』トークンを使うため、公称の単価が安く見えても1回あたりの実支払いは膨らむことがある。第三に、ベンチの数字は測定条件で揺れる。何回試した中の最良値か、テスト問題が学習データに混ざっていないか(コンタミネーション)まで確かめないと、同じ『88点』でも意味が変わる。数字に出にくい改善(指示への忠実さ、余計な前置きの減少、日本語の自然さ)こそ、現場では一番効くことも多い。
価格は、単価のままでは中小にはピンと来ない。入出力の単価に、1日の件数と1件あたりの分量をかけ、月額に直して初めて判断できる。同じ使い方なら、入出力が2ドル/12ドルのGemini 3.1 Proと、5ドル/25ドルのOpus 4.8では、毎月の固定費がおよそ2倍違う計算になり、件数が増えるほどこの差は開く。加えて推論モデルは裏で『考える』トークンを多く使うため、公称単価より実支払いが上振れしやすい点も見積もりに織り込みたい。逆に、日本語の自然さや指示への素直さといった数字に出ない使い勝手は、ベンチではなく自社の実データを1週間流して確かめるほかない。
中小の選び方は、頂点を追わないこと
では地方の10人規模の会社なら、どう選ぶか。まず仕事を1つに絞る。長い契約書や議事録をまとめて読ませたいなら、文脈長が広く単価も安いGemini 3.1 Proが向く。逆に、社内のちょっとしたコード修正や自動化を任せたいなら、コーディングに強いOpus 4.8が生きる。大事なのは、いま使っているChatGPTの有料版やCopilotで足りていないか、乗り換えの手間を回収できる差なのかを一度通すことだ。今日の一手は、新規の高額契約ではなく、無料枠や既存契約の範囲で、自社のよくある作業を10件試すこと。8件そのまま使える品質が出れば本採用を検討し、5件以下なら見送る。得点表の首位ではなく、その10件の結果が、あなたの会社の正解を教えてくれる。
出典 / SOURCES
- Claude Opus 4.8(Anthropic 公式)
- Claude Opus 4.8 vs GPT-5.5 vs Gemini 3.1 Pro: 8-Point Gap(tech-insider)
- Claude Opus 4.8 Pricing 2026(finout)
- Claude vs ChatGPT vs Gemini 2026: 88% SWE-Bench, $2 API(tech-insider)
※本記事は公開情報をもとに AI が自動で編集・要約し、出典を明記しています。正確性は各出典をご確認ください。