2026年10月 AIコスパランキング:性能と価格で比べるLLM
Jonhisking · 2026年10月4日
いちばん高いAIモデルが、いちばん賢いのでしょうか。AIモデル23種の性能スコアとAPI料金を並べて確かめました。答えは「いいえ」です。1位のモデルは2位の半額で、1位の5%の料金のモデルが1位と13ポイントしか違いません。
性能スコアには Epoch Capabilities Index(ECI) を使いました。数学、コーディング、科学、推論など数十のベンチマークを1つの尺度にまとめたスコアです。料金は2026年10月4日時点のAPI定価です。
緑の点線上のモデルが コスパのライン です。「もっと安くてもっと賢いモデル」が存在しないモデルです。ラインより下のモデルは、同じかそれ以上のスコアを持つライン上のモデルより高くつきます。
ひと目でわかるまとめ
| 区分 | モデル | ECI | チャット1万回 |
|---|---|---|---|
| 最高性能 | Claude Opus 5.5 | 167.3 | $182 |
| コスパ | Claude Sonnet 5.5 | 165.2 | $91 |
| 安くて強い | Gemini 3.8 Flash | 156.9 | $25 |
| 最安 | DeepSeek V4 Flash | 154.5 | $9 |
チャット1回は英語で入力1,500トークン、出力400トークンとして計算しました。モデルごとのトークナイザーの差も反映しています。Claude は同じ文章で GPT より約30%多くトークンを使いますが、その差はすでに金額に含まれています。
1. 最高性能:Claude Opus 5.5
Claude Opus 5.5 が167.3で1位です。しかも料金は100万トークンあたり入力 $4、出力 $20 で、最も高いモデルではありません。2位の GPT-6 Astra は166.5と僅差ですが、料金は $10 / $50。チャット1万回で Astra は $350、Opus は $182 です。
2つの差は誤差の範囲内なので、使っていて品質の差を感じることはまずありません。請求額の差ははっきり感じます。
2. コスパ:Claude Sonnet 5.5
Claude Sonnet 5.5 は165.2。Opus より2.2ポイント低いだけで、料金は半分($2 / $10)です。この差も誤差の範囲内です。いまサービスに使うモデルを1つだけ選ぶなら、グラフが指すのはこのモデルです。
3. 安くて強いモデル:Gemini 3.8 Flash と DeepSeek V4 Flash
- Gemini 3.8 Flash(156.9):$0.75 / $3.75。チャット1万回で約 $25
- DeepSeek V4 Flash(154.5):$0.30 / $1.20。チャット1万回で約 $9、Opus の5%
どちらも1位より10〜13ポイント低い程度です。分類、情報抽出、要約、一般的なチャットボットなら十分なことが多く、費用は7〜20分の1になります。
4. 料金のわりに物足りないモデル
次のモデルは、同じかそれ以上のスコアを持つ別のモデルより高くつきます。
| モデル | ECI | チャット1万回 | もっと安くて同等以上 |
|---|---|---|---|
| Claude Fable 5.1 | 164.8 | $455 | Sonnet 5.5(165.2、$91) |
| GPT-6 Astra | 166.5 | $350 | Opus 5.5(167.3、$182) |
| GPT-5.5 | 159.2 | $195 | Sonnet 5.5(165.2、$91) |
| Gemini 3.1 Pro | 154.8 | $74 | Gemini 3.8 Flash(156.9、$25) |
悪いモデルという意味ではありません。特定の作業では総合スコア以上の力を出すこともあります。ただ、なんとなく使い続けているなら、まず安いモデルを自分のプロンプトで試してみてください。
5. GPT-6 Sol は?
実際にいちばん使われているのが GPT-6 Sol なので、グラフで最も目立つ空白です。Epoch AI はまだ Sol のスコアを出していませんが、別の尺度での独立した測定結果が1つ出ています。Artificial Analysis Intelligence Index(v4.3.2、最大推論、9月30日時点)で GPT-6.1 Sol は 51.8、GPT-6 Astra の 52.7 にほぼ並びました。
Astra に近い性能を5分の1の料金($2 / $10 対 $10 / $50)で出しているわけです。Epoch のスコアでも同様なら、Sol は定価が同じ Claude Sonnet 5.5 の隣、コスパのライン上に乗る可能性が高いでしょう。2つのスコアは尺度が違うため、上のグラフには載せていません。
6. まだスコアがないモデル
GPT-6 Sol、GPT-6 Luna、GPT-6.1 Sol、Gemini 4 Argon、Grok 4.7 は新しすぎて、まだ性能スコアがありません。Epoch AI がスコアを公開するとリアルタイムのランキングに自動で加わります。
使い方
- コスパのラインから始めましょう。品質重視なら Sonnet 5.5、量が多いなら Gemini 3.8 Flash か DeepSeek V4 Flash です。
- そのうち2〜3個を、自分のサービスの実際のプロンプト20個で試してください。総合スコアは一般的な性能で、あなたの作業での性能ではありません。
- 自分のプロンプトがモデルごとにいくらかかるかをトークンカウンターで確認しましょう。日本語は英語の約1.79倍のトークンを使うので、上の金額より高くなります。
グラフと表は料金とスコアが変わるたびに毎日更新されます。最新の順位はAIランキングのページでどうぞ。
性能スコア:Epoch AI の Epoch Capabilities Index(CC BY 4.0)を使用。料金:API定価、キャッシュ・バッチ割引なし、2026年10月4日時点。
関連記事
- Gemini 4 Argon の API 料金:GPT-6・Claude との費用比較
- 1トークンは何文字?日本語・英語など12言語で実測
- GPT・Claude・Gemini のトークンの数え方
- 日本語プロンプトは英語で送るとトークン44%節約:41言語で実測
- LLM API 料金比較:GPT-6・Claude・Gemini・DeepSeek など22モデル
自分のプロンプトを貼り付けて、Opus 5.5・Sonnet 5.5・Gemini 3.8 Flash・DeepSeek V4 Flash でいくらかかるか確かめましょう。
トークンカウンターを開く →