AI 模型怎麼選?排行榜與牌價之外,先量每件任務的成本

AI 模型怎麼選?排行榜與牌價之外,先量每件任務的成本

AI 模型選型時,多數企業先看排行榜、再看牌價。以 2026 年 6 月題目進行的第三方評測顯示,兩款牌價相同、推理強度都設最高檔的旗艦模型,正確率分不出高下,每題成本卻相差 8.7 倍。

30 秒看結論

  • 牌價一樣、能力相當,成本仍可能差很多,GPT-6 Astra 與 Claude Fable 5.1 每題費用差 8.7 倍。
  • 牌價便宜不等於省,牌價便宜一半的模型,每題成本可能高出 5.5 倍。
  • 要知道自己的成本,得用自己的工作實測,比較多家模型,需要逐家串接。
  • 勤英科技的 MixRoute:一組 API key 串接多家模型,在同一個後台查看各家費用,輕鬆比較成本。

牌價一樣、能力相當,每件任務的成本會一樣嗎?

不一定。牌價只是每單位 token 的價格,實際費用還要看模型完成工作時消耗多少 token。

數學評測平台 MathArena 每個月以新公布的題目出一批考題讓多款模型作答,每題執行 4 次,記錄正確率與作答一題平均的實際 API 費用。

在 2026 年 6 月那批題目上,GPT-6 Astra 與 Claude Fable 5.1 的牌價相同。兩款模型的正確率分別為 94.4% 與 91.0%。

兩款每題平均 API 費用分別為 $0.67 與 $5.86,相差 8.7 倍。

牌價相同的兩款模型,帳單卻相差近九倍

同一組模型,4 到 6 月三批題目都差 8.7 到 11.6 倍

這個差距不是單一場的結果。兩款模型維持相同設定,作答 4 到 6 月三批題目的表現如下:

題目月份 Astra 正確率 Astra 每題成本 Fable 5.1 正確率 Fable 5.1 每題成本 成本相差
2026 年 4 月 90.8% $0.59 77.5% $6.87 11.6 倍
2026 年 5 月 95.0% $0.57 87.5% $5.38 9.4 倍
2026 年 6 月 94.4% $0.67 91.0% $5.86 8.7 倍

正確率相近的模型,每題成本可以差多少?

正確率相近的模型,每題成本可以相差數十倍。

下表從 6 月場的 25 款模型中,挑出官方定價頁查得到標準牌價的主力模型,以及本文拿來對照的設定;25 款的完整名次見表後的原始截圖。

表中的費用是這批數學題目的實測結果,可用來觀察成本差距;企業選型仍須以自己的工作案例另測。

名次 模型(推理強度) 正確率(信賴區間) 每題成本 平均輸出 token 牌價(每百萬 token,輸入/輸出)
1 GPT-6 Astra(max) 94.4%(±3.7) $0.67 12,636 $10/$50
2 Claude Fable 5.1(max) 91.0%(±4.7) $5.86 117,076 $10/$50
4 Claude Fable 5(max) 85.4%(±5.8) $3.79 75,675 $10/$50
5 GPT-6 Astra(low) 84.4%(±7.3) $0.088 1,711 $10/$50
7 Claude Opus 5(max) 82.6%(±6.2) $3.66 146,509 $5/$25
9 Qwen3.8-Max 75.7%(±7.0) $0.39 64,770 $2/$6
12 Gemini 3.8 Flash 67.4%(±7.7) $0.15 40,222 $0.75/$3.75
15 Gemini 3.7 Flash 62.5%(±7.9) $0.084 22,313 $0.75/$3.75
22 Claude Fable 5.1(low) 38.5%(±9.7) $0.11 2,140 $10/$50

牌價為各家定價頁的標準價(2026 年 9 月 23 日查閱),Qwen3.8-Max 為阿里雲國際部署的價格。原始排名圖中的 ⚠️ 標記,見下方說明。

若把正確率與每題平均費用一起看,GPT-6 Astra(low)與 Claude Opus 5(max)這組尤其明顯:在這批題目上,兩款的正確率信賴區間重疊,但每題平均費用相差 42 倍。

MathArena ArXivMath 2026 年 6 月場 25 款模型的完整排名
圖片來源:MathArena,ArXivMath 2026 年 6 月場排名(2026 年 9 月 23 日查閱、數字已逐項核對)

原始排名圖中三種標記的意思:

  • ±:95% 信賴區間。本文將區間重疊的模型視為正確率相近。
  • ⚠️:模型在這批題目公布後才發表,訓練時可能已接觸過這批題目,正確率宜保守解讀;每題成本與 token 用量仍是實際測得的數字。
  • Invalid:GPT-5.6-Sol 的成本欄。OpenAI 回報的單次用量異常,MathArena 判定相關成本無效。

成本差在哪?牌價之外,還要看用量

完成一題消耗多少 token,決定帳單

牌價相同時,每題成本的差距全部來自用量。前表牌價同為 $10/$50 的幾個設定,平均輸出 token 的差距,幾乎就是每題成本的差距。

定價頁只列出每百萬 token 的單價,不會告訴你模型完成一件工作需要多少 token。

牌價怎麼讀、輸入與輸出怎麼分開計算,見〈OpenAI API 費用怎麼算?2026 計費與成本一次看〉。

牌價便宜一半,每題成本反而高 5.5 倍

牌價排不出每題成本的高低。Claude Opus 5 的牌價是 GPT-6 Astra 的一半,6 月場的每題成本卻是 Astra 的 5.5 倍,正確率也較低。

選定模型之後,如何分層使用與控制成本,見〈AI API 成本怎麼省?LLM API 成本優化的 4 層策略〉。

MathArena 的每題費用不能直接當作企業工作的預算。要知道自己的成本,得讓候選模型處理同一批實際案例,再把費用與驗收結果放在一起看。

比較多家模型的實際費用,一定要逐家串接嗎?

不必逐家串接,可以透過 AI Gateway 從同一個入口使用多家模型。

若直接使用各家的 API,每多一家供應商,就要多申請一組金鑰、多完成一次串接、多處理一份付款與帳單;比較費用時,還得自行彙整各家的用量。

勤英科技自行開發的 MixRoute 是一套 AI Gateway,提供以下功能:

  • 一組 API key 串接多家模型:使用 MixRoute 支援的模型時,不必逐家申請金鑰與完成串接。請求格式相容 OpenAI API,方便在同一套測試流程中切換候選模型。
  • 新模型通常在 24 小時內接入:平台接入後,即可沿用既有串接,以同一批工作測試新模型,減少重新準備的時間。
  • 在同一個後台查看用量與費用:各款模型消耗多少 token、花了多少錢,可以集中查閱,不必再逐家核對帳單。將測試費用與驗收結果彙整後,就能比較每件合格成果的 API 成本。

如果還不確定哪些工作適合測試、該比較哪幾款模型,勤英科技的企業 AI 導入評估可以協助從現有流程挑選測試案例、訂定驗收標準,並規劃候選名單。

結論:用每件合格成果的成本選模型

牌價一樣、能力相當的模型,完成同一件工作的成本仍可能差好幾倍。

選模型前,先拿一批實際工作讓候選模型各做一遍,再比較合格成果的費用;從挑選工作到多家模型的串接,勤英科技都可以協助。

資料來源

AI 模型 API 成本 API 選型