AI Model Intelligence & Economics
全球大模型智力 × 成本座標圖
把當今主流大模型放在同一張座標上:縱軸是「智力指數」,橫軸是「每一百萬 token 的混合成本」,
氣泡大小則代表「一美元能買到多少智力」。左上角的模型最聰明,右下角最貴,
愈靠左上方、氣泡愈大,就是愈划算的選擇。
資料日期 2026 / 09 / 15 ·
智力口徑 Artificial Analysis Intelligence Index v4.3 ·
成本口徑 混合價格(輸入:輸出 = 3:1) · 共 31 個模型
一、智力 × 成本座標圖
橫軸為對數刻度(每格差 10 倍),所以從 Qwen3.8-Flash-Next 的 $0.23 到 Claude Fable 5.1 的 $20,
約 89 倍的價差才能畫在同一張圖上。
實心圓=有第三方實測分數;空心圓=依公開基準推估,僅供相對參考。
綠色虛線是「效率前緣」——線上與線左上方的模型,沒有任何其他模型能在「更便宜」的同時「更聰明」。
陣營
分數
名稱
美國(OpenAI / Anthropic / Google / xAI / Meta)
中國(Moonshot / DeepSeek / Z.ai / MiniMax / 阿里 / 騰訊)
歐洲(Mistral / Meta)
推估值
二、一美元能買到多少智力?(每美元智力點數排行)
計算方式:智力指數 ÷ 混合價格。數值愈高,代表同一塊錢換到的能力愈多。
這是「算力投資報酬率」最直白的代理指標——各家都不公開 FLOPs,
所以業界標準是用「基準分數 ÷ 實際花費」來衡量。
三、一美元能買到多少 token?(純產出量排行)
上一段看的是「聰不聰明」,這一段看的是「量大不大」:
1 ÷ 混合價格,也就是一美元能買到多少個百萬 token。
適合評估高併發客服、批量摘要、大量標註這類「不求最強、只求夠用」的工作負載。
四、一人公司實戰:任務分級路由
前面三張圖是「全球視角」。但一人公司真正要回答的是:我手上這些工作,該派給哪個模型最划算?
答案不是挑一個最強的從頭用到尾,而是把工作分四級——八成的呼叫量走便宜模型,
只在真正卡關的地方動用頂級旗艦。下面這套分配可以直接照做。
TIER 0高頻瑣事
分類、打標籤、抓重點、格式整理、信件歸檔、逐字稿清稿、批次改寫
DeepSeek V4.1 Flash
智力 39.5 混合 $0.26 / 1M(離峰)
約占總呼叫量 60% · 替代:GLM-5.3-Flash(智力 42,$0.29)/Qwen3.8-Flash-Next(智力 39.9,$0.23)
TIER 1日常產出
社群貼文、LINE 話術、Email 草稿、銷售頁初稿、短影音口播稿
GLM-5.3
智力 44 混合 $2.15 / 1M
約占 25% · 替代:Muse Spark 1.3(智力 48,$2.00)/Kimi K2.6(智力 31.3,$1.71)
TIER 2硬任務
課程大綱、長文、市場研究、競品分析、整包講義/知識庫理解
騰訊 Hy4 Preview
智力 44 混合 $1.25 / 1M 1M 上下文
約占 12% · 替代:Gemini 3.8 Flash(智力 41,$1.50,推廣價)/Kimi K3(智力 44,$6.00)
TIER 3決策關卡
品牌定位、決策壓力測試、複雜多步 Agent、出錯代價高的對外產出
Claude Opus 5
智力 51 混合 $10.00 / 1M
約占 3% · 替代:GPT-6 Astra(智力 53,$20.00)/GPT-5.6 Sol(智力 47,$8.00)
同一份工作量,五種策略的月成本。
以每月 500 萬 token 混合用量計算——約等於每天 200 次來回、含 Agent 反覆讀取上下文的一人公司重度使用量:
- 八成的呼叫量,用不著前十名的模型。分類、抓重點、清稿這些事,39 分和 51 分的模型做出來的結果人眼看不出差別,但價格差約 38 倍。
- 把頂級模型留给「錯了會痛」的 3%。品牌定位、對外承諾、決策壓力測試——這些才值得 $10/百萬 token。分級路由下,你在最關鍵任務上用的仍然是全球最強的模型。
- 長上下文是隱藏成本殺手。整包講義、逐字稿、知識庫這類工作,先用 1M 上下文的 Hy4 或 Kimi K3 一次塞進去,比分塊切段再跑好幾輪便宜得多,也少掉一整套 RAG 工程。
如果你不是直接付 API,而是走積分制平台:這套邏輯一樣適用。
同樣的積分,全部拿去呼叫頂級模型,和分級路由相比,能撐過的工作量差好幾倍。
重點不是「哪個模型最強」,而是「這件工作值得花多少」——把預算當成分配問題,而不是選邊站。
五、完整數據表
點欄位標題可排序。混合價格 =(3 × 輸入價 + 1 × 輸出價)÷ 4。
| 模型 |
智力指數 |
ARC-AGI-3 |
輸入 $/1M |
輸出 $/1M |
混合 $/1M |
每美元智力 |
每美元 M tokens |
上下文 |
⚠ 讀這張圖之前,請先看完這六點
- 智力指數不是絕對智商。它是 Artificial Analysis 把 9 項評測(GDPval-AA v2、Terminal-Bench v2.1、SciCode、HLE、GPQA Diamond、CritPt 等)加權合成的 0–100 分,重點在代理與程式能力。不同評測機構(LM Arena、LiveBench、SWE-bench)排名會不一樣,差距可達 5 分以上。
- 空心圓是推估。騰訊混元 Hy3/Hy4、Gemini 3.6/Flash-Lite、GLM-5-Turbo 等仍無第三方分數,本圖依 v4.2 分數 ×0.75 換算定位,誤差可能達 ±4 分。特別注意:AA 指數已於 9/7 改版至 v4.3(Terminal-Bench 升 v4、新增 AutomationBench-AA、私測權重升至 45%),難度提高使全場分數普遍下滑約 20–25%,v4.2 與 v4.3 分數絕對不可直接相比。另:DeepSeek V4.1 Flash(9/10 發布)AA 已於近日收錄(39.5),並自 9/14 起接替退役的 V4 Pro 承接 deepseek-v4-pro 全部流量。
- 標價 ≠ 帳單。模型「話多」會讓同樣的任務變貴:Z.ai GLM-5.3 與 5.2 定價完全相同,但每完成一項任務的成本從約 $0.44 升到 $0.68(+55%),純粹因為輸出 token 變多。做 Agent 類應用一定要用「每任務成本」而非「每 token 價格」來比。
- 快取(Prompt Cache)會大幅改寫結論。DeepSeek 快取命中價是標準輸入價的 0.8%,Kimi K3 是 10%,Grok 4.6 是 25%。固定 system prompt 或重複餵同一份文件的場景,實際成本可以再降 50–90%,中國模型在這一項的折扣普遍較猛。
- 階梯計價要另外算。Grok 4.6 超過 200K token 後價格翻倍($2/$6 → $4/$12),Gemini 3.1 Pro 亦然;GPT-5.6 系列超過 272K 後跳高一級(Sol $8/$30、Terra $4/$18);DeepSeek 尖峰時段(北京時間 09–12、14–18)2 倍計價已於 8/16 生效,V4 Pro 尖峰輸入 $1.32/輸出 $3.96。長上下文或尖峰時段的工作量,成本要自己重算。
- 單項滿分 ≠ 綜合最強:「99 分」的陷阱。GPT-6 Astra 在 ARC-AGI-3(抽象推理單項)以官方 adapter 跑出 99.9%,但 ARC Prize 用中立標準組重跑只有 62.7%(花了 $26,098)。同項目 Opus 5 標準組 30.2%、GPT-5.6 Sol 7.8%,Astra 確實把標準組 SOTA 翻倍——但那不是「綜合智力 99 分」。綜合智力指數 v4.3 上 Astra 與 Fable 5.1 並列 53,且 Astra 每任務成本僅 $3.26(比 Fable 5.1 的 $7.63 便宜 57%)。看任何單項滿分先問:誰跑的、用哪套跑法。