AI Model Intelligence & Economics

全球大模型智力 × 成本座標圖

把當今主流大模型放在同一張座標上:縱軸是「智力指數」,橫軸是「每一百萬 token 的混合成本」, 氣泡大小則代表「一美元能買到多少智力」。左上角的模型最聰明,右下角最貴, 愈靠左上方、氣泡愈大,就是愈划算的選擇

資料日期 2026 / 09 / 15 · 智力口徑 Artificial Analysis Intelligence Index v4.3 · 成本口徑 混合價格(輸入:輸出 = 3:1) · 共 31 個模型

最聰明
最貴
每美元智力冠軍
中美頂級價差

一、智力 × 成本座標圖

橫軸為對數刻度(每格差 10 倍),所以從 Qwen3.8-Flash-Next 的 $0.23 到 Claude Fable 5.1 的 $20, 約 89 倍的價差才能畫在同一張圖上。 實心圓=有第三方實測分數;空心圓=依公開基準推估,僅供相對參考。 綠色虛線是「效率前緣」——線上與線左上方的模型,沒有任何其他模型能在「更便宜」的同時「更聰明」。

陣營
分數
名稱
美國(OpenAI / Anthropic / Google / xAI / Meta) 中國(Moonshot / DeepSeek / Z.ai / MiniMax / 阿里 / 騰訊) 歐洲(Mistral / Meta) 推估值

二、一美元能買到多少智力?(每美元智力點數排行)

計算方式:智力指數 ÷ 混合價格。數值愈高,代表同一塊錢換到的能力愈多。 這是「算力投資報酬率」最直白的代理指標——各家都不公開 FLOPs, 所以業界標準是用「基準分數 ÷ 實際花費」來衡量。

三、一美元能買到多少 token?(純產出量排行)

上一段看的是「聰不聰明」,這一段看的是「量大不大」: 1 ÷ 混合價格,也就是一美元能買到多少個百萬 token。 適合評估高併發客服、批量摘要、大量標註這類「不求最強、只求夠用」的工作負載。

四、一人公司實戰:任務分級路由

前面三張圖是「全球視角」。但一人公司真正要回答的是:我手上這些工作,該派給哪個模型最划算? 答案不是挑一個最強的從頭用到尾,而是把工作分四級——八成的呼叫量走便宜模型, 只在真正卡關的地方動用頂級旗艦。下面這套分配可以直接照做。

TIER 0高頻瑣事
分類、打標籤、抓重點、格式整理、信件歸檔、逐字稿清稿、批次改寫
DeepSeek V4.1 Flash
智力 39.5 混合 $0.26 / 1M(離峰)
約占總呼叫量 60% · 替代:GLM-5.3-Flash(智力 42,$0.29)/Qwen3.8-Flash-Next(智力 39.9,$0.23)
TIER 1日常產出
社群貼文、LINE 話術、Email 草稿、銷售頁初稿、短影音口播稿
GLM-5.3
智力 44 混合 $2.15 / 1M
約占 25% · 替代:Muse Spark 1.3(智力 48,$2.00)/Kimi K2.6(智力 31.3,$1.71)
TIER 2硬任務
課程大綱、長文、市場研究、競品分析、整包講義/知識庫理解
騰訊 Hy4 Preview
智力 44 混合 $1.25 / 1M 1M 上下文
約占 12% · 替代:Gemini 3.8 Flash(智力 41,$1.50,推廣價)/Kimi K3(智力 44,$6.00)
TIER 3決策關卡
品牌定位、決策壓力測試、複雜多步 Agent、出錯代價高的對外產出
Claude Opus 5
智力 51 混合 $10.00 / 1M
約占 3% · 替代:GPT-6 Astra(智力 53,$20.00)/GPT-5.6 Sol(智力 47,$8.00)

同一份工作量,五種策略的月成本。 以每月 500 萬 token 混合用量計算——約等於每天 200 次來回、含 Agent 反覆讀取上下文的一人公司重度使用量:

如果你不是直接付 API,而是走積分制平台:這套邏輯一樣適用。 同樣的積分,全部拿去呼叫頂級模型,和分級路由相比,能撐過的工作量差好幾倍。 重點不是「哪個模型最強」,而是「這件工作值得花多少」——把預算當成分配問題,而不是選邊站。

五、完整數據表

點欄位標題可排序。混合價格 =(3 × 輸入價 + 1 × 輸出價)÷ 4。

模型 智力指數 ARC-AGI-3 輸入 $/1M 輸出 $/1M 混合 $/1M 每美元智力 每美元 M tokens 上下文

⚠ 讀這張圖之前,請先看完這六點