大模型性价比排行榜

智能、成本、耗时三维独立实测,权重由你定

性价比榜单

点击表头排序
# 模型 智能指数 速度 tok/s 耗时/任务(分) Token/任务 成本/任务 综合分
DeepSeek V4.1 Flash(空闲)44.97209.47.8136k¥1.65 / $0.22967.4
GPT-6.1 Sol57.9564.211.243k¥5.27 / $0.73267.0
DeepSeek V4.1 Flash(高峰)44.97209.47.8136k¥3.29 / $0.45763.0
GPT-6 Sol51.1687.17.941k¥10.75 / $1.49459.5
GPT-6 Astra60.7551.610.232k¥25.13 / $3.49152.0
GPT-6 Luna34.77128.38.566k¥0.68 / $0.09550.7
Gemini 3.8 Flash42.48248.65.485k¥15.26 / $2.11950.3
GPT-5.6 Sol49.8279.67.336k¥22.4 / $3.11150.2
GLM-5.3-Flash44.3548.920.081k¥2.02 / $0.28150.2
Mimo-V2.6 Pro47.6143.727.476k¥1.2 / $0.16747.1
GPT-5.6 Terra45.9795.39.957k¥17.63 / $2.44847.0
DeepSeek V4 Pro(空闲)37.29100.511.281k¥5.08 / $0.70544.5
Grok 4.643.6077.29.342k¥20.12 / $2.79443.8
Claude Opus 5.563.5092.412.7110k¥36.62 / $5.08543.7
GPT-5.6 Luna33.771248.160k¥2.33 / $0.32343.5
DeepSeek V4 Pro(高峰)37.29100.511.281k¥10.16 / $1.41140.2
GLM-5.348.7965.917.792k¥21.02 / $2.91940.1
Mimo-V2.6 Flash40.6251.230.7101k¥0.62 / $0.08638.7
Claude Sonnet 5.563.46139.112.4166k¥48.95 / $6.79936.3
Kimi K339.2733.924.756k¥14.68 / $2.03830.2
Grok 4.744.827917.680k¥38.38 / $5.3329.7
Claude Opus 553.4854.615.885k¥51.07 / $7.09329.0
Claude Fable 5.156.8468.213.085k¥56.2 / $7.80528.6
Qwen3.8 Max46.063939.5117k¥46.31 / $6.43313.1
Claude Sonnet 530.6583.819.1163k¥52.12 / $7.23910.9

数据更新于 2026-10-02:智能、成本、耗时均来自 Artificial Analysis 独立实测;价格为各厂商官方 API 定价。

DeepSeek 高峰/空闲为同一模型:能力与耗时相同,仅成本差一倍,空闲版综合分更高。

价格与成本仅供参考,请以官方最新定价为准。

方法论

  1. 智能指数 I:Terminal-Bench 4.0(终端代理编程)、Humanity's Last Exam(综合推理)与 AutomationBench(SaaS 工作流自动化)三项得分的算术平均,全部由 Artificial Analysis 统一口径独立实测,非厂商自报。
  2. 成本 C 与耗时 T:均为 AA 实测:C 是三项基准每任务的全成本(含输入、缓存写入、推理与输出全部 Token,美元计价);T 是每任务实际耗时(秒)。话痨模型的 Token 开销被如实计入。
  3. 综合分公式:综合分 = 智能归一^a × 成本归一^b × 耗时归一^c(a+b+c=1)。三维各自在本榜单 25 款模型内最小-最大归一化到 0.05–1:智能为线性映射,成本与耗时因跨数量级采用对数映射(下限 0.05 防归零)。几何加权意味着任何一轴过弱都会显著拖累总分——单项偏科无法靠另一项极端优势翻盘。
  4. 预设侧重:均衡=⅓/⅓/⅓;性能=75/12.5/12.5;成本=20/60/20;速度=20/20/60;自定义可用滑杆任意组合(自动归一化为 100%)。
  5. 币种无关:综合分由比值计算,与币种无关。成本列美元为实测口径,人民币按 1 USD = 7.2 CNY 换算仅供参照。
  6. 收录口径:仅收录有独立实测数据的模型,能力、速度与成本均为实测值;DeepSeek 空闲版与高峰版同能力同时长,成本按官方半价。

常见问题

综合分是怎么计算的?
综合分 = 智能归一^性能权重 × 成本归一^成本权重 × 耗时归一^耗时权重(权重和=1)。三维先在本榜单 25 款模型内各自最小-最大归一化到 0.05–1:智能线性映射,成本与耗时因跨数量级采用对数映射。再做几何加权:任何一轴过弱都会拖累总分。三维均为 Artificial Analysis 独立实测。
为什么切换侧重后排名完全变了?
因为不同任务的最佳模型不同:单步便宜任务适合便宜模型,多步关键工作流适合强模型,实时场景适合快模型。这正是本工具的价值——用权重天平找到你的场景最优解,而不是给一个唯一答案。
数据来源是什么,可靠吗?
智能指数、每任务成本(含输入、缓存、推理、输出全部 Token)与耗时均来自 Artificial Analysis 的统一实测;成本以美元计价,人民币按 7.2 换算仅供参照。