大模型性价比排行榜
智能、成本、耗时三维独立实测,权重由你定
性价比榜单
| # | 模型 | 智能指数 | 速度 tok/s | 耗时/任务(分) | Token/任务 | 成本/任务 | 综合分 |
|---|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash(空闲) | 44.97 | 209.4 | 7.8 | 136k | ¥1.65 / $0.229 | 67.4 | |
| GPT-6.1 Sol | 57.95 | 64.2 | 11.2 | 43k | ¥5.27 / $0.732 | 67.0 | |
| DeepSeek V4.1 Flash(高峰) | 44.97 | 209.4 | 7.8 | 136k | ¥3.29 / $0.457 | 63.0 | |
| GPT-6 Sol | 51.16 | 87.1 | 7.9 | 41k | ¥10.75 / $1.494 | 59.5 | |
| GPT-6 Astra | 60.75 | 51.6 | 10.2 | 32k | ¥25.13 / $3.491 | 52.0 | |
| GPT-6 Luna | 34.77 | 128.3 | 8.5 | 66k | ¥0.68 / $0.095 | 50.7 | |
| Gemini 3.8 Flash | 42.48 | 248.6 | 5.4 | 85k | ¥15.26 / $2.119 | 50.3 | |
| GPT-5.6 Sol | 49.82 | 79.6 | 7.3 | 36k | ¥22.4 / $3.111 | 50.2 | |
| GLM-5.3-Flash | 44.35 | 48.9 | 20.0 | 81k | ¥2.02 / $0.281 | 50.2 | |
| Mimo-V2.6 Pro | 47.61 | 43.7 | 27.4 | 76k | ¥1.2 / $0.167 | 47.1 | |
| GPT-5.6 Terra | 45.97 | 95.3 | 9.9 | 57k | ¥17.63 / $2.448 | 47.0 | |
| DeepSeek V4 Pro(空闲) | 37.29 | 100.5 | 11.2 | 81k | ¥5.08 / $0.705 | 44.5 | |
| Grok 4.6 | 43.60 | 77.2 | 9.3 | 42k | ¥20.12 / $2.794 | 43.8 | |
| Claude Opus 5.5 | 63.50 | 92.4 | 12.7 | 110k | ¥36.62 / $5.085 | 43.7 | |
| GPT-5.6 Luna | 33.77 | 124 | 8.1 | 60k | ¥2.33 / $0.323 | 43.5 | |
| DeepSeek V4 Pro(高峰) | 37.29 | 100.5 | 11.2 | 81k | ¥10.16 / $1.411 | 40.2 | |
| GLM-5.3 | 48.79 | 65.9 | 17.7 | 92k | ¥21.02 / $2.919 | 40.1 | |
| Mimo-V2.6 Flash | 40.62 | 51.2 | 30.7 | 101k | ¥0.62 / $0.086 | 38.7 | |
| Claude Sonnet 5.5 | 63.46 | 139.1 | 12.4 | 166k | ¥48.95 / $6.799 | 36.3 | |
| Kimi K3 | 39.27 | 33.9 | 24.7 | 56k | ¥14.68 / $2.038 | 30.2 | |
| Grok 4.7 | 44.82 | 79 | 17.6 | 80k | ¥38.38 / $5.33 | 29.7 | |
| Claude Opus 5 | 53.48 | 54.6 | 15.8 | 85k | ¥51.07 / $7.093 | 29.0 | |
| Claude Fable 5.1 | 56.84 | 68.2 | 13.0 | 85k | ¥56.2 / $7.805 | 28.6 | |
| Qwen3.8 Max | 46.06 | 39 | 39.5 | 117k | ¥46.31 / $6.433 | 13.1 | |
| Claude Sonnet 5 | 30.65 | 83.8 | 19.1 | 163k | ¥52.12 / $7.239 | 10.9 |
数据更新于 2026-10-02:智能、成本、耗时均来自 Artificial Analysis 独立实测;价格为各厂商官方 API 定价。
DeepSeek 高峰/空闲为同一模型:能力与耗时相同,仅成本差一倍,空闲版综合分更高。
价格与成本仅供参考,请以官方最新定价为准。
方法论
- 智能指数 I:Terminal-Bench 4.0(终端代理编程)、Humanity's Last Exam(综合推理)与 AutomationBench(SaaS 工作流自动化)三项得分的算术平均,全部由 Artificial Analysis 统一口径独立实测,非厂商自报。
- 成本 C 与耗时 T:均为 AA 实测:C 是三项基准每任务的全成本(含输入、缓存写入、推理与输出全部 Token,美元计价);T 是每任务实际耗时(秒)。话痨模型的 Token 开销被如实计入。
- 综合分公式:综合分 = 智能归一^a × 成本归一^b × 耗时归一^c(a+b+c=1)。三维各自在本榜单 25 款模型内最小-最大归一化到 0.05–1:智能为线性映射,成本与耗时因跨数量级采用对数映射(下限 0.05 防归零)。几何加权意味着任何一轴过弱都会显著拖累总分——单项偏科无法靠另一项极端优势翻盘。
- 预设侧重:均衡=⅓/⅓/⅓;性能=75/12.5/12.5;成本=20/60/20;速度=20/20/60;自定义可用滑杆任意组合(自动归一化为 100%)。
- 币种无关:综合分由比值计算,与币种无关。成本列美元为实测口径,人民币按 1 USD = 7.2 CNY 换算仅供参照。
- 收录口径:仅收录有独立实测数据的模型,能力、速度与成本均为实测值;DeepSeek 空闲版与高峰版同能力同时长,成本按官方半价。
常见问题
- 综合分是怎么计算的?
- 综合分 = 智能归一^性能权重 × 成本归一^成本权重 × 耗时归一^耗时权重(权重和=1)。三维先在本榜单 25 款模型内各自最小-最大归一化到 0.05–1:智能线性映射,成本与耗时因跨数量级采用对数映射。再做几何加权:任何一轴过弱都会拖累总分。三维均为 Artificial Analysis 独立实测。
- 为什么切换侧重后排名完全变了?
- 因为不同任务的最佳模型不同:单步便宜任务适合便宜模型,多步关键工作流适合强模型,实时场景适合快模型。这正是本工具的价值——用权重天平找到你的场景最优解,而不是给一个唯一答案。
- 数据来源是什么,可靠吗?
- 智能指数、每任务成本(含输入、缓存、推理、输出全部 Token)与耗时均来自 Artificial Analysis 的统一实测;成本以美元计价,人民币按 7.2 换算仅供参照。