我从 Artificial Intelligence 把截至 8 月 3 日的数据下载了下来,它上面一共有 592 个模型。
价格便宜的模型使用起来不一定便宜
其中有 130 条数据同时具备正的 cost per task 和 intelligence index,能够放进对数坐标系中。为什么用这两个指标?其实很简单:
1. Intelligence Index(智力指数):
指的是模型的“智商”,也就是它是否能够完成像高考数学题、写代码以及各种智力测试。
2. Cost per Task(单次任务成本):
我觉得这是一个很妙的指标。它不是指单纯的 API 价格指标。如果只看 API 价格,有些模型因为本身很小,可能只要几 B、几十 B(参数),显得非常便宜;相比之下,几百 B 的大模型在这个指标上就会很吃亏。
但这个指标衡量的是完成一个任务所需要的 Token 量,这就尽可能避免了小模型因为参数量小而占便宜的优势。即使是参数量大的模型,如果你足够厉害,一步就能完成任务,那么你的 Cost per Task 就会非常低。
你看,这是它默认的 27 个模型,从最便宜到最贵。完成一个任务,像 DeepSeek-V4-Pro 是最便宜的,只要 0.05 刀;而对于 Claude Fable 5(也就是目前最贵的模型),它需要 3.15 刀。这里面差的可是六七十倍的差价。
但你如果真的要单纯比较这个 API 的价格,那比它便宜的还真有的是,比如最近疯狂降价、大出名的 GPT 5.6 Luna,它的 API 价格甚至低于 0.01 刀。像那个小米的 MiMo-V2.5,也非常非常便宜。
下面这个图就说明了API 单价便宜,并不等于实际使用成本低。横轴是每百万 token 的 API 标价,纵轴是完成一项实际评测任务的平均成本。像 Ministral 3 这样的模型,单价看起来很低,但由于完成任务时消耗的输入、输出或推理 token 较多,最终成本反而明显高于整体趋势。相比之下,DeepSeek V4 Flash 不仅标价低,Cost per Task 也很低,说明它的优势不只是“卖得便宜”,而是完成任务本身也更省钱。
DeepSeek的斩杀线到底杀掉了谁
按照成本越低越好、分数越高越好的规则计算,这 130 个模型形成了 16 个帕累托最优点。DeepSeek V4 Flash 0731 的 Intelligence Index 是 49.9277,Cost per Task 是 0.0271308 美元,它正好站在前沿上。
GPT-5.6 Luna xhigh 的 Index 是 49.0677,Cost per Task 是 0.0316694 美元。换成 DeepSeek 以后,分数提高了约 0.86,成本还下降了约 14.3%,这就是一次标准的帕累托改善,Luna xhigh 也因此被 DeepSeek 严格支配。
但 GPT-5.6 Luna high 的情况不一样,它的 Index 是 46.0590,Cost per Task 只有 0.0215565 美元,比 DeepSeek 更便宜,只是分数低约 3.87。Luna max 的 Index 达到 51.2359,分数比 DeepSeek 高约 1.31,但任务成本也增加到 0.0473489 美元,约为 DeepSeek 的 1.75 倍,这两个模型都和 DeepSeek 各自保留了一项优势,不能互相支配,所以也都能留在前沿上。
DeepSeek 右下方那片区域,就是网上所说的斩杀区。凡是落进这个区域的模型,成本不低于 DeepSeek,Index 又不高于 DeepSeek,在当前两个指标下都可以被替换。
130 个可绘制点中,除去 DeepSeek 自己,有 91 个点被它支配。不过这里不能写成 91 个现役模型都被淘汰,因为 130 个点里只有 96 个没有被标记为 deprecated,清理掉旧模型和弃用档位以后,DeepSeek 实际支配的现役模型是 64 个。
红色的那部分区域,都是被斩杀的模型。因为你会发现,在帕累托最优点的所属公司寥寥无几,暂时看起来就只有四家:OpenAI、DeepSeek、Groq 以及 Anthropic。
这是很惨的一种现象。
这就跟我们经常看的玄幻小说里面一样:你在地界疯狂修炼,有朝一日终于成为了宗门里面的天才,再加上勤学苦练,终于习得了一身武功。结果准备飞升天界,飞上天之后,发现上面还有一群怪物在等着你。
这些红色点真不是什么默默无名的模型,其实都是有头有脸的公司做出来的,并且消耗了大量的财富才造出来。但就非常的无奈,它正好处在了这个尴尬的区域里面。
这张图里,横轴越往左越便宜,纵轴越往上能力越强,最理想的位置当然是左上角。可现实中的模型不会都挤在那里,能力提高往往需要更多推理和更高成本,于是图上形成了一条从左下向右上的边界,这就是帕累托前沿。
帕累托支配的判断并不复杂。假设模型 A 的成本不高于模型 B,Intelligence Index 又不低于 B,并且至少有一项严格更好,那么 A 就支配 B。既然换成 A 以后能力不会下降,成本也不会增加,B 在这两个指标下就没有继续保留的必要。
从 B 换到 A 的过程叫帕累托改善,也就是至少有一项变好,同时其他项目没有变差。如果一个模型找不到任何这样的替代者,它就是帕累托最优。寻找全部非支配方案和整条边界的过程,通常叫帕累托优化。
帕累托最优并不是综合冠军。前沿上有些模型非常便宜,但分数低一点,有些模型分数更高,同时也要多花很多钱。它们留在前沿上,是因为没有另一个模型能够不付出任何代价,把它们全面替换掉。
但我觉得现在的问题是,看起来 DeepSeek V4 的方案是处于这个 Pareto 最优,但实际上它是在我们目前的 benchmark 上面拿到了 100% 的分数。
我并不觉得现在的 100% 能够真正反映出跟人类齐平的智能,它更多的是一个还是挺主观的判别标准。如果以后到了 200 分是满分的情况下,那么这个 Pareto 最优就会有所改变。
当然,DeepSeek 肯定是非常牛逼的一个存在,但我们还是需要继续努力,去追求更高级、最高的智能,因为智能是没有上限的。同时,我觉得 DeepSeek 的策略目前看起来确实是最优的,那就是用尽可能少的 token,去达到尽可能高质量的智能。