牛来?锐评GLM-5.3-Flash:学术原创性?1/40的Opus价格,打平Deepseek?

问AI · Flash工程组装如何达十分之一旗舰价?

AI 评测 · 刀哥锐评

锐评 GLM-5.3-Flash:
学术原创性如何?1/40 的 Claude 价格,打平 Deepseek?

上周 AI 圈最大的悬疑剧落幕了。「牛来」匿名屠榜,
智谱终认领,刀哥拆解五件事。

刀友们好,我是刀哥!

上周 AI 圈最大的悬疑剧落幕了。一个代号"牛来"(ox-alpha)的神秘模型,在 OpenCode 和 OpenRouter 上匿名开跑,上线首日直接登顶,还把 OpenRouter 平台单日 tokens 用量的历史纪录一口气抬高了 4 倍

社区猜疯了,有人说是 OpenAI 藏的新货,有人说是 Anthropic 的小号。结果 8 月 26 日晚上,智谱站出来认领:这是我们家的 GLM-5.3-Flash!

图片


刀哥把官方博客、技术文档和定价页翻了个底朝天,今天用大白话给家人们讲清楚五件事:它的开创性贡献是什么?为什么叫 Flash?跟 GLM-5.3 差异在哪?跟 DeepSeek-V4-Flash 差异在哪?跟 Kimi K3 比又是什么水平?

图片

⚡ 划重点 · 三个核心结论

第一,学术上,它没有任何从 0 到 1 的突破,全是成熟技术的组装。

第二,工程上,很强:综合智能超过上代旗舰 GLM-5.2,价格是自家旗舰 GLM-5.3 的十分之一,官方口径是 Claude Opus 4.8 的四十分之一

第三,它标志着国产大模型的主战场,正式从"谁更聪明"切换到"谁更便宜地聪明"

一、先泼冷水:学术上没突破

咱们先做一道拆解题。GLM-5.3-Flash 的技术卖点就四样,刀哥挨个说人话:

  • 线性注意力
    用递归状态记住局部上下文,省算力。这个思路 Mamba 时代就有了,Kimi 的 KDA 更是珠玉在前。
  • 稀疏注意力
    用一个轻量"索引器"只召回相关的全局上下文。DeepSeek 的 NSA、DSA 早就发过论文。
  • mHC(流形约束超连接),
    是在字节 Hyper-Connections 的基础上加了个流形约束,属于改进,不是首创。
  • IndexPool
    把索引器的 4 个缓存向量加权池化压成 1 个,这是个纯工程 trick,连"方法"都算不上。

看出来了吧?四项技术,没有一项是新发明的。智谱的真本事在于,工程上组合这些技术,低成本做出了前沿智能,而且在 100 万 token 的超长上下文下精度没崩。(基于公开信息,是否有未披露的不保证,你杠你就是对的)

智谱自己其实也很诚实:这次没发 arXiv 论文,发的是技术博客。再看它大哥 GLM-5.3,官方原话是 "Scaling post-training is all we did"——基座没换,全靠后训练堆环境、堆算力。


所以 GLM-5.3 和 Flash 兄弟俩,一个在堆量,一个在省钱,都是漂亮的工程学,但都不是新科学。这一点,刀哥觉得必须给家人们说清楚,别被"首个混合架构开源前沿模型"这种话术唬住,"首个组装"不等于"首次发明"。

二、工程上,确实有亮点

泼完冷水,该夸的必须夸。Flash 的工程含金量,刀哥给打高分。

  • 架构效率是真省。
    相比 GLM-5.3,注意力计算量降低 3.01 倍,KV 缓存降低 4.44 倍,注意力计算量是官方对标的几个模型里最低的。
  • 基座对比:18B 激活参数的 Flash 基座,多数 benchmark 追平了 40B 激活的 GLM-5-Base,LiveCodeBench-Base 甚至 37.6 比 34.4 反超。用不到一半的激活算力干同样的活,这就是架构红利。
  • GLM-5 系列第一次长出了眼睛。
    Flash 是全系首个原生多模态模型,主打"视觉编码":写完前端代码自己截图看一眼,发现按钮歪了自己改。编码从此不只是文字游戏,而是"看得见、能自检"的闭环。
  • 十万张国产芯片扛住了前沿模型。
    全部流量跑在国产 AI 芯片集群上,自研推理引擎加 EPD 分离式架构,端到端性能提升 3 倍,单 token 成本打平主流英伟达方案。

  • SemiAnalysis 的评价是"英伟达护城河再受考验"。最有意思的是个彩蛋:GLM-5.3 这个模型亲自参与了优化跑 Flash 的推理栈——AI 优化承载 AI 的系统,这个闭环成了。

三、为什么叫 Flash?它和 GLM-5.3 到底啥关系

Flash 是行业黑话,意思就是"又快又便宜的产品线",谷歌的 Gemini Flash、DeepSeek 的 Flash 都是一个意思。

但这里有个最大的误区必须澄清:Flash 不是 GLM-5.3 的缩水版、蒸馏版。GLM-5.3 用的是 GLM-5.2 的老基座,而 Flash 是从零预训练的一套全新架构——新混合注意力、45 层(比 GLM-4.5 的 92 层近乎腰斩)、30T token 的多模态语料。

它俩是两条产品线:GLM-5.3 负责冲智能上限,Flash 负责把智能卖成白菜价。官方还放话要把这套配方放大到更大的模型,所以 Flash 更像"下一代架构的先行低价版"

维度
GLM-5.3-Flash
GLM-5.3
总参 / 激活
320B / 18B,45 层
744B / 40B
架构
稀疏+线性混合注意力、mHC
GLM-5 架构 + IndexShare
模态
原生多模态(图/视频/文件)
纯文本
国内 API(每百万 token)
输入 0.8 元 / 输出 2.8 元
输入 8 元 / 输出 28 元
Coding Plan 配额
3 倍
基准

四、能力对比 GLM-5.3:九成功力,另有绝活儿

两家官方评测口径基本一致,直接上数据:

基准
Flash
GLM-5.3
解读
Terminal Bench 2.1
84.3
88.2
旗舰明显更强
DeepSWE v1.1
63.4
66.9
旗舰更强
HLE 带工具
55.3
62.5
深度推理差距最大
Toolathlon
78.4
73.0
Flash 反超 5.4 分
GDPval-AA v2
1773
1769
知识工作打平

规律很清楚:硬核长程编码和深度推理,GLM-5.3 强出一截;工具调用、自动化办公这类"干活"场景,Flash 打平甚至反超。

而且两家各有独占技能:GLM-5.3 有涌现的网络安全能力(CyberGym 84.5 全球最佳,在 269 个真实项目里挖出 2436 个漏洞);Flash 独占视觉能力(OfficeQA Pro 62.4,把 Claude Opus 4.8 的 48.9 按在地上摩擦)。

GLM-5.3 是天花板,Flash 是"天花板九成功力 + 独有视觉 + 十分之一价格"

五、对比 DeepSeek-V4-Flash

这是 Flash 的直接对标选手。官方对标 DeepSeek-V4-Vision-Exp 的结果是:

编码四项赢三项(DeepSWE 63.4 对 59.3 优势明显,NL2Repo 小输);Agent 类互有胜负,但 AutomationBench 48.8 对 38.8 是碾压;

视觉六项全胜,最夸张的 BabyVision 是 53.4 对 35.1

基座层面,DeepSeek-V4-Flash-Base 激活参数更小(13B),MMLU 略高,但 LiveCodeBench-Base 被 37.6 对 29.9 拉开了身位。

价格上,GLM-5.3-Flash 前两周半价期 0.8 元/1.5 元,不打折的话输入打平

图片


当然短板也要说:Flash 的 KV 缓存仍略大于 DeepSeek 和 Kimi,这是官方自己承认的"后续优化方向"。所以准确的说法是:能力多数维度压着打,效率细节上和 DeepSeek 互有胜负,价格折扣期完胜。

六、对比 Kimi K3:同档智能,一半机身,三十倍价差

K3 是另一种打法:2.8 万亿参数的暴力美学,激活参数 104B 是 Flash 的近 6 倍,全球首个 3T 级开源模型,WebDev Arena 以 1679 Elo 登顶。

能力怎么比?划重点:综合智能指数基本打平(57 对 57.1);长程编码和深度推理,K3 明显更强(Terminal Bench 88.3 对 84.3,DeepSWE 67.5 对 63.4,HLE 59.8 对 55.3);

工具调用和自动化办公,Flash 小胜(Toolathlon 78.4 对 76.5,AutomationBench 48.8 对 46.7,GDPval 1773 对 1682)。

但价格差异实在太悬殊!输出价格每百万 token,Flash 是 0.50 美元,K3 是 15 美元30 倍。部署门槛,Flash 的 FP8 权重 8 卡节点能跑,K3 官方建议 64 卡起步。

所以可以定性说:Flash 处于准旗舰水平。K3 是冲刺智能上限的旗舰,Flash 是把旗舰90%的能力,白菜价卖的杀手。如果追求能力极限,选 K3;如果追求性价比想省钱,选 Flash。

七、GLM-5.3-Flash使用场景

适合的场景

  • 高频 Agent 工具调用和自动化办公(便宜量大)
  • 视觉类活儿——前端还原、截图排错、扫描件财报理解、视频理解(这是它的独占区)
  • 预算敏感的创业团队和个人开发者
  • Coding Plan 重度用户(同档位 3 倍配额)
  • 想自托管的中型团队(8 卡就能跑)

不适合的场景

  • 极限长程编码攻关和深度推理(加钱上 GLM-5.3 或 K3)
  • 网络安全研究(GLM-5.3 独占)
  • “我要最好的”的场景(那还是 Claude Fable 5 和 GPT-5.6 Sol 的区间)

📌 结语

最后说句锐评。GLM-5.3-Flash 学术上确实没有原创突破,这是真的, 所以算不上大牛;但 2026 年的大模型战场,论文已经不再是最硬的通货,账单才是


大部分日常任务真的需要那么高的智能水平吗?当 57 分的智能只卖 0.045 美元一个任务,所有卖贵的模型都被迫回答一个问题:你贵得有什么道理?

GLM系列的价格相对比较贵,这次把智能从奢侈品变成水电煤,这才是 Flash 最大的贡献,也是智谱这步棋的战略目标。

💬 问一嘴

你会在哪些场景用GLM-5.3-Flash?
风里雨里,评论等你。