AI 评测 · 刀哥锐评
锐评 GLM-5.3-Flash:
学术原创性如何?1/40 的 Claude 价格,打平 Deepseek?
上周 AI 圈最大的悬疑剧落幕了。「牛来」匿名屠榜,
智谱终认领,刀哥拆解五件事。
刀友们好,我是刀哥!
上周 AI 圈最大的悬疑剧落幕了。一个代号"牛来"(ox-alpha)的神秘模型,在 OpenCode 和 OpenRouter 上匿名开跑,上线首日直接登顶,还把 OpenRouter 平台单日 tokens 用量的历史纪录一口气抬高了 4 倍。
社区猜疯了,有人说是 OpenAI 藏的新货,有人说是 Anthropic 的小号。结果 8 月 26 日晚上,智谱站出来认领:这是我们家的 GLM-5.3-Flash!
刀哥把官方博客、技术文档和定价页翻了个底朝天,今天用大白话给家人们讲清楚五件事:它的开创性贡献是什么?为什么叫 Flash?跟 GLM-5.3 差异在哪?跟 DeepSeek-V4-Flash 差异在哪?跟 Kimi K3 比又是什么水平?
⚡ 划重点 · 三个核心结论
第一,学术上,它没有任何从 0 到 1 的突破,全是成熟技术的组装。
第二,工程上,很强:综合智能超过上代旗舰 GLM-5.2,价格是自家旗舰 GLM-5.3 的十分之一,官方口径是 Claude Opus 4.8 的四十分之一。
第三,它标志着国产大模型的主战场,正式从"谁更聪明"切换到"谁更便宜地聪明"。
一、先泼冷水:学术上没突破
咱们先做一道拆解题。GLM-5.3-Flash 的技术卖点就四样,刀哥挨个说人话:
- ✦线性注意力,
用递归状态记住局部上下文,省算力。这个思路 Mamba 时代就有了,Kimi 的 KDA 更是珠玉在前。 - ✦稀疏注意力,
用一个轻量"索引器"只召回相关的全局上下文。DeepSeek 的 NSA、DSA 早就发过论文。 - ✦mHC(流形约束超连接),
是在字节 Hyper-Connections 的基础上加了个流形约束,属于改进,不是首创。 - ✦IndexPool
把索引器的 4 个缓存向量加权池化压成 1 个,这是个纯工程 trick,连"方法"都算不上。
看出来了吧?四项技术,没有一项是新发明的。智谱的真本事在于,工程上组合这些技术,低成本做出了前沿智能,而且在 100 万 token 的超长上下文下精度没崩。(基于公开信息,是否有未披露的不保证,你杠你就是对的)
智谱自己其实也很诚实:这次没发 arXiv 论文,发的是技术博客。再看它大哥 GLM-5.3,官方原话是 "Scaling post-training is all we did"——基座没换,全靠后训练堆环境、堆算力。
所以 GLM-5.3 和 Flash 兄弟俩,一个在堆量,一个在省钱,都是漂亮的工程学,但都不是新科学。这一点,刀哥觉得必须给家人们说清楚,别被"首个混合架构开源前沿模型"这种话术唬住,"首个组装"不等于"首次发明"。
二、工程上,确实有亮点
泼完冷水,该夸的必须夸。Flash 的工程含金量,刀哥给打高分。
- ◆架构效率是真省。
相比 GLM-5.3,注意力计算量降低 3.01 倍,KV 缓存降低 4.44 倍,注意力计算量是官方对标的几个模型里最低的。 基座对比:18B 激活参数的 Flash 基座,多数 benchmark 追平了 40B 激活的 GLM-5-Base,LiveCodeBench-Base 甚至 37.6 比 34.4 反超。用不到一半的激活算力干同样的活,这就是架构红利。 - ◆GLM-5 系列第一次长出了眼睛。
Flash 是全系首个原生多模态模型,主打"视觉编码":写完前端代码自己截图看一眼,发现按钮歪了自己改。编码从此不只是文字游戏,而是"看得见、能自检"的闭环。 - ◆十万张国产芯片扛住了前沿模型。
全部流量跑在国产 AI 芯片集群上,自研推理引擎加 EPD 分离式架构,端到端性能提升 3 倍,单 token 成本打平主流英伟达方案。 SemiAnalysis 的评价是"英伟达护城河再受考验"。最有意思的是个彩蛋:GLM-5.3 这个模型亲自参与了优化跑 Flash 的推理栈——AI 优化承载 AI 的系统,这个闭环成了。
三、为什么叫 Flash?它和 GLM-5.3 到底啥关系
Flash 是行业黑话,意思就是"又快又便宜的产品线",谷歌的 Gemini Flash、DeepSeek 的 Flash 都是一个意思。
但这里有个最大的误区必须澄清:Flash 不是 GLM-5.3 的缩水版、蒸馏版。GLM-5.3 用的是 GLM-5.2 的老基座,而 Flash 是从零预训练的一套全新架构——新混合注意力、45 层(比 GLM-4.5 的 92 层近乎腰斩)、30T token 的多模态语料。
它俩是两条产品线:GLM-5.3 负责冲智能上限,Flash 负责把智能卖成白菜价。官方还放话要把这套配方放大到更大的模型,所以 Flash 更像"下一代架构的先行低价版"。
四、能力对比 GLM-5.3:九成功力,另有绝活儿
两家官方评测口径基本一致,直接上数据:
规律很清楚:硬核长程编码和深度推理,GLM-5.3 强出一截;工具调用、自动化办公这类"干活"场景,Flash 打平甚至反超。
而且两家各有独占技能:GLM-5.3 有涌现的网络安全能力(CyberGym 84.5 全球最佳,在 269 个真实项目里挖出 2436 个漏洞);Flash 独占视觉能力(OfficeQA Pro 62.4,把 Claude Opus 4.8 的 48.9 按在地上摩擦)。
GLM-5.3 是天花板,Flash 是"天花板九成功力 + 独有视觉 + 十分之一价格"。
五、对比 DeepSeek-V4-Flash
这是 Flash 的直接对标选手。官方对标 DeepSeek-V4-Vision-Exp 的结果是:
编码四项赢三项(DeepSWE 63.4 对 59.3 优势明显,NL2Repo 小输);Agent 类互有胜负,但 AutomationBench 48.8 对 38.8 是碾压;
视觉六项全胜,最夸张的 BabyVision 是 53.4 对 35.1。
基座层面,DeepSeek-V4-Flash-Base 激活参数更小(13B),MMLU 略高,但 LiveCodeBench-Base 被 37.6 对 29.9 拉开了身位。
价格上,GLM-5.3-Flash 前两周半价期 0.8 元/1.5 元,不打折的话输入打平
当然短板也要说:Flash 的 KV 缓存仍略大于 DeepSeek 和 Kimi,这是官方自己承认的"后续优化方向"。所以准确的说法是:能力多数维度压着打,效率细节上和 DeepSeek 互有胜负,价格折扣期完胜。
六、对比 Kimi K3:同档智能,一半机身,三十倍价差
K3 是另一种打法:2.8 万亿参数的暴力美学,激活参数 104B 是 Flash 的近 6 倍,全球首个 3T 级开源模型,WebDev Arena 以 1679 Elo 登顶。
能力怎么比?划重点:综合智能指数基本打平(57 对 57.1);长程编码和深度推理,K3 明显更强(Terminal Bench 88.3 对 84.3,DeepSWE 67.5 对 63.4,HLE 59.8 对 55.3);
工具调用和自动化办公,Flash 小胜(Toolathlon 78.4 对 76.5,AutomationBench 48.8 对 46.7,GDPval 1773 对 1682)。
但价格差异实在太悬殊!输出价格每百万 token,Flash 是 0.50 美元,K3 是 15 美元,30 倍。部署门槛,Flash 的 FP8 权重 8 卡节点能跑,K3 官方建议 64 卡起步。
所以可以定性说:Flash 处于准旗舰水平。K3 是冲刺智能上限的旗舰,Flash 是把旗舰90%的能力,白菜价卖的杀手。如果追求能力极限,选 K3;如果追求性价比想省钱,选 Flash。
七、GLM-5.3-Flash使用场景
适合的场景
高频 Agent 工具调用和自动化办公(便宜量大) 视觉类活儿——前端还原、截图排错、扫描件财报理解、视频理解(这是它的独占区) 预算敏感的创业团队和个人开发者 Coding Plan 重度用户(同档位 3 倍配额) 想自托管的中型团队(8 卡就能跑)
不适合的场景
极限长程编码攻关和深度推理(加钱上 GLM-5.3 或 K3) 网络安全研究(GLM-5.3 独占) “我要最好的”的场景(那还是 Claude Fable 5 和 GPT-5.6 Sol 的区间)
📌 结语
最后说句锐评。GLM-5.3-Flash 学术上确实没有原创突破,这是真的, 所以算不上大牛;但 2026 年的大模型战场,论文已经不再是最硬的通货,账单才是。
大部分日常任务真的需要那么高的智能水平吗?当 57 分的智能只卖 0.045 美元一个任务,所有卖贵的模型都被迫回答一个问题:你贵得有什么道理?
GLM系列的价格相对比较贵,这次把智能从奢侈品变成水电煤,这才是 Flash 最大的贡献,也是智谱这步棋的战略目标。
💬 问一嘴
你会在哪些场景用GLM-5.3-Flash?
风里雨里,评论等你。