三月中旬发布的时候,M2.7的讨论度就很高,数据表现也不错。SWE-Pro得分56.22%,和Opus 4.6几乎持平;Terminal Bench 2拿到57.0%,多语言软件工程测试SWE Multilingual 76.5、Multi SWE Bench 52.7——每一项都是开源模型里的第一梯队。
当时API定价也是蛮香的:每百万输入token $0.30,输出$1.20。 对比Opus 4.6的$5/$25,输入便宜17倍,输出便宜21倍。
开源协议与性能争议
先说好消息——开源了。再说坏消息——用的是修改版MIT协议。
HuggingFace的讨论区里已经有人开喷,说这不算真开源,是"可查看权重的专有代码"。这个争论在Gemma 3的时候也发生过,大概率不会影响实际使用,但如果你对开源定义有严格洁癖,值得留意。
性能方面有两个需要说清楚的数字。
Artificial Analysis的独立测试显示,M2.7标准端点的实际速度是45.6 tokens/s,低于MiniMax宣传的100 TPS,也低于同价位模型中位数的95.8 TPS。首字节延迟2.49秒,对比中位数1.84秒,交互体验上能感觉到差异。高速版本有没有接近宣传数字,目前还没有独立数据。
另一个需要注意的:BridgeBench vibe-coding任务上,M2.7的成绩实际上不如前代M2.5。 这种局部退步在benchmark选择性展示里是看不到的——但用的人会碰到。
自己改进自己
M2.7发布博客里最有意思的部分,不是分数,而是MiniMax描述他们怎么训练这个模型的。
他们让一个M2.7的内部版本去优化一个编程测试框架。这个模型在没有人工干预的情况下,自主执行了100多轮循环:分析失败轨迹→规划修改→改scaffold代码→跑评测→比较结果→决定保留还是回滚。跑完之后,内部eval提升了30%。
这就是Karpathy所说的Autoresearch思路在实际生产中的落地:模型参与自己的训练循环,不是做数据标注,而是做架构决策。MiniMax没有拿这个概念做宣传,但联创Yuchen Jin转发时直接点明了这一点。
另一个更值得注意的细节:MiniMax让M2.7协助RL团队的日常研究工作。研究员和agent讨论实验想法,agent负责文献检索、跑数据pipeline、监控实验进度、处理log debug、提merge request。MiniMax的说法是,M2.7能处理这个工作流里30%到50%的内容。
这不是Copilot式的代码补全。是一个模型在承接原本需要多人协作才能完成的研究任务链条。
128GB Mac能跑
开源权重出来之后,Unsloth迅速跟上了量化支持。
M2.7的原始bf16权重需要457GB,一般人根本放不下。Unsloth用Dynamic 4-bit量化(UD-IQ4_XS格式)把它压到了108GB,降幅60%。这个大小刚好卡在128GB统一内存Mac的线上。
实测推理速度:Mac上15+ tokens/s。如果有一张16GB显存的GPU再加96GB系统内存,速度能到25+ tokens/s。
要在本地跑,最简单的方式是用Unsloth Studio——终端执行安装脚本,启动后搜MiniMax-M2.7下载对应量化版本,直接聊。Mac、Windows、Linux全平台支持。也可以用llama.cpp和llama-server部署OpenAI兼容API。
这样的“开源”会越来越多吗?
这轮开源潮背后有一个很实用的逻辑。
模型训练成本极高,但把权重放到 HuggingFace 上,开发者社区会自发测评、写教程、出对比视频。这些曝光如果靠广告买,成本远高于"开放权重"本身的代价。所以开源是最低成本的营销。
但允许任何人拿权重部署商业服务,API 业务就直接被自托管的竞争者蚕食。修改版 MIT 协议的核心逻辑就是:研究可以,学习可以,自己玩可以,但你不能拿我的模型去和我抢钱。
这种模式短期内只会更多。模型能力越来越接近,差异化竞争必然从"我比你强"转向"我比你更开放、更便宜、更容易集成"。限制商用的"伪开源",是在能力没有绝对优势、又想要开发者生态时的折中方案。
当然,社区对这种做法越来越不买账——M2.7 宣布开源几小时内 HuggingFace 讨论区就有人喷"this is not open source"。