实测Macaron V1,还真给我GLM5.2调成0.8个Fable5了

问AI · 模型自我出题改进的闭环,如何保证稳定不跑偏?

完胜了超越了逼近了,

每次有新模型发布,介绍基本都长一个样。

推理更强了,代码更稳了,上下文更长了,Agent更聪明了。

榜单一排,柱状图一拉,每一项都比上一代强20%。所以我现在看模型,已经越来越不关心它在某张榜单上高了几分,不涨也不会放出来。

我更关心一件事

稳定。

哪怕不是个全能水桶模型,只要能在我高频使用场景上一直有效,我很乐意冲个plan,很多时候这比我去openrouter扣扣搜搜挑一个免费模型要好得多得多。

还有67小时后Kimi额度才重置,Fable5用着API的我刷X看到了一个新模型Macaron V1,这也是我第一次看到公开的GLM5.2后训练模型,能一句话直出鹈鹕游戏,主打一个前端能力拉满,还把上下文扩展到了原生2M。

🔗 macaron. im/mindlab/research/introducing-macaron-v1

接入到Claude Code,加上taste skill之后一把出来的效果也挺能证明这模型UI水平的。待会我发发这个离谱的提示语,专门来测模型UI创意力的。

图片

Macaron V1这次提出了一个新框架,MoL,

说穿了做了一件事,把基座模型整个冻住,一个参数都不动。所有后训练全发生在 LoRA 空间里。用人话说,就是同一个公司共用一套知识库,但客服,项目经理,程序员和设计师,各自保留一颗专业脑袋。

MoL想做的,就是让相近的任务互相强化,差得太远的任务各练各的。

像聊天需要理解你的语气,记住上下文,还要知道什么时候承认自己错了。

Agent要拆任务,调工具,处理意外,原来的路走不通了还得自己拐弯。

Coding更死板一点,语法,依赖,测试,终端,一个地方出错整段代码都跑不通

UI又是另一种脑回路,视觉得好看,交互得能用,代码还不能只负责把首屏糊出来。

以前这些能力都挤在同一组后训练参数里,很容易优化跷跷板,代码提升来了情商就低了,情商上来了写作就都是幻觉了,所以我至今还怀念GPT5.4。

Macaron团队甚至专门做了一个插件来UI打分,也就是测试AI模型的A2UI(Agent-to-User Interface) 能力,测的就是模型在对话中,除了回复文字外,能不能在合适的地方生成UI组件。

图片





图片

图片

图片

对于不爱用CLI命令行页面的人,马卡龙也一个Skill,也把问题解决了

也就是说我可以直接看到之前的内容还不用/resume的一次次的开新视窗。相当于一个不用下载可装可关的Desktop App了已经。

🔗 github. com/mindverse-ltd/macaron-artifacts

纸面实力和新插件都看差不多了,是时候上真实任务了。

Kimi K3和Macaron V1都说自己UI好UI妙,那我就好奇了,在同样的任务下的表现会是怎么样。所以我给了一段精简提示词,

V1来个自我介绍,没有额外提供技术栈限制,也没有让skill做场外辅助。

  
创建一个名为 web_design 的文件夹,并制作一个介绍 Macaron-V1-Venti 模型的交互式网页。
确保该网站达到生产级质量标准,并可直接部署上线。

总共花了十分钟左右,从0开始,一个没啥AI味带模块化设计还有可视化图表的介绍站出现了。


图片

总的来说,里面带的特效,没有压过文字要表达的信息,嵌入了加入Agent的聊天UI对话,这是我在其他模型用一样的提示语还没见过的效果,还挺新颖

图片




也是借由Agent聊天框的想法,让我萌生了实测个Agent聊天室吧的想法。

一样短短的几句Prompt

  
创建一个名为 chat 的新文件夹,并在网页中展示一个多智能体聊天室。
确保各个智能体能够相互交流,同时我可以随时终止它们的对话。
整体氛围可以像一个“AI 议会”,围绕人工智能的未来展开讨论。

等个十几分钟,它又又又出了结果


图片

不同Agent各司其职,

有统筹者,有研究员,教育家和工程师也都进入了这个对话

让他们开始聊天后,消息源源不绝

大家都符合自己人设的疯狂表达。

在每轮对话主题过后还都有总结以及意向在边上让我做参考

图片



从平时自己在家里跟Fable5斗智斗勇到现在看着Agent们内部间辩论的战火朝天,

就是三行提示词出来的效果。。。

再来再来,身为大模型,会点物理不过分吧,V1来做一个物理课教学页面,再考考模型的世界知识。

  
创建一个名为 gravity 的文件夹,并制作一个名为 Gravity Particle Lab(引力粒子实验室) 的精致单页 HTML 交互体验。
仅使用 HTML、CSS 和原生 JavaScript。所有代码都放在同一个 index.html 文件中,不使用任何外部库或框架。

## 核心概念
在一个大型交互式画布中展示动态粒子系统。画布中设有一个可以移动的引力源,用于吸引或排斥粒子。整体体验应更像一个轻量级的交互式物理实验室,而不是单纯的装饰性背景动画。

## 主要交互
在画布中渲染 100~300 个持续运动的粒子。
在画布中心附近放置一个引力源。
用户可以通过鼠标或触控拖动引力源。
粒子会加速朝引力源移动。
添加可选的排斥模式,将粒子推离引力源。
粒子碰到画布边界时应产生柔和的反弹效果。
限制粒子的最大速度,确保模拟过程保持稳定。
防止粒子被困在引力源内部。
保持动画流畅,并确保运动具有足够的稳定性和可预测性,避免出现失控或不稳定的情况。

从运动轨迹到不同参数导致的反应,都展现的稳定还正确。

因为是大项目的缘故,在没有调用任何Skill的情况下,V1还能在接受后还自己加上了个内测。


图片

而为了继续测它的 Coding 能力,我又想到了一个看着简单,实际上特别容易出Bug的经典大一作业噩梦:2048。

这个游戏大家应该都玩过,页面本身并不复杂,

无非就是一个 4×4 的格子,几个数字方块,再加上滑动和合并动画。

但真要把它写对,里面的坑一点都不少。

比如连续四个2应该合成两个4,而不是直接变成8

同一个方块在一轮移动中只能合并一次

无效移动不能生成新方块

好多好多都是之前其他Agent踩过的坑。所以它表面上是个小游戏,实际上更像是一场状态管理和边界条件考试。我给它的提示语还是很直接:

  
创建一个名为 2048 的新文件夹,并制作一款功能完整且可以正常游玩的 2048 游戏。
使用自适应的4×4棋盘,并正确实现原版 2048 的全部游戏规则。
支持方向键、WASD 键以及移动端滑动手势。加入流畅的方块移动与合并动画,并提供当前分数、持久化保存的最高分、重新开始、获胜、游戏结束和继续游戏等状态。
需要特别注意方块的合并顺序,防止同一回合重复合并,同时正确处理无效移动、重复输入和响应式适配。
确保所有交互均可正常使用,最终完成的游戏中不得包含占位控件或明显错误。

等它一次性生成结束后,整个游戏已经可以直接玩

从键盘操作,到数字方块移动和合并的反馈都做得很完整。

分数,最高纪录,重新开始,胜利提示和游戏结束状态也都有对应处理。

最后的最后,我一个真正的魔王任务来了。

这一次,直接把我们一直在做的AI学习网站,LearnPrompt交给它,现在重构之后长这样,


图片

让它把原本偏内容型的学习页面,重新做成一个具有3D特效,可交互,还能清楚解释课程体系的展示网站。同时,我也允许它根据需要自行调用合适的 Skills。接到任务之后,V1没有直接套一个常见的科技网站模板,是先读取了现有内容和项目规则,随后主动选择了Taste Skill,把它作为视觉与交互设计上的参考规范。

最终生成的结果,就是刚刚我发的第一个case,提示语也就是,

说实话,整体完成度比我预期中高不少,莫名有种我学习之前还可以看一个过场动画的感觉。

它使用了大量展开,收缩,切换和空间层级变化,把原本比较平面的学习内容重新组织成可以探索的页面。

不同内容之间不是简单地一段接一段往下堆,通过交互和动画逐步呈现,让在查看页面时有一种进入课程地图、逐层了解内容的过度感


图片

图片

OK啊,就测到这儿,

聊点技术的,Macaron V1的2M上下文是怎么做到的,直接让glm5.2上下文翻了一倍。

他们发了个叫LongStraw的训练方法。现在强化学习训练有个硬墙,大概卡在256Ktoken。

模型学习的时候要同时记住刚才算了什么,反复比较好几个答案哪个更好,再把经验攒起来一起更新。

这三件事同时干的话,上下文再长一点显卡内存根本扛不住。

LongStraw的核心想法其实挺直觉的,一道题的题目大家都一样对吧,那题目只读一次,存个快照,后面只重播做题的过程。省下来的内存全拿去撑更长的上下文。实际效果上8 张H20上就把27B模型训到了 2.1M token,32 张H20上,GLM-5.2这种78层256路MoE的满血大模型也跑通了2.1M。

还有一个点我觉得有意思但容易被忽略的,他们的训练框架 MindForge 把上线后用的整套 Agent 环境原封不动搬进了训练。路由怎么分发、工具怎么调用、内存怎么排,训练和上线完全一样。

这也解决了一个老问题,训练环境和真实环境不一样导致模型上线就拉胯。

再说个更骚的,他们搞了个递归自我改进的闭环。模型自己出题,自己做,做完审计轨迹,改进harness配置,再拿优化后的数据更新自己。更新完的模型又能出更难的题。这个循环能一直转下去。

左脚踩右脚起飞了属于是。

从benchmark上看,Venti在大部分赛道上跟Opus 4.8、GPT5.5、Gemini 3.1 Pro打得有来有回,同时还是开放权重可以自己部署的。而且他们部署的GLM-5.2推理速度比智谱还快,这个我自己体感也对得上。


图片

问题是现在按 API 调用收费,跑多了钱包扛不住。

我直接在线催更,

Mint Coding Plan 什么时候出?

出了我就是一个订订订。

@ 作者 / 卡尔 & yc星辰