Kimi Work用了2天,堪比失败助手

问AI · 推广猛烈的Kimi Work用户体验为何落差大?

说实话,我不是一个粉不粉的,一个只想使用好用的工具、模型提效的开发者。

从网页版到 Kimi Code,从 K2.5 到 K2.7,一路看着更新,基本没落过,

这次2.7的出没,以及kimi work的广告满天飞,好像很强的样子,所以想试试,

实话实说,Kimi Coding (2.7)做出来的页面效果我是真喜欢,

原生多模态~,做出的效果,比 gpt5.5 更契合我的胃口,

代码质量也能打(对比国产里,也是前列了,可国产里,真能用的又有几家?

所以当我把 Coding 额度「压榨」完之后,满怀期待地打开了刚上线的 Kimi Work 桌面端。

然后,就后悔了。已上火

不是那种「不太好用」的后悔。

199的套餐,coding 2天多就,三天不到周额度烧光,

图片

转到 kimi work,一个任务,Agent 集群能连续三批次全部失败,失败原因未知,一点提示都没有

第一次在一个「生产力工具」上,真切地感受到了什么叫「浪费时间」。

图片

用完整个人上火,得喝凉茶去。

把 work 做成黑盒了吗?

Kimi Work 的页面设计,说实话,像极了 OpenAI 的 Codex。

但问题在于——好像真的只学了 Codex 的表面,没学内核。

Codex 是透明~

每一步执行了什么、调用了什么工具、遇到了什么错误,你都能看得一清二楚。

哪怕它做错了,你也能知道错在哪里,甚至自己动手修正。

但 Kimi Work 呢?

它把一切都封装进了一个黑盒。

Agent 集群执行失败,没有错误提示。子 (sub)Agent 调用失败,没有调试信息。

连续三批次全部失败,你只能对着屏幕发呆。

这产品的定位的目标群体可能不是我这种吧,我更希望透明一些

图片

我把这个体验发到小红书,评论区有朋友立刻共鸣——

「对,很逆天。我不知道为什么连召唤子 Agent 都能失败。这不应该是它已经内置好的功能吗?」

还有一位的朋友说——

图片

「Kimi work 做代码问题感觉烧总额度烧的又快,又做不出来。」

当一个 AI 工具的核心能力——Agent 协作——都能莫名其妙地失败,

而且这个失败对用户完全不可见、不可调试时,它就已经丧失了作为「工具」最基本的可信度。

「读书郎」式体验,又慢又烧钱

Kimi Code 给我的感觉,一直都是「读书郎」——慢。

图片

(也是学到codex精髓了吗??)

但 Kimi Work 把这个「慢」字,演绎到了极致。

官方宣传说的是「13 小时连续编码」「300 个子 Agent 并行协作」「4000 余次自主工具调用」——听上去像是一个不眠不休的超级员工。

可实际体验呢?

CSDN 上一位博主连续测了 30 多个小时,记录很真实:300 个 Agent 全开的时候,风扇起飞;浏览器操作偶尔会「点歪」;Token 消耗是真的大,一次 13 小时的编码任务大概烧了 30 万左右的 Token。

说实话、、、我怀疑哥们没用,没测,怎么开的300+agent,好奇,想学

图片

(难道是尊贵的allegro用户??还是把官方宣传稿读了一遍啊)

我自己的体验:不到 3 天,coding 周限制就被压榨完了,而且还没开 3 倍消耗模式。

kimi work 把自己气上火,然后还不知道问题在哪,只能重试?或者放弃

这哪里是「生产力工具」,分明是「血压提升器」。

图片
图片

这可是官方正版[官方发布的时候说是beta,应用里感觉是正式版]、+此刻最新版+官方账号+会员,这你不能找我麻烦吧,纯路人用户

说白了,稳定性还没做好,就急着推广。

推广很猛,产品很懵

让我最不舒服的,还不是产品本身的问题,

而是产品问题与推广投入之间的巨大落差。

Kimi Work 上线前后,能看到大量的推广内容——博主测评、媒体报道、技术社区讨论,俨然一副「颠覆桌面办公」的气势。

就连官方视频号都刷到了好多,好吧,可能我是他‘粉丝’

以及一些文章里面的wx广告,看见这么强,不用都感觉自己掉队

但我不清楚那些做推广的博主是怎么使用的,

只是看到一些标题和分享,感觉很强,但是没怎么看,

(可能也是我的使用方法有问题,如果是,那很抱歉

从我自己实际测试的 coding、写文档、收集素材这些任务来看,

图片
图片

Kimi Work 的表现,用「loser work」来形容,一点也不冤枉。

「有一种看见别人在做这个赛道,然后自己也挤进来,结果就是一手烂牌,干啥啥不行。」

这不是酸,而是真实用户的困惑。(叠甲,我真用户,真纯用户

当你花真金白银(或者宝贵的额度)去尝试一个被吹得天花乱坠的产品,

结果得到的只是连续失败、超时中断和莫名其妙的黑盒行为时,

而且有个细节特别离谱——

Kimi Work 至今还在用 2.6 模型, Kimi Code 已经有 2.7 版本了。

(为coding 而生,应该理解的,好吧我理解不了,好慢好卡

桌面端的「旗舰产品」,在模型能力上反而落后于自家的代码工具。

让人难以理解,好东西不应该快速给自家产品和用户用上么。

「长程任务」?

大模型已经开始进化了,开始走长程任务了,

大家更新的时候最引以为傲的卖点之一,是所谓的「长程任务」能力。

例如kimi 2.6 官方说它可以 十几个小时任务,

图片

甚至开发kimi work,

但我一直都在想一个问题——如果一个任务需要运行几十个小时,中间还要帮你失败 3-5 次,然后再自动重试——

这真的叫「智能」吗?

或者说,这个任务是真实需要执行十几个小时,全是有效执行?还是包含了大量的重试,修改,修改再修改?即使是agent 自主执行

【直白点是不是loop 反复的执行,压缩上下文?】

图片

可以反向理解一下,如果同一个任务,

友商是否能快速高效地完成?而我需要十几个小时几千次调用?

同样的task,是类似1000跑步,谁先到谁nb,还是谁走的久,换的姿势多nb?

一直都对长任务有挺大误解的,希望有学术大拿& 专业人士讨论一下。我只是个普通用户~

我认为

长程任务的价值,不在于运行得多久,而在于完成得有多可靠。

什么时候有类似透明的bench就好了!

图片

一个运行了 20 小时、失败了 5 次、最后还不知道能不能交付的任务,远不如一个运行 2 小时、一次成功、结果可用的任务来得有价值。

work 这个赛道,Kimi 真的适合吗?

2026 年,AI Agent 桌面端确实是一个热闹的赛道,

Anthropic 发布了 Claude Cowork,OpenClaw 成为开源现象级项目,

阿里、阶跃星辰、MiniMax、昆仑天工等国内厂商也相继推出了各自的桌面 Agent 产品。

Kimi 想挤进来,可以理解,

但问题是——你挤进来的时候,手里有没有牌?

Claude Cowork 背靠的是 Claude 4x 的模型能力;

OpenClaw 走的是深度系统访问、远程遥控的技术路线;

而 Kimi Work 似乎没有一个清晰的差异化定位,

只是外观像codex,或者claude 桌面端?

又不像 Codex 那样透明,

如果是beta,那加油吧!

图片

补个看到的,我的记录太多,,分不清,借友友个图

‘你的 agent 正在偷偷燃烧🔥’

‘agent半夜自进化ing’

最后,想说几句

Kimi 的模型能力,我是认的。

K2.7 Coding 做出来的页面效果、代码质量,确实不错,

就是额度,,,确实少的可怜,根本不够用,而且也慢,kimi work也慢

但 Kimi Work 给我的感觉是——一个急于抢占赛道、匆忙上线的产品。

同样的模型,朋友开发的桌面 agent 就调教的很顺畅,终究还是没上心吧

想做一个「通用型本地 Agent」,

但好像连最基本的可靠性和透明度都没做好,

想替代知识工作者的繁琐流程,但自己却成了最大的「繁琐」,

模型才是 Kimi 的根基,也是它真正能和国内外竞品掰手腕的地方。

AI Agent 桌面端的未来确实值得期待。

但那个未来,不属于一个「疯狂失败」的产品,

「建议还是好好做模型吧,如果这个赛道不适合,不要乱挤。」

这里是safphere,一个只想说真实体验的小地方~

期待下一个令人大开眼界的agent 应用


不喜勿喷,AI 提效不是制造垃圾的理由~


本文基于 Kimi Work (Kimi 版本 3.0.21)桌面端真实使用体验,

结合公开报道与社区反馈及个人使用体验撰写,无恶意,纯发泄!