Kimi K3 好不好,就看算力还扛不扛得住
BubbleBrain
2026-07-20 07:40
发布于上海
科技领域创作者
问AI
·
开源最大模型K3算力告急背后有何隐情?
Hello,大家周一好!
这里是B&B!
也是终于有时间可以好好聊一聊
Kimi K3
了!
其实它发的那天晚上就体验上了,但是后面又是工作,又是WAIC就没赶上热乎的。
本来想算了,毕竟新鲜时间过了,
但是在我又多体验了两三天之后,我还是觉得这是一个非常值得聊一下的模型,我愿意为它单独的写一篇。
根据我自己使用模型的经验来看,到目前为止,有三个模型是我有私心偏爱的。
一个是当时还没长成如今万人喊打般模样的Claude Opus 3,因为我在这个模型里感受到了Anthropic训练进了人格;
第二个是DeepSeek R1,这个就不用多说什么了吧我觉得;
第三个就是Kimi的K3,我认为它是完完全全可以在我日常的工作、生活里使用的模型。
当然我必须要承认的是,
我对Kimi一直是有偏爱的。
「但是我写这篇,他们真的没给我钱啊!希望Kimi的人看到了赶紧安排一下(bushi)」
为什么是偏爱呢?!
因为他们是我认为国内厂商里非常少数具备自己的品味的公司。这种品味你可以从官网、招聘网站、发布视频等等各种细节能看得出来。
举一个小例子,
Kimi的老版会员购买网站。
这是一个简单到不能再简单的网站。
这每个档位的英文单词绝对不是为了装逼,随便学习Anthropic去取的,它是有自己的意思在里面的。
它们分别代表着音乐的速度,从左到右,依次增强。
而音乐,如果你了解月之暗面的话,就会知道,这本身就扎根在月之暗面这家公司的DNA里。
当然,我知道还是有很多人会觉得这特么不是装逼么?!哎是的,但我自己确实很吃这一套。
本质上,可能我的骨子里也有这种“中二之魂”。。。
一个非常不幸的消息是,在我哐哐写这篇文章的时候,Kimi的算力终于还是扛不住了。
新用户已经没有办法再订阅他们家的套餐了,只能等一手后面第三方厂商的接入。
我记得前一两年一个新模型出来,大家还会去看各种各样的Benchmark跑分。现在大家都学明白了,一个模型牛不牛逼,就看你家资源有没有被打爆,套餐是不是还能买的到。。。
这何尝不是一种新的Benchmark呢?!
OKK扯远了,现在是时候回来谈论一下K3了。
2.8T的参数,目前开源最大的模型,1M上下文并且原生多模态,支持视频理解。
这样的配置你哪怕是放到闭源模型里,都非常的全能。
说实话我都无法想象要训练、部署一个这样的模型需要多少的资源。。
在一些能够快速对比出结果的case里,比如前端,3D,能明显感受到巨大的提升。
我在刚发布的那天晚上就测了几个。
比如下面这个飞机停机坪3D的case,
这是我第一次见到国产的模型能做到这么精细的程度。 在此之前,上一个能够还原度这么高的模型,是
Fable 5
。
再比如因为Kimi支持理解视频,我尝试让它复刻了一下自己的发布视频。
这个真的太牛逼了我觉得,做出来的时候我真就一句卧槽牛逼。 因为不仅仅考验模型的前端能力,还包括视觉理解的能力,两者缺一不可,才能做得好。
虽然没有实际测试过别的模型在这上面的表现,但是K3的表现绝对应该是顶级。
还有本身Kimi就非常擅长的网页设计任务。
我自己本身有一个知识库网站,里面有一个资讯日报板块。它本来长这个样子:
很丑对吧?!我之前也一直没管过它,而且它还缺少一个首页,用户进来还得自己找对应日期,多点一步才能看到资讯内容,一点儿也不优雅。
然后我就是这么跟K3这么说的,
就是让它来给我设计一个首页,然后改改这里的交互逻辑。
现在看上去有没有感觉顺眼多了?!
再来一个需求是想给我抓取的内容源里,增加一个Simon Willison的博客,然后去除掉我原本抓取的一个Reddit的源,因为感觉抓取的质量不够好,然后再多增加一次自动抓取的时间。
K3 一上来做的比较好的一件事是,没有着急动手改代码,而是先设计方案。
而且它会自己分析出任务改动比较大,然后分配给一个叫Coder的子代理去执行。
执行这种长任务的时候,就能体会出来参数量翻倍带来的影响。慢是真的慢,等的时候一度陷入自我怀疑,“这真的对吗?”,“你没搞我吧兄弟”
好在最后是完成了这个任务。
直接验证一下,
基本的逻辑是没什么问题的,我想要和不想要的内容都处理好了已经,剩下的就是一些小修小补的过程了我觉得。
等我整的差不多了,就放开给大家看看。
然后我最近还在做的一个统一的Agent管理平台,叫Aegis。
其实已经做了有一段时间了,但是就一直是小修小补,它长下面这样:
是不是看着就特别的眼熟? Codex:你问我几分像从前?!
我之前本来是想着,既然Codex APP的体验那么好,但是我又不想在Codex 里接别的模型,这样反而也会影响使用体验,那我为什么不自己造一个?!
所以,就有了它!
然后正好今天
Qwen3.8
也开始预热了,我就想着不如我们考验一把K3,把Qoder 也接进来,(这算什么奇怪的需求🤔)
看看它在面对这种实际的工程需求的时候,效果怎么样。
我直接把文档丢给K3让它搞。
它先是帮我评估了一下,这个方案的可行性。
判断基本可行之后,它就会帮我先把文档写出来,顺便还发现了我本地似乎还没提供过登录态。
它就会先提醒我先登录,然后把方案给落成文档。
这里我提醒大家千万别像我一样,还喜欢手贱启动一手agent swarm来评审一下方案,不然就会直接把5小时额度给干满。。。
但是多一轮互相review 效果也确实是有的,
会抓出一些问题,然后自己进行方案的修正。
方案设定好之后,就是一个goal的事情了。Kimi Code也支持像Codex 和Claude Code的那种直接通过一个goal命令,来让Agent 长时间工作。
等了1个小时20分钟,终于干完了;实际测试了一下一把接入的效果,正常的对话这些都没什么问题。
还非常细节的帮我把上下文指示器圆环给显示在输入框上了。
美中不足的是接入的时候,没帮我把可选的模型给都接入了,然后还有个bug是agent 在工作的时候,模型显示会从Default 跳转到Auto;
让K3修复了一下这两个bug,也非常精准的定位到了并且正确执行了修复。
总体上,K3的情况就是这样吧。我觉得能力上比之前确实是大幅度提升了很多。
最后想再写点什么吧,
K3给我的感觉是又惊喜又可惜说实话。
惊喜的是它有足够长的上下文,又是多模态,还有不错的编码能力,这就代表着它完全能在你任何的日常任务里拥有一席之地。
如果像下面这种,以一句简简单单的,“蒸馏Fable 5”而试图掩盖它本身的光芒,
我只能说他既不尊重整个团队的努力,也不懂训练模型本身的魅力所在。
可惜的是,算力真的不够,没法让更多的人体验到K3的优秀。也因为算力的不够,导致一连串反应,比如官方价格很高,用量相对比较少等等。
比起大洋彼岸的土豪般的疯狂重置,甚至可以为此取消5小时限制,Kimi的资源真的少的太多太多了。
我非常不专业的瞎感觉一下,算力的差距估计得有上万倍。。
但还好,开源社区的魅力也在于此。
国内外各种云厂商,做算力的,都可以自己部署接入,给大家更多的选择和使用。
写到这,突然想到一句话,
“莫愁前路无知己,天下谁人不识君”
我相信好的模型,自然会走到人民群众中去。
以上,