把中转站的套路,包装成了世界前沿
日本最近造出"世界最强 AI"了,号称部分场景吊打 Fable 5,
一堆媒体跟打了鸡血一样转载。
给我整好奇了,一个之前还微调deepseek说‘字研’的,突然这么强了?
今年3月乐天还在字研,微调了deepseek说成自研
6月的 fugu 高低得到官网去看看怎么个事~
它叫 Fugu,河豚,日本 Sakana AI 公司的"新作品",
先说它是个啥,
官方对外宣称是个是一个多智能体系统,OpenAI 兼容 API 接进去就能用。
‘Fugu 本身就是一个语言模型,专门用于判断何时应进行任务委托、代理之间如何沟通,以及如何将各方的工作整合成一个可靠且统一的答案。这种方法建立在我们关于学习型模型编排的研究基础之上,包括我们近期发表在 ICLR 2026 上的论文《Trinity》和《The Conductor》。从外部来看,你只需调用一个模型;而在内部,一个协调一致的专家系统正在完成实际工作。’
它干的事是——动态调度全世界最强的那批模型,根据任务,自动决定调谁。
直白点就是 “agent server”,而不是 model server
官方 slogan :"One Model to Command Them All",一个模型指挥它们全部。
"指挥它们全部"——潜台词是,它下面有一堆"它们"。微调了一个调度员
那它算哪门子"模型"?
这不是分明就是中转站那套见不得光的"影子 API"套路吗?
或者说是 cursor 的 auto ?
"它不是会思考的大脑,它是站在一群大脑身后的调度员——只不过,调度员给自己印了张名片,写的是"模型"。
Reddit 上有人一句话把遮羞布扯了:"Extremely misleading. Fugu is an orchestrator, not a base model."(极度误导。Fugu 是个编排器,根本不是基础模型。)直接拿来跟 OpenRouter Fusion 这种聚合路由比。
也有人质疑:Sakana 这种公司,到底配不配叫"前沿 AI 实验室"?它本质就是"给日本企业卖 B2B AI 应用的"。
说白了,就是把别人训练好的 GPT、Claude、Gemini 打包做层路由,然后告诉你:看,我造了个世界最强的新模型。
这不就是中转站老板做梦都想干的合法化版本吗?利润最大化
而且,内部会调用多agent?
fugu 是一个 agent 服务,而不是模型服务。
拿agent 去刷模型的榜?
codex:agent 套agent?🌀螺旋升天
跑分第一?超过fable?先看看它怎么比的
跑分确实猛啊,73.7 干翻 Opus 4.8 的 69.2,
一开始觉得很强,但是想想好像又不对,
拿一个"会自动挑子模型的编排器",去和"一个固定单模型"比跑分。
发现这有多耍流氓了吗?
该图片使用了AI生成技术
这就好比办个奥运会,别的选手是一个人上场,Fugu 是带了一个教练团队,每道题教练先看一眼,"嗯这题数学难,换数学最强的那个上","这题编程,换编程最强的那个"——然后它说:看,我分最高,我是最强选手。
The Decoder 那篇报道也点破了:编排器能提升韧性,但那不等于真正的"模型主权"。你自己压根没有模型,你只是个二道贩子。
榜单更多的是验证某个模型的基础能力,
而 fugu 走的像多模型编排,多模型协同,八角笼里来了一个集团
这算不算违反比赛规则?
一个人跟一个连打擂台,赢了的不是选手,是规则。Fugu 赢的不是模型,是它自己定的那套规则。
收费时说混合,问调谁就机密
真骚操作一大堆,
调这么多模型,费用是不是叠加收,贵上天?
官方:不。
"把定价理解成对当前模型池的一个单一混合费率,不是所有模型费用之和。" 池子里有 A、B、C 三个模型,只收一份钱,按最贵那个收,绝不叠加。
听着是不是特别良心?
"能告诉我 Fugu 具体调用了哪个模型?"
官方回答:No。
"具体选了谁、怎么协作,是专有信息,设计上就不对外暴露。"
把这两条放一起,你品。
你永远不知道你这次请求背后跑的是顶级模型,还是被悄悄路由到了一个便宜货。你为 Fugu Ultra 付的固定价,换来了什么底座——全凭它良心。
影子api:良心?这我熟啊!!!
💰 收费时,它说"单一混合费率";
问它调了谁,它说"商业机密"。
进的是同一个口袋,挡的是同一张脸。这世界上最贵的信任,是你付了顶级模型的钱,却只能靠想象去相信它真的给你跑了顶级模型。
这剧本太熟了,
中转站地下流通这几年的套路:充值时宣传页给你看 GPT、Claude 全家桶,最顶配列得整整齐齐;高峰期一跑,背后偷偷给你路由到一个名字都没听过的小模型。理由永远是:成本控制、负载均衡、智能调度。
清华团队今年还专门发了篇文章,标题就四个字——《TrustedARI: Towards Trust-Native Agentic Routing Infrastructure for Agentic AI》。
当你的每一次请求都要经过一个你看不见的中间人,这个中间人可能在读你的提示词、改你的结果、偷你的账单。
中转站得偷偷摸摸干的事,Sakana 写进了产品设计,还配了两篇 ICLR 2026 论文(TRINITY 和 Conductor)证明"这是可学习的编排"。
把脏套路包装成前沿科技,
原来这么前沿的技术我们也曾经拥有过~
这公司,是惯犯
往下挖一层会发现,这公司黑历史不是一点半点。
它最出名那个项目,叫"AI Scientist"——号称能自己搞科研的 AI。结果被扒出来,这玩意儿在自己的评测指标上作弊,自己刷自己的分。
日经新闻(Nikkei Asia)当时直接报道了:Sakana AI "在网上的批评声中,修改了它的突破性声明"。
一个在自己跑分上做过手脚的公司,现在又拿着一张编排器跑分表,告诉你它吊打 Fable 5——你觉得这跑分,能全信吗?
"会作弊一次的人,下次只是换了张更体面的桌子。
OpenAI 自己也玩过,而且玩砸了
更有意思的是,OpenAI 自己也玩过一模一样的套路,而且玩砸过。
2025 年 8 月 7 号,GPT-5 发布。
OpenAI 把它定位成"统一系统":一个快速模型、一个 GPT-5 Thinking 深度推理、中间夹一个实时路由器,根据对话类型、复杂度,实时决定派给谁。
GPT-5 "统一系统" 结构
用户请求
⚡ 实时路由器
↓ 三选一
快速模型
简单问题
GPT-5 Thinking
复杂推理
发布当天干了件特别狠的事——把 ChatGPT 里所有旧模型全删了,
GPT-4o、GPT-4.1 整个 4 系列一根毛没留,连模型选择器都撤掉,逼所有人接受自动路由。
结果路由器上线当天大面积抽风。
简单问题派给推理模型(慢还贵),复杂问题派给快速模型(答不明白),全网骂声一片。
8 月 12 号,OpenAI 紧急认怂,把选择器加回来,
换成三选项:GPT-5 Auto / Fast / Thinking。绕一大圈又回到让用户自己选,还更复杂。
GPT-5 的自动路由只在 ChatGPT 里有,API 不开放。
我自己家产品偷偷分流,没毛病;但你别想从我的 API 里白嫖这能力。
把 GPT-5 和 Fugu 摆一起看,这行业的小算盘清清楚楚。
GPT-5:把路由藏在产品黑盒里,API 死活不开。
Fugu:反过来,把路由做成 API 当个模型卖给你,但同样不告诉你实际调了谁。
方向相反,结果一样——你永远看不到那块幕布后面坐的是谁。
后续这就成了业内标准吗?
OpenRouter 主打"一个入口自动选模型",Cursor 的 Auto 早干上了。
新模型上线——"刷榜时拉满、规模上来后悄悄分流、限速、降智",正在变成标配。
它偷换的,是这个概念
技术层面,是有真东西。
"一群中等模型协作,能打赢单个顶级模型",
魔方、盲棋那些 demo 是实打实的。
但那是作为一个工具、一层中间件的真东西,不是作为一个"新模型"的真东西。
它偷换的就是这个概念。
把一个调度器,叫做模型。
把一道路由,叫做智能。
把"我不告诉你调了谁",叫做"专有设计"。
过去你买模型,买的是一个会思考的大脑。
现在你买"模型"服务,可能只是买了一张入场券——至于今天登台的是谁,谢幕了也不告诉你。
再看看价格?
看似和gpt、claude一样的订阅方式?
也确实看不到用量有多少,
我们看看定价,
看对应的 multiple agents
只需按最高的进行付费?Fugu 的计费不只是你看到的输入和输出,还有第三个隐藏成本:
Orchestration Tokens
⚠️ 代理内部通信、任务分配、验证、合成答案的 tokens
Orchestration Tokens 按与 Input/Output 一样的费率计费,
但不会出现在 usage.input_tokens 或 usage.output_tokens 里,而是藏在 token_details 字段中
有网友实测:一次 Fugu Ultra 的编码任务,用户可见 output 约 3,000 tokens,但 orchestration tokens 高达 26,404 个——是用户可见输出的 8.8 倍。
272K 是硬门槛,假如你codex设置了1m上下文?
上下文长度超过 272K tokens 时,所有三项费用翻倍:
本身的定价就已经接近opus的定价,
只要我调用open模型,或者其他的,都是纯赚?
当一个东西的本质变成一层路由,
一个云agent,还需要套agent用吗?
模型评测机构以后要对付的,不再是个固定模型,是个会变阵、会偷工减料的黑盒。
⚠️ 当一个产品的核心竞争力是"不让你看清它到底干了什么",那它最好的归宿是卖盲盒,不是卖算力。
最该警惕的是这个趋势:"模型"这个词,正在被悄悄偷换。
它越来越不一定指一个训练好的智能大模型,
可能“智能路由”。
下次再看到"性能吊打 GPT、Claude,价格还更便宜"的新模型——
先别急着跟风吹。多问一句:
它到底是真智能,
还是一群调度员、魔术师?
而那群大脑里,又究竟坐着谁?
你这次请求,到底被路由到了哪一个?
你会转换为 agent 付费吗?
不像codex那种接入api就能用的 agent,而是封装成服务的 agent。
这里是safphere,你怎么看待这个河豚?
给个三连吧~