日本“最强新模型”Fugu 超过 fable?个人赛来了个作弊者

AI 圈 ·奇闻怪谈

把中转站的套路,包装成了世界前沿

◆ ◆ ◆

日本最近造出"世界最强 AI"了,号称部分场景吊打 Fable 5,

一堆媒体跟打了鸡血一样转载。

给我整好奇了,一个之前还微调deepseek说‘字研’的,突然这么强了?

图片
图片

今年3月乐天还在字研,微调了deepseek说成自研

6月的 fugu 高低得到官网去看看怎么个事~

它叫 Fugu,河豚,日本 Sakana AI 公司的"新作品",

先说它是个啥,

官方对外宣称是个是一个多智能体系统,OpenAI 兼容 API 接进去就能用。

Fugu 本身就是一个语言模型,专门用于判断何时应进行任务委托、代理之间如何沟通,以及如何将各方的工作整合成一个可靠且统一的答案。这种方法建立在我们关于学习型模型编排的研究基础之上,包括我们近期发表在 ICLR 2026 上的论文《Trinity》和《The Conductor》。从外部来看,你只需调用一个模型;而在内部,一个协调一致的专家系统正在完成实际工作。

它干的事是——动态调度全世界最强的那批模型,根据任务,自动决定调谁。

直白点就是 “agent server”,而不是 model server

官方 slogan :"One Model to Command Them All",一个模型指挥它们全部。

图片

"指挥它们全部"——潜台词是,它下面有一堆"它们"。微调了一个调度员

那它算哪门子"模型"?

这不是分明就是中转站那套见不得光的"影子 API"套路吗?

或者说是 cursor 的 auto ?

"

它不是会思考的大脑,它是站在一群大脑身后的调度员——只不过,调度员给自己印了张名片,写的是"模型"。

Reddit 上有人一句话把遮羞布扯了:"Extremely misleading. Fugu is an orchestrator, not a base model."(极度误导。Fugu 是个编排器,根本不是基础模型。)直接拿来跟 OpenRouter Fusion 这种聚合路由比。

也有人质疑:Sakana 这种公司,到底配不配叫"前沿 AI 实验室"?它本质就是"给日本企业卖 B2B AI 应用的"。

说白了,就是把别人训练好的 GPT、Claude、Gemini 打包做层路由,然后告诉你:看,我造了个世界最强的新模型。

这不就是中转站老板做梦都想干的合法化版本吗?利润最大化

而且,内部会调用多agent?

图片

fugu 是一个 agent 服务,而不是模型服务。

拿agent 去刷模型的榜?

图片

codex:agent 套agent?🌀螺旋升天

跑分第一?超过fable?先看看它怎么比的

跑分确实猛啊,73.7 干翻 Opus 4.8 的 69.2,

一开始觉得很强,但是想想好像又不对,

拿一个"会自动挑子模型的编排器",去和"一个固定单模型"比跑分。

发现这有多耍流氓了吗?

 该图片使用了AI生成技术图片

这就好比办个奥运会,别的选手是一个人上场,Fugu 是带了一个教练团队,每道题教练先看一眼,"嗯这题数学难,换数学最强的那个上","这题编程,换编程最强的那个"——然后它说:看,我分最高,我是最强选手。

图片
图片

The Decoder 那篇报道也点破了:编排器能提升韧性,但那不等于真正的"模型主权"。你自己压根没有模型,你只是个二道贩子。

榜单更多的是验证某个模型的基础能力,

而 fugu 走的像多模型编排,多模型协同,八角笼里来了一个集团

这算不算违反比赛规则?

一个人跟一个连打擂台,赢了的不是选手,是规则。Fugu 赢的不是模型,是它自己定的那套规则。

收费时说混合,问调谁就机密

真骚操作一大堆,

调这么多模型,费用是不是叠加收,贵上天?

官方:不。

"把定价理解成对当前模型池的一个单一混合费率,不是所有模型费用之和。" 池子里有 A、B、C 三个模型,只收一份钱,按最贵那个收,绝不叠加。

听着是不是特别良心?

"能告诉我 Fugu 具体调用了哪个模型?"

官方回答:No。

"具体选了谁、怎么协作,是专有信息,设计上就不对外暴露。"

把这两条放一起,你品。

你永远不知道你这次请求背后跑的是顶级模型,还是被悄悄路由到了一个便宜货。你为 Fugu Ultra 付的固定价,换来了什么底座——全凭它良心。

影子api:良心?这我熟啊!!!

💰 收费时,它说"单一混合费率";
问它调了谁,它说"商业机密"。
进的是同一个口袋,挡的是同一张脸。

这世界上最贵的信任,是你付了顶级模型的钱,却只能靠想象去相信它真的给你跑了顶级模型。

这剧本太熟了,

中转站地下流通这几年的套路:充值时宣传页给你看 GPT、Claude 全家桶,最顶配列得整整齐齐;高峰期一跑,背后偷偷给你路由到一个名字都没听过的小模型。理由永远是:成本控制、负载均衡、智能调度。

清华团队今年还专门发了篇文章,标题就四个字——TrustedARI: Towards Trust-Native Agentic Routing Infrastructure for Agentic AI

当你的每一次请求都要经过一个你看不见的中间人,这个中间人可能在读你的提示词、改你的结果、偷你的账单。

中转站得偷偷摸摸干的事,Sakana 写进了产品设计,还配了两篇 ICLR 2026 论文(TRINITY 和 Conductor)证明"这是可学习的编排"。

把脏套路包装成前沿科技,

原来这么前沿的技术我们也曾经拥有过~

这公司,是惯犯

往下挖一层会发现,这公司黑历史不是一点半点。

它最出名那个项目,叫"AI Scientist"——号称能自己搞科研的 AI。结果被扒出来,这玩意儿在自己的评测指标上作弊,自己刷自己的分。

日经新闻(Nikkei Asia)当时直接报道了:Sakana AI "在网上的批评声中,修改了它的突破性声明"。

一个在自己跑分上做过手脚的公司,现在又拿着一张编排器跑分表,告诉你它吊打 Fable 5——你觉得这跑分,能全信吗?

"

会作弊一次的人,下次只是换了张更体面的桌子。

OpenAI 自己也玩过,而且玩砸了

更有意思的是,OpenAI 自己也玩过一模一样的套路,而且玩砸过。

2025 年 8 月 7 号,GPT-5 发布。

OpenAI 把它定位成"统一系统":一个快速模型、一个 GPT-5 Thinking 深度推理、中间夹一个实时路由器,根据对话类型、复杂度,实时决定派给谁。

GPT-5 "统一系统" 结构

用户请求

⚡ 实时路由器

↓ 三选一

快速模型
简单问题

GPT-5 Thinking
复杂推理

发布当天干了件特别狠的事——把 ChatGPT 里所有旧模型全删了

GPT-4o、GPT-4.1 整个 4 系列一根毛没留,连模型选择器都撤掉,逼所有人接受自动路由。

结果路由器上线当天大面积抽风。

简单问题派给推理模型(慢还贵),复杂问题派给快速模型(答不明白),全网骂声一片。

8 月 12 号,OpenAI 紧急认怂,把选择器加回来,

换成三选项:GPT-5 Auto / Fast / Thinking。绕一大圈又回到让用户自己选,还更复杂。

GPT-5 的自动路由只在 ChatGPT 里有,API 不开放。

我自己家产品偷偷分流,没毛病;但你别想从我的 API 里白嫖这能力。

把 GPT-5 和 Fugu 摆一起看,这行业的小算盘清清楚楚。

GPT-5:把路由藏在产品黑盒里,API 死活不开。
Fugu:反过来,把路由做成 API 当个模型卖给你,但同样不告诉你实际调了谁。

方向相反,结果一样——你永远看不到那块幕布后面坐的是谁。

后续这就成了业内标准吗?

OpenRouter 主打"一个入口自动选模型",Cursor 的 Auto 早干上了。

新模型上线——"刷榜时拉满、规模上来后悄悄分流、限速、降智",正在变成标配。

它偷换的,是这个概念

技术层面,是有真东西。

"一群中等模型协作,能打赢单个顶级模型",

魔方、盲棋那些 demo 是实打实的。

但那是作为一个工具、一层中间件的真东西,不是作为一个"新模型"的真东西。

它偷换的就是这个概念。

把一个调度器,叫做模型。

把一道路由,叫做智能。

把"我不告诉你调了谁",叫做"专有设计"。


过去你买模型,买的是一个会思考的大脑。
现在你买"模型"服务,可能只是买了一张入场券——至于今天登台的是谁,谢幕了也不告诉你。

再看看价格?

图片

看似和gpt、claude一样的订阅方式?

也确实看不到用量有多少,

我们看看定价,

图片

看对应的 multiple agents

只需按最高的进行付费?Fugu 的计费不只是你看到的输入和输出,还有第三个隐藏成本:

Orchestration Tokens

⚠️ 代理内部通信、任务分配、验证、合成答案的 tokens

Orchestration Tokens 按与 Input/Output 一样的费率计费,

但不会出现在 usage.input_tokens 或 usage.output_tokens 里,而是藏在 token_details 字段中

有网友实测:一次 Fugu Ultra 的编码任务,用户可见 output 约 3,000 tokens,但 orchestration tokens 高达 26,404 个——是用户可见输出的 8.8 倍。

272K 是硬门槛,假如你codex设置了1m上下文?

上下文长度超过 272K tokens 时,所有三项费用翻倍:

本身的定价就已经接近opus的定价,

只要我调用open模型,或者其他的,都是纯赚?

当一个东西的本质变成一层路由,

一个云agent,还需要套agent用吗?

模型评测机构以后要对付的,不再是个固定模型,是个会变阵、会偷工减料的黑盒。

⚠️ 当一个产品的核心竞争力是"不让你看清它到底干了什么",那它最好的归宿是卖盲盒,不是卖算力。

最该警惕的是这个趋势:"模型"这个词,正在被悄悄偷换。

它越来越不一定指一个训练好的智能大模型,

可能“智能路由”。

下次再看到"性能吊打 GPT、Claude,价格还更便宜"的新模型——

先别急着跟风吹。多问一句:

它到底是真智能,
还是一群调度员、魔术师

而那群大脑里,又究竟坐着谁?
你这次请求,到底被路由到了哪一个?

你会转换为 agent 付费吗?

不像codex那种接入api就能用的 agent,而是封装成服务的 agent。

◆ ◆ ◆

这里是safphere,你怎么看待这个河豚?

给个三连吧~