客户端
游戏
无障碍

0

评论

2

分享

手机看

微信扫一扫,随时随地看

OpenAI员工指责马斯克Grok 3基准测试结果具有误导性

三言科技2月24日消息,据报道,日前,OpenAI一名员工指责马斯克xAI发布的Grok 3模型基准测试结果具有误导性。而XAI联合创始人伊戈尔·巴布什金表示公司并无不当。

xAI 在其博客上发布了一张图表,展示了 Grok 3 在 AIME 2025(一项近期邀请制数学考试中的高难度数学题集)上的表现。图表显示,Grok 3 的两个版本 ——Grok 3 Reasoning Beta 和 Grok 3 mini Reasoning—— 在 AIME 2025 上的表现超过了 OpenAI 当前最强的可用模型 o3-mini-high。

不过,OpenaI的员工指出,xAi的图标并未包含o3-mini-high在“cons@64”条件下的 AIME 2025 得分。“cons@64”是指“consensus@64”,即允许模型在基准测试中对每个问题尝试 64 次,并将出现频率最高的答案作为最终答案。

在 AIME 2025 的“@1”条件下(即模型首次尝试的得分),Grok 3 Reasoning Beta 和 Grok 3 mini Reasoning 的得分低于 o3-mini-high。但是xAI仍然宣传Grok 3 是“最聪明的AI”。

对此,巴布金什回应称,OpenAI曾经也发布过类似的误导性基准测试图表。

免责声明:本内容来自腾讯平台创作者,不代表腾讯新闻或腾讯网的观点和立场。
举报
评论 0文明上网理性发言,请遵守《新闻评论服务协议》
请先登录后发表评论~
查看全部0条评论
首页
刷新
反馈
顶部