OpenAI员工指责马斯克Grok 3基准测试结果具有误导性

三言科技

2025-02-24 13:20发布于河北三言财经官方账号

+关注

三言科技2月24日消息，据报道，日前，OpenAI一名员工指责马斯克xAI发布的Grok 3模型基准测试结果具有误导性。而XAI联合创始人伊戈尔·巴布什金表示公司并无不当。

xAI 在其博客上发布了一张图表，展示了 Grok 3 在 AIME 2025（一项近期邀请制数学考试中的高难度数学题集）上的表现。图表显示，Grok 3 的两个版本 ——Grok 3 Reasoning Beta 和 Grok 3 mini Reasoning—— 在 AIME 2025 上的表现超过了 OpenAI 当前最强的可用模型 o3-mini-high。

不过，OpenaI的员工指出，xAi的图标并未包含o3-mini-high在“cons@64”条件下的 AIME 2025 得分。“cons@64”是指“consensus@64”，即允许模型在基准测试中对每个问题尝试 64 次，并将出现频率最高的答案作为最终答案。

在 AIME 2025 的“@1”条件下（即模型首次尝试的得分），Grok 3 Reasoning Beta 和 Grok 3 mini Reasoning 的得分低于 o3-mini-high。但是xAI仍然宣传Grok 3 是“最聪明的AI”。

对此，巴布金什回应称，OpenAI曾经也发布过类似的误导性基准测试图表。

免责声明：本内容来自腾讯平台创作者，不代表腾讯新闻或腾讯网的观点和立场。