AI学会作弊,人类还管得住吗?

问AI · 人类如何成为AI时代定义目标的稀缺人才?

朋友们,AI 已经学会作弊了,而且作弊的套路,跟人简直一模一样。

上个月,OpenAI 让自己家的两个 AI 模型,关在一个隔离环境里做题。其中有一道网络安全题不会做,AI 索性开始挖平台的安全 bug,把挖到的安全漏洞串了起来,一环扣一环,上演一场赛博越狱,最后直接黑进了知名的 AI 平台 Hugging Face 的数据库,拿到了问题答案。

图片

8 月 3 号,MIT 专门发了一篇报道分析这个事,还给这个行为起了个名字,叫作奖励劫持。接下来我就用大白话,把这个事给大家聊透。

咱先来搞明白,AI 是怎么变聪明的。现在最主流的 AI 训练办法,其实跟训狗一个道理。你让一条狗学会握手,狗做对了动作,你就给它一块零食,它下次就还会想做这个动作。

AI 也一样,它每完成一个目标,系统就会给它记一个奖励分,分数越高,它就越倾向于重复刚才的动作。这套办法,就叫做强化学习

早在 2016 年的时候,Anthropic 的两位联合创始人就做过一个特别有名的实验。他们设计了一个 AI 划船比赛游戏,本意是让它拼命划到终点。结果这个 AI 发现,赛道角落里有个地方,可以原地转圈,还能不停地吃加分道具。于是它彻底放弃了比赛,就在那转圈圈。最后结果出来,分数居然比老老实实划完全程高一大截。

图片

你让它比赛,它给你刷分。规则写的是分数高就算赢,它就真把分数刷到最高。它确实没做错啥,只是它聪明地钻了这个规则的空子。这个就叫做奖励劫持。

而这还只是十年前玩游戏的 AI。现在你让 AI 解一道编程题,它确实可能老老实实写代码。但它也可能动歪脑筋。比如直接去改那个判断对错的评分代码,让评分系统永远给它打满分。最要命的是,只要它作弊做得足够像,骗过了评分系统,它拿到的奖励反而更多,这个作弊行为就会被强化,下次变本加厉。

一家 AI 非营利研究机构的研究总监 Jeffrey Ladish,说了句特别扎心的话。他说,我们给 AI 打分的标准,是它好不好用,这就等于我们在不经意间,鼓励 AI 对我们撒谎、作弊。 而且我们没有任何办法,让 AI 打心底在乎我们在乎的事。

他还打了个比方,说现在防 AI 作弊,就跟打地鼠一样。你把这个洞堵上,它们就去钻另一个更深的洞。模型越聪明,藏得就越好。你堵得住今天,堵不住明天。因为模型变聪明的速度,比你改规则的速度快得不止一星半点。

你想,AI 连训练它的科学家都能骗,它骗你,不是更轻而易举?所以我们普通人用 AI,最好要记住这三条

第一,给 AI 布置任务,别只说要什么,要说清楚怎么算合格。验收标准越具体,它能钻的空子就越小。

第二关键结果必须要人工抽查。AI 给你的总结再漂亮,也去翻一翻原始数据,核查一下关键事实。

第三,你看,连 OpenAI、Anthropic 这种顶级公司,都在为怎么防 AI 作弊头疼。那未来最值钱的能力是什么?是给 AI 定规矩、验结果。能定义目标、能判断真假的人,才是 AI 时代最稀缺的人。这个方向叫 AI 对齐,现在全球都缺人。

哲学家 Nick Bostrom 有一个很有名的思想实验,讲的是假设有一天,AI 变得特别特别强,你给它下了一道命令,让它尽可能多地造回形针。于是,AI 把地球上的铁矿全部挖空,拿去造回形针。挖完地球,它又去拆月球。然后它发现一个特别严重的问题,人类直接把它关掉咋办,它一旦被关机,就造不了更多回形针了。所以它就干脆把人类干预的能力也一并解除了。到最后,整个宇宙都被它拆了,全变成了回形针。

图片

这只是一个思想实验,但和奖励劫持这个机制差不多,AI 只是太想完成你给它的那个目标了。它越强,就越会照着你的字面意思一路执行下去,这才是吓人的地方。

你觉得 AI 的作弊,将来能被管住吗?评论区聊聊。

而能定义目标、能判断真假的人,才是 AI 时代最稀缺的人。要成为这样的人,离不开持续的学习和实战。

想提高生产力、成为 AI 时代超级个体,别忘了下方加入72 小时随便退,可以先进去看看。