Hello啊朋友们,我是Simonlin,用通俗易懂的语言,手把手带你玩转AI,提升10倍效率!
先看一个画面。
一台液压机,压着一摞书。
操作员按下按钮,咔的一声,整摞书的书脊被齐齐切掉。
装订没了,几百本书变成一摞散纸。
散页送进高速扫描仪,一秒几页,扫完的纸直接当废料打包拉走。
最近它在外网被传疯了。
开发了 Claude 的 Anthropic,做着跟视频里一样的事儿。
它们管这个流程叫「破坏性扫描」。
我看完的第一反应是,这词起得真诚实。
一、
先说说这事的来龙去脉。
2024年初,Anthropic 启动了一个内部项目,代号「巴拿马计划」。
流程分四步:
第一步,通过中间商在全球二手书市场批量收书。第二步,切掉书脊。第三步,高速扫描成电子文本。第四步,纸质原件作为废料处理。
规模多大呢?法庭文件披露的数字,大约200万本。
收书的量有多大,有个细节可以感受一下。荷兰一个旧书商,某天收到一笔3000本的订单,他第一反应是自己遇到钓鱼诈骗了,量太大,不像真人买的。
更让书圈破防的是,这200万里有不少绝版书、稀有初版。
卖一本少一本的那种。
有书商清库存的时候才发现,自己架上那些压箱底的冷门绝版书,正是AI公司最想要的货。
二、
新闻出来之后,「AI焚书」这个词就上了热搜。
我一开始也觉得,这不就是焚烧吗。
但往下查了一圈,我发现这个说法其实不准。
烧书是把信息毁掉,而这个流程恰恰相反,它把每一个字都完整保留下来了,扫描、识别、存档,一样不少。
信息没死,但是作为载体的纸,确实是被毁了。
那为什么非要毁纸?
因为切了书脊才能过机器,效率最高。
实体书留着反而占地方,还要付仓储成本。
所以这事更准确的说法不是焚书,更像是采矿。 而采矿这个词背后,藏着一个真正值得琢磨的问题。
好端端的,AI公司为什么要跑去买纸质书?网上什么文本没有。
原因说出来有点黑色幽默——网上的文本,几乎都被AI污染了。
过去这两年,AI生成的内容大量回流互联网。 你随便搜个问题,排前面的回答,很可能就是AI写的。 然后拿AI生成的数据再去训练AI,圈内有个说法叫模型自食。
因此,想找确定没被污染过的语料,只剩一个地方——2022年以前出版的纸质书。 那时候还没有今天这波生成式AI,书上每个字都是人敲出来的,干干净净。
所以你看明白了吗?
人类花了几千年攒下来的书,在AI公司的账本上,是一批即将枯竭的高品位矿,而且是不可再生矿。 扫完一本,世上就少一本。
更要命的是,这可能是最后一座这样的矿。
2022年之后出的书,写作过程里多多少少都有AI的痕迹。 查资料用它,润色用它,甚至整章都是它起草的。 以后你拿到任何一页新文本,都很难拍胸脯说,这上面每个字都出自人脑。
纯人类的文字,正在变成不再生产的稀缺资源。
所谓巴拿马计划,就是抢在关矿之前扫货而已。
三、
有人会说,纸没了就没了,电子版不是还在吗。
问题就在这。
扫描出来的电子文本,存在Anthropic自己的服务器里。它不会公开,你也搜不到。这本书从此以一种你永远读不到的方式「永生」着。
文明的备份,存进了私家公司手里。
说难听点,这是赤果果的,圈占。
其实大规模扫书,谷歌二十年前就干过。
2004年谷歌图书计划启动,跟各大图书馆合作扫了几千万册,被作家团体告了十年,最后法院判了合理使用。
但有个本质区别。谷歌扫的书,原本还在图书馆书架上,谁都能借;扫出来的电子版,所有人都能搜,能看片段,一句话出自哪本书一查便知。
它是把私家的扫描,做成了公共的索引。
Anthropic 全反着来。 纸切了当废料,电子版锁进私库,不开放检索,外人看不到一个字,唯一用途是喂模型。
同样是大规模扫书,一个越扫越开放,一个越扫越封闭,要么说是A÷呢...
这也是为什么最近开始有人号召,趁AI公司还没把绝版书买光,自己赶紧把手里的稀有书扫描存档。
听起来挺荒诞的,普通人拿家用扫描仪,跟硅谷抢时间。
但方向是对的。因为双方抢的是同一种东西,即将消失的原文。
区别只在于,扫完之后,一份锁进私库,一份留在人间。
///