为了喂 AI,硅谷切掉了两百万本书的书脊

问AI · AI公司为何舍网文而选纸质书作为训练语料?
 SIMONLIN / AI TOOL NOTE 先看判断

给普通人看的 AI 工具学习记录

为了喂 AI,硅谷切掉了两百万本书的书脊

THE SIMONLIN METHOD

看见试过判断
AI 工具小白视角

Hello啊朋友们,我是Simonlin,用通俗易懂的语言,手把手带你玩转AI,提升10倍效率!

先看一个画面

一台液压机,压着一摞书。

操作员按下按钮,咔的一声,整摞书的书脊被齐齐切掉。

装订没了,几百本书变成一摞散纸。

散页送进高速扫描仪,一秒几页,扫完的纸直接当废料打包拉走。


最近它在外网被传疯了

开发了 Claude 的 Anthropic,做着跟视频里一样的事儿。

它们管这个流程叫「破坏性扫描

我看完的第一反应是,这词起得真诚实。

一、

先说说这事的来龙去脉

2024年初,Anthropic 启动了一个内部项目,代号「巴拿马计划」。


图片


流程分四步:

第一步,通过中间商在全球二手书市场批量收书。第二步,切掉书脊。第三步,高速扫描成电子文本。第四步,纸质原件作为废料处理。

规模多大呢?法庭文件披露的数字,大约200万本。

收书的量有多大,有个细节可以感受一下。荷兰一个旧书商,某天收到一笔3000本的订单,他第一反应是自己遇到钓鱼诈骗了,量太大,不像真人买的。

更让书圈破防的是,这200万里有不少绝版书、稀有初版。

卖一本少一本的那种

有书商清库存的时候才发现,自己架上那些压箱底的冷门绝版书,正是AI公司最想要的货。

二、

新闻出来之后,「AI焚书」这个词就上了热搜。

我一开始也觉得,这不就是焚烧吗。

但往下查了一圈,我发现这个说法其实不准。

烧书是把信息毁掉,而这个流程恰恰相反,它把每一个字都完整保留下来了,扫描、识别、存档,一样不少。

信息没死,但是作为载体的纸,确实是被毁了。

那为什么非要毁纸?

因为切了书脊才能过机器,效率最高。 

实体书留着反而占地方,还要付仓储成本。

所以这事更准确的说法不是焚书,更像是采矿。 而采矿这个词背后,藏着一个真正值得琢磨的问题。

好端端的,AI公司为什么要跑去买纸质书?网上什么文本没有。

原因说出来有点黑色幽默——网上的文本,几乎都被AI污染了。

过去这两年,AI生成的内容大量回流互联网。 你随便搜个问题,排前面的回答,很可能就是AI写的。 然后拿AI生成的数据再去训练AI,圈内有个说法叫模型自食

因此,想找确定没被污染过的语料,只剩一个地方——2022年以前出版的纸质书。 那时候还没有今天这波生成式AI,书上每个字都是人敲出来的,干干净净。

所以你看明白了吗

人类花了几千年攒下来的书,在AI公司的账本上,是一批即将枯竭的高品位矿,而且是不可再生矿。 扫完一本,世上就少一本。

更要命的是,这可能是最后一座这样的矿。

2022年之后出的书,写作过程里多多少少都有AI的痕迹。 查资料用它,润色用它,甚至整章都是它起草的。 以后你拿到任何一页新文本,都很难拍胸脯说,这上面每个字都出自人脑。

纯人类的文字,正在变成不再生产的稀缺资源。

所谓巴拿马计划,就是抢在关矿之前扫货而已。

三、

有人会说,纸没了就没了,电子版不是还在吗。

问题就在这

扫描出来的电子文本,存在Anthropic自己的服务器里。它不会公开,你也搜不到。这本书从此以一种你永远读不到的方式「永生」着。

文明的备份,存进了私家公司手里。

说难听点,这是赤果果的,圈占。

其实大规模扫书,谷歌二十年前就干过。

2004年谷歌图书计划启动,跟各大图书馆合作扫了几千万册,被作家团体告了十年,最后法院判了合理使用。

但有个本质区别。谷歌扫的书,原本还在图书馆书架上,谁都能借;扫出来的电子版,所有人都能搜,能看片段,一句话出自哪本书一查便知。

它是把私家的扫描,做成了公共的索引。

Anthropic 全反着来。 纸切了当废料,电子版锁进私库,不开放检索,外人看不到一个字,唯一用途是喂模型。

同样是大规模扫书,一个越扫越开放,一个越扫越封闭,要么说是A÷呢...

这也是为什么最近开始有人号召,趁AI公司还没把绝版书买光,自己赶紧把手里的稀有书扫描存档。

听起来挺荒诞的,普通人拿家用扫描仪,跟硅谷抢时间。

但方向是对的。因为双方抢的是同一种东西,即将消失的原文。

区别只在于,扫完之后,一份锁进私库,一份留在人间。


///