S1上单 发表于 2026-7-29 11:24

美国AI公司的新思路:将古早的书的原件毁掉,扫进AI里,以此企图垄断知识

刚刚在X看到一个令我背脊发凉的事情……
美国的AI 公司正在大量购买稀有的绝版书籍,通过高速机器扫描它们,这些机器会切开书脊,然后将原版书籍销毁??????
为了获取“干净”的训练数据(尤其是2022年之前出版的书,里面几乎没有AI生成的“垃圾文本”,可以避免模型崩溃),AI实验室通过中间商(如ISBNdb等平台)批量采购二手书、绝版书甚至珍稀书籍,订单规模可达成千上万甚至上百万本。买家身份通常保密,并签保密协议。
一些书商(尤其是欧洲二手/古董书商)报告说他们最近收到大量异常订单,深夜下单、随机挑冷门专业书、不问成色、不议价。有些几乎只剩几本的地方史、土著语言文献、冷门科学著作等,可能就这样被毁掉了????
扫描方式是用液压切刀切掉书脊,把散页送进工业高速扫描仪,扫描完后原书直接粉碎或回收。Anthropic(Claude的开发公司)在内部“Project Panama”项目中就这样做过,据法庭文件显示销毁了约200万本实体书。
可以在美国联邦法院在相关版权诉讼中裁定中看到Anthropic合法买下了实体书并销毁了原件(只留下一份数字拷贝),这属于“合理使用”(fair use),不构成侵权。这反而形成了“法律奖励销毁、惩罚保存”的奇怪激励——如果你扫描后还留着原书或公开分享扫描件,法律地位反而更弱。









Nanachi 发表于 2026-7-29 11:29

买纸质书扫描为何能被理解为剽窃

论坛助手,iPhone

古畑任三郎2015 发表于 2026-7-29 11:30

一本不在各级收藏家和博物馆里,存量少到只剩孤本的书
它被扫描数字化不就是最好的归宿

库德里尔 发表于 2026-7-29 11:32

最大的问题是结果并没有进入公有领域

—— 来自 鹅球 v3.5.99

scikirbypoke 发表于 2026-7-29 11:32

数字化了又不放出来,还有说蒸馏完就删的

柊四四八 发表于 2026-7-29 11:33

所有做过扫图的人都知道纸质书扫描电子化本身确实会把书给弄坏

难说 发表于 2026-7-29 11:35

这些书都是公开交易的吧,有没有AI都可以这么干。

2027恭喜发财 发表于 2026-7-29 11:35

发呆的龙虾 发表于 2026-7-29 11:36

如果只进入AI里,那以后就不知道AI给的是真的还是编的吧。

—— 来自 HUAWEI HOP-AL10, Android 12, 鹅球 v4.0-alpha

肥胖的道奇兔 发表于 2026-7-29 11:37

柊四四八 发表于 2026-7-29 11:33
所有做过扫图的人都知道纸质书扫描电子化本身确实会把书给弄坏

现在我的任务包括扫一批30年前档案,都得提心吊胆的生怕纸烂掉

—— 来自 Xiaomi 23117RK66C, Android 15上的 S1Next-鹅版 v2.5.4

hgfdsa 发表于 2026-7-29 11:37

库德里尔 发表于 2026-7-29 11:32
最大的问题是结果并没有进入公有领域

—— 来自 鹅球 v3.5.99

但是这些冷门书本来就没可能进公有领域

prattwhitney 发表于 2026-7-29 11:38

A/毁书扫描这事,只能说弗诺文奇老爷子唯一指定AI预言家,早在《彩虹尽头》里就预见到了。那里面描写更暴力,是一个巨型碎纸机把书全部切碎,然后用风扇吹进一个巨大的箱子里面,箱子四周都布满摄像头,高速拍照,把碎片都拍下来然后用算法合成成原书。这个灵感实际上来自于DNA测序的霰弹枪法。原书里写这种方法非常高效,但是被民众抗议,后来使用了传统的翻页扫描形式。
当然,我非常怀疑A/这帮人实际上是看过《彩虹尽头》获得的灵感。

EP3 发表于 2026-7-29 11:39

从书商手里收的,能有什么值钱的东西哦
东西值不值钱他们自己最清楚了

oyss 发表于 2026-7-29 11:43

数量少难道不是因为价值不大么,圣经也是一本古书你看就没人担心绝版

الطائر 发表于 2026-7-29 11:43

好啊,不问成色、不议价,用AI批量生成孤版书做旧,卖给它们。《卡申银矿编年史》、《五十二军诺曼底日记》、《张拾迈教授论文集》等。

菠萝蛋散 发表于 2026-7-29 11:46

scikirbypoke 发表于 2026-7-29 11:32
数字化了又不放出来,还有说蒸馏完就删的

应该不会删,毕竟算数字资产,会有下次的使用机会就是有价值的。

—— 来自 鹅球 v3.3.96

jojog 发表于 2026-7-29 11:51

所以这就是西大AI的中文输出越来越拉的原因?

看来真是语料吃完了开始降智了

不见不散 发表于 2026-7-29 11:52

midearth 发表于 2026-7-29 11:55

都有ISBN了还会稀缺?

coldhot3 发表于 2026-7-29 11:55

菠萝蛋散 发表于 2026-7-29 11:46
应该不会删,毕竟算数字资产,会有下次的使用机会就是有价值的。

—— 来自 鹅球 v3.3.96 ...

是炼化了,只保留炼的结果。

我爱喵喵 发表于 2026-7-29 11:59

菠萝蛋散 发表于 2026-7-29 11:46
应该不会删,毕竟算数字资产,会有下次的使用机会就是有价值的。

—— 来自 鹅球 v3.3.96 ...

过几天AI公司倒闭了,那剩下的数字资产又怎么算

别说倒闭了自然会有人接手,就古早动画公司倒闭之后,二游厂商想找人联动情怀IP都找不到到底谁能算版权方的事也不少了

heemoon 发表于 2026-7-29 12:00

垄断“知识”

菠萝蛋散 发表于 2026-7-29 12:05

coldhot3 发表于 2026-7-29 11:55
是炼化了,只保留炼的结果。

真以为“喂”了就消失了吗…怎么可能。
训练资料可是重要的资产,这个模型今天成了,还可以有下个模型,模型迭代的时候会不会再用谁也说不准。这种数字化的资产也可以打包了再次出售,打包就可以规避版权之类的,不出售也可以算是某种意义的实体资产,储存成本也不高。

—— 来自 鹅球 v3.3.96

Demi.Albertini 发表于 2026-7-29 12:07

读完一本烧一本?

羊寢 发表于 2026-7-29 12:07

古畑任三郎2015 发表于 2026-7-29 11:30
一本不在各级收藏家和博物馆里,存量少到只剩孤本的书
它被扫描数字化不就是最好的归宿 ...

问题在于扫完ai公司就独占了啊,a/就一直这么做,这点文里也有提到,如果是扫完之后公开共享渠道那还能当成保护性措施,直接自己垄断独占你想要看还得看对方脸色还得付钱,你觉得这没问题?

sanludafu 发表于 2026-7-29 12:10

我爱喵喵 发表于 2026-7-29 11:59
过几天AI公司倒闭了,那剩下的数字资产又怎么算

别说倒闭了自然会有人接手,就古早动画公司倒闭之后,二 ...

书商要是倒闭了卖不出去剩下的书除了打成纸浆难道还有别的处理方式?

kazemitoya 发表于 2026-7-29 12:15

很难不支持加油哟。

awy002 发表于 2026-7-29 12:16

这种问题在社达论坛讨论有什么意义吗

gammatau 发表于 2026-7-29 12:18

jojog 发表于 2026-7-29 11:51
所以这就是西大AI的中文输出越来越拉的原因?

看来真是语料吃完了开始降智了 ...

全人类的文字就这些,没有身体光吃文字大概也就这水平了

bourier 发表于 2026-7-29 12:19

四库全书?
如此古典,如此封建

菠萝蛋散 发表于 2026-7-29 12:19

羊寢 发表于 2026-7-29 12:07
问题在于扫完ai公司就独占了啊,a/就一直这么做,这点文里也有提到,如果是扫完之后公开共享渠道那还能当 ...

我可以接受。

采集公司是把单体书本采集完后销毁,并非采集完了全世界的记录会消失。如果真的是孤本情况那么,我认为真正有用的知识会成为孤本书籍的机会微乎其微,如果按照进化的角度来看,会成为孤本书籍的知识淘汰了也就那样吧。

在我眼中,稀有书籍的价值大部分在于获取难度,而非书籍的内容。稀有书籍内容被采集了也不会消失,要么在以后 ai 的引用中重现片段,要么成为 ai 反馈中的影子,极端点的就是以后采集公司倒闭后来个赛博考古。


—— 来自 鹅球 v3.3.96

Alexmacau8 发表于 2026-7-29 12:19

陈年旧闻了,借AI壳又发一遍。谷狗搞扫描书十几年了 当年就有人抗诉毁书的,实际上大部分都流出来了 zlibrary的书源之一

论坛助手,iPhone

離生離死 发表于 2026-7-29 12:20

怎么又成了社达论坛了有前情提要吗

—— 来自 OPPO PGCM10, Android 13, 鹅球 v3.5.99

gammatau 发表于 2026-7-29 12:28

他们训练图像模型时候能不能把cm没流出的本子扫一下啊

边缘中心 发表于 2026-7-29 12:32

羊寢 发表于 2026-7-29 12:07
问题在于扫完ai公司就独占了啊,a/就一直这么做,这点文里也有提到,如果是扫完之后公开共享渠道那还能当 ...

有一说一,既然这些书是买来的,那说明这些书本来就有是被“独占”的啊,如果不是a/形象过于烂,这些书的下场就是一辈子没人关心吧

sjax001 发表于 2026-7-29 12:36

hgfdsa 发表于 2026-7-29 11:37
但是这些冷门书本来就没可能进公有领域

谁告诉你的?
一句话就否决了像古腾堡计划和archive.org这样的公益性孤本冷门书籍数据化的全部努力。

单脚着地 发表于 2026-7-29 12:49

我小时候看过一个科幻小说的剧情就是这样的,男人的在所有书籍上传网络的信息时代,执着与收藏纸质书籍,旁人都嘲笑他,后来数据都丢失了,大家又去找男主

放大镜 发表于 2026-7-29 12:56

扫书确实先得拆书,否则扫下来纸面都不平,越厚越压不住。切书脊听着好像很粗暴,其实跟拆书没差太多

至于销毁这一步,我支持市售图书价值有限的说法

PEPTIDE 发表于 2026-7-29 13:01

A畜炒作新闻之一
谁信谁是傻逼

前几个月就炒作过一轮了,只能说网民记忆力只有金鱼的水平

放大镜 发表于 2026-7-29 13:04

羊寢 发表于 2026-7-29 12:07
问题在于扫完ai公司就独占了啊,a/就一直这么做,这点文里也有提到,如果是扫完之后公开共享渠道那还能当 ...

大多数人信息渠道有限,想要恶心用户只消堵住管子就好,并不需要真的销毁原件

不信可以看百度文库跟视觉中国
页: [1] 2
查看完整版本: 美国AI公司的新思路:将古早的书的原件毁掉,扫进AI里,以此企图垄断知识