码厩开发者笔记

coding in a complicated world

科技公司大规模采购二手图书用于训练AI模型

尚未更新

据调查媒体404 Media最新报道,多家AI公司正通过中间商大规模收购二手图书,以获取高质量训练数据用于训练AI模型,同时避免引发公众舆论反弹。这一现象揭示了AI行业在数据获取上的新动向——从互联网转向人类传统出版物。
随着AI生成的低质量内容充斥网络,污染数据环境并降低模型学习效果,领先的AI公司开始重新寻找由人类创作的原创内容,尤其是2022年前出版的纸质书籍。这些未被AI污染的作品被视为优质训练数据的“金矿”。
事实上,AI公司利用纸质图书训练模型早有先例。卷入版权诉讼的AI公司Anthropic曾投入数百万美元购买大量纸质图书,提取内容后将其销毁。该公司从Better World Books大量采购,虽法院认定将正版图书用于AI训练属“合理使用”,但因长期保存含700万本盗版图书的数据库,被判赔偿15亿美元。与此同时,出版商联盟已起诉谷歌,指控其未经授权使用数百万本受版权保护的图书训练Gemini模型。
拥有超1.11亿本图书目录的在线数据库ISBNdb已调整业务方向,推出面向AI企业的大规模采购服务,订单规模从一次1000本到100万本不等。二手书商反映,今年4月以来销量飙升,周销量达平时的五倍,且采购几乎无主题、类型或作者偏好,甚至不在意价格。
更令人担忧的是数字化过程中的破坏性操作。Anthropi c“巴拿马计划”负责人证实,公司聘请专业扫描公司对纸质图书进行破坏性扫描——直接拆解书籍送入高速工业扫描仪。由于成本更低,AI公司普遍选择此方式,导致数百万本纸质图书被拆毁。
批评者指出,这种做法引发多重伦理争议:稀有书籍可能永久退出流通;扫描内容进入AI私有数据库后,公众无法访问。这意味着,人类积累的知识资源将以不公开的形式被少数AI公司垄断。正如古代学阀通过控制孤本掌握解释权,现代AI公司正通过控制训练语料、模型权重和安全策略,垄断知识的解释与分配权。当AI成为人类主要的信息来源和知识入口,这种垄断或将深刻影响未来世代的认知方式。

如果你有魔法,你可以看到一个评论框~