1
59.5万
精华分
2 层引用链锐评超原推
引用罕见书被撕脊扫描训练的长帖,一句“你们还在担心蒸馏?”把政策辩论扳向数据榨取伦理
Chamath Palihapitiya
@chamath
您担心蒸馏吗?
如果这是真的,那就太可悲了。代币最大化的放缓将会阻止这种疯狂行为。
Jul 27, 2026, 09:07 PM·202.1K Views
Hedgie
@HedgieMarkets
🦔人工智能公司正在大量购买善本,通过高速机器进行扫描,切掉书脊,然后粉碎原版。一项名为 ISBNdb 的服务可促成多达 100 万本书的订单,并使买家保持匿名。 2022 年之前的书籍非常优质,因为它们不含人工智能生成的文本。一位联邦法官裁定这种做法属于合理使用,因为消除原始版本意味着一次只存在一份副本。 Anthropic聘请了谷歌图书合作伙伴关系的前负责人来获取“世界上所有的图书”。
我的看法
这让我很感动。一位书商告诉 404 Media,几乎没有幸存的珍本书籍正在被送入这条管道。在战争、火灾和几个世纪的处理中幸存下来的书籍正在被粉碎,以便人工智能可以学习编写更好的营销电子邮件。
ISBNdb 的网站字面意思是“‘人工智能公司销毁了 200 万本书’这不是一个能引起同情的标题”,而且他们仍然围绕着让它悄然发生来建立整个业务。他们提供保密协议作为一项功能。他们指导客户称之为“数字保存”。
我介绍了人工智能公司抓取互联网、下载种子库和窃取音乐的情况。这更糟糕,因为它是不可逆转的。您可以重新上传网站。您可以重印畅销书。一旦有人将 18 世纪植物学文本的最后三份撕碎作为训练数据,您就无法替换它们。法官说这是合法的。所以它会加速。
“我们粉碎善本并提供保密协议,这样就没有人发现”是 2026 年的合法商业模式。多么好的时间表啊。
海吉🤗
Jul 27, 2026, 12:18 AM·7.5M Views











