“我的文字不是AI的免费午餐!”Anthropic豪掷15亿美元“赎罪”,给全球数据“白嫖”敲响警钟
Anthropic的妥协绝非个例,它更像是一面镜子,折射出了整个AI行业在数据合规上面临的系统性危机。
近日,美国加州北区联邦法院正式批准作家群体诉Anthropic集体诉讼和解方案,这场持续两年的版权拉锯战终以15亿美元落槌。
图源:视觉中国
在高额和解金之外,真正撼动行业的是,法院判决背后的“逻辑炸弹”:AI仅抓取训练但不留存副本,与批量爬取并永久囤积素材的两种行为,从此被切割为两个完全独立的法律问题——合法阅读抓取可以免责,非法获取囤积必须重罚。
Anthropic之外,AI巨头们正集体承压。7月10日,阿歇特、圣智、爱思唯尔三大国际学术出版集团联合知名作家,在纽约联邦法院起诉谷歌,指控其未经许可抓取数百万册期刊和图书,并删除作品版权元数据用于模型训练。同时,OpenAI也持续面临来自《纽约时报》和美国作家协会的双重诉讼,双方长达两年多的授权谈判至今未能达成共识;Meta的Llama系列模型,同样深陷版权争议的漩涡中。
这次的判决,恰恰是全球科技公司、版权方和监管机构最需要厘清的那条“合理使用”红线:AI要进化,作者要吃饭,到底有没有第三条路?
15亿美元,究竟在赔什么?盗版存储是核心侵权原罪
这笔天价和解金的核心,指向了AI训练数据获取方式的合法性问题。
2025年6月23日,主审法官William Alsup在一份简易判决中提出了关键性意见,该意见将AI数据抓取行为清晰地划分为两种截然不同的性质:一种是合规行为,即通过官方渠道购买正版书籍,仅用于训练模型的语言能力,过程中不进行复制、不留存底本,这被视为“合理使用”;另一种则是侵权行为,即批量爬取盗版资源,并永久存档海量图书,建立数字仓库进行囤积,法官明确指出,这种行为不能用“合理使用”作为挡箭牌。
法官的逻辑在于,即便Anthropic囤积并留存盗版书籍的初衷是训练模型,但这些盗版副本的存在,本身就构成了对正版市场的潜在威胁。它们可能导致读者减少购买正版书籍,从而蚕食作家的版税和出版社的营收。因此,15亿美元的和解金,实质上是对Anthropic过去“非法获取和囤积”盗版数据行为的惩罚。
对于这一判决,前科幻杂志编辑、科幻小说创作者魏先生对时代财经表示,这一判决为AI训练数据的法律边界提供了重要的参考。他认为,创作者公开作品本是一种促进思想交流的自愿行为,但这并不意味着其权利可以被忽视。
“无论是实体还是电子形式,作品一旦公开,就附带了创作者设定的规则。如果AI未经许可进行抓取,我认为这确实侵犯了作者的权利。”魏先生指出,尽管现有法律对此的界定尚存模糊地带,但此次判决至少推动了相关法律边界的清晰化,为保护创作者权益迈出了关键一步。
天价和解金只是开始?法院给Anthropic划下三条“生死红线”
15亿美元的和解并不意味着Anthropic可以高枕无忧。事实上,法院给Anthropic设下了三条不可逾越的红线:永久关停盗版素材数据库、留存完整凭证、开展第三方溯源审计,以确保其数据合规体系的真实有效。
Anthropic的妥协与整改绝非个例,它更像是一面镜子,折射出了整个AI行业在数据合规上面临的系统性危机。
近两年,AI厂商粗放式、无授权抓取训练数据的模式,已经持续触发创作者与出版机构的大规模维权行动。根据最新全球版权诉讼汇总数据,截至2026年5月,全球在审AI版权相关诉讼共计112起,其中近八成案件集中在美国本土。
矛盾为何会如此尖锐?究其根本,大模型的迭代升级高度依赖海量文本,如果每一本书都单独找版权方签约,研发成本将呈指数级暴涨,但另一边,版权方也拿不出一套面向AI行业的统一授权窗口,普通作家更没有与科技巨头平等谈判的筹码。于是,双方陷入了一个难以解开的死结——一边是企业嫌授权太贵、太慢,一边是创作者愤慨被“白嫖”且无处说理。
这种信任危机在版权行业内普遍存在。IFRRO(国际复制权组织联合会)的调查发现,近八成作家和机构对AI未经许可的抓取行为表示担忧,其中超过七成的受访者认为,矛盾的根源恰恰在于AI公司版权意识的缺失。
前科幻杂志编辑、科幻小说创作者魏先生对时代财经表示,这种担忧的核心,在于AI的“模仿”正在侵蚀原创的根基。他认为,这不仅限于文字领域,AI对图像、音乐等艺术形式的模仿,同样对原创构成了威胁。
“很多绘图AI模型的训练数据也来自艺术家的创作,但艺术家们是否同意将自己的作品作为数据源?训练出的AI作品在画风上与原作者相差无几,这本身就是对画家创意的一种危害和侵犯。”魏先生强调,问题的关键在于,现有法律是否对AI的训练数据源提供了充分的保护。
他建议,未来需要建立更清晰的标识体系,例如,创作者可以明确标注其作品“不允许AI抓取”,而AI生成的内容也应被明确标识出来,以便公众区分。“AI创作虽然便捷,但它缺乏人类创作中那种原始而真诚的情感。只有理清这些界限,才能构建一个健康的创作生态。”
敲响警钟!国内大模型如何走出“先上车后补票”的困局
海外 15 亿美元的天价罚单,不仅是Anthropic的教训,更是悬在大模型企业头顶的警钟。
中国《生成式人工智能服务管理暂行办法》第七条明确规定,生成式AI服务商必须使用具备合法来源的训练数据,并留存完整的溯源台账。然而,规定与现实之间仍存在差距。
中国信息通信研究院白皮书曾指出,头部大厂92%已搭好合规骨架,可中小公司的合规率不到二成,2026年,国内AI版权案件暴涨216%,其中41%的纠纷导火索与本次Anthropic案件如出一辙。
这一组反差的数据,精准戳中了国内AI产业在合规转型期的隐患。当头部企业已将合规视为生存底线时,大量中小公司仍深陷“先上车后补票”的惯性思维,将盗版数据视为降低研发成本的捷径。
就在今年6月,千余名网文作者共同签署《网络文学反抄袭倡议书》,直指AI洗稿、恶意搬运等新型侵权乱象,呼吁平台建立更严格的审查机制。同月,国家版权局等四部门联合启动“剑网2026”专项行动,明确将人工智能领域的版权整治列为重点,严厉打击利用AI工具进行“洗稿”“魔改”等违法行为。
在司法实践上,上海市高级人民法院5月发布了全国首例AI洗稿刑事案,以非法经营罪对涉案团伙判刑,明确了“技术中立不阻却刑事责任”的司法导向。
在社会关注、平台监管与法律重拳的共同推动下,国内大模型企业正在加速纠错补漏。
中国信息通信研究院发布的白皮书数据显示,2025年国内合规中文语料市场规模已冲至32.6亿元,同比增速超过40%。一个正规的版权授权市场正在形成。对国内大模型企业而言,越早将数据溯源和授权系统打造成基础能力,就越能避免在模型进入规模化商业阶段后,为早期的数据捷径支付更为高昂的代价。
海外市场的现状同样印证了这一趋势。Omdia的数据显示,当前合规数据授权成本已占据海外头部大模型总研发投入的35%,预计到2026年末,这一比例将攀升至45%。这意味着,未来用户支付的AI订阅费中,将有近一半并非用于算力消耗,而是为合法使用数据买单。
随着过去野蛮生长的低成本路径彻底走不通,一场“抢版权”的军备竞赛已悄然开启。各大厂商正疯狂与出版集团签署长期协议,批量采购合规语料,以此构筑产品护城河。
2026年5月,由中国大百科全书出版社牵头,人民出版社、人民文学出版社、中信出版集团等首批22家权威单位,联合签署了《人工智能高质量语料库建设公约》,确立了“先授权,后使用”的行业底线。
未来,创作者或许无需再单打独斗地维权,而是通过集体管理组织统一向AI公司发放年度许可,并根据实际使用频次进行分账。这不仅是解决海量数据授权难题的终极方案,更是重塑健康AI创作生态的必由之路。从“先用了再说”到“先授权再用”,在国内外司法判例与监管行动的共同催化下,AI行业的数据合规之路,方向已经明确。
本网站上的内容(包括但不限于文字、图片及音视频),除转载外,均为时代在线版权所有,未经书面协议授权,禁止转载、链接、转贴或以其他 方式使用。违反上述声明者,本网将追究其相关法律责任。如其他媒体、网站或个人转载使用,请联系本网站丁先生:news@time-weekly.com