用受版权保护的作品训练AI是否侵权,三地答案不同。在中国,把作品投喂进模型这个动作本身不当然构成复制,法院把侵权判断放在输出端,看生成物与原作是否实质性相似;在美国,训练可能构成合理使用,但从盗版渠道获取语料这个动作独立构成侵权,Anthropic为此支付15亿美元;在欧盟,问题变成必须按模板公开训练内容摘要,否则面临行政罚款。同一批语料,三地拦截的位置不一样,企业要按最严的那一边准备来源台账。

一车书推过收费闸门交出美元 门头挂着Anthropic星标 店内的AI机器空置未用

7月20日,美国加州北区联邦法院对Anthropic与作者集体的15亿美元和解作出终局批准,同时下了判决。上诉期一过,钱就要开始向40多万部作品的权利人发放。签发这份批准令的法官是Araceli Martínez-Olguín,最早审这个案子的William Alsup已经在去年底退休。

这条新闻在国内很容易被读成两句话:美国人真敢罚,还好我们不在那儿。但如果你在做模型、做微调、做垂类应用,或者干脆在卖语料,这15亿美元换回来的东西,你多半用得上。

它换回来的是三条教训:赔的是哪个动作、钱按什么算、以及花了这笔钱到底买到多大范围的安宁。这三条搬回中国,落点会挪个位置;再带去欧美,又要换一种算法。下面一条一条拆,最后落到你上线之前该改的那几件事上。

第一条教训,赔的是把书搬回家的动作,不是用书训练

先把这个案子的账算清楚。

2025年6月23日,Alsup法官在本案的实体判决里把Anthropic的行为切成两段。第一段是训练:用受版权保护的图书文本训练大语言模型,目的和性质具备典型的转换性,构成合理使用,不侵权。第二段是获取:从LibGen、PiLiMi这两个盗版书库下载数百万本书并且永久留存在中央数据库里,这个动作本身独立构成侵权,事后再去买一本正版也消除不了。

15亿美元赔付的是第二段。

这一点在7月20日的终局批准令里被写得更死。法院在处理异议时载明:Anthropic陈述,LibGen或PiLiMi数据集及其任何部分,均未进入其任何已商业发布的大语言模型的训练语料。这笔钱跟Claude好不好用、赚了多少钱、这些书对模型贡献了多少,统统没有关系。它赔付的是把书搬回家这个动作。

第二条教训,钱按件数算,跟你赚多少没关系

赔偿金额也不取决于你赚了多少。法院核定的作品清单是482,460部,按件平摊每部约3,000美元,法院在批准令里点明这个数字是普通侵权法定最低赔偿750美元的四倍;集体通知里写明的法定赔偿区间是每件200美元到150,000美元。截至4月16日,91.3%的作品已被权利人认领,只有350名成员选择退出。集体律师最初主张20%即3亿美元的律师费,法院最终只核准约1.01亿美元,占基金的6.8%。

件数乘以单价,这就是全部算法。你的模型是否商用、单部作品在几十亿token里占多大权重,在这个公式里没有位置。国内做模型的人习惯按“影响范围”估算侵权赔偿,广州奥特曼案判1万、杭州奥特曼案判3万、美杜莎案判5万,都是这个量级;集体诉讼那套算法一旦启动,同样一批数据的敞口是几个数量级的差距。

赔偿算法示意图 件数482460乘以每件3000美元等于合计15亿美元 与营收无关

第三条教训,这笔钱买到的了断,比看上去窄很多

批准令确认,集体成员放弃的只是过去输入端的请求权,也就是过去的盗版下载与复制,截止到任何AI输出为止。他们没有放弃关于过去AI输出的请求权,也没有放弃针对2025年8月25日之后任何未来行为的请求权。异议方要求把许可机制、输出溯源标注、删除模型写进和解,法院认为超出本案可获救济的范围,全部驳回。作为非金钱救济,Anthropic还要销毁集体成员的盗版副本。

集体范围还严格限于那份作品清单,未列入清单的作品,权利人的请求权原封不动地保留着,已经有作者绕开这份和解单独起诉。

更准确的说法是,Anthropic用15亿美元结清了一段特定时间、特定来源、特定动作的旧账,买到的是这一段的了断,不是一张免于被起诉的通行证。和解在这里更像交了一笔停车罚单,不等于以后随便停。

三条教训搬回国内,闸门要挪个位置

上面三条教训是在美国法下换来的,直接搬到国内会错位。中国法上同样的问题,最新的答案在今年4月29日。

上海知识产权法院对(2025)沪73民终1189号案作出二审判决,维持原判。案情是一名用户截取《斗破苍穹》动漫里美杜莎角色形象图片二十余张,用平台的训练LoRA功能生成两款模型公开发布并对外销售,其他用户借助这个模型能生成与该角色实质性相似的图片。一审是上海市金山区人民法院去年11月3日判的,用户赔偿5万元,平台不担责;原告起诉时要求平台赔偿200万元。

真正值得中国AI从业者抄下来的,是二审对复制权的澄清:

复制权赋予权利人可以禁止他人实施以营利为目的,采取各种方式将作品加以固定的行为,并且这种固定行为应当是形成新的复制件,可以直接或者间接再现作品。因此,复制权本质上是一种“再现权”。

李某为模型训练将Y公司《斗破苍穹》系列动漫中美杜莎角色形象图片输入LoRA模型的行为,只有LoRA模型在用户的指令下再次生成了与所输入的权利作品实质性相似的作品之时,才构成对复制权的侵害。原因在于,只有输出物再现了作品时,才能使他人接触到作品,才完成了对作品的复制。

翻译过来:在中国,把一部作品投喂进模型这个动作,本身还不算复制;要等到模型生成的东西跟原作像到一定程度、并且被别人看到了,复制才算完成,侵权才算成立。

这跟Anthropic案正好是反着来的。美国把闸门装在进料口,你从哪里获取、获取的时候手脚干不干净,是生死线;中国目前把闸门装在出料口,看的是生成物像不像。第一条教训换到国内,得改一个字:在美国要命的是“拿”,在国内要命的是“像”。

同一条流水线两道闸门 左端进料口标美国看你从哪里拿 右端出料口标中国看生成的像不像

同方向还有两个案子可以互相印证。杭州奥特曼案里,一审法院明确表示数据训练阶段使用他人作品原则上是为了学习分析在先作品,并非以再现独创性表达为目的,在无相反证据时可以认为是合理使用,并且提出对数据输入、数据训练宜采取相对宽松包容的标准,对生成内容的输出和使用则宜从严(杭州互联网法院(2024)浙0192民初1587号一审、杭州市中级人民法院(2024)浙01民终10332号二审,判决说理详见环球律师事务所对训练语料著作权风险的梳理)。广州奥特曼案(2024)粤0192民初113号判了平台1万元,但原告要求删除训练集里奥特曼素材的诉请没有获得支持,理由是法院查不到被告实际使用这些作品训练。

这就带出国内最现实的一层:权利人想在训练环节告赢你,先要跨过举证这道坎。模型权重不可逆推,训练完不保留数据集,连你自己都未必说得清当初投喂了什么。爱奇艺2025年1月在上海市徐汇区人民法院起诉MiniMax、索赔约10万元,指控的正是未经授权使用其版权素材训练,一年多过去仍在司法程序中。截至目前,中国还没有一份认定大模型厂商训练语料侵权的生效判决。

输入端的账在国内由另一条线来收

看到这里如果得出国内进料随便拿的结论,就要出事。第一条教训在中国没有失效,只是换了一个人来找你算账。

输入端在中国不是没有规矩,只是这套规矩不由权利人起诉来触发,而由监管来收。《生成式人工智能服务管理暂行办法》第七条把合法来源写成了服务提供者的法定义务:

第七条 生成式人工智能服务提供者(以下称提供者)应当依法开展预训练、优化训练等训练数据处理活动,遵守以下规定:

(一)使用具有合法来源的数据和基础模型;

(二)涉及知识产权的,不得侵害他人依法享有的知识产权;

(三)涉及个人信息的,应当取得个人同意或者符合法律、行政法规规定的其他情形;

(四)采取有效措施提高训练数据质量,增强训练数据的真实性、准确性、客观性、多样性;

(五)《中华人民共和国网络安全法》、《中华人民共和国数据安全法》、《中华人民共和国个人信息保护法》等法律、行政法规的其他有关规定和有关主管部门的相关监管要求。

同一部规章第十九条第一款,规定了你被检查的时候必须交出什么:

第十九条 有关主管部门依据职责对生成式人工智能服务开展监督检查,提供者应当依法予以配合,按要求对训练数据来源、规模、类型、标注规则、算法机制机理等予以说明,并提供必要的技术、数据等支持和协助。

两条合起来的意思很直白:语料来源不合法,在中国通常不是先被权利人起诉,而是先在备案、安全评估和监督检查这一关卡住,走的是责令改正、警告通报、责令暂停服务这条路。国家标准已经把它变成可以逐项核对的指标,GB/T 45654-2025要求开源数据遵循开源协议或者取得授权文件,自采数据须有采集记录、不采集他人已明确禁止采集的数据,商业数据须有具法律效力的交易合同、交易方拿不出来源证明材料的不应使用。

至于合理使用能不能救你,中国的合理使用是封闭列举,《著作权法》第二十四条列了十二种情形加一个由法律、行政法规规定其他情形的兜底项,没有一项写着数据挖掘或者模型训练,总括限制还要求不得影响作品正常使用、不得不合理损害著作权人合法权益。它是被起诉之后的抗辩,不是入库之前的通行证,更不能拿中国法院的宽松论述去解释你在境外的下载动作。

同一批语料出了国门,三个法域拦你的位置各不相同

在美国,问题是钱,也就是前面那三条教训的原产地。盗版书库、破解学术库、影视资源站是红线来源,Anthropic案已经把这类来源明码标价。除此之外还有两条独立于版权的技术红线:美国《千禧年数字版权法》第1201条禁止规避访问控制的技术措施,爬虫绕登录、破验证这个动作本身就可能违规,与后续用得合不合理无关;第1202条禁止故意移除版权管理信息,数据清洗时把作者、来源这些字段一并抹掉,也可能单独成案。责任还在往上游延伸,2025年11月,作者在加州北区法院起诉Together AI,指控它把Books3盗版书库复制进RedPajama开源数据集并促成十九万余次第三方下载。转手的人不能靠“我只是搬运”脱身。

在欧盟,问题是披露。欧盟《人工智能法案》第53条第1款(d)项要求通用AI模型提供者按照欧盟AI办公室的公开摘要模板,公开一份关于训练内容的充分详细的摘要,模板强制使用。8月2日,欧盟AI办公室对这项义务的执法权正式启动,罚则最高可到上一财年全球营业额的3%或者1500万欧元,取高者。摘要里要求列出网络爬取数据中数据量前10%的最相关域名,还要说明有没有设置选择退出机制。换个角度看,这份摘要等于是你自己交给全球权利人的一张维权地图。欧盟这边还认权利人的事前保留,慕尼黑第一地区法院2025年11月11日在GEMA诉OpenAI案里认定歌词进入训练数据构成复制与公开提供,不能援引文本与数据挖掘例外。

三个法域的拦截位置可以并成一张清单:

  1. 中国拦在输出端和行政端。民事上看生成物是否实质性相似,输入端的来源合法性由备案、安全评估和监督检查来收。
  2. 美国拦在获取端。训练可能是合理使用,但盗版下载、规避技术措施、剥离版权管理信息三个动作各自独立成案,赔偿按作品件数乘单价计算。
  3. 欧盟拦在披露端。训练内容摘要必须按模板公开,权利人的事前退出声明必须尊重,违反的后果是行政罚款而非民事赔偿。

三边都要过,就按最严的那一边准备台账。

三个并排关卡 中国是图章和检查表 美国是钱袋 欧盟是清单和放大镜 同一批语料三种拦法

三条教训落到你手上,该改的就这几件事

按角色对号入座:

  1. 自研预训练的模型公司先整理来源清单。按批次列出,每一批能回答从哪里来、凭什么能用、谁批准的、什么时候删除。红线来源该隔离就隔离,隔离和删除的过程都要留下记录。对外采购语料时,合同里必须写进版权保证与全额补偿条款,让供应商为来源合法性背书。做欧盟市场的,训练内容摘要现在就该开始准备,那份东西不是发稿前一晚能写出来的。
  2. 做微调和应用层的公司盯住输出端和用户上传的素材。美杜莎案里平台之所以能够全身而退,靠的是五件事同时做到:用户协议尽到告知、模型发布前有机审、每个模型页面都设置举报入口、收到通知后及时删除屏蔽断链、以及把侵权通知转送给共享了数据的关联平台。最后这一条最容易被遗漏,如果你把用户产出的模型或者图片同步到海外站点、关联产品,转通知就是你的法定附随义务。这五件事缺一件,你就可能从美杜莎案那一侧滑到杭州奥特曼案那一侧,那个案子里的平台被认定帮助侵权,赔偿了3万元。
  3. 卖语料和做数据服务的公司守住授权链路。Together案说明上游会被单独追究。你的核心资产不是数据量,是每一批数据背后那条能够出示的授权链路。
  4. 采购模型的甲方企业在服务协议里锁定三件事。供应商对训练数据来源合法性的陈述与保证、侵权索赔发生时的抗辩与补偿安排、以及你自己输入的数据是否被用于训练、怎么关闭。最后一项国标要求从服务主界面到关闭选项不超过四次点击,验收时可以直接核对。

结尾

今年5月23日在深圳,首批22家出版、传媒、版权和科技单位签署了《人工智能高质量语料库建设公约》,确立先授权后使用的原则,要求所有用于AI训练的文字、图表、图片、音视频提前取得合法版权授权,并且打算引入区块链做全流程留痕。它是行业自律文件,不是法律,你不加入也不违法。

但它改变了一件事:市场上开始有合规语料可以买了。当合法采购渠道客观存在,拿不到授权所以只能爬这句话在法庭上的分量,会一年比一年轻。

回到开头那个问题。Anthropic用15亿美元换来的教训,说到底可以并成一句:训练本身合法,不等于获取过程合法;而获取动作留下的痕迹,比模型权重清楚得多,也保存得久得多。你的模型是个黑箱,你的下载日志、采购合同和爬虫配置不是。

语料这道进料口早晚要装上计量表。自己提前装是成本,等被查处之后再补就是代价。这个价目表,Anthropic已经替全行业付过一次了。


如果你正在训练自己的模型、做垂类微调,或者手里就有一批来源说不太清楚的语料,拿不准在国内和出海市场分别会卡在哪一环,可以通过预约咨询找我聊聊。把来源台账和合同里的责任分配在上线前理清楚,永远比收到律师函之后再补便宜。

参考来源

  1. Bartz v. Anthropic PBC, No. 3:24-cv-05417-AMO(美国加州北区联邦地区法院),《终局批准令及判决》,2026年7月20日(裁定原文PDF
  2. 美联社:Judge approves a $1.5B Anthropic settlement over books used to train Claude,2026年7月21日
  3. Bartz v. Anthropic 和解官方网站(anthropiccopyrightsettlement.com),载集体通知、作品清单与申领截止日
  4. Bartz v. Anthropic PBC 合理使用即决判决,2025年6月23日
  5. 上海知识产权法院(2025)沪73民终1189号民事判决,2026年4月29日;一审上海市金山区人民法院,2025年11月3日(判决说理与专家点评见知产财经报道
  6. 杭州互联网法院(2024)浙0192民初1587号、杭州市中级人民法院(2024)浙01民终10332号民事判决
  7. 广州互联网法院(2024)粤0192民初113号民事判决,2024年2月8日
  8. 《生成式人工智能服务管理暂行办法》(国家互联网信息办公室等七部门令第15号)第七条、第十九条
  9. 《中华人民共和国著作权法》(2020年修正)第二十四条
  10. GB/T 45654-2025《网络安全技术 生成式人工智能服务安全基本要求》
  11. 欧盟《人工智能法案》(Regulation (EU) 2024/1689)第53条第1款(d)项及欧盟AI办公室《训练内容公开摘要模板》
  12. 欧盟《数字单一市场版权指令》(Directive (EU) 2019/790)第4条
  13. 慕尼黑第一地区法院GEMA诉OpenAI案判决,2025年11月11日
  14. 美国《千禧年数字版权法》17 U.S.C. §1201、§1202
  15. James v. Together Computer, Inc., No. 3:25-cv-09578-RFL(美国加州北区联邦地区法院),2025年11月6日
  16. 中国新闻网:破AI语料版权乱象 22家机构共建人工智能高质量语料库,2026年5月24日
  17. 环球律师事务所:生成式AI输入环节的训练语料著作权侵权风险问题,2025年7月17日