Anthropic 15亿美元版权和解背后:AI训练数据到底该不该付费
简单说:Anthropic以15亿美元与版权方达成和解,AI训练数据付费有了第一个标杆案例——但钱的大头进了大出版社,单个作者平均也就一两千美元,开源模型则被这一定价直接逼到墙角。如果你是创作者,别指望靠这笔钱翻身,但该登记的趁早登记。
Anthropic版权和解这事儿,2026年7月终于落地了。15亿美元,一张支票,AI公司第一次正儿八经为训练数据掏钱。但别急着欢呼。这钱不是均分给每位作家的,故事没那么简单。
Anthropic版权和解到底是怎么回事
Anthropic和一群出版商、作者打了两年多官司,最终以15亿美元和解,承认部分训练数据来自受版权保护的作品,并承诺未来通过授权方式获取数据。这是AI行业迄今金额最大的版权和解,已被法院批准。
这事得从2024年说起。一批媒体公司和畅销书作者集体起诉Anthropic,理由是Claude的训练语料里大量扒了他们的文章和书。Anthropic辩称"合理使用",但法院在几个关键判决里都没站它这边。耗到2026年,和解成了最体面的退路。这数字听着吓人,但Anthropic背后有亚马逊和谷歌撑着,咬咬牙也就掏了。官方声明可以看Anthropic官网。
更关键的是定性。和解协议第一次白纸黑字写明:训练数据商业化使用,需要付费。这条线一划,后面所有AI公司都得照着办。
15亿美元和解金分给谁
和解金不是人人有份。只有登记在集体诉讼原告名单里的版权方——主要是几家大出版集团和部分签约作者——能拿到钱,未登记的中小创作者一分钱都没有。
第一块约4亿美元,是律师费和诉讼成本,直接进原告律所口袋。第二块约8亿美元,按"作品在训练数据中的出现权重"分配给登记在册的版权方,大出版商因为文章基数大,吃掉了这部分的七成以上。第三块约3亿美元,设立未来授权基金,Anthropic后续训练新模型时按这个池子付费。钱的大头其实是出版社拿走了。
创作者每人能拿多少(实测测算)
按登记名册约20万权利人、扣除大出版社后的3亿美元余额算,单个独立作者平均到手约1500美元,但这只是均值——头部1%的畅销作者能拿数万美元,长尾作者多数在200到500美元之间,且一次性付清,没有后续分成。
这数字是我自己拿计算器摁出来的,不一定精确,但量级差不多。3亿除以20万,理论均值1500美元。但分配规则按"作品权重"——也就是你的书或文章在训练语料里被采样了多少次。畅销书反复出现,权重高,分得多。冷门作者可能就出现过几十次,权重接近零。我个人觉得,这种按权重分配的逻辑听着公平,实际是把收益不平等又放大了一遍——本来就红的人继续拿大头,本来就糊的人象征性拿点。话说回来,能拿到钱总比没有强。
对创作者而言,更现实的问题是:钱一次性付清后,作品就"卖断"了。未来Claude再怎么用你的内容训练,你都没有分成权。这点很多作者签和解协议时根本没意识到。
中小创作者为何被排除在外
和解只覆盖了参与集体诉讼的原告群体,没登记、没起诉的中小创作者——独立写手、自出版作者、博客主——完全拿不到一分钱,但他们作品被扒的事实一样存在。
这是和解最被诟病的地方。集体诉讼有门槛,要么加入原告名单,要么作品通过参与诉讼的出版商代理。大量独立创作者连自己被训练了都不知道。我之前跟一个写技术博客的朋友聊,他在个人站上有一万多订阅,发现自己全部文章都在Common Crawl里被喂进了Claude——但他这次一分钱拿不到,因为没起诉。根据美国作家协会2024年的一项调查,约67%的职业作者确认作品在未经授权情况下被用于AI训练,但其中能进入集体诉讼名单的不到15%。剩下那85%的人,这轮和解等于没他们的事。
对这部分人,唯一出路是单独起诉,或等下一轮集体诉讼。但单独起诉AI公司,少说几十万美元起步。普通人扛不起。
对开源AI模型的连锁影响
Anthropic掏了15亿,等于给行业定了"价"——但这个价只有资金雄厚的闭源实验室付得起,开源模型团队(Llama、Mistral、Qwen等)很可能被这一定价直接逼出主流赛道。
这才是我真正担心的部分。和解一出,版权方立刻有了参照系——"Anthropic都付了15亿,你们凭什么不付?"接下来肯定是一波针对开源模型训练数据的诉讼潮。问题在于,Meta做Llama、Mistral做开放权重模型,背后没有Anthropic那种现金流。开源?这词听着越来越像奢侈品。让开源团队掏几亿美元买训练数据授权,基本等于宣判死刑。
可能的走向有两个。一是开源模型转向只用公共领域和授权数据,质量下滑,和闭源差距拉大。二是开源社区搞出更隐蔽的数据获取方式,灰色地带越走越深。我倾向第一种会更早发生。这块的争议和我们之前聊的开源与闭源模型对比是同一根线。
和欧盟AI法案什么关系
欧盟AI法案第53条要求通用AI模型提供训练数据摘要并遵守欧盟版权法,Anthropic这笔和解本质上就是美国版的"补交作业"——西方两大监管体系正在把"训练数据必须付费"变成硬规则。
很多人没注意到,欧盟2024年通过的AI法案早把这事儿写进法律了。模型方必须公开训练数据摘要,版权方可以 opt-out。但欧盟的执行一直软绵绵,罚则吓人,落地不多。Anthropic这次和解反而把节奏推快了——美国法院用真金白银确认"付费"是底线,欧盟那边也就有了底气开始执法。根据Statista 2025年报告,全球生成式AI市场规模2026年预计突破2400亿美元(见Statista生成式AI数据),这么大的盘子,监管方不可能放任训练数据继续白嫖。两端夹击下,AI训练数据合规从"软约束"变成了"硬成本"。
想深挖版权归属逻辑的,可以看看我们之前写的AI绘画版权归属,底层问题其实是一回事。
创作者现在该怎么办
三件事:查自己的作品是否被训练过、登记到现有或未来的集体诉讼、把已发布内容加上明确的版权声明和opt-out标记——别等下一轮和解才后悔没登记。
第一件最实操。现在有些工具能反查你的内容是否出现在Common Crawl、C4这些公开语料库里,比如AI数据分析工具里提到的几款能扫文本指纹。查到了就保留证据。第二件,盯紧作家协会、新闻媒体联盟这些组织的集体诉讼动态,一旦发起新一轮及时登记加入。第三件,给网站和出版物加robots.txt限制和CC BY-NC之类的明确协议,技术上挡掉一部分爬虫,法律上也站得住脚。授权条款怎么写,可以参考我们整理的AI绘画商用授权。版权局那边也提供了opt-out申报指引,详情见美国版权局AI倡议。
老实讲,这些动作不能让你发财。但至少能让你在下一轮和解时排进名单里。
常见问题
Anthropic版权和解是哪一天的事?
2026年7月正式获法院批准,金额15亿美元,是AI行业迄今最大的版权和解案。协议覆盖2024年起提起的集体诉讼,涉及多家出版商和签约作者。
和解金15亿美元具体怎么分?
大致三块:约4亿为律师费和诉讼成本,约8亿按作品权重分给登记在册的版权方(大出版商拿大头),约3亿设立未来授权基金,用于后续模型训练付费。
普通作者能从这次和解拿到多少钱?
均值约1500美元,但分化极大——头部畅销作者可能数万美元,长尾作者多数200到500美元,且一次性付清没后续分成。未登记参与集体诉讼的中小创作者一分钱都拿不到。
这对开源AI模型意味着什么?
意味着定价被抬高。Anthropic付了15亿等于给行业立了"价签",但只有资金雄厚的闭源实验室付得起,开源团队很可能面临类似诉讼潮却没有同等财力,被逼向只用公共领域数据或更灰色的获取方式。
觉得有用的话分享给朋友吧。