美国政府力挺OpenAI,AI版权战进入关键期
AI公司和出版商之间那场关于“机器能不能读书”的争论,正在从企业诉讼层面进入美国版权政策的核心地带。
9月3日,据《华尔街日报》报道,美国政府已向法院提交文件,支持OpenAI在与《纽约时报》等出版商的版权纠纷中的主要立场,认为利用受版权保护的新闻内容训练人工智能模型,可以符合美国版权法中的“合理使用”(fair use)原则。
美国司法部在文件中给出的逻辑相当直接:如果法院大幅收紧AI训练使用版权内容的空间,不只是OpenAI等公司会受到影响,美国整个AI产业都可能被迫改变商业模式。
这场官司因此已经不只是“OpenAI有没有拿《纽约时报》的文章训练模型”。
它实际上在争夺一个更大的问题——训练人工智能的基础数据,到底应该被视为需要逐笔购买的知识产权,还是一种在特定条件下可以适用合理使用原则的数据资源。
美国政府为什么站到了OpenAI一边?
《纽约时报》在2023年12月起诉微软和OpenAI,指控ChatGPT以及微软Copilot大量使用时报内容训练模型,并在回答用户问题时生成与原始作品高度相关的内容。
出版商的核心担忧并不难理解。
如果AI公司可以大规模抓取新闻、书籍、图片和其他受版权保护的内容,然后训练出一个能够替代用户直接访问原始内容的系统,那么传统媒体赖以生存的内容商业模式就可能受到冲击。
问题在于,版权法面对AI训练时遇到了一个旧规则套新技术的难题。
美国司法部现在强调,AI训练对原始作品具有“高度转化性”,而且并不必然损害这些版权作品的市场价值。
这套论证其实抓住了生成式AI最核心的技术特点。
模型并不是简单把几百万篇文章存进一个数据库,用户提问时再把原文检索出来。训练过程会将海量文本转化成模型内部的参数关系,最终形成语言生成能力。
从这个角度看,AI训练和传统意义上的“复制”之间,确实存在一个法律上需要重新解释的距离。
但真正麻烦的地方也在这里。
“训练不等于复制”,并不意味着版权问题消失
如果只讨论模型训练本身,合理使用似乎有比较强的论据。
可一旦把模型输出放进来,事情就复杂了。
如果用户要求模型概括一篇文章,模型提供的是新的表达;但如果模型能够大段复现一篇仍在销售的新闻报道,甚至让用户无需访问原网站就获得完整内容,那么“高度转化性”是否仍然成立,就会变成另一个问题。
这也是AI版权诉讼很难通过一个简单原则解决的原因。
训练、检索、生成和商业替代,其实是四个不同环节。
法院需要判断的不是“AI有没有使用版权内容”这么简单,而是这种使用的目的、方式以及最终产生的市场影响。
美国政府此次提交文件支持OpenAI,更多是在强调训练环节本身不应该被轻易排除在合理使用之外。
这给AI公司留下了相当重要的政策空间。
如果每篇内容都要授权,谁还能训练大模型?
美国司法部提出的另一个理由,更接近产业竞争。
如果法院要求AI公司为训练所使用的大量版权内容逐一支付授权费用,最终可能只有资金最雄厚的科技公司能够承担这种成本。
听起来有点反直觉。
版权保护原本是为了保护创作者,为什么严格执行版权授权反而可能让大公司更强?
因为大模型训练需要的数据规模实在太大。
一个大型模型不是购买几千本书、几万篇文章就能完成训练。它需要海量数据来建立语言、事实、代码和知识之间的关联。如果每一种数据都必须取得明确许可,数据获取成本可能从模型研发的一项基础成本,变成一道极高的准入门槛。
大公司还能买。
创业公司可能直接被挡在门外。
这也是美国政府所担心的产业后果:如果版权授权成为训练AI的必要前提,最终可能形成“只有大型科技公司负担得起数据”的市场结构。
而这与美国希望维持AI产业竞争力的政策方向并不完全一致。
出版商真正害怕的,是AI变成新的流量终点
从媒体行业看,问题又完全不同。
过去互联网已经把媒体从“卖报纸”变成“争夺流量”。搜索引擎、社交平台把用户带到新闻网站,媒体再通过广告、订阅等方式变现。
生成式AI可能进一步改变这条链路。
用户现在可以直接问AI:“今天某个事件发生了什么?”
如果模型能够综合大量新闻来源,给出一篇完整答案,那么用户甚至不需要打开原始新闻网站。
流量入口从搜索框变成聊天框。
这才是出版商真正担心的商业变化。
所以《纽约时报》等媒体争取的并不只是某篇文章有没有被训练,而是一个更现实的问题:如果AI公司利用自己的内容吸引用户,却不向内容生产者支付相应费用,那么未来谁还有动力持续生产高质量新闻?
这也是为什么AI版权之争最终很可能不会停留在“合理使用”四个字上。
它还会继续延伸到授权、分成、引用、来源展示以及AI搜索流量的利益分配。
这可能催生一种新的内容授权市场
即便法院最终支持OpenAI,也不代表出版商和AI公司的商业合作会消失。
恰恰相反。
合理使用解决的是“法律上能不能训练”,但不一定解决“商业上有没有必要付钱”。
AI公司需要实时新闻、专业数据库和高质量垂直内容时,直接购买授权仍然可能比自己处理版权争议更加高效。
过去一年,已经出现越来越多媒体与AI公司围绕内容授权展开合作的商业探索。
这说明未来很可能形成两套并存的体系:
一部分通用训练数据适用合理使用原则;另一部分具有高商业价值、实时性强或者版权边界明确的数据,则通过授权协议进入模型或AI搜索系统。
真正的市场竞争,会发生在两者的边界上。
AI公司也不能把这场官司理解成“免费通行证”
美国政府支持合理使用,对OpenAI来说显然是利好。
但它并不意味着所有AI训练行为天然合法。
法院最终仍然需要根据具体事实判断,包括训练用途、数据使用方式、模型输出以及是否造成原作品市场替代等因素。
更重要的是,AI行业的商业模式正在发生变化。
早期大模型公司强调“尽可能扩大训练数据”,因为模型能力与数据规模高度相关。现在模型越来越强,数据的价值开始分层:普通网络文本可能越来越容易获得,而高质量新闻、专业研究、代码、金融数据和实时信息的重要性反而上升。
这会让版权从一个法律问题,逐渐变成AI产业链里的成本问题。
谁拥有数据,谁就拥有谈判筹码。
谁拥有高质量数据,甚至可能直接影响一个模型在特定领域的竞争力。
这场诉讼最终影响的,不只是OpenAI
美国政府此次站队的真正分量,在于它把案件从一家公司的版权纠纷,拉到了美国AI产业政策的高度。
如果法院认可AI训练具有足够强的转化性,那么美国模型公司获得海量公开网络内容进行训练的空间可能继续存在。
反过来,如果法院对合理使用设置更严格的限制,AI公司就必须大规模转向授权数据。
这会改变整个产业的成本结构。
数据提供方的议价能力会上升,媒体和数据库公司可能获得新的收入来源,而模型创业公司的进入成本则可能明显提高。
甚至连模型之间的竞争方式都会变化——从单纯拼算力和算法,变成拼数据采购、版权关系和内容生态。
现在还无法判断法院最终会如何切分这条边界。
但有一点已经越来越清楚:生成式AI真正昂贵的资源,并不只有GPU。
下一轮AI基础设施竞争,很可能也会围绕“谁有权使用什么数据”展开。
而美国政府这次提交的文件,实际上是在为这个问题划出一条倾向于AI创新的起跑线。接下来,法院要决定的,则是这条线究竟应该画在哪里。