围绕大模型训练数据的版权争议,正在从个别媒体的单点诉讼,演变为新闻行业更集中的法律行动。据 TechCrunch AI 报道,《西雅图时报》和《新闻日报》已对 OpenAI 与微软提起诉讼,指控两家公司未经授权使用其新闻内容训练 AI 模型。
诉讼核心:AI 模型依赖新闻内容,却可能损害新闻生产
起诉书将生成式 AI 形容为“一条吞噬自己尾巴的蛇”,认为它可能“摧毁那些生产被训练内容的机构”。诉讼还称,随着 AI 兴起,新闻行业有可能变得“无法修复地破碎”。
诉状进一步指出,ChatGPT、CoPilot 等产品对外被宣传为内容生产者,但实际上是“贪婪的消费者”,大量吞食人类创作的内容,再向世界输出复制品和衍生模仿,以实现商业目标。
《西雅图时报》起诉的特殊之处
这起诉讼之所以受到关注,还在于《西雅图时报》与微软、OpenAI 之间并非单纯的对立关系。报道提到,微软和 OpenAI 曾资助过该媒体部分新闻项目和奖学金项目。在这种背景下,《西雅图时报》仍然选择起诉,说明新闻机构与 AI 公司之间关于内容授权和收益分配的矛盾,已经难以通过既有合作关系消化。
事实上,这并非新闻机构首次就 AI 训练数据问题向 OpenAI 与微软发难。2023 年,《纽约时报》已就涉嫌版权侵权起诉 OpenAI 及其合作伙伴、投资方微软。随着该案推进,越来越多出版机构开始跟进。
微软回应:感到意外,愿意沟通
针对最新诉讼,微软发言人向 GeekWire 表示,公司“对这起诉讼感到意外”,但“始终愿意坐下来,探索解决此类纠纷的方案”。
这一表态保持了 AI 公司在此类争议中的常见姿态:一方面避免直接承认侵权,另一方面释放谈判信号。不过,随着原告数量增加,行业层面的规则问题已经很难仅靠个案和解解决。
新闻机构为何集体转向诉讼
对出版商而言,问题不只是模型是否“学习”了文章,而是大模型产品开始直接承接用户的信息需求。当用户通过聊天机器人获取摘要、改写和回答时,原本属于新闻网站的访问、订阅和广告收入都可能被分流。
- 训练阶段:新闻内容是否可以在未经许可的情况下进入训练语料;
- 输出阶段:模型是否会复现、改写或总结原报道;
- 商业阶段:AI 产品是否借新闻内容获利,却没有向出版方分配收益。
这些环节共同构成了当前版权诉讼的核心争议。对于依赖原创采编投入的新闻机构来说,如果内容被低成本用于训练,而自身还要承担报道成本,长期来看会削弱新闻生产的经济基础。
行业意义:AI 训练数据争议进入利益重分配阶段
从《纽约时报》到《西雅图时报》《新闻日报》,新闻业对 AI 公司的态度正在从观望、谈判转向更直接的司法路径。这也意味着,大模型训练数据的版权问题已经不只是技术合规问题,而是内容产业与 AI 产业之间利益如何重新分配的问题。
接下来的关键在于,法院是否会将新闻内容纳入更明确的版权保护边界,以及 AI 公司是否会为训练数据建立更清晰的授权机制。对于整个中文内容生态而言,这同样是一个值得提前观察的信号。
原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/you-you-liang-jia-mei-guo-bao-zhi-qi-su-openai-he-wei-ruan