纽约联邦法院解封的文件曝光了OpenAI与微软内部关于抓取版权内容训练大模型的争议。随着科技巨头普遍遭遇侵权诉讼,AI行业正加速转向合成数据与递归自我改进,人类或正成为最后一茬训练基石。
纽约南区联邦法院解封的一批内部诉讼文件,将 OpenAI 与微软的大模型训练内幕推到了聚光灯下。这批来自《纽约时报》版权诉讼的档案显示,科技巨头不仅深知抓取全网内容训练大语言模型的争议性,更预见到了其对原生内容生态的颠覆性冲击。
解封文件显示,微软应用科学总监布伦特·赫克特(Brent Hecht)曾在内部备忘录中直言,用全网版权内容训练大模型堪称“一场规模前所未有的惊人盗窃”,甚至可能是“人类历史上最大规模的劳动盗窃”。
微软内部测算指出,Copilot 上线后,《纽约时报》域名的访问点击率较传统 Bing 搜索最多下滑了 93%。赫克特在演示文稿中将这种下滑定义为“死亡循环”:下游终端应用严重冲击了上游“内容供应链”的经济命脉,最终反噬模型自身的表现与整个互联网生态。
ChatGPT 负责人尼克·特利(Nick Turley)在沟通中承认,这类产品对出版机构构成了“生存威胁”,其替代属性随着模型能力的增强愈发显著。OpenAI 总裁布罗克曼则表示大模型“非常擅长新闻”。
证据还披露了具体的抓取手段。OpenAI 研究员曾向管理层汇报存在“绕过纽约时报付费墙的技术方法”,并在数据预处理阶段刻意剥离版权声明,以防模型直接向终端用户输出版权提示。仅在公开数据集与双方合作项目中,就涉及数百万份未经授权的媒体专有内容。
利用公开网络与用户资产训练大模型,并非个别厂商的行为,整个人工智能行业正面临密集的法律反弹:
研究表明,大语言模型具备极强的记忆特性,即便仅提供大纲摘要,经微调后的 GPT-4o 或 Gemini 2.5 Pro 依然能逐字复现大量受版权保护的书籍原文。
版权壁垒与人类高质量数据耗尽的现实,正倒逼头部实验室转向新的路径——用 AI 制造数据喂养 AI。
Anthropic 披露的数据显示,其代码库中超过 80% 的生产代码已由 Claude 编写。在其研发自动化等级评估中,AI 独立承担大部任务的研发比例迅速上升,内部平台常态化运行着数万个 AI 智能体。
OpenAI 同样在推进递归自我改进,通过高级模型自动生成合成数据、调优超参数并执行后训练流程,大幅削减了人工研究员的干预成本。
然而,完全摆脱人类数据仍存隐患。《自然》发表的研究指出,若完全依赖递归生成的合成数据迭代训练,模型将陷入“模型坍缩”(Model Collapse),输出多样性收窄、边缘语义消失,最终退化为语法完整但信息空洞的机械复读。
目前主流的技术配方仍需保留 10% 至 30% 的真实人类数据作为锚点,其余部分则由合成数据填充。在高质量合成数据彻底解决坍缩问题之前,人类创作者沉淀的数字资产,依然是支撑大模型进化的关键基石。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断