尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

GPT训练数据版权争议:从wikiHow诉OpenAI看模型训练的数据合规与风险

GPT训练数据版权争议:从wikiHow诉OpenAI看模型训练的数据合规与风险 wikiHow 起诉 OpenAI理由是 OpenAI 用 wikiHow 的文章训练 GPT 模型没有获得授权。这个案子在法律上不会很快出结果但它把 AI 行业始终绕不开的问题直接摆到了台面上大模型训练时用的大量公开网页文本到底能不能直接拿去训练如果内容作者主张权利应该从哪个环节切入本文不准备把诉讼细节复述一遍而是从技术、版权、数据合规三个角度拆一个问题当一家大模型公司把全网文本爬进训练集时版权风险到底发生在哪里以及内容方、开发者、普通用户分别该怎么应对。1. 先看争议焦点训练 GPT 时用了 wikiHow 文章问题出在“训练”这一步1.1 wikiHow 是什么为什么它的内容会被训练语料看重wikiHow 是一个图文教程类网站覆盖面很广从修电脑、做饭、整理房间到各种生活技能每篇文章通常有清楚的步骤说明、条目化的操作建议和配图。这类内容有两个特点数量大结构规整而且“自然语言指令”密度高。对训练大模型来说这种内容很受欢迎。模型需要大量文本学习语言规律、指令形式和常识推断wikiHow 这类网站相当于现成的“一步一步教你做某事”语料和后来常见的“指令微调”数据在形态上有相似之处。所以不只是 OpenAI很多做预训练和指令微调的团队都会把这类公开网页纳入候选数据源。原告的主张方向也不难理解你没有经过我同意就把站内文章抓走、整理、放进训练集再用来训练一个商业大模型。问题不在于某一个生成结果是否原样复制了某篇文章而在于训练过程本身使用了这些受版权保护的内容。1.2 数据在训练流程里究竟经历了什么为什么会产生复制问题要理解这个争议先要区分“训练”和“生成”两个阶段。训练阶段模型要读取海量文本把文本切分成 token转换成向量不断调整模型参数。这个过程中训练集通常会被完整保存在本地硬盘上文本会被批量加载进内存反复读取。也就是说即使最终模型不会逐字复述原文训练阶段也必然会对文章做复制、存储、整理和加工。这在版权法上非常关键。生成阶段则不一样。模型收到用户提示后根据学到的概率分布逐步生成 token。它不是在“查数据库”也不是把某篇文章原样抽出来。大多数时候输出的是融合了大量语料统计规律后的结果。只有在某些情况下模型会“记住”训练语料里的长句甚至整段内容并被用户诱导输出出来。所以很多 AI 公司会说“模型不会记住每一篇文章”。这个说法本身没错但它回避了训练阶段的数据复制问题。版权的争议点恰恰发生在训练阶段你把文章放进训练集的那一刻复制行为就已经发生了。1.3 这起纠纷可能同时踩中版权、合同和服务条款三条线类似诉讼通常不会只告一个“著作权侵权”一般会混合多个法律路径。第一是版权侵权。原告需要证明文章属于著作权法保护的作品被告未经许可实施了复制、改编等行为。对 wikiHow 来说单篇文章的步骤性描述有一定独创性配图和版式也能成为独立保护对象。第二是违反服务条款。网站通常会写明“未经授权不得抓取内容用于商业用途”。如果爬虫在抓取时已经违反了网站条款原告可以主张违约或者把条款作为被告“明知未经授权”的证据。第三是数据库权利或不正当竞争。有些法域对数据库有专门保护有些则通过反不正当竞争来回应“大量抓取他人平台数据”的行为。多条路径一起主张是这类案子很常见的设计。原因很简单单打版权认定有难度合同、条款和数据抓取行为能提供更多攻击角度。2. GPT 训练的数据流水线从网页到模型的几个环节版权触点在哪2.1 一条典型的训练数据流水线无论用 GPT、Llama 还是其他开源模型重新训练数据处理流程大体相似主要几步是这样的数据采集。通过爬虫抓取公开网页或直接下载 Common Crawl、网页转储等公开数据集。数据清洗。去掉 HTML 标签、低质量文本、重复内容过滤色情暴力内容也可能去掉某些域名。格式转换。把清洗后的文本整理成统一格式常见做法是一行一段或保留标题和正文结构。分词与编码。把文本切分成 token生成训练样本这一步会构建词表或训练 tokenizer。预训练。用训练样本更新模型参数这个过程会反复读取文本内容。后处理。包括监督微调、人类反馈对齐、评测筛选等。部署。模型上线提供服务用户通过 API 或对话界面调用。版权触点最集中的是第 1 到第 4 步。采集是把网页内容变成自己的副本清洗是把副本保留下来格式转换和分词是把原始表达转换成另一种形式。到第 5 步训练时模型已经在反复学习这些内容了。2.2 每个环节的版权触点这里用一个表格把问题说得更清楚数据流水线环节是否涉及复制潜在版权问题常见抗辩网页抓取是未经许可下载作品副本公开可访问、robots 允许数据清洗是保留、筛选、整理作品技术处理必要步骤格式转换是对作品进行转换和重组机器读取、非人类阅读token 化是将文本切分并映射成数字不直接暴露原文预训练是反复读取并学习作品表达合理使用、转换性使用微调是使用特定领域数据继续学习已获授权或合理使用生成输出不确定可能逐字复制或高度相似模型生成、非训练复制其中“生成输出”是否侵权取决于输出结果和原作品之间是否构成实质性相似以及这种相似能否归因于训练数据。现在很多原告会专门去测模型能不能“背诵”指定文本用来证明训练数据包含自己的作品。2.3 公开可访问不等于可以随便训练一个很容易混淆的地方是网页是公开的搜索引擎可以抓取用户可以直接访问那么 AI 公司也能拿来训练吗从版权法角度看公开可访问解决的是“获取途径”不是“使用授权”。作者把文章发在网上通常只是允许公众阅读、分享并没有当然授权别人下载后用于训练商业模型。就像我公开演讲不代表听众可以把录音拿去训练语音模型。技术上的可及性和法律上的授权是两回事。当然版权法并不是保护所有内容。事实、思路、操作方法本身不受版权保护被保护的是具体的文字表达和独创性编排。wikiHow 的文章有很多事实性步骤但这不等于整篇文章都不受保护。同样的操作步骤换一种写法照样可能有独创性。2.4 文本、事实、表达三者的区别大模型训练中最难判断的其实是“模型到底学到了什么”。如果模型学到的是“醋和小苏打可以疏通下水道”这是一个事实或生活常识原作者不能垄断这个知识。如果模型学到了“作者用了一种很有趣的比喻来描述疏通过程”并且生成的文字和原文高度相似这就可能涉及表达层面的侵权。所以诉讼中不会因为“训练数据里有 wikiHow 文章”就直接判 OpenAI 侵权还要看文章是否构成作品、训练行为是否复用了表达、合理使用抗辩是否成立。这也是这类案子周期很长、不确定性很高的原因。3. “合理使用”为什么是本案最大的不确定项3.1 合理使用的四个判断维度在讨论 AI 训练数据侵权时最常被拿出来救场的是“合理使用”。这个概念在美国版权法里有明确判断框架主要看四个因素使用目的和性质。是商业使用还是非商业使用是转换性使用还是直接替代原作品被使用作品的性质。作品是事实性内容还是高度创造性内容使用的比例。使用了多少内容是否使用了核心部分对原作品市场的影响。是否会影响原作的市场价值、授权收入或潜在流量这四个因素不是“三票胜两票”的简单题而是法官综合权衡。3.2 在 GPT 训练场景下如何争论放在 wikiHow 起诉 OpenAI 这个场景里双方都会有自己的解释。支持 OpenAI 合理使用的一方会说模型不是把文章原样提供给用户而是用海量文本学习语言统计规律这是“转换性使用”不会替代 wikiHow 的阅读流量。支持 wikiHow 的一方会说你是在全球范围内大规模复制网站全部文本目的是训练一个商业产品而且如果用户要求模型生成“某某教程”模型输出可能在结构和内容上直接替代 wikiHow 的页面这会损害原网站的真实广告和授权市场。目前没有能覆盖所有 AI 训练场景的统一答案。不同法院在具体案件里可能会得出完全不同的结论。这也解释了为什么 OpenAI 等公司在某些案件里愿意和解而不愿意把最终判决拖到不可控。3.3 不同法域的差异如果你关注过 AI 版权问题会看到各司法辖区的态度并不一致。美国有比较灵活的合理使用制度法官会做综合权衡。欧洲一些国家在文本和数据挖掘领域设置了一定例外但商用场景的限制更多。部分亚洲国家和地区目前没有专门的训练数据例外条款更多是回到传统著作权法判断。也就是说同样一个爬虫数据集在美国训练和在欧洲数据库里训练法律风险可能完全不同。对一个使用开源模型做二次训练的技术团队来说不能默认“代码开源了训练数据也能随便用”。模型权重开源和数据许可开放是两件事。很多开源模型只开放了模型权重训练数据集要么不公开要么有额外限制。3.4 合理使用不是一句免责咒语我在看技术社区讨论时经常看到一个误区只要我说“这是合理使用”好像就不用担心侵权了。实际上合理使用是一个防御性抗辩不是事先获得的授权。它意味着被告承认确实使用了原告作品但主张这种使用在法律上是合理的。这个判断需要放在具体事实里做而且每个因素都能被双方拿出大量证据拉扯。对创业团队和中小开发者来说把整个产品押在“合理使用”上风险很高。更稳妥的做法是在项目启动前就梳理清楚数据来源明确哪些数据允许商用、哪些只能做研究、哪些需要额外授权。4. 版权诉讼之外内容方和开发者现在能做的合规动作4.1 内容站长用 robots.txt、服务条款和证据留存降低风险如果你运营一个内容网站不希望自己的文章被收集进大模型训练集可以分几步处理。第一步在 robots.txt 里声明禁止 AI 爬虫。这里是一个通用示例User-agent: * Disallow: /wp-admin/ # 禁止常见的 AI 爬虫 User-agent: GPTBot Disallow: / User-agent: CCBot Disallow: / User-agent: anthropic-ai Disallow: /需要注意robots.txt 本质是技术约定主要靠爬虫自觉遵守。它可以在一定程度上减少抓取但不是版权授权文件也不能完全阻止所有爬虫绕过。第二步在网站服务条款里写清楚禁止未经授权的抓取、存储、加工、训练等行为。这一步非常重要因为它把“使用授权”和合同约束绑在一起将来维权时可以作为证据。第三步保存证据。定期保留服务器访问日志、被抓取记录、网页快照。如果发现某个 IP 或爬虫在短时间内大量抓取页面可以截图或导出日志。这些证据在投诉或诉讼中非常关键。第四步如果想给合法使用者留口子可以增加一个“许可申请”通道比如在页面底部写清楚联系邮箱。愿意付费授权的机器人服务商可以直接联系而不是逼着所有抓取都走灰色路径。4.2 开发者给训练数据建一套“来源清单”和“许可证审计”对做模型训练、微调、RAG 检索增强的技术团队我建议从第一天起就做数据来源管理而不是等收到投诉再做。一个简单但有效的做法是每个数据集建一个配置文件记录来源 URL、抓取时间、许可类型、是否允许商用、联系人信息。这份清单叫 dataset card 也好数据集清单也好核心目的是让团队知道“这些数据是从哪来的”。许可类型至少要分成几类完全开放可以商用。可以研究使用但不可商用。可以部分使用但需要署名。明确禁止训练或抓取。来源不明不确定权利状态。对于“来源不明”的数据宁可不用。很多事故都不是因为模型能力不行而是因为团队拿着来历不明的数据直接开跑最后产品上线前被内容方投诉。4.3 输出侧能否追责相似度、记忆检测和溯源除了在输入端规避风险还可以在输出端增加一层检测。一种做法是相似度检测。把模型的输出结果和原始训练数据做模糊匹配如果一段输出和某个网页高度重合就标记为风险内容。这种方法适合内容发布平台也可以作为生成内容的内部质检环节。另一种做法是记忆检测。用一组“隐私探针”问题去测试模型是否背出了特定文本比如某篇新闻的完整段落。如果模型能原样输出说明它对特定文本产生了“记忆”这对 RAG 应用来说可能是质量问题对版权合规来说也是风险信号。对很多中小团队而言不需要训练自己的检测模型。可以先用一个简单的项目准备一批敏感样本批量询问模型用相似度算法计算输出和原文的重合度。不需要精确到逐字匹配也能发现明显问题。4.4 授权合作和 opt-out 机制正在成为行业标配从行业趋势看数据授权已经不只是版权律师的话题而是商业合作的一部分。现在已经有媒体集团、图片库、代码托管平台、学术出版商和 AI 公司签署数据授权协议由平台方代表内容作者向模型厂商提供合法训练数据并收取费用。另一种是 opt-out 机制内容方主动声明“不要把我的内容用于训练”模型厂商在数据采集时排除这些来源。这种机制在技术上是可落地的但效果取决于厂商是否真的遵守以及“退出”程序是否足够简单。对独立内容创作者来说单个作者很难和大公司谈判。更现实的方法是在作品发布时明确版权声明。在平台设置里尽可能选择“禁止 AI 爬取”的选项。保存创作过程记录和发布时间。发现输出内容与自己文章高度一致时保留截图和链接。先别急着写长篇律师函先把证据链做清爽。5. 这个案子真正值得关注的是什么5.1 诉讼短期不会终结但会改变整个行业的数据合规水位wikiHow 起诉 OpenAI 这类案件最值得关注的不是“谁赢了”而是它会倒逼行业把训练数据问题从黑盒变成可讨论的流程问题。过去几年很多团队拿到数据集的第一反应是“能不能跑出好效果”很少问“这些数据从哪来、允许我这么用吗”。大模型时代数据来源和版权状态直接关系到产品能不能上线、能不能商用。一个训练时的疏忽可能变成上线前最麻烦的法律风险。所以我会把这类诉讼看成一次行业规范教育。它提醒所有人大模型是一台需要大量食物才能运转的设备但食物来源必须有票据。5.2 对不同角色的实际影响如果你是应用开发者只调用大模型 API不自己训练模型风险相对小。你处理的是输入和输出而不是训练集。你仍然要注意输出内容是否明显复制了某个来源、是否侵害第三方的既有权利但训练数据版权问题主要在模型服务商那一侧。如果你自己微调模型或收集数据做 RAG就要把数据来源和数据许可当重点。很多自动化采集工具把网页抓下来就灌进知识库连出处都没存这是很危险的。建议在采集端就把 URL、采集时间、作者、许可状态一起存下来。如果你运营内容网站前面说的 robots.txt、服务条款、日志留存、证据固定要尽快做好。就算目前没有发现有人拿你的内容训练也要在技术上保留追责能力。如果你是普通用户用 AI 生成内容发布到公共平台之前做个最基本的检查即可如果生成结果明显是某篇报道或教程的复述不要直接商用。用搜索引擎搜索关键句看有没有一模一样的长句。不用过度担心但也不要在明知高度重合时拿去卖钱。5.3 后续观察清单这个案子和其他类似案件往后推进我会重点关注几个信号观察点说明原告是否要求被告披露训练数据集构成如果法院允许会有更大范围的数据合规讨论被告是否公开列出删除的训练数据来源这会影响 opt-out 机制的可信度是否会有内容平台和模型厂商达成新授权协议授权价格会成为行业基准法院是否对“转换性使用”做明确判断这会影响后续所有大模型训练诉讼训练数据供应商是否加强数据源审计数据中间商会变成新的合规节点这些信号比具体某一笔赔偿金额更有长期价值。5.4 我的态度我的判断是长期来看大模型训练不可能完全避开版权内容但也不可能继续靠“全网随便爬”来维持商业产品。中间路线是清晰的内容方保留选择权模型厂商提供可验证的授权记录数据中间商负责清洗和溯源工具链帮助自动检测风险内容。对普通开发者我更建议把数据合规当成工程问题来做。不要只在收到律师函时才去翻数据来源而是从项目第一天开始就保存记录、建立清单、训练前审计、输出后检测。这套流程能给的不只是安全感也是将来面对疑问时拿得出证据的能力。这个案子开庭后还会有持续讨论。无论结果如何有一点可以确定训练数据已经不是黑盒授权和证据会成为大模型服务的基本配置。
返回列表