事件背景
今年1月,有报道称OpenAI研究人员认为,DeepSeek可能使用了OpenAI模型的输出来训练R1,这种方法可以在使用较少资源的情况下加速模型能力提升。这一质疑引发了广泛关注,也给DeepSeek带来了不小的压力。
DeepSeek回应
9月18日登上《Nature》封面的论文中,DeepSeek回应称,DeepSeek-V3-Base的训练数据仅来自普通网页和电子书,不包含任何合成数据。在预训练冷却阶段,没有故意加入OpenAI生成的合成数据,此阶段使用的所有数据都是通过网页抓取的。尽管一些网页包含大量OpenAI模型生成的答案,可能导致基础模型间接受益于其他强大模型知识,但已在预训练中针对数据污染进行了处理。
相关影响
此回应受到了一些专业人士的关注。哥伦布市俄亥俄州立大学的AI研究员HuanSun认为,DeepSeek的反驳具有说服力。HuggingFace的机器学习工程师LewisTunstall也表示,现有证据表明仅使用纯强化学习即可获得极高性能。这一事件也再次引发了人们对于AI领域技术竞争与合规边界的思考。

模型情况
DeepSeek-R1基于DeepSeek-V3模型训练,总训练成本约为600万美元,远低于竞争对手的数千万美元。它已成为全球最受欢迎的开源推理模型,在HuggingFace上的下载量超过1090万次,也是首个经过同行评审的主流大语言模型。该论文展示了通过大规模强化学习激发大模型推理能力的重要成果,为相关领域的研究开辟了新思路。
事件意义
这一事件凸显了AI领域竞争的激烈程度。在技术快速发展的当下,对于模型训练数据来源等问题的关注日益增加。DeepSeek的回应不仅关乎自身的声誉和发展,也为整个行业在面对类似质疑时提供了一个参考范例,促使行业更加注重技术的合规性和透明度。
行业思考
此事件引发了全球科技行业对技术竞争与合规边界的激烈讨论。模型蒸馏的法律边界尚未明确,美国现行法律主要保护代码和训练数据,而模型输出的“功能相似性”难以直接构成侵权。此类争议或将推动各国更新AI相关知识产权法规,以更好地规范行业发展。

相关问答
OpenAI为何质疑DeepSeek?
OpenAI公开指控DeepSeek通过“模型蒸馏”技术“违规复制”其产品功能,但未提供具体证据,可能是因竞争压力,DeepSeek在部分垂直场景崭露头角。
DeepSeek如何回应质疑?
DeepSeek回应称,DeepSeek-V3-Base的训练数据仅来自普通网页和电子书,不包含合成数据,预训练中针对数据污染已处理。
DeepSeek-R1模型有什么特点?
DeepSeek-R1基于DeepSeek-V3模型训练,总训练成本约600万美元,是全球受欢迎的开源推理模型,下载量超1090万次,经同行评审。
模型蒸馏是怎么回事?
模型蒸馏是通过训练小型模型模仿大型模型行为的技术,广泛用于提高AI效率与降低成本,但若涉及复制专有模型输出结构或参数可能侵权。
此次事件对行业有何影响?
引发全球科技行业对技术竞争与合规边界的讨论,推动各国更新AI相关知识产权法规,促使行业注重技术合规性和透明度。
DeepSeek在预训练中如何处理数据污染?
虽一些网页含OpenAI模型生成答案,可能使基础模型受益于其他强大模型知识,但DeepSeek称已在预训练中针对数据污染进行了处理。
简短标题:DeepSeek回应蒸馏OpenAI质疑,是怎么回事?
转载声明:欢迎分享本文,转载请保留出处!发布者 财云量化
