
DeepSeek是真开源吗
DeepSeek-R1在发布时,开源了模型权重、模型参数、训练框架。但网上也有一些声音认为,DeepSeek难以算是完全的开源,因为它并没有公开训练数据。
但DeepSeek也通过技术报告的方式,公开DeepSeek的GPRO训练算法、目标算法等和技术细节,同时采用宽松的MIT License,不限制商用,能够让其他的AI开发者减少研究和开发成本,也能够借着DeepSeek来改进大模型训练,DeepSeek已经足够有诚意了。
然而,还是有开发人员不能满足于此。在DeepSeek-R1发布不到一周,Hugging Face的研究人员就尝试复现一个更“开放”的DeepSeek。Open R1项目的目的在于构建R1的副本,并将所有的组件开源,包括R1的训练数据等,以便让更多的开发者能够复制和构建R1。

他们的动作也很迅速,截至目前,该团队已经取得了一系列的进展,包括实现GPRO训练,生成合成数据,近日还发布了OpenR1-Math-220k数据集等。

OSI要求开源AI公开训练数据集吗
之所以有人认为DeepSeek不算完全的开源,或许是因为OSI发布的开源AI定义提及了训练数据。
去年10月,开放源代码倡议组织(Open Source Initiative,简称OSI)宣布发布业界首个开源 AI 定义(OSAID)。
开源在过去主要指的是软件程序的开源,但是生成式人工智能的语境下,除了软件程序,还融合了训练数据、模型配置、模型权重等,训练数据也无法与软件源代码等同。因此,OSI认为有必要对开源AI进行定义。

那么,OSI是否要求AI系统开源也要提供训练数据?
根据OSI对开源AI的定义,对机器学习系统进行修改的首选形式必须包括数据信息、代码、参数。
其中,数据信息指的是有关用于训练系统的数据的足够详细的信息,以便技术人员可以构建基本等效的系统。数据信息应根据OSI 批准的条款提供。具体而言,数据信息必须包括:
用于训练的所有数据的完整描述,包括(如果使用)不可共享的数据,披露数据的来源、范围和特征、数据的获取和选择方式、标注程序以及数据处理和过滤方法;
所有公开可用的训练数据的列表以及从何处获取这些数据;以及
从第三方获得的所有训练数据列表及其获取来源(包括收费)。
可以看出,OSI并未要求提供AI系统的训练数据集本身,而是仅要求提供训练数据的描述、来源出处等数据相关信息。
OSI的做法在业内遭受了一些专家学者的质疑,Julia Ferraioli 认为“如果不要求提供数据,那么OSAID所能约束的就只剩下使用和分发AI系统的能力了。”
关于开源AI系统的定义仍在引发热议,随着开源的影响力不断提升,越来越多的AI企业想要参与其中,试图改变开源AI的定义,或许其中一部分原因是出于监管的考虑。

欧盟对开源AI的豁免
根据《欧盟人工智能法案》第2条对适用范围的规定,本条例规定的义务不适用于根据免费且开源许可发布的人工智能系统,除非这些系统作为高风险人工智能系统或属于本法第五条(禁止性人工智能活动)或第五十条(特定人工智能系统)规定的人工智能系统被投放到市场或投入使用的除外。
对于该条提到的“免费且开源许可发布的人工智能系统”的具体内涵,根据《欧盟人工智能法案》的背景介绍部分第102、103项:
免费发布:有偿提供或以其他方式货币化的人工智能组件,包括通过软件平台提供与人工智能组件相关的技术支持或其他服务,或出于改善软件安全性、兼容性或互操作性以外的原因使用个人数据,不应享受免费和开源人工智能组件的例外规定,但微型企业之间的交易除外。
符合法案的开源要求:在免费和开源许可下发布的通用人工智能模型,如果其参数(包括权重)、模型架构信息和模型使用信息都是公开的,则应被视为确保了高水平的透明度和公开性。如果许可证允许用户运行、复制、分发、研究、更改和改进软件和数据,包括模型,但必须注明模型的原始提供者,并遵守相同或类似的分发条款,那么许可证也应被视为免费和开源的。
我国目前的法律,并未对“开源协议”进行定义,但专家学者也对开源AI的法律问题进行了积极探讨。

在去年发布《人工智能示范法2.0(专家建议稿)》中,专家学者针对“开源人工智能的法律责任减免”问题起草条文如下:
第七十一条 以免费且开源的方式提供人工智能研发所需的部分代码模块,同时以清晰的方式公开说明其功能及安全风险的,不承担法律责任。 免费且开源提供人工智能的个人、组织能够证明已经建立符合国家标准的人工智能合规治理体系,并采取相应安全治理措施的,可以减轻或免于承担法律责任。
这两个条款的协调性可能还需要进一步完善,但也能够看得出专家学者们对开源AI的倾向性态度。
正如马斯克一直以来的立场,开源是一种必然的趋势。我们也是开源AI的忠实拥趸,希望DeepSeek这条鲶鱼,能够让更多的大模型加入开源生态的行列中来。
---
作者简介

陈 焕 律师
陈焕律师,《法律人ChatGPT应用指南》作者,北京市隆安(广州)律师事务所律师、隆安湾区人工智能法律研究中心主任、隆安广州数字经济部副部长、广东财经大学法学院人工智能法研究中心兼职研究员、国家工业信息安全发展研究中心《生成式人工智能数据应用合规指南》标准起草人、广州市涉外律师领军人才。

李琪瑶 律师
李琪瑶律师,英语专业八级。现为北京市隆安(广州)律师事务所律师,隆安湾区人工智能法律研究中心研究员。李琪瑶律师擅长人工智能、数据合规、知识产权诉讼和非诉业务、民商事争议解决事务。
---
「AI合规圈」往期文章推荐:
人工智能
三问“中国AI生成物可版权性第二案”
驳回起诉:OpenAI暂时击败了新闻媒体关于AI训练的版权诉讼|附原文和翻译
AI开始关心你的便便,挂上摄像头的马桶,要不要来一个?
爱,死亡,与AI:一个因AI而死的少年
可以控制电脑的Claude3.5,离自己上班还有多远
AI搜索还能不能行了?
拥有钢铁侠的“钞能力”:想知道这个人的名字,看眼镜就行?
Adobe:推出新应用帮助用户拒绝内容用于训练AI模型
德国法院:使用摄影作品训练AI模型不构成侵权
帮你写简历?LinkedIn是如何使用你的个人信息的
加州通过两项法案,保护演员的肖像不被AI模仿
任天堂与宝可梦公司对《幻兽帕鲁》提起专利诉讼
《人工智能生成合成内容标识办法(征求意见稿)》公开征求意见的通知
中国人工智能监管及政策文件汇编
重磅:网安标委颁布《人工智能安全治理框架》1.0版
360儿童手表陷“辱华”风波,儿童智能设备如何做好合规?
利用AI换脸技术破解实名验证,太刑了
最新消息:理想已经报警。AI云诊产品有哪些合规要点?
赛博“照妖镜”:AI魑魅的标识与辨别
秘塔AI:完蛋!我们收到了知网28页的侵权告知函
检察院发文提示人工智能合规问题 | 企业如何防控刑事风险
写给法律人/程序员:与AI“开源协议”有关的5个核心问题
最新消息:理想已经报警。AI云诊产品有哪些合规要点?
赛博“照妖镜”:AI魑魅的标识与辨别
秘塔AI:完蛋!我们收到了知网28页的侵权告知函
不用考证的赛博心理咨询师,有哪些必须做的合规要点?
大模型厂商使用用户输入信息训练AI的合规策略
律师测评 | 用户创建AI虚拟人角色,平台有哪些责任?
寡姐要告OpenAI:律师评山寨名人声音的商业模式
律师测评 | ChatGPT-4o,让人机之恋走进现实
AI生成声音第一案,给AIGC创业项目的3点教训
律师评测 | 华为手机“AI一键脱衣”
数字经济
政府补贴|数据资源入表/人工智能算法备案奖励政策梳理(附原文|广州)
双十一,手可以剁,但千万不可以抖|开屏摇一摇
数据资产 | 数据资源入表,到底应该如何开展工作?
最新发布:《网络数据安全管理条例》1月1日起施行
写在3季度结束前:已有41家上市公司披露数据资源入表情况
最新发布:粤港澳大湾区(内地、澳门)个人信息跨境流动标准合同实施指引
人民法院报:虚拟货币司法处置须规范化
全国首案:《数据知识产权登记证》案的几点启发
喝咖啡前,要如何“走流程”?小程序监管已来
数据资产 | 如何在农业领域发挥数据要素乘数效应
数据资产 | 公交领域数据入表案例盘点与分析
数据圆桌|数字化智能化改造最新税收优惠政策解读
醒醒吧!虚拟币征税=交易合法?
限期实缴制下出资新方式探索——数据“入表+入股”是否具有可行性?
数据资产新篇章丨隆安广州“数据资源入表实战沙龙”在南沙圆满落幕
数据资产|对企业而言,数据资源入表有6大价值
数据合规 | 家长们最在意的“青少年模式”如何做好合规?
影响数字经济领域的指导案例发布,虚拟币交易的未来何去何从?
数据产权规定汇编|国家数据局将推出8项制度文件,涉及人工智能和数据产权
观点汇编 | 数据权益的保护路径
新书资讯
诚邀参编|全新司法解释下侵权责任编实务问答新书
通知查收|《工程老板必备法律锦囊》出书共创群
重磅推荐:《网络犯罪办案实务指南》新书上市
---
《法律人ChatGPT应用指南》,可直接点击下图购买:
