科思研究

写给法律人/程序员:与AI“开源协议”有关的5个核心问题

科思律师事务所 · 2024-08-09

(图片由AI生成)

4月份,百度大佬李彦宏在圈内引发一场论战。在Create 2024百度AI开发者大会上,李彦宏表示:“开源模型会越来越落后。”

就此引爆了科技圈内关于“开源社区将最终战胜闭源”的一轮辩论。

文章插图

没过多久,“违背祖宗决定”的苹果,号称以“真正开源”的模式,发布了一款名为DCLM的模型,实力非常强劲。

文章插图

(“真正开源”)

但不止一位法律人/程序员告诉我,“开源”“闭源”“开源协议”和“真正开源”这样术语,听得云里雾里的,不知道在说什么。尤其是法律人,在最熟悉的“协议”面前加了个“开源”,瞬间就变得非常陌生。

所以,我整理了以下5个“最少必要知识”,尝试帮大家简要解释一下:

“开源协议”是什么?

常见的开源协议有哪些?

为什么要另外讨论“开源AI”的定义?

苹果的“真正开源”是否符合开源定义?

法律人最关心:违反开源协议,有何法律后果?

文章插图

我们通常说的“开源协议”是什么?

首先要明确的是,我们国家的法律,并未对“开源协议”进行定义。

要理解开源协议,首先请大家一定要牢牢记住OSI这个组织(开源计划组织,Open Source Initiative,简称OSI)。OSI在开源软件发展的历史进程中,凝聚了大量对“开源”的共识,使得OSI在开源定义和开源协议的管理方面,具有相当高的权威性和话语权。它不是一个具有政府背景的组织,但声望很高。

千禧年前后,OSI提出了被广泛接受的10条开源标准,称之为OSD(开源定义,The Open Source Definition,简称OSD),只有符合这十条OSD标准的协议(或者称为许可证),才是一个合格的“开源协议”。我们来看看OSD的这十条标准包含了什么内容:

写给法律人/程序员的OSD简要释义

英文原标题|中文翻译|简要释义

1|Free Redistribution|自由重新分配|允许软件自由销售或赠送,不得收取额外费用。

2|Source Code|源代码|程序必须包括源代码,且能以合理方式获取和分发。

3|Derived Works|衍生作品|允许修改和分发衍生作品,并遵循相同条款。

4|Integrity of The Author’s Source Code|作者源代码的完整性|允许修改源代码,并且允许修改后分发。 一般情况下,不能限制修改后的代码分发;非要限制的话,最多能够要求分发者以【源代码】+【补丁】的方式,进行分发。

5|No Discrimination Against Persons or Groups|不歧视个人或群体|不得歧视任何个人或群体。

6|No Discrimination Against Fields of Endeavor|不歧视任何领域|不得限制程序的使用领域(不管是将程序用于商业还是基因研究,都不应受到限制)。

7|Distribution of License|许可证的分发|A以开源方式获得【X软件】,B从A处获得【X软件】,则B也能够享受【X软件】上附带的与开源有关的权利。

8|License Must Not Be Specific to a Product|许可不得专属于某一产品|从【X软件】中拆分出来的【Y软件】,【Y 软件】的使用和分发需要遵循【X 软件】原有的许可证条款。

9|License Must Not Restrict Other Software|许可不得限制其他软件|【X 软件】有开源许可证,当【X 软件】与【Y 软件】一起分发时,【X 软件】的许可证不能规定【Y 软件】也必须是开源的。

10|License Must Be Technology-Neutral|许可证必须是技术中立的|不限制开源协议的格式(不管是word还是Excel),开源协议中的权利和义务都应当得到尊重和执行。

注1:本表格仅为快速入门之用。如考虑在法律或技术上进一步深究原意的,推荐大家在官网查阅原文自行研读:https://opensource.org/osd。 注2:一般情况下,开源协议和开源许可证都是正确的翻译,本文不作专门区分。 注3:在这些定义之下,OSI官方还认证了超过100个开源协议,详情可在前述官网(尾注4)查询。

据此,我们可以把市面上流传的“开源协议”分为三大类:

(1)经过OSI官方审查批准的“OSI-approved”开源协议;

(2)未经过OSI官方批准,但符合OSD标准的“OSD-compliant”开源协议;

(3)自己手搓的“开源协议”;或者声称自己用了某个“OSI-approved”的开源协议(比如用了阿帕奇协议)但加了很多限制条件进行魔改后的协议。(请自己对号入座,不客气)

文章插图

常见的开源协议有哪些?

常见的开源协议有:GPL、BSD、MIT、Mozilla、Apache和LGPL(特别点名一个非常好笑的WTFPL协议,我不方便在公众号里解释他的中文翻译,有兴趣的自己在下面的图片里找一下,或者自己检索)。

还有一些我们常见的开源协议,用途也并不是在软件领域(比如著名的CC协议[1],其实并不符合OSI对于开源协议的定义,主要用途在于文字、图片、音频、视频等,而不用于软件)。

为了方便大家横向和纵向比对这些协议的异同,我从一个第三方网站上面截了个非常漂亮的表格[2],供大家参考。大家最关心的“能否商用”,也有一个基本的呈现:

文章插图

(出处见脚注2,经豆包浏览器插件翻译)

其中:

绿色○ 代表permissions 许可

蓝色○代表conditions 条件

红色○ 代表limitations 限制

不过需要注意的是,只要是用于【软件领域】的开源协议,不管条款如何约定,原则上都必须符合【OSD标准】,否则就不会被开源社区认为是真正意义上的开源。

此外,还有国内大佬阮一峰做的图[3],对GPL、BSD、MIT、Mozilla、Apache和LGPL的区分描述得非常清晰详实。此处也专门引用过来,供读者参考:

文章插图

尤其有趣的是,大佬的版权声明,用的是:自由转载-非商用-非衍生-保持署名(创意共享3.0许可证,即CC BY-NC-ND 3.0)。大家如果要转载的话,一定要遵守。

文章插图

为什么要另外讨论“开源AI”的定义?

当前的AI,与过去的软件有着非常明显的区别:过去的软件,大多数只包含代码和一些运行程序所必需的图文音频等材料;但当前的AI,主要包括3大部分内容,分别是:

(1)Data information:数据信息,用于训练人工智能的数据集等;

(2)Code:用于训练和运行系统的源代码;

(3)Model:模型参数。

唐卌贰:

那么,这里就会产生一些非常真实的困难。比如:

(1)源代码部分如果适用了某一开源协议,其效力是否及于模型参数和数据信息?

(2)模型参数,是否属于训练数据集的衍生作品?

(3)假设有一份数据集,是用适用某一开源协议AI生成的,那么这份数据集,是否属于AI的衍生作品?

(4)模型源代码、权重参数、数据信息,如果被分别套用不同的开源许可证时,一旦许可证的效力发生冲突,那么它们应该被如何遵守?

(5)当一个AI包含了不同来源的模型源代码、数据信息,或模型参数的时候,应该如何署名?

这些问题恐怕都难以在当前得到解决。

此外,大模型厂商应用现有开源协议的方式,也还没有形成共识:有些号称“开源”的大模型厂商,被开源社区吐槽不是“真正开源”。这些厂商,要么只开源了源代码、参数,不对数据信息进行开源;要么适用了某个开源协议后,对开源协议进行魔改,完全无视开源协议和OSD的要求……

OSI也注意到这个问题:

文章插图

OSI在官网表示,传统的开源代码和许可证的观点不足以保证使用、研究、共享和修改系统的自由。所以正在召集全球专家,准备建立一套共同的原则,为人工智能从业者重新创造开源AI协议。希望在AI领域,也能够像过去的开源协议、开源社区一样,对开源AI的生态起促进作用。

目前,OSI倡议发起的开源AI定义的草稿,已经更新到v.0.0.8(The Open Source AI Definition–draft v. 0.0.8)[4]。

这些与AI开源有关的问题,也许能够在OSI未来推出的定义里得到一定程度的解决。

文章插图

一个实例:苹果“真正开源”的DCLM模型,是否符合开源AI的定义?

文章插图

关于苹果DCLM的背景,可以查看:苹果开源7B大模型,训练过程数据集一口气全给了,网友:开放得不像苹果。

那么,苹果的DCLM,到底是不是“真正开源”的AI呢?

首先,苹果开源了“data”“weight models”和“training code”;

其次,苹果使用的开源协议是自家的Apple Sample Code License,这份协议并未经过OSI认证。那么进一步的,我们需要明确这份开源协议是否符合OSD的十条标准。经过逐条比对,在“自由再分发”和“衍生作品”方面,苹果的许可与OSD存在部分不完全一致的规定,但整体已经非常接近。

最后,在数据集方面,苹果采用cc-by-4.0协议,即仅对数据集的版权来源声明(或者说署名权)做出限制。虽然与开源AI定义的草稿的开源定义存在一定区别,但苹果仅保留了署名权,可以说已经相当地道了。

这样看来,科技圈对于苹果“真正开源”的溢美之词,一点都不过分。

法律人最关心的:违反开源协议,有什么法律后果?

目前国内没有涉及开源软件的法律或司法解释,涉开源软件的案件屈指可数。根据Alpha数据库的检索,以“开源协议”为关键词词,目前仅能搜索到35个命中结果。

文章插图

在广州知识产权法院发布的2021年度十大典型案例之八——济宁市罗盒网络科技有限公司与广州市玩友网络科技有限公司、深圳冠准航科技有限公司、深圳奥斯坦科技有限公司、祥运实业(深圳)有限公司侵害计算机软件著作权纠纷案中,法院的点评字字珠玑,可以用于借鉴思考目前的司法认定倾向,我作全文摘录:

(1)开源软件项目贡献者众多,作为最主要贡献者的管理者有权单独起诉。

(2)已适用开源协议的软件不能撤销先前的许可。

(3)开源软件的最主要贡献者不能在开源协议基础上增加限制商业使用条款。(再次邀请某些声称使用阿帕奇协议,又增加了限制条款的大模型厂商对号入座)

(4)软件源代码不收费,而利用开源软件开发的商业软件可以对其他人使用进行收费。

(5)GPL协议作为最严苛的开源软件授权许可协议,任何使用了GPL协议开源代码的软件再发布时需将软件全部源代码开源而不是仅需公开使用了开源软件部分的源代码。

(6)GPLV3协议是授权方和用户订立的附解除条件的格式化著作权协议,若用户违反协议条款则GPLV3协议终止适用,用户因此获得的授权自动终止,其再使用开源软件已没有法律和合同依据,构成侵权。

此外,近期数据堂《数据知识产权登记证》案件,涉及对CC开源协议法律效果的评价,也很大程度上代表了法院对该协议的适用态度(商业道德)。感兴趣的读者请跳转阅读我们之前的分析:全国首案:《数据知识产权登记证》案的几点启发。

---

参考资料:

[1]https://creativecommons.org/share-your-work/cclicenses/

[2]https://choosealicense.com/appendix/

[3]https://www.ruanyifeng.com/blog/2011/05/how_to_choose_free_software_licenses.html,阮一峰的个人网站

[4]https://opensource.org/deepdive/drafts/the-open-source-ai-definition-draft-v-0-0-8

---

创作团队

作者:陈焕 李琪瑶 唐卌贰

审核:有鲤Legal

往期文章推荐

人工智能

大模型厂商使用用户输入信息训练AI的合规策略http://mp.weixin.qq.com/s?\_\_biz=MzAxMDc0ODY5Mg==&mid=2247485181&idx=1&sn=d0eccc97c4e6f0aa6dc0555dcb4fe925&chksm=9b4ad086ac3d59907f9d2e6549cee5affa3791f6222bbc372ecac270c79a0d0ba43910d38d58&scene=21#wechat_redirect

深夜重磅!OpenAI突然发布SearchGPT,AI 搜索的合规怎么卷?| 附内测申请链接

AIGC律师|AI水平大幅逼近美国,生成物标识的合规监管还会远吗?

律师测评 | 用户创建AI虚拟人角色,平台有哪些责任?

寡姐要告OpenAI:律师评山寨名人声音的商业模式

律师测评 | ChatGPT-4o,让人机之恋走进现实

AI生成声音第一案,给AIGC创业项目的3点教训

律师评测 | 华为手机“AI一键脱衣”

数字经济

全国首案:《数据知识产权登记证》案的几点启发http://mp.weixin.qq.com/s?\_\_biz=MzAxMDc0ODY5Mg==&mid=2247485065&idx=1&sn=983572540d58a03cfed52630c5b9cc1e&chksm=9b4ad0f2ac3d59e43c5224e741ab7d0967bdeb7ea7c83cfdeb32b24a64756588e1c991ca00a1&scene=21#wechat_redirect

数据资产 | 数据资源入表,到底应该如何开展工作?

数据圆桌|数字化智能化改造最新税收优惠政策解读

数据资产 | 公交领域数据入表案例盘点与分析

限期实缴制下出资新方式探索——数据“入表+入股”是否具有可行性?

数据资产新篇章丨隆安广州“数据资源入表实战沙龙”在南沙圆满落幕

文章插图