开源许可彻底改变了软件开发,建立了一个基于共享创新与协作的繁荣生态系统。诸如 MIT 和 Apache-2.0 等许可证为开发者提供了一种标准且法律上稳健的代码共享方式,减少了阻力并加速了技术采纳。
今天,我们正处于开放人工智能模型的一个类似拐点。这些模型日益成为研究和工业的基础,但却缺乏相应的许可标准。现有的开源软件许可证在设计时并未考虑人工智能模型,而大多数针对模型的特定许可证要么过于复杂,要么限制过多,或在法律上存在歧义。
为了充分释放开放人工智能的潜力,我们需要一个专为机器学习现实情况而构建的许可证。这就是 OpenMDW 的由来。
为什么人工智能模型需要新的许可证
人工智能模型与传统软件有本质区别。它们是:
- 多种组件的复合体:包括代码、架构、训练数据、权重、文档和评估协议。
- 受重叠知识产权制度的约束:例如版权、数据库权利和商业机密,这些在不同司法管辖区各不相同。
- 在没有统一的“开放”定义的情况下分发:导致了碎片化的许可环境。
这种复杂性导致了大量定制且互不兼容的许可证激增,这些许可证往往:
- 限制再分发、重用或修改。
- 未能解决模型特有的法律细微差别。
- 为开发者和采用者带来不确定性。
结果如何?开放生态系统出现摩擦,法律模糊不清,成为协作和创新的重大障碍。
OpenMDW 的起源
OpenMDW,即“开放模型、数据和权重许可证”(Open Model, Data and Weights License)的缩写,诞生于实施 模型开放框架 (MOF) 的努力之中。MOF 是一个三级分类系统,定义了何为真正的“开放”模型——不仅仅是在有限制或使用约束的情况下提供,而是其代码、架构、参数、训练数据和文档在许可上均保持开放。
为了使 MOF 具有实用性,模型开发者需要一个简单、标准的许可证,就像软件中使用的 Apache-2.0 或 MIT 一样,可以轻松放入任何代码仓库中。这需要一个专门为多种类型内容(包括模型,而不仅仅是代码)构建的许可证。
OpenMDW 的不同之处
OpenMDW 是第一个从底层开始为机器学习模型设计的真正宽松的许可证。以下是它的独特之处:
覆盖整个模型堆栈
它旨在适用于模型发布的所有组件:
- 模型架构
- 参数和检查点 (checkpoints)
- 训练和推理代码
- 预处理和评估数据
- 文档(如模型卡、数据卡)
重要的是,OpenMDW 不强制要求包含所有组件。它仅适用于所分发的内容,同时保持与可能管辖存储库中某些部分的其他多种许可证的兼容性。
(当然,OpenMDW 用户必须继续遵守适用于其存储库中其他现有材料的任何其他第三方许可证,例如通过提供许可证文本和声明、在适用时提供源代码等。)
全面且具有法律依据
OpenMDW 授予广泛的许可权限,包括版权、专利、数据库和商业机密法下的权利,涵盖了与人工智能产物相关的广泛法律权利范围。
它还包括:
- 一项专利诉讼终止条款,以阻止模型材料用户发起专利诉讼。
- 归属要求,以维护来源和信任。
与政策和开源原则兼容
- 旨在与欧盟《人工智能法案》中对“自由和开源许可证”的引用完全一致。
- 支持开源促进会 (OSI) 的 10 条原则,包括自由再分发、源代码可用性、衍生作品以及不对个人或群体进行歧视。
为简洁而设计
- 一个许可证,一个文件,一个位置:仓库根目录下的 LICENSE 文件。
- 没有复杂的许可矩阵:下游用户不会感到困惑。
- 易于集成到任何仓库中:就像 MIT 或 Apache-2.0 一样。
了解 OpenMDW 许可证
定义与范围
OpenMDW 下的“模型材料”包括:
- 模型架构和训练后的参数;以及
- 根据 OpenMDW 提供的所有其他相关材料,可以包括:
- 预处理、训练和推理代码
- 数据集和评估脚本
- 文档、元数据和工具
这一全面的范围直接对应于 模型开放框架 (MOF),确保了如果模型随附了关键要素,则这些要素都在覆盖范围内。
“模型材料”并不旨在作为分发时必须包含的强制性要求。它仅规定了分发内容受该许可证约束,并排除了分发内容中受其他许可证约束的任何部分。
权利授予
OpenMDW 授予“无限制地处理模型材料”的广泛权利,例如包括:
- 使用、修改和分发模型材料
- 在版权、专利、数据库和商业机密法下进行操作
这些权利是免费授予的,没有任何使用领域限制,消除了开发者和企业之间的模糊性。
归属权,而非 Copyleft (传染性开源)
OpenMDW 仅施加最低限度的义务:
- 保留许可证文本
- 保留原始版权和归属声明
没有任何 Copyleft 或“相同方式共享”的条件,这意味着衍生模型和集成可以保持完全宽松。这实现了最大限度的重用和互操作性。
专利保护
为了防止公共资源的滥用,OpenMDW 包含一项专利诉讼终止条款:如果被许可人针对模型材料发起攻击性专利诉讼,其许可证将被撤销。
这反映了开源软件中的最佳实践,并有助于维护一个协作生态系统。
输出不受限制
一项重大创新:使用 OpenMDW 下的模型生成的输出,完全不受模型材料提供商施加的许可限制。
这消除了关于生成的文本、图像、代码或预测是否受到模型提供商限制的困惑——这是现有许可证中常见的不确定点。
如何采用 OpenMDW
采用 OpenMDW 非常简单:
- 将 OpenMDW-1.0 许可证文件添加到您的仓库: LICENSE
- 在 README 中明确指出您的版本是根据 OpenMDW-1.0 发布。
- 确保模型包的所有组件都已涵盖并披露,包括显眼地标注出受其他许可证约束的组件。
为什么现在这很重要
人工智能社区正处于一个拐点。开放模型——从 AI2 的 Molmo 到 Mistral,以及从 DeepSeek 的 R1 到多模态智能体等开放推理模型——正在重塑开放领域的可能性。但它们的许可状态仍然难以界定,因为软件许可证可能无法完全映射到人工智能模型上。
一些使用限制性许可证的开放权重模型已逐渐变得更加宽松;但由于缺乏可用的强大法律框架,模型生产者被迫在设计自己的许可证时倾向于谨慎行事。
在最近的一篇文章中, Nathan Lambert (AI2) 正确地指出:“开源人工智能长期以来的待办事项之一是更好的许可证”,OpenMDW 有助于满足这一需求。
正如 Apache-2.0 和 MIT 成为开源软件的基础许可证一样,OpenMDW 有望成为开放模型的标准。其清晰度、覆盖范围和宽松性降低了开发者的门槛,并为希望在开放基础上负责任地进行构建的公司和研究人员创造了确定性。
这不仅仅关乎法律清晰度,更关乎实现一个充满创新且开放的人工智能生态系统。
访问 openmdw.ai 获取更多详细信息,包括常见问题解答 (FAQ)。