法国CNIL更新Genmod:开源AI模型的谱系溯源工具
法国数据保护机构CNIL于8月26日发布了Genmod的新版本,这款演示工具用于追溯开源AI模型的祖先与衍生模型,搜索速度更快,数据每周从Hugging Face自动更新。

法国国家信息与自由委员会(CNIL)于2026年8月26日发布了其演示工具的新版本,该工具用于探索以开源方式发布的AI模型之间的谱系关系。此次更新提升了工具的性能和易用性,并实现了数据更新的自动化。除法语版外,现在还提供英语版界面。
以开源方式发布的AI模型可以被下载、修改、用新数据进行专门化训练,或与其他模型组合后再次发布。因此,同一个模型——例如Kimi K3、Mistral Medium或LLaMa——可以衍生出众多派生模型,以至于很难分辨谁源自谁。仅Hugging Face一家平台就托管了约两百万个已发布的模型,这使得辨别哪些模型是知名模型的衍生版本变得更加困难。
追溯一个模型的祖先与后代
这款名为Genmod(意为「模型谱系」)的演示工具,由CNIL的AI部门与其数字创新实验室(LINC)合作开发,最初于2025年11月发布。它可以探索模型之间的关联,找到某一模型的祖先——即该模型的来源模型——以及它的后代,也就是它所贡献衍生出的模型。
这种可追溯性有助于研究AI模型记忆训练数据所带来的后果。具体做法是:从一个已知记忆了个人数据的模型出发,识别其「谱系」中可能同样保留了相同信息的其他模型,从而研究《通用数据保护条例》(GDPR)所规定权利——反对权、访问权或删除权——的行使条件。
搜索速度明显更快
图谱搜索引擎已经过优化,大幅缩短了最广泛搜索所需的时间:一次不限深度的搜索现在平均只需约二十秒。界面会显示搜索进度,并在可以估算时显示预计剩余完成时间。系统可同时处理多个搜索请求,在访问量较大时,用户可以看到自己在队列中的位置。
- 不限深度的搜索:平均约二十秒
- 显示搜索进度,并估算剩余时间
- 可同时处理多个搜索,访问量大时显示排队位置
- 基于Hugging Face公开数据,图谱每周自动更新
- 应用内显示数据最近一次更新的日期
- 下载量最高的模型优先出现在搜索建议中,结果默认按下载量排序
- 应用内各页面新增了直接返回首页的入口
- 在Firefox、Chrome、Edge和Safari上以及不同屏幕尺寸下的页面布局更加统一
一项新的处理流程可以根据Hugging Face上公开的模型与数据集信息重建演示工具的底层数据库,从而实现图谱的每周自动更新,以更好地跟上开源生态系统的快速演变。
一个具体案例:Kimi K3的衍生模型
法国媒体Next给出了一个使用示例:用户可以先输入发布方Moonshot AI的代码仓库名称,再输入模型名称的前几个字母,来查看Kimi K3模型的完整衍生族谱。对于每一个衍生模型,该工具都会标明所采用的衍生方法——例如量化技术,即通过降低源模型权重的精度来减小其内存占用。该工具还可以查找所有使用过某一特定数据集(例如The Cauldron)的模型。此外,专家搜索模式还可以让用户精确选择自己关心的筛选条件。
如果某个个人的个人数据已被一个模型记忆,那么应该如何识别哪些其他模型也可能同样记忆了这些数据?
这种可追溯性在AI模型被指控「复述」受版权保护内容的情况下也可能有用——《纽约时报》与OpenAI之间正在进行的诉讼就体现了这一点,其中哪些模型可能记忆并复述了受保护文本这一问题仍是核心争议。
对于使用开源模型的研究人员和开发者而言,Genmod提供了一种切实可行的方法,可以在模型部署前记录其来源,从而为可能出现的、类似欧盟《通用数据保护条例》所规定的权利主张请求做好准备,而不是事后才被动应对。对于关注数据治理的监管机构而言,该工具也提供了一个具体范例,展示监管者如何将模型可追溯性落到实处:图谱每周都会随着Hugging Face新发布的模型而扩充,这使它成为一个随生态系统同步更新的参考工具,而不是在发布当天就被冻结的静态清单。
信息来源
- IA : la CNIL met à jour son outil de traçabilité des modèles publiés en source ouverteCNIL · 2026年8月26日
- Généalogie des modèles d'IA ouverts : la CNIL propose un outil pour s'y retrouverNext (INpact) · 2026年9月3日



