La CNIL met à jour Genmod, son outil de généalogie des modèles d'IA ouverts
La CNIL a publié le 26 août une nouvelle version de Genmod, son démonstrateur qui retrace les ascendants et descendants des modèles d'IA en source ouverte, avec des recherches accélérées et des données actualisées chaque semaine depuis Hugging Face.

La Commission nationale de l'informatique et des libertés (CNIL) a publié le 26 août 2026 une nouvelle version de son démonstrateur permettant d'explorer la généalogie des modèles d'IA publiés en source ouverte. Cette mise à jour améliore les performances de l'outil, son ergonomie, et automatise l'actualisation des données. Une version en anglais de l'interface est désormais disponible, en plus du français.
Les modèles d'IA publiés en source ouverte peuvent être téléchargés, modifiés, spécialisés avec de nouvelles données ou combinés avec d'autres modèles avant d'être remis à disposition. Un même modèle — par exemple Kimi K3, Mistral Medium ou LLaMa — peut ainsi être à l'origine de nombreux modèles dérivés, au point qu'il devient difficile de savoir qui provient de qui. Hugging Face héberge à lui seul environ deux millions de modèles publiés, ce qui rend d'autant plus difficile de repérer lesquels sont des dérivés des modèles les plus connus.
Retrouver les ascendants et les descendants d'un modèle
Le démonstrateur, appelé Genmod (« Généalogie des modèles »), a été développé par le service IA de la CNIL en collaboration avec son Laboratoire d'innovation numérique (LINC), et initialement publié en novembre 2025. Il permet d'explorer les liens entre modèles et de retrouver les ascendants d'un modèle donné — les modèles dont il provient — ainsi que ses descendants, c'est-à-dire les modèles auxquels il a contribué.
Cette traçabilité est utile pour étudier les conséquences de la mémorisation de données d'entraînement par les modèles d'IA. Il s'agit d'identifier, à partir d'un modèle ayant mémorisé des données personnelles, les autres modèles de sa « généalogie » susceptibles d'avoir conservé les mêmes informations, afin d'étudier les conditions d'exercice des droits prévus par le RGPD — droit d'opposition, d'accès ou d'effacement.
Des recherches nettement plus rapides
Le moteur d'exploration du graphe a été optimisé, ce qui réduit fortement le temps des recherches les plus étendues : une recherche sans limite de profondeur prend désormais une vingtaine de secondes en moyenne. L'interface affiche la progression d'une recherche et, quand elle peut être estimée, le temps restant avant achèvement. Plusieurs recherches peuvent être traitées simultanément, et en cas d'affluence l'utilisateur voit sa position dans la file d'attente.
- Recherche sans limite de profondeur : une vingtaine de secondes en moyenne
- Progression affichée, avec estimation du temps restant
- Recherches simultanées, avec position dans la file d'attente en cas d'affluence
- Actualisation automatique et hebdomadaire du graphe depuis les données publiques de Hugging Face
- Date de la dernière mise à jour des données affichée dans l'application
- Modèles les plus téléchargés proposés en priorité, résultats classés par défaut selon le nombre de téléchargements
- Accès direct à la page d'accueil ajouté depuis les différentes pages de l'application
- Mise en page homogénéisée sur Firefox, Chrome, Edge et Safari, et sur différentes tailles d'écran
Un nouveau procédé permet de reconstruire la base du démonstrateur à partir de données publiques relatives aux modèles et jeux de données disponibles sur Hugging Face, ce qui automatise l'actualisation hebdomadaire du graphe pour mieux suivre l'évolution rapide de l'écosystème open source.
Un exemple concret : la descendance de Kimi K3
Le média Next donne un exemple d'usage : on peut inspecter la descendance du modèle Kimi K3 de l'éditeur Moonshot AI en tapant d'abord le nom du dépôt de l'éditeur, puis les premières lettres du modèle, pour afficher son arbre généalogique complet. Pour chaque modèle dérivé, l'outil précise la méthode ayant permis la dérivation — la quantisation, par exemple, qui réduit la précision des poids du modèle source pour diminuer son empreinte mémoire. L'outil permet aussi de retrouver tous les modèles ayant utilisé un jeu de données donné, comme The Cauldron. Une recherche experte permet par ailleurs de sélectionner précisément les critères qui intéressent l'utilisateur.
Dans le cas où les données à caractère personnel d'un individu seraient mémorisées par un modèle, comment est-il possible d'identifier les modèles par lesquels ces données seraient également susceptibles d'être mémorisées ?
Cette traçabilité peut aussi être utile en cas d'accusations de régurgitation de contenus sous copyright par un modèle d'IA — un enjeu illustré par le procès en cours entre le New York Times et OpenAI, où la question de savoir quels modèles ont pu mémoriser puis restituer des textes protégés reste centrale.
Pour les chercheurs et les développeurs français qui manipulent des modèles open source, Genmod donne un moyen concret de documenter la provenance d'un modèle avant de le déployer, et d'anticiper une éventuelle demande d'exercice de droits RGPD plutôt que de la découvrir après coup. Pour la CNIL elle-même, l'outil sert de démonstrateur pour instruire ses futures positions sur l'IA open source : chaque semaine, le graphe s'enrichit des nouveaux modèles publiés sur Hugging Face, ce qui en fait une référence qui s'actualise au rythme de l'écosystème plutôt qu'un inventaire figé au jour de sa publication.
Sources
- IA : la CNIL met à jour son outil de traçabilité des modèles publiés en source ouverteCNIL · 26 août 2026
- Généalogie des modèles d'IA ouverts : la CNIL propose un outil pour s'y retrouverNext (INpact) · 3 septembre 2026



