CNIL atualiza o Genmod, sua ferramenta de genealogia de modelos de IA abertos
A CNIL publicou em 26 de agosto uma nova versão do Genmod, seu demonstrador que rastreia os ancestrais e descendentes de modelos de IA de código aberto, com buscas mais rápidas e dados atualizados semanalmente a partir do Hugging Face.

A Comissão Nacional de Informática e Liberdades da França (CNIL) publicou, em 26 de agosto de 2026, uma nova versão de seu demonstrador para explorar a genealogia dos modelos de IA publicados em código aberto. A atualização melhora o desempenho da ferramenta, sua usabilidade, e automatiza a atualização dos dados. Uma versão em inglês da interface já está disponível, além da francesa.
Os modelos de IA publicados em código aberto podem ser baixados, modificados, especializados com novos dados ou combinados com outros modelos antes de serem disponibilizados novamente. Um mesmo modelo — por exemplo, Kimi K3, Mistral Medium ou LLaMa — pode assim dar origem a diversos modelos derivados, a ponto de tornar difícil saber quem vem de quem. Somente o Hugging Face hospeda cerca de dois milhões de modelos publicados, o que torna ainda mais difícil identificar quais são derivados dos modelos mais conhecidos.
Encontrar os ancestrais e descendentes de um modelo
O demonstrador, chamado Genmod ('Genealogia dos modelos'), foi desenvolvido pelo serviço de IA da CNIL em colaboração com seu Laboratório de Inovação Digital (LINC), e foi publicado inicialmente em novembro de 2025. Ele permite explorar as ligações entre modelos e encontrar os ancestrais de um determinado modelo — os modelos dos quais ele deriva — bem como seus descendentes, ou seja, os modelos para os quais ele contribuiu.
Essa rastreabilidade é útil para estudar as consequências da memorização de dados de treinamento pelos modelos de IA. Trata-se de identificar, a partir de um modelo que memorizou dados pessoais, os demais modelos de sua 'genealogia' que podem ter conservado as mesmas informações, a fim de estudar as condições de exercício dos direitos previstos pelo RGPD (o regulamento europeu equivalente à LGPD brasileira) — direito de oposição, de acesso ou de exclusão.
Buscas muito mais rápidas
O motor de exploração do grafo foi otimizado, o que reduz fortemente o tempo das buscas mais extensas: uma busca sem limite de profundidade agora leva cerca de vinte segundos em média. A interface exibe o progresso de uma busca e, quando pode ser estimado, o tempo restante até a conclusão. Várias buscas podem ser processadas simultaneamente, e em caso de grande demanda o usuário vê sua posição na fila.
- Busca sem limite de profundidade: cerca de vinte segundos em média
- Progresso exibido, com estimativa do tempo restante
- Buscas simultâneas, com posição na fila em caso de grande demanda
- Atualização automática e semanal do grafo a partir de dados públicos do Hugging Face
- A data da última atualização dos dados é exibida na aplicação
- Modelos mais baixados são sugeridos primeiro, e os resultados são ordenados por padrão pelo número de downloads
- Acesso direto à página inicial adicionado nas diferentes páginas da aplicação
- Layout homogeneizado no Firefox, Chrome, Edge e Safari, e em diferentes tamanhos de tela
Um novo processo permite reconstruir a base do demonstrador a partir de dados públicos sobre os modelos e conjuntos de dados disponíveis no Hugging Face, o que automatiza a atualização semanal do grafo para acompanhar melhor a rápida evolução do ecossistema de código aberto.
Um exemplo concreto: a descendência do Kimi K3
O site Next dá um exemplo de uso: é possível inspecionar a descendência do modelo Kimi K3, da Moonshot AI, digitando primeiro o nome do repositório da empresa e depois as primeiras letras do modelo, para exibir sua árvore genealógica completa. Para cada modelo derivado, a ferramenta indica o método que permitiu a derivação — a quantização, por exemplo, que reduz a precisão dos pesos do modelo de origem para diminuir seu consumo de memória. A ferramenta também permite encontrar todos os modelos que utilizaram um determinado conjunto de dados, como o The Cauldron. Uma busca avançada também permite selecionar com precisão os critérios que interessam ao usuário.
Caso os dados pessoais de um indivíduo tenham sido memorizados por um modelo, como é possível identificar os outros modelos pelos quais esses dados também podem ter sido memorizados?
Essa rastreabilidade também pode ser útil em casos de acusações de regurgitação de conteúdo protegido por direitos autorais por um modelo de IA — uma questão ilustrada pelo processo em curso entre o New York Times e a OpenAI, no qual a pergunta sobre quais modelos podem ter memorizado e depois reproduzido textos protegidos continua central.
Para pesquisadores e desenvolvedores brasileiros que trabalham com modelos de código aberto, o Genmod oferece uma forma concreta de documentar a proveniência de um modelo antes de colocá-lo em produção, e de se antecipar a um eventual pedido de exercício de direitos sob a LGPD — cujos princípios de acesso, correção e eliminação de dados pessoais espelham os do RGPD europeu — em vez de descobri-lo depois. Para a Autoridade Nacional de Proteção de Dados (ANPD) e outras autoridades da região, a ferramenta também é um exemplo prático de como um regulador pode operacionalizar a rastreabilidade de modelos: a cada semana o grafo se enriquece com os novos modelos publicados no Hugging Face, o que o torna uma referência que se atualiza no ritmo do ecossistema, e não um inventário congelado na data de sua publicação.
Fontes
- IA : la CNIL met à jour son outil de traçabilité des modèles publiés en source ouverteCNIL · 26 de agosto de 2026
- Généalogie des modèles d'IA ouverts : la CNIL propose un outil pour s'y retrouverNext (INpact) · 3 de setembro de 2026



