A CNIL atualiza o Genmod, a sua ferramenta de genealogia de modelos de IA abertos
A CNIL publicou a 26 de agosto uma nova versão do Genmod, o seu demonstrador que traça os ascendentes e descendentes dos modelos de IA de código aberto, com pesquisas mais rápidas e dados atualizados semanalmente a partir do Hugging Face.

A Comissão Nacional de Informática e Liberdades francesa (CNIL) publicou, a 26 de agosto de 2026, uma nova versão do seu demonstrador para explorar a genealogia dos modelos de IA publicados em código aberto. A atualização melhora o desempenho da ferramenta, a sua ergonomia, e automatiza a atualização dos dados. Está agora disponível uma versão em inglês da interface, além da francesa.
Os modelos de IA publicados em código aberto podem ser descarregados, modificados, especializados com novos dados ou combinados com outros modelos antes de voltarem a ser disponibilizados. Um mesmo modelo — por exemplo, o Kimi K3, o Mistral Medium ou o LLaMa — pode assim estar na origem de numerosos modelos derivados, ao ponto de se tornar difícil saber quem provém de quem. Só o Hugging Face aloja cerca de dois milhões de modelos publicados, o que torna ainda mais difícil identificar quais são derivados dos modelos mais conhecidos.
Encontrar os ascendentes e descendentes de um modelo
O demonstrador, chamado Genmod ('Genealogia dos modelos'), foi desenvolvido pelo serviço de IA da CNIL em colaboração com o seu Laboratório de Inovação Digital (LINC), tendo sido inicialmente publicado em novembro de 2025. Permite explorar as ligações entre modelos e encontrar os ascendentes de um determinado modelo — os modelos de onde este provém — bem como os seus descendentes, ou seja, os modelos para os quais contribuiu.
Esta rastreabilidade é útil para estudar as consequências da memorização de dados de treino pelos modelos de IA. Trata-se de identificar, a partir de um modelo que tenha memorizado dados pessoais, os demais modelos da sua 'genealogia' suscetíveis de terem conservado as mesmas informações, a fim de estudar as condições de exercício dos direitos previstos pelo RGPD — direito de oposição, de acesso ou de apagamento.
Pesquisas bastante mais rápidas
O motor de exploração do grafo foi otimizado, o que reduz fortemente o tempo das pesquisas mais extensas: uma pesquisa sem limite de profundidade demora agora cerca de vinte segundos em média. A interface mostra o progresso de uma pesquisa e, quando pode ser estimado, o tempo restante até à conclusão. Podem ser processadas várias pesquisas em simultâneo e, em caso de grande afluência, o utilizador vê a sua posição na fila.
- Pesquisa sem limite de profundidade: cerca de vinte segundos em média
- Progresso apresentado, com estimativa do tempo restante
- Pesquisas simultâneas, com posição na fila em caso de afluência
- Atualização automática e semanal do grafo a partir de dados públicos do Hugging Face
- A data da última atualização dos dados é apresentada na aplicação
- Os modelos mais descarregados são sugeridos em primeiro lugar, e os resultados são ordenados por defeito pelo número de descarregamentos
- Acesso direto à página inicial adicionado nas diferentes páginas da aplicação
- Disposição uniformizada no Firefox, Chrome, Edge e Safari, e em diferentes tamanhos de ecrã
Um novo processo permite reconstruir a base do demonstrador a partir de dados públicos relativos aos modelos e conjuntos de dados disponíveis no Hugging Face, o que automatiza a atualização semanal do grafo para melhor acompanhar a rápida evolução do ecossistema de código aberto.
Um exemplo concreto: a descendência do Kimi K3
O órgão de informação Next dá um exemplo de utilização: pode inspecionar-se a descendência do modelo Kimi K3, da Moonshot AI, digitando primeiro o nome do repositório da editora e depois as primeiras letras do modelo, para mostrar a sua árvore genealógica completa. Para cada modelo derivado, a ferramenta indica o método que permitiu a derivação — a quantização, por exemplo, que reduz a precisão dos pesos do modelo de origem para diminuir a sua ocupação de memória. A ferramenta também permite encontrar todos os modelos que utilizaram um determinado conjunto de dados, como o The Cauldron. Uma pesquisa avançada permite ainda selecionar com precisão os critérios que interessam ao utilizador.
Caso os dados pessoais de um indivíduo tenham sido memorizados por um modelo, como é possível identificar os outros modelos pelos quais esses dados também poderão ter sido memorizados?
Esta rastreabilidade também pode ser útil em casos de acusações de reprodução de conteúdos protegidos por direitos de autor por um modelo de IA — uma questão ilustrada pelo processo em curso entre o New York Times e a OpenAI, no qual a questão de saber que modelos poderão ter memorizado e depois reproduzido textos protegidos continua central.
Para investigadores e programadores portugueses que trabalham com modelos de código aberto, o Genmod oferece uma forma concreta de documentar a proveniência de um modelo antes de o colocar em produção, e de antecipar um eventual pedido de exercício de direitos ao abrigo do RGPD, em vez de o descobrir depois. Para a Comissão Nacional de Proteção de Dados (CNPD) e as demais autoridades europeias, a ferramenta é também um exemplo prático de como um regulador pode operacionalizar a rastreabilidade de modelos: a cada semana o grafo é enriquecido com os novos modelos publicados no Hugging Face, o que o transforma numa referência que acompanha o ritmo do ecossistema, e não um inventário congelado na data da sua publicação.
Fontes
- IA : la CNIL met à jour son outil de traçabilité des modèles publiés en source ouverteCNIL · 26 de agosto de 2026
- Généalogie des modèles d'IA ouverts : la CNIL propose un outil pour s'y retrouverNext (INpact) · 3 de setembro de 2026



