Resumos de Treinamento do AI Act Não Listam Sites Raspados, Revela Revisão
Análise de 24 resumos públicos de conteúdo de treinamento do AI Act mostra que nenhum documento inclui os domínios raspados na seção dedicada, suscitando dúvidas sobre a conformidade com o modelo da Comissão Europeia.

ActuIA examinou 24 resumos de conteúdo de treinamento que estavam publicamente acessíveis em 25 de setembro de 2026, todos preparados de acordo com as obrigações de reporte do Artigo 53(1)(d) do AI Act, e verificou que o modelo da Comissão Europeia exige que os provedores listem os domínios de primeiro e segundo nível que representam os maiores dez por cento dos sites raspados por volume, com limite mais baixo para pequenas e médias empresas (PMEs).
Maioria dos Resumos Omite Listas de Domínios
Vinte e um dos documentos analisados incluíram a seção do modelo para domínios raspados, mas deixaram o campo vazio, sem mencionar nenhum site.
Três resumos submetidos pela DeepSeek omitiram completamente a seção de raspagem, o que significa que a informação exigida está ausente do documento.
Como os Provedores Descrevem suas Fontes de Dados
Em vez de enumerar domínios específicos, os resumos utilizam categorias amplas como recursos acadêmicos, plataformas de hospedagem de código, enciclopédias, portais regionais ou extensões genéricas como .com.
O conjunto de provedores cobertos inclui OpenAI, Mistral AI, Z.AI, ByteDance, MiniMax, DeepSeek e onze novos documentos do Ant Group.
Documentação do Ant Group no Hugging Face
Os resumos do Ant Group foram publicados no repositório inclusionAI/AI‑Transparency no Hugging Face. O repositório declara que contém apenas documentação, não pesos de modelo ou conjuntos de dados de treinamento, e esclarece que a publicação não constitui certificação regulatória.
Esses documentos do Ant seguem o modelo do Artigo 53(1)(d), porém também deixam o campo de listagem de domínios vazio, reproduzindo o padrão observado no restante da amostra.
Contexto Regulatório e Prazos
A obrigação do AI Act de divulgar informações sobre domínios raspados se aplica a modelos de uso geral recém‑lançados a partir de 2 de agosto de 2025. Modelos já existentes têm até 2 de agosto de 2027 para se adequarem.
- 21 resumos incluem o modelo mas não listam domínios
- 3 resumos da DeepSeek omitem a seção completamente
- Provedores usam categorias genéricas ao invés de URLs específicas
- Repositório do Ant Group no Hugging Face esclarece que documentos não são certificação
A análise dos resumos de treinamento evidencia que a prática de deixar o campo destinado à listagem de domínios raspados vazio cria uma zona cinzenta de interpretação regulatória, pois o modelo da Comissão define explicitamente a necessidade de identificar os domínios que compõem os dez por cento superiores do volume raspado. Essa omissão impede a verificação direta da aderência ao critério quantitativo, exigindo que os auditores recorram a métodos indiretos, como a inspeção de logs internos ou a solicitação de relatórios detalhados ao provedor, o que aumenta a carga de trabalho e pode gerar atrasos na avaliação de conformidade. Sem a presença das informações exigidas, a confiança na transparência declarada pelos provedores diminui, pois a ausência de dados concretos impede a validação objetiva da origem dos dados de treinamento.
Do ponto de vista das limitações operacionais, a utilização de categorias genéricas em vez de domínios específicos reduz a granularidade da informação e dificulta a comparação entre diferentes provedores. As categorias amplas não permitem identificar se há sobreposição de fontes, nem se determinados domínios de alto risco foram efetivamente excluídos ou mitigados. Essa falta de detalhamento também impede a aplicação de filtros automatizados que poderiam ser implementados pelos reguladores para detectar padrões de uso indevido de conteúdo protegido, limitando, assim, a eficácia dos mecanismos de monitoramento previstos no âmbito do AI Act.
A verificação da conformidade, portanto, depende de processos de auditoria mais intrusivos, nos quais os reguladores precisam solicitar documentos complementares, como registros de rastreamento de coleta de dados ou relatórios de classificação interna dos domínios raspados. Esses procedimentos exigem recursos adicionais e podem encontrar resistência por parte dos provedores, que podem alegar confidencialidade comercial ou proteção de propriedade intelectual. A ausência de uma lista padronizada dificulta ainda a criação de métricas comparativas padronizadas, comprometendo a consistência dos relatórios de conformidade entre diferentes jurisdições e dificultando a harmonização regulatória.
As consequências práticas para as empresas, especialmente aquelas operando no Brasil, incluem a necessidade de revisar os resumos existentes e incorporar listas de domínios reais antes de eventuais verificações formais. Caso a Comissão Europeia exija a inclusão desses detalhes, as organizações terão de adaptar seus processos de coleta e documentação de dados, possivelmente revisando acordos de licenciamento e implementando mecanismos de registro mais robustos. Essa adaptação pode gerar custos operacionais adicionais, bem como a necessidade de treinamento de equipes para garantir que a documentação atenda ao formato exigido, evitando sanções ou exigências de correção posterior.
Além disso, a falta de transparência sobre os domínios raspados pode impactar a percepção de risco pelos usuários finais e pelos parceiros comerciais, que podem questionar a origem dos dados utilizados para treinar modelos de IA. Essa desconfiança pode levar a uma diminuição da adoção de soluções de IA provenientes de provedores que não demonstram plena conformidade, afetando a competitividade no mercado internacional. Em um cenário onde a confiança regulatória se torna um diferencial, a capacidade de apresentar listas detalhadas e verificáveis pode se tornar um fator decisivo para a aceitação de produtos de IA em ambientes corporativos e governamentais.
Em síntese, a prática de omitir ou deixar vazio o campo de domínios raspados compromete a efetividade da obrigação de transparência prevista no Artigo 53(1)(d), impondo desafios de verificação, aumentando a carga de auditoria e gerando potenciais impactos econômicos e reputacionais. Para mitigar esses efeitos, os provedores precisam adotar medidas corretivas que incluam a coleta sistemática de informações de domínios, a padronização da apresentação desses dados nos resumos e a preparação de documentação de apoio que possa ser rapidamente disponibilizada a autoridades regulatórias, assegurando assim a conformidade plena e reduzindo a exposição a medidas corretivas ou sanções.
Para organizações brasileiras, o impacto prático é claro: sem listagens explícitas de domínios, auditorias de conformidade podem sinalizar as divulgações como incompletas, podendo gerar solicitações de informações adicionais ou medidas corretivas por parte dos reguladores da UE. As empresas devem se preparar para complementar seus resumos atuais com dados concretos de domínios caso a Comissão determine que a abordagem atual não atende aos requisitos do Artigo 53.
Fontes
- Résumés AI Act : 21 documents sur 24 ne nomment aucun site moissonné dans la rubrique prévueActuIA · 25 de setembro de 2026
- Ant Ling — Training Content SummariesHugging Face · 24 de setembro de 2026



