Cloudflare lança opção Disallow AI Training para manter sites indexáveis e bloquear uso em treinamento de IA
A Cloudflare agora oferece a configuração Disallow AI Training, permitindo que sites continuem aparecendo em mecanismos de busca enquanto impedem que seus conteúdos sejam usados por crawlers de treinamento de IA, atendendo a uma preocupação crescente sobre bots de uso misto.

Em um artigo publicado no blog da Cloudflare em 15 de setembro de 2026, a empresa revelou uma nova funcionalidade chamada Disallow AI Training. Essa opção permite que os proprietários de sites mantenham a presença nos resultados dos mecanismos de busca tradicionais, como Google e Bing, ao mesmo tempo em que declaram explicitamente que seus conteúdos não devem ser coletados por crawlers destinados ao treinamento de modelos de inteligência artificial.
A iniciativa visa regular uma classe específica de bots que, além de indexar páginas para fins de busca, também extraem grandes volumes de texto, imagens e outros dados para alimentar algoritmos de aprendizado de máquina. Esses crawlers de uso misto têm sido alvo de intensos debates, pois uma única solicitação pode atender a dois propósitos comerciais e éticos muito diferentes, gerando preocupação entre editores, criadores de conteúdo e defensores da privacidade digital.
Por que a distinção é importante
Segundo métricas internas divulgadas pela Cloudflare, menos de um por cento dos milhões de sites que utilizam sua rede de proteção bloqueiam completamente bots de busca. Em contraste, 17 % desses sites já ativaram ao menos um mecanismo para impedir que seus dados sejam usados em treinamento de IA, demonstrando uma demanda crescente por controles mais granulares e transparentes.
Um simples arquivo robots.txt só consegue expressar uma preferência genérica, como "não rastrear" ou "permitir tudo". Ele não autentica a identidade do crawler nem verifica a finalidade da coleta. Assim, um operador que decida ignorar o robots.txt ainda pode raspar o conteúdo sem enfrentar barreiras técnicas ou consequências jurídicas, o que fragiliza a proteção dos direitos autorais e da propriedade intelectual dos editores.
Como funciona a solução da Cloudflare
A Cloudflare afirma que, ao habilitar a flag Disallow AI Training, a preferência do site será inserida nos metadados HTTP, permitindo que a própria rede identifique e classifique cada bot que atravessa sua infraestrutura. Quando um crawler ignora essa sinalização, ele será bloqueado imediatamente, e todas as tentativas serão registradas no Cloudflare Radar, garantindo transparência e auditabilidade para os proprietários de sites.
O rótulo "Accountable" criado pela empresa define um conjunto de requisitos para o rastreamento responsável. Entre eles estão: um mecanismo formal de recusa de treinamento, a futura capacidade de recusar a geração de resumos por IA, visibilidade por URL da recusa e a garantia de que a recusa não prejudique a indexação tradicional nos buscadores.
- Apple, Google e Microsoft já atenderam ou se comprometeram a atender os critérios Accountable dentro de um prazo definido.
- Amazon, Anthropic, Meta e OpenAI já separam seus bots de busca e de treinamento conforme a taxonomia da Cloudflare.
- Os controles da Cloudflare diferenciam três categorias: Busca, Treinamento e Agente.
- A nova configuração Disallow AI Training se aplica apenas à categoria Treinamento e ainda não se estende a agentes mandatados por usuários.
Separar as funções de Busca e Treinamento é essencial para preservar o valor central da descoberta na web. Com a nova flag, os sites podem continuar aparecendo nos resultados de pesquisa do Google, Bing ou outros mecanismos, enquanto enviam um sinal técnico inequívoco de que seu conteúdo não deve ser reutilizado em larga escala para treinamento de modelos de IA.
Roteiro futuro
A Cloudflare indicou que a próxima fase de desenvolvimento focará no controle da quantidade de conteúdo de uma página que pode aparecer em resumos gerados por IA. Essa capacidade será distinta da simples recusa de treinamento e buscará atender a preocupações sobre a exposição de textos proprietários em assistentes conversacionais, chatbots e outros agentes que sintetizam informações a partir da web.
Para organizações brasileiras, o impacto prático já é imediato. Ao ativar a opção Disallow AI Training, uma empresa pode manter seu desempenho de SEO intacto, ao mesmo tempo em que envia um sinal técnico claro aos provedores de IA de que suas páginas estão fora dos limites para treinamento. Essa sinalização ajuda a evitar o uso não autorizado de conteúdos sensíveis, como documentos jurídicos, relatórios financeiros ou material educacional.
Além disso, a visibilidade oferecida pelo Cloudflare Radar fornece um registro de auditoria detalhado, que pode ser utilizado por equipes jurídicas e de compliance para demonstrar conformidade com políticas emergentes de uso de dados. Esse registro pode ser crucial em casos de litígio ou investigações regulatórias, especialmente à medida que autoridades brasileiras avançam na regulamentação de IA e proteção de dados.
Desafios e perspectivas
Embora a solução represente um avanço significativo, ainda há desafios a serem superados. A eficácia depende da adoção ampla pelos principais provedores de IA, que precisam reconhecer e respeitar a flag Disallow AI Training. Caso alguns atores ignorem a sinalização, os sites ainda podem ser vulneráveis a raspagens indiscriminadas, exigindo vigilância contínua e possíveis ajustes nas políticas de bloqueio.
Outro ponto crítico é a necessidade de padronização internacional. Se diferentes regiões adotarem abordagens distintas para a sinalização de recusa de treinamento, os operadores de sites poderão enfrentar um cenário fragmentado, aumentando a complexidade de gerenciamento de políticas em escala global.
Conclusão local
Em resumo, a nova opção Disallow AI Training da Cloudflare oferece aos editores brasileiros um caminho viável para equilibrar a visibilidade nos buscadores com a proteção contra o uso indevido de seus conteúdos em treinamento de IA. Ao combinar sinalização nos metadados, bloqueio ativo e registro transparente no Radar, a solução promete atender às demandas de SEO, compliance e direitos autorais, ao mesmo tempo em que abre espaço para futuras inovações no controle de resumos gerados por IA.
Fontes
- Have it both ways: stay discoverable in search while disallowing AI trainingCloudflare · 15 de setembro de 2026
- Cloudflare ermöglicht Trennung von KI- und SuchbotsGolem.de · 18 de setembro de 2026



