Cloudflare lanza la opción “Disallow AI Training” para mantener sitios visibles y bloquear el entrenamiento de IA
Cloudflare ofrece ahora una opción que permite que los sitios sigan indexados por buscadores pero eviten que los mismos rastreadores sirvan para entrenar modelos de inteligencia artificial, respondiendo a la creciente preocupación por los bots de uso mixto.

En una entrada del blog publicada el 15 de septiembre de 2026, Cloudflare reveló una nueva configuración denominada Disallow AI Training. Dicha opción permite a los propietarios de sitios web seguir siendo encontrados por los motores de búsqueda tradicionales, al mismo tiempo que declaran de forma explícita que no desean que el mismo rastreador extraiga contenido para entrenar modelos de inteligencia artificial.
La medida está dirigida a una categoría concreta de bots que combinan la indexación tradicional con la recolección de datos para fines de aprendizaje automático. Estos rastreadores de uso mixto se han convertido en un punto focal del debate, ya que una única petición puede servir a dos objetivos comerciales y éticos muy diferentes.
Por qué importa la distinción
Según las mediciones internas de Cloudflare, menos del uno por ciento de los millones de sitios que protege bloquean por completo a los bots de búsqueda. En contraste, el 17 % de esos sitios ya ha activado al menos un mecanismo para impedir el entrenamiento de IA, lo que evidencia un apetito claro por un control más granular.
Un archivo robots.txt sencillo solo puede expresar una preferencia; no autentica la identidad del rastreador ni verifica su uso previsto. En consecuencia, un operador que decida ignorar el archivo puede seguir extrayendo contenido sin repercusiones técnicas o legales.
Cómo funciona la solución de Cloudflare
Cloudflare afirma que publicará la preferencia del sitio en sus metadatos, para luego identificar y clasificar cada bot que atraviese su red. Los bots que desobedezcan la señal Disallow AI Training serán bloqueados y su actividad quedará registrada en Cloudflare Radar, garantizando así la transparencia para los propietarios de los sitios.
La etiqueta Accountable define un conjunto de requisitos para un rastreo responsable. Entre ellos se incluye un mecanismo para rechazar el entrenamiento, una futura capacidad para rechazar resúmenes generados por IA, visibilidad por URL del rechazo y la garantía de que el rechazo no afecte la indexación normal de búsqueda.
- Apple, Google y Microsoft ya han cumplido o se han comprometido a cumplir los criterios Accountable dentro de un plazo definido.
- Amazon, Anthropic, Meta y OpenAI separan sus bots de búsqueda y entrenamiento según la taxonomía de Cloudflare.
- Los controles de Cloudflare distinguen tres categorías: Búsqueda, Entrenamiento y Agente.
- La nueva opción Disallow AI Training se aplica solo a la categoría Entrenamiento y aún no se extiende a agentes mandatados por usuarios.
La distinción entre Búsqueda y Entrenamiento es crucial porque preserva el valor esencial de la descubribilidad web. Los sitios pueden seguir apareciendo en Google, Bing u otros resultados de búsqueda mientras indican que su contenido no debe reutilizarse para el entrenamiento a gran escala de modelos.
Hoja de ruta futura
Cloudflare ha indicado que la próxima fase se centrará en controlar cuánto del contenido de una página aparece en resúmenes generados por IA. Esa capacidad será independiente del rechazo al entrenamiento y abordará las preocupaciones sobre la exposición de contenido en agentes conversacionales.
Para organizaciones de habla hispana, el impacto práctico es inmediato. Al activar la opción Disallow AI Training, una empresa puede mantener su rendimiento SEO intacto mientras envía una señal técnica clara a los proveedores de IA de que sus páginas están fuera de los límites para el entrenamiento.
La visibilidad ofrecida por Radar también proporciona una pista de auditoría, ayudando a los equipos legales y de cumplimiento a demostrar adherencia a las nuevas políticas de uso de datos, lo que resulta especialmente valioso en entornos regulatorios cada vez más estrictos.
Implicaciones para el ecosistema de bots
Al clasificar los bots en categorías distintas, Cloudflare facilita que los proveedores de servicios de búsqueda mantengan su actividad de indexación sin interrupciones, mientras que los proveedores de IA deberán ajustar sus pipelines para respetar la señal Disallow AI Training antes de extraer datos.
Esta segmentación también abre la puerta a futuros estándares abiertos que podrían ser adoptados por otras infraestructuras de red, creando un marco más coherente para la gestión de datos web a gran escala.
En última instancia, la iniciativa de Cloudflare busca equilibrar dos intereses fundamentales: la necesidad de que la información siga siendo accesible para los usuarios a través de los motores de búsqueda y la creciente demanda de proteger el contenido contra usos no autorizados en entrenamientos de IA.
Desde Madrid, la comunidad de desarrolladores y responsables de contenido web sigue de cerca la evolución de esta herramienta, anticipando su integración en flujos de trabajo de gestión de sitios y en auditorías de cumplimiento de datos.
Fuentes
- Have it both ways: stay discoverable in search while disallowing AI trainingCloudflare · 15 de septiembre de 2026
- Cloudflare ermöglicht Trennung von KI- und SuchbotsGolem.de · 18 de septiembre de 2026



