Base Labs, Hugging Face y Goodfire presentan estándar de seguridad para IA de peso abierto
Base Labs, Hugging Face y Goodfire anunciaron el 16 de septiembre de 2026 una alianza para crear una infraestructura transparente de evaluación de seguridad para modelos de IA de peso abierto, transformando la apertura en una ventaja de seguridad.

El 16 de septiembre de 2026 Baseten anunció una colaboración estratégica que reúne a su unidad de investigación Base Labs, la plataforma de alojamiento de modelos Hugging Face y la empresa especializada en interpretabilidad Goodfire AI, con el objetivo de crear un marco compartido para evaluar y monitorizar la seguridad de los modelos de IA de peso abierto, es decir, aquellos que se publican con sus parámetros de entrenamiento completos.
Base Labs ha declarado que implementará salvaguardas tanto durante la fase de entrenamiento como métodos de monitorización después del despliegue, describiendo la iniciativa como un "estándar transparente integrado en la forma en que los modelos se entrenan y sirven". La intención es incorporar controles de seguridad directamente en el ciclo de vida del modelo, evitando que se traten como un añadido posterior.
Por qué la apertura puede reforzar la seguridad
Los socios sostienen que poner a disposición pública los pesos del modelo aumenta la visibilidad del comportamiento, permitiendo a investigadores independientes auditar, probar y proponer mejoras. Según la asociación, esta visibilidad hace que los mecanismos de control sean más inspeccionables y puede revelar vulnerabilidades que permanecerían ocultas en implementaciones cerradas.
El papel de Goodfire se centra en la interpretabilidad del modelo. Aunque los detalles técnicos exactos no se han revelado, la empresa planea enlazar señales internas del modelo —como patrones de activación y flujos de gradiente— al sistema de monitorización más amplio, mejorando la capacidad de detectar salidas anómalas o inseguras.
Hugging Face aporta su extenso repositorio de modelos, que actualmente incluye más de 6 000 modelos de peso abierto. TechCrunch señala que muchos de estos modelos han tenido sus guardrails internos eliminados mediante una técnica conocida como "abliteration", una práctica que subraya la necesidad de controles de seguridad externos robustos.
Contexto del Informe Internacional de Seguridad de IA 2026
El Informe Internacional de Seguridad de IA 2026 destaca una paradoja: compartir los pesos del modelo acelera la investigación, la revisión por pares y la auditoría, pero también complica la aplicación de modificaciones después de su lanzamiento. Una vez distribuido, controlar cómo se ajusta o integra en aplicaciones posteriores se vuelve cada vez más difícil.
El informe subraya que cualquier marco de seguridad para modelos de peso abierto debe operar tanto en la fuente —durante el entrenamiento— como en la periferia —mediante monitorización continua tras el despliegue—, garantizando una defensa en profundidad.
Elementos clave del marco propuesto
- Cheques de seguridad estandarizados durante el entrenamiento integrados en el código del modelo
- Monitorización continua en tiempo de ejecución usando señales de interpretabilidad
- Suite de referencia de código abierto para medir el rendimiento de seguridad
- Portal de contribución comunitaria para nuevos métodos de detección
- Informe transparente de métricas de seguridad a los consumidores del modelo
La asociación ha lanzado una convocatoria abierta a todo el ecosistema de IA, invitando a investigadores, desarrolladores y organizaciones a presentar herramientas, conjuntos de datos o protocolos de evaluación que se alineen con el estándar propuesto. No se publicó ningún benchmark formal, cronograma de certificación ni documento procedural detallado junto al anuncio.
Base Labs y Hugging Face subrayaron que la iniciativa está pensada como colaborativa y no prescriptiva. Aprovechando la comunidad de desarrolladores de Hugging Face, los socios esperan iterar rápidamente, incorporando retroalimentación del mundo real a las especificaciones de seguridad en evolución.
Llamado a la comunidad
Se anima a la comunidad a contribuir con scripts de prueba, métricas de robustez y datasets de escenarios adversarios, de modo que el estándar evolucione de forma abierta y refleje los retos emergentes en la práctica diaria de la IA.
Implicaciones para el sector hispanohablante
Para organizaciones hispanohablantes, el marco emergente ofrece ventajas concretas: expectativas de seguridad más claras al adquirir modelos de peso abierto, acceso a herramientas de monitorización compartidas que pueden integrarse en pipelines existentes y un registro de auditoría transparente que puede presentarse a reguladores o equipos de cumplimiento interno.
En última instancia, la iniciativa busca transformar la apertura en una ventaja competitiva, demostrando que la transparencia no está reñida con la robustez y que la colaboración entre actores académicos, industriales y de la comunidad puede elevar el nivel de confianza en los sistemas de IA a nivel global.
Este anuncio se difundió en Madrid, donde representantes de las tres empresas participaron en una mesa redonda organizada por la asociación española de IA, resaltando el compromiso de la región con la seguridad responsable de la inteligencia artificial.
Fuentes
- Base Labs launches an open-weight AI safety partnership with Hugging Face and GoodfireTechCrunch · 17 de septiembre de 2026
- International AI Safety Report 2026International AI Safety Report · 3 de febrero de 2026



