Meta logra que un modelo de 8000 millones de parámetros iguale a Claude Opus 4.5
Investigadores de Meta AI y la Universidad de Illinois en Urbana-Champaign entrenaron el modelo abierto Qwen3-8B con un nuevo método de refuerzo, EvoHarness-RL. En ALFWorld, un benchmark de tareas secuenciales de varios pasos, el modelo alcanza un 96,9% de éxito, por delante del 96,4% de Claude Opus 4.5 y 49 puntos más que su base ReAct.

Investigadores de Meta AI y la Universidad de Illinois en Urbana-Champaign (UIUC) presentaron EvoHarness-RL, un método de entrenamiento por refuerzo para agentes de inteligencia artificial. Según un artículo publicado el 29 de agosto por AI Times, el equipo aplicó el método a Qwen3-8B, un modelo abierto de solo 8000 millones de parámetros, y alcanzó un 96,9% de éxito en ALFWorld, un benchmark de tareas domésticas secuenciales de varios pasos. Ese resultado supera el 96,4% que obtiene el modelo insignia de Anthropic, Claude Opus 4.5, con el método ReAct clásico, y supone un salto de 49,0 puntos porcentuales frente a la base ReAct del propio Qwen3-8B (47,9%). El medio estadounidense VentureBeat cubrió la misma investigación por separado el 28 de agosto, informando de que GPT-4.1 y GPT-5, de OpenAI, también mejoraron 22,1 y 25,7 puntos porcentuales respectivamente al aplicarles el método solo en el momento de la inferencia, sin reentrenamiento.
BPE: dividir el estado del agente en creencia, progreso y experiencia
El núcleo de EvoHarness-RL es una abstracción de estado que los investigadores llaman BPE — Belief, Progress, Experience (creencia, progreso, experiencia). La creencia recoge lo que el agente sabe en cada momento sobre su entorno; el progreso registra los subobjetivos cumplidos y el trabajo pendiente; la experiencia almacena habilidades, fallos anteriores y prioridades de búsqueda acumuladas en tareas previas. Para gestionar estos tres estados, el agente solo cuenta con cuatro meta-acciones: rastrear (comprobar el estado actual), confirmar (registrar el progreso), recordar (recuperar experiencia pasada) y anotar (registrar información nueva). Los investigadores explican que, mientras los sistemas anteriores de memoria externa y uso de herramientas seguían reglas fijadas de antemano por humanos, BPE entrena al agente para decidir por sí mismo cuándo anotar algo y cuándo recuperar una experiencia pasada.
Dos etapas de entrenamiento: ajuste supervisado y después aprendizaje por refuerzo
El entrenamiento se realiza en dos etapas. En la primera, el ajuste fino supervisado (SFT), Qwen3-8B aprende primero el significado de BPE y el uso de las cuatro meta-acciones. En la segunda, de aprendizaje por refuerzo, el equipo aplica lo que denomina «optimización de política relativa de grupo sensible al costo» (cost-aware GRPO), que entrena al modelo para juzgar por sí mismo si recurrir al arnés realmente contribuye a completar la tarea. Según VentureBeat, la coautora Xuying Ning señaló que «el arnés óptimo suele cambiar según el modelo» y que «una memoria que solo añade información asume que más contexto siempre ayuda, lo cual no es necesariamente cierto». Cuando los investigadores retiraron el componente Experiencia en una prueba de ablación, la tasa de éxito media cayó al 48,6%, la caída más pronunciada de los tres componentes.
- ReAct básico: 47,9%
- BPE aplicado solo en inferencia (sin reentrenamiento): 56,4%
- Con ajuste supervisado (SFT): 68,6%
- Con SFT y aprendizaje por refuerzo (EvoHarness-RL, resultado final): 96,9%
- Claude Opus 4.5 — 96,4% con ReAct básico, 98,5% con BPE (+2,1 puntos)
- GPT-4.1 — de 47,9% a 70,0% con BPE en inferencia (+22,1 puntos)
- GPT-5 — de 60,7% a 85,0% con BPE en inferencia (+25,7 puntos)
- Sistemas de comparación — SkillRL 89,9%, SkillOS 80,2%
También funcionó en entornos desconocidos, con un fenómeno de «recocido del arnés»
Los investigadores también probaron el modelo en tareas nuevas de ALFWorld nunca vistas durante el entrenamiento. El Qwen3-8B básico se quedó en el 50,0%; añadir BPE solo en inferencia lo elevó al 77,6%; y la versión completamente entrenada con EvoHarness-RL alcanzó el 86,6%. Durante el entrenamiento, los investigadores observaron un fenómeno que llaman «recocido del arnés» (harness annealing): al principio, el agente recurría al arnés externo en casi cada paso, pero a medida que avanzaba el entrenamiento, los patrones de tareas repetidas se interiorizaron, el uso del arnés cayó con fuerza y terminó estabilizándose en torno a una llamada por episodio de media. El almacén de experiencia evolucionó de forma similar: al principio acumula rápidamente habilidades variadas y errores, y después consolida la información redundante y descarta las habilidades poco útiles, de modo que conserva solo lo esencial en lugar de crecer sin límite. En un ejemplo citado por los investigadores, un agente que buscaba una tetera comprobó que su recuerdo de la ubicación de la encimera no coincidía con el entorno real, y se corrigió a sí mismo anotando que la información anterior era errónea.
Del desarrollo de software al cumplimiento normativo financiero
Los investigadores sostienen que esta arquitectura va más allá de entornos de juego y se aplica a tareas reales. En desarrollo de software, la creencia correspondería al estado actual de una base de código y sus componentes, el progreso a las tareas, pruebas y dependencias completadas, y la experiencia a correcciones pasadas y casos de error. En finanzas y cumplimiento normativo, la creencia cubriría las normas aplicables y las evidencias, el progreso las verificaciones realizadas y las excepciones abiertas, y la experiencia los problemas recurrentes y cómo se resolvieron antes. Gracias a lo que el equipo llama «adaptadores de entorno», cada organización puede conservar sus propias herramientas internas y su gestión de estado añadiendo BPE como una capa de coordinación entrenable, sin sustituir las herramientas ya existentes. La investigación se publicó en el servidor de preimpresión arXiv (arXiv:2608.05446v1).
Este resultado interesa directamente a las empresas de habla hispana que desarrollan agentes de IA. Hasta ahora, procesar de forma fiable tareas complejas de varios pasos parecía exigir pagar el acceso a un modelo de frontera costoso, de Anthropic u OpenAI. Demostrar que un modelo abierto de 8000 millones de parámetros, bien dotado de memoria y gestión de herramientas, puede igualar a esos modelos abre la puerta a despliegues más baratos, incluso alojados en infraestructura propia en lugar de depender de una API de terceros. El resultado, eso sí, se limita a un único benchmark, ALFWorld, y deberá confirmarse en casos de uso reales antes de sacar conclusiones definitivas para producción.
Fuentes
- 메타, 80억 소형 AI로 '클로드 오퍼스 4.5'급 성능 구현…'에보하네스-RL' 공개AI타임스 · 29 de agosto de 2026
- Meta researchers taught an 8B AI model to match Claude Opus 4.5 — without the frontier price tagVentureBeat · 28 de agosto de 2026



