CLM-8B clasifica acciones para agentes con baja latencia
Contrastive-LM ha presentado CLM-8B, un modelo abierto que clasifica acciones candidatas en vez de generar texto, funcionando hasta nueve veces más rápido que Jev.

La organización de investigación Contrastive-LM ha presentado públicamente CLM-8B, marcando la introducción formal de un modelo de pesos abiertos dentro de la categoría emergente de los modelos de lenguaje contrastivos o Contrastive Language Models (CLM). A diferencia de los modelos de lenguaje autorregresivos convencionales, que producen texto de forma secuencial token por token, CLM-8B prescinde por completo de la generación de texto libre. En su lugar, el sistema evalúa un conjunto explícito y declarado de acciones candidatas frente al estado actual de un entorno determinado, generando como resultado una distribución de probabilidad estructurada sobre dichas opciones. Esta reorientación en el diseño arquitectónico está pensada específicamente para optimizar las etapas de toma de decisiones y enrutamiento dentro de los bucles de agentes autónomos, donde la sobrecarga computacional de la generación de texto suele introducir una latencia considerable.
El principal punto de referencia frente al que se compara CLM-8B es Jev, un modelo propietario de razonamiento rápido (System One) desarrollado por la empresa TypeSafe AI, que inició una fase de acceso anticipado limitado el 15 de septiembre de 2026. Al igual que Jev, CLM-8B ha sido concebido para proporcionar elecciones categóricas estructuradas en lugar de composiciones generativas en prosa. Con el propósito de facilitar su adopción e integración técnica en infraestructuras ya existentes, el repositorio oficial de CLM sirve el modelo a través de una interfaz compatible con el estándar de TypeSafe. Esta arquitectura admite tres formatos concretos de consulta: Noul, que calcula la probabilidad exacta de que una afirmación sea verdadera; Choice, que selecciona un único candidato a partir de una lista explícita con probabilidades asignadas; y Score, que califica una entrada determinada frente a una rúbrica ordenada de criterios.
Doble codificador y almacenamiento en caché de vectores en agentes
Desde una perspectiva arquitectónica, CLM-8B implementa un diseño de doble codificador compuesto por un codificador de estado y un codificador de acciones. Ambos componentes comparten una red base congelada correspondiente a Qwen3-8B, complementada con un cabezal de proyección entrenable de 20 millones de parámetros. El proceso de entrenamiento optimiza una función de pérdida bidireccional InfoNCE, cuya formulación aproxima vectorialmente la representación incrustada de un estado dado hacia la incrustación de la acción que fue efectivamente ejecutada en el historial, al tiempo que la distancia de aquellas acciones candidatas que fueron descartadas. Durante la fase de inferencia en tiempo real, las acciones candidatas se ordenan mediante el producto escalar de sus vectores con el vector del estado, aplicándose a continuación una función softmax para calcular la distribución final de probabilidades.
Esta clara separación computacional entre las representaciones del estado y de las acciones permite introducir optimizaciones determinantes en el rendimiento. En los flujos de trabajo reales de agentes de software, el catálogo de acciones posibles suele permanecer estático durante periodos prolongados, mientras que el estado del entorno cambia en cada interacción sucesiva. Mediante su módulo especializado de servicio en producción, denominado clm-serve, el sistema reserva un bloque específico de memoria en la GPU para almacenar en caché los vectores precalculados de las acciones, tomando inspiración arquitectónica de los mecanismos estándar de almacenamiento en caché de claves y valores (KV cache). En pruebas de laboratorio llevadas a cabo sobre una única tarjeta gráfica NVIDIA RTX 4090 con un conjunto de tres acciones candidatas, la reutilización de vectores en caché redujo la latencia de 1,7 milisegundos a tan solo 0,6 milisegundos en estados recurrentes. Asimismo, ante catálogos amplios compuestos por aproximadamente 1.000 acciones candidatas, la tarjeta técnica del modelo documenta velocidades de inferencia hasta 13 veces superiores a las registradas por Jev.
El proceso de entrenamiento de CLM-8B se estructura en un programa secuencial de tres fases, concebido para afinar la precisión en la clasificación sin perjudicar la estabilidad del codificador base congelado:
- Preentrenamiento sobre aproximadamente 60 millones de pares de preguntas y respuestas procedentes de Nemotron DQA, alcanzando una precisión top-1 del 52,1% en un conjunto de pruebas reservado de 100.000 preguntas.
- Entrenamiento intermedio sobre cerca de 30 millones de ejemplos negativos difíciles sintéticos generados mediante Gemini 2.5 Flash-Lite, elevando la precisión top-1 hasta el 69,2%.
- Postentrenamiento sobre aproximadamente 1 millón de trayectorias de agentes obtenidas a partir de los conjuntos de datos Agent Data Protocol, Endless-Terminals y LiteCoder-Terminal-SFT.
Los investigadores de Contrastive-LM señalaron que el intento de introducir ejemplos negativos difíciles desde la fase inicial de preentrenamiento provocó un estancamiento prematuro del rendimiento en un 62,4% de precisión, seguido de un sobreajuste severo, lo que confirmó la estricta necesidad de mantener este plan pedagógico por etapas.
Evaluaciones zero-shot y rendimiento como modelo verificador
En las pruebas comparativas en modalidad zero-shot, CLM-8B exhibió ventajas considerables en el volumen de procesamiento frente a Jev. La reducción de latencia de hasta nueve veces se observó de forma destacada en las pruebas del juego T-Rex, un entorno en el que las acciones candidatas se repiten de manera continua a lo largo de estados sucesivos del sistema. En un marco de evaluación más amplio, CLM-8B igualó el rendimiento de Jev en los entornos de T-Rex y Super Mario, mientras que se situó por detrás de Jev en las pruebas de llamadas a herramientas (tool-calling) y en las tareas de WikiRacing, aunque manteniendo en todos los casos evaluados una latencia de ejecución significativamente menor.
Más allá de su utilidad en el control reactivo de videojuegos, CLM-8B fue evaluado en calidad de modelo verificador dentro de flujos de trabajo de agentes orientados a la ingeniería de software. En esta configuración operativa, un modelo de lenguaje generativo muestrea múltiples soluciones candidatas y el verificador evalúa y clasifica dichas opciones para seleccionar el código óptimo. En una selección de 38 tareas reservadas de DeepSWE, utilizando conjuntos de cuatro candidatos (best-of-4) generados por Opus 5, una versión con cabezal ajustado de CLM-8B alcanzó una tasa de éxito del 81,6%. Por su parte, en 30 tareas reservadas del banco de pruebas Terminal-Bench 2.1, utilizando cinco candidatos (best-of-5) generados por Fable 5, el modelo logró una precisión del 87,6%.
Las mediciones de rendimiento ejecutadas en un entorno de hardware con aceleradoras NVIDIA H100 revelaron que CLM-8B funcionó entre 4,1 y 5,7 veces más rápido que Jev durante las tareas de verificación. El equipo de investigación enfatizó que Jev obtuvo resultados por debajo de la línea base pass@1 en ambas baterías de verificación, lo que significa que realizar una selección mediante Jev arrojó peores resultados que escoger una muestra al azar. No obstante, los autores del estudio aclararon explícitamente que estos resultados como verificador corresponden a cabezales especializados ajustados sobre subconjuntos reservados, y no a puntuaciones obtenidas directamente por el modelo base zero-shot ni a envíos completos en las tablas de clasificación oficiales.
Límites técnicos e impacto en el despliegue empresarial
Pese a su elevada eficiencia operativa, CLM-8B presenta ciertas restricciones funcionales que deben tenerse en cuenta. Los cabezales de proyección están estrictamente vinculados a los vectores de agrupamiento del último token procedentes de la arquitectura Qwen3-8B, lo que impide su utilización directa sobre otros modelos base sin un reentrenamiento específico. Asimismo, el sistema carece de capacidad para redactar o generar respuestas novedosas, limitándose de manera estricta a calcular probabilidades relativas sobre un catálogo de opciones suministrado externamente. No obstante, Contrastive-LM ha anunciado que explorará capacidades de generalización multimodal más amplias en un próximo modelo denominado CLM-35B, cuyo lanzamiento está programado para principios de octubre.
Para las organizaciones e industrias tecnológicas que desarrollan agentes autónomos, asistentes de programación automatizada o canalizaciones complejas de enrutamiento de instrucciones, CLM-8B representa una alternativa sumamente práctica frente a las costosas y lentas llamadas a modelos generativos de gran escala. El sistema se distribuye bajo una licencia de código abierto Apache-2.0, con un cabezal de proyección que ocupa apenas 75 megabytes y que puede ejecutarse localmente en una única GPU de NVIDIA junto con infraestructuras como vLLM. Esto permite a las empresas alojar internamente sistemas de clasificación de acciones y selección de herramientas de alto rendimiento, reduciendo de forma drástica la latencia operativa en flujos de trabajo de múltiples pasos y eliminando la dependencia de servicios API de terceros.
Fuentes
- Contrastive-LM Releases CLM-8BMarkTechPost · 24 de septiembre de 2026
- CLM-v0.1-8B model cardContrastive-LM · 23 de septiembre de 2026



