CLM-8B: Offenes Contrastive-Modell bewertet Agentenaktionen
Contrastive-LM hat CLM-8B veröffentlicht, ein offenes System-One-Modell, das Aktionskandidaten bewertet statt Text zu generieren, und bis zu neunmal schneller als Jev läuft.

Die Forschungsorganisation Contrastive-LM hat das Modell CLM-8B vorgestellt und damit die Einführung eines quelloffenen Modells in der Kategorie der kontrastiven Sprachmodelle (Contrastive Language Models, CLMs) markiert. Im Gegensatz zu traditionellen autoregressiven großen Sprachmodellen, die Text schrittweise Token für Token generieren, erzeugt CLM-8B überhaupt keinen Fließtext. Stattdessen bewertet es eine deklarierte Menge von Aktionskandidaten anhand des aktuellen Zustands einer Umgebung und gibt eine Wahrscheinlichkeitsverteilung über diese Optionen aus. Dieser architektonische Wechsel zielt speziell auf Entscheidungsfindungs- und Routing-Schritte innerhalb autonomer Agentenschleifen ab, bei denen der Rechenaufwand herkömmlicher Textgenerierung häufig zu erheblichen Latenzzeiten führt.
Die primäre Vergleichsbasis für CLM-8B ist Jev, ein proprietäres System-One-Modell des Unternehmens TypeSafe AI, das am 15. September 2026 in einen limitierten Early-Access-Betrieb überging. Ähnlich wie Jev wurde CLM-8B so konstruiert, dass es strukturierte kategoriale Entscheidungen statt generativer Prosa liefert. Um eine unkomplizierte Integration zu gewährleisten, stellt das CLM-Repository das Modell über eine zu TypeSafe kompatible Schnittstelle bereit. Dieser Aufbau unterstützt drei spezifische Abfrageformate: Noul, das die Wahrscheinlichkeit berechnet, mit der eine Aussage wahr ist; Choice, das einen einzelnen Kandidaten aus einer expliziten Liste mit zugewiesenen Wahrscheinlichkeiten auswählt; und Score, das eine Eingabe anhand eines geordneten Bewertungsschemas einstuft.
Duale Encoder und Vektor-Caching in Agentenschleifen
Auf architektonischer Ebene verwendet CLM-8B ein duales Encoder-Design, das aus einem Zustands-Encoder und einem Aktions-Encoder besteht. Beide Encoder teilen sich ein eingefrorenes Qwen3-8B-Rückgrat, das mit einem trainierbaren Projektionskopf mit 20 Millionen Parametern gekoppelt ist. Das Training optimiert ein bidirektionales InfoNCE-Verlustkriterium, welches das Embedding eines gegebenen Zustands an das Embedding der tatsächlich ausgeführten Aktion heranzieht und es gleichzeitig von den nicht ausgewählten Kandidatenaktionen wegschiebt. Während der Inferenz werden die Aktionskandidaten über das Skalarprodukt ihrer Embeddings mit dem Zustandsembedding eingestuft, gefolgt von einer Softmax-Funktion zur Bestimmung der finalen Wahrscheinlichkeitsverteilung.
Diese Trennung zwischen Zustands- und Aktionsrepräsentationen ermöglicht erhebliche Rechenoptimierungen. In praxisnahen Agenten-Workflows bleibt die verfügbare Menge an Aktionen häufig statisch, während sich der Zustand der Umgebung in jedem Schritt ändert. Über seine dedizierte Bereitstellungskomponente clm-serve reserviert das System einen festen Bereich des GPU-Speichers, um vorberechnete Aktionsvektoren zwischenzuspeichern, was architektonisch an standardmäßige Key-Value-Caching-Mechanismen angelehnt ist. Bei Tests auf einer einzelnen NVIDIA RTX 4090 GPU mit drei Aktionskandidaten reduzierte die Wiederverwendung zwischengespeicherter Vektoren die Latenz für erneut besuchte Zustände von 1,7 Millisekunden auf 0,6 Millisekunden. Bei großen Optionsmengen mit rund 1.000 Aktionskandidaten berichtet die Modellkarte von Inferenzgeschwindigkeiten, die bis zu 13-mal schneller als bei Jev ausfallen.
Die Trainingspipeline von CLM-8B stützt sich auf ein dreistufiges sequenzielles Verfahren, das darauf ausgelegt ist, die Ranking-Genauigkeit zu verfeinern, ohne den eingefrorenen Basis-Encoder zu destabilisieren:
- Vortraining auf rund 60 Millionen Nemotron DQA Frage-Antwort-Paaren, wodurch eine Top-1-Genauigkeit von 52,1 % auf einer separaten Testsuite mit 100.000 Fragen erreicht wurde.
- Zwischentraining auf etwa 30 Millionen synthetischen harten Negativbeispielen, die mit Gemini 2.5 Flash-Lite generiert wurden, was die Top-1-Genauigkeit auf 69,2 % steigerte.
- Nachtraining auf rund 1 Million Agenten-Trajektorien aus den Datensätzen Agent Data Protocol, Endless-Terminals und LiteCoder-Terminal-SFT.
Die Forscher von Contrastive-LM stellten fest, dass der Versuch, bereits im initialen Vortraining auf harten Negativbeispielen zu trainieren, dazu führte, dass die Leistung vorzeitig bei 62,4 % Genauigkeit ihren Höchststand erreichte, bevor schwerwiegendes Overfitting auftrat. Dies unterstreicht die Notwendigkeit ihres gestaffelten Lehrplans.
Zero-Shot-Evaluationen und Verifier-Leistung
In vergleichenden Zero-Shot-Evaluationen demonstrierte CLM-8B deutliche Durchsatzvorteile gegenüber Jev. Der viel beachtete Spitzenwert einer neunfachen Latenzreduzierung wurde bei Tests im T-Rex-Spiel gemessen, in dem Aktionskandidaten über aufeinanderfolgende Umweltzustände hinweg wiederholt auftreten. Bei breiter angelegten Bewertungen erreichte CLM-8B im T-Rex-Spiel sowie in Super-Mario-Umgebungen die gleiche Leistungsfähigkeit wie Jev, lag jedoch bei Tool-Calling-Evaluationen und WikiRacing-Aufgaben hinter Jev, wenngleich es in allen evaluierten Szenarien mit geringerer Latenz agierte.
Über die reaktive Spielsteuerung hinaus wurde CLM-8B auch als Verifier-Modell für Software-Engineering-Agenten getestet. In diesem Workflow tastet ein generatives Sprachmodell mehrere Lösungskandidaten ab, woraufhin das Verifier-Modell die Optionen bewertet, um die optimale Vervollständigung auszuwählen. Bei 38 separaten Aufgaben aus DeepSWE unter Verwendung von Best-of-4-Kandidatensätzen, die von Opus 5 generiert wurden, erzielte ein leichtgewichtiger, feinabgestimmter Kopf auf CLM-8B eine Erfolgsquote von 81,6 %. Bei 30 separaten Aufgaben aus Terminal-Bench 2.1 mit Best-of-5-Kandidaten von Fable 5 erreichte das Modell eine Genauigkeit von 87,6 %.
Benchmark-Messungen auf einem NVIDIA H100-System ergaben, dass CLM-8B bei Verifikationsaufgaben zwischen 4,1- und 5,7-mal schneller operierte als Jev. Das Forschungsteam wies darauf hin, dass Jev auf beiden Verifikationssuiten unterhalb der pass@1-Baseline lag. Das bedeutet, dass eine Auswahl mittels Jev schlechtere Ergebnisse lieferte als das Ziehen eines einzelnen Zufallsmusters. Die Autoren stellten jedoch ausdrücklich klar, dass diese Verifier-Werte spezialisierte feinabgestimmte Köpfe auf Teilmengen widerspiegeln und nicht die Zero-Shot-Leistung des Checkpoints oder vollständige Leaderboard-Einreichungen darstellen.
Technische Einschränkungen und Einsatz im Unternehmen
Trotz seiner operativen Effizienz unterliegt CLM-8B spezifischen funktionalen Beschränkungen. Die Projektionsköpfe sind fest an die Last-Token-Pooled-Embeddings von Qwen3-8B gebunden, was ihre Verwendung mit anderen Basisarchitekturen verhindert. Darüber hinaus kann das Modell keine neuartigen Antworten formulieren; es berechnet ausschließlich relative Wahrscheinlichkeiten über eine extern bereitgestellte Menge an Kandidaten. Contrastive-LM hat angekündigt, dass weitergehende Generalisierungsfähigkeiten in einem kommenden multimodalen Modell CLM-35B untersucht werden sollen, dessen Veröffentlichung für Anfang Oktober geplant ist.
Für Entwicklungsteams in Unternehmen, die autonome Agenten, Programmierassistenten oder strukturierte Routing-Pipelines aufbauen, bietet CLM-8B eine praxisnahe Alternative zu langsamen und kostspieligen generativen LLM-Aufrufen. Das gesamte System steht unter der Apache-2.0-Lizenz, wobei der Projektionskopf lediglich 75 Megabyte groß ist und zusammen mit vLLM auf einer einzelnen NVIDIA-GPU betrieben werden kann. Organisationen können hochperformantes Aktions-Ranking und Werkzeug-Routing somit intern und selbst gehostet umsetzen. Dies eliminiert externe API-Abhängigkeiten und reduziert gleichzeitig die Latenzen in komplexen, mehrstufigen Workflows entscheidend.
Quellen
- Contrastive-LM Releases CLM-8BMarkTechPost · 24. September 2026
- CLM-v0.1-8B model cardContrastive-LM · 23. September 2026



