Reka präsentiert Rho‑1: 19‑Milliarden‑Parameter‑Omni‑Modell für Text, Bild, Video und Robotersteuerung
Am 5. Oktober 2026 stellte Reka AI Rho‑1 vor, ein einziges 19‑Milliarden‑Parameter‑Modell, das Text, Bilder, Video, logisches Schließen und Roboterbefehle in einem gemeinsamen Token‑Strom verarbeitet und Echtzeit‑Video‑Generierung sowie direkte Robotersteuerung verspricht.

Am 5. Oktober 2026 präsentierte Reka AI in einer rein virtuellen Produkteinführung das neue Modell Rho‑1. Das System wird als ein „Forschungs‑Grade“-Modell mit exakt 19 Milliarden Parametern beschrieben und wurde von Grund auf neu entwickelt, um gleichzeitig Text, Bild, Video, logisches Schließen und physische Aktionen in einem einzigen neuronalen Netzwerk zu verarbeiten.
Im Unterschied zu den herkömmlichen KI‑Stacks, die für jede Modalität separate Spezialmodelle einsetzen, kodiert Rho‑1 sämtliche Eingaben und Ausgaben als Token, die einen gemeinsamen Kontext teilen. Durch dieses einheitliche Design entfällt die Notwendigkeit separater Vision‑, Sprach‑ oder Steuer‑Pipelines, sodass dieselbe Gewichtsmatrix über alle Bereiche hinweg interpretieren und generieren kann.
Einheitliche Token‑Darstellung
Reka betont, dass Text, Bild‑Patches, Videoframes und Roboterbefehle zunächst in ein einheitliches Token‑Format konvertiert werden, bevor sie dem Modell zugeführt werden. Der geteilte Kontext erlaubt dem System, Informationen aus früheren Interaktionen zu behalten, sodass ein Bild oder ein Video über mehrere iterative Schritte hinweg modifiziert werden kann, ohne den internen Zustand zurückzusetzen.
Die Basisversion von Rho‑1 soll Video mit einer Geschwindigkeit von 0,79‑facher Echtzeit erzeugen und die Wiedergabe etwa sechs Sekunden nach einer Anfrage starten. In internen Benchmarks erzeugte eine destillierte Variante, die auf acht Verarbeitungsschritte reduziert wurde, einen 5,3‑Sekunden‑Clip in etwa einer Sekunde, wobei diese Zahlen bislang nicht von unabhängigen Dritten verifiziert wurden.
Leistung und Trainingsdetails
Laut Angaben von The Decoder dauerte der Trainingslauf rund drei Monate und nutzte dabei 320 Nvidia H100‑GPUs. Das intensive Compute‑Budget spiegelt das Ziel wider, den multimodalen Stack in einer einzigen Architektur zu konsolidieren – ein Schritt, den Reka als Vorstoß zu Systemen bezeichnet, die die Welt mit einem einheitlichen Modell wahrnehmen, verstehen und handeln können.
Ein zentrales Unterscheidungsmerkmal sei die Fähigkeit des Modells, visuelle Medien über mehrere Interaktionen hinweg zu erzeugen, zu bearbeiten und zu vergleichen. Nutzer können wiederholt Verfeinerungen anfordern – etwa die Beleuchtung ändern, Objekte hinzufügen oder Bewegungen anpassen – während das Modell eine kohärente interne Repräsentation der Szene bewahrt.
Robotersteuerung mit denselben Gewichten
Reka demonstrierte zudem, dass exakt derselbe Gewichtssatz für die Robotersteuerung wiederverwendet werden kann. Eine Inverse‑Dynamik‑Komponente übersetzt öffentlich verfügbare Internet‑Videos in Aktionssignale, die die Antriebe von Robotern steuern. Dieser Ansatz deutet auf einen Weg hin, bei dem visuelles Lernen unmittelbar motorisches Verhalten beeinflusst, ohne ein separates Steuer‑Modul zu benötigen.
- 19 Milliarden Parameter in einem einzigen Netzwerk
- Von Grund auf neu trainiert in einem dreimonatigen, 320‑GPU‑H100‑Durchlauf
- Einheitlicher Token‑Strom für Text, Bild, Video und Roboterbefehle
- Basisversion erzeugt Video mit 0,79‑facher Echtzeit, Startzeit ~6 Sekunden
- Destillierte 8‑Schritte‑Variante behauptet 5,3‑Sekunden‑Clip in ~1 Sekunde
Die Ankündigung positioniert Rho‑1 als Proof‑of‑Concept für das, was Reka ein „Omni‑Modell“ nennt – ein System, das fließend zwischen Wahrnehmung, Sprache und Handlung wechseln kann. Durch das Zusammenführen der traditionellen multimodalen Pipeline argumentiert das Unternehmen, dass Entwicklungszyklen verkürzt und Integrationskomplexitäten reduziert werden könnten.
Kritiker weisen jedoch darauf hin, dass die genannten Leistungsangaben, insbesondere für die destillierte Variante, bislang nicht durch Dritt‑Tests bestätigt wurden. Unabhängige Benchmarks werden entscheidend sein, um zu prüfen, ob Rho‑1 die beworbenen Geschwindigkeits‑ und Qualitätsvorteile gegenüber spezialisierten Modellen tatsächlich liefert.
Was das für deutschsprachige Unternehmen bedeutet
Für Unternehmen im deutschsprachigen Raum könnte Rho‑1 die KI‑Infrastruktur vereinfachen, indem ein Suite verschiedener Einzelmodelle durch einen einzigen Service ersetzt wird. Inhaltsersteller würden von schnellerer iterativer Videogenerierung profitieren, Marketing‑Teams könnten multimodale Assets on‑the‑fly produzieren, und Hersteller könnten vision‑gesteuerte Robotersteuerung testen, ohne eigens dedizierte Steuer‑Netze zu trainieren.
Der einheitliche Token‑Ansatz verspricht zudem ein konsistenteres cross‑modales Schließen, was Fehler reduziert, die beim Zusammenspiel separater Systeme entstehen können. Dadurch könnten Projekte, die bislang mehrere spezialisierte Modelle erforderten, mit einem einzigen Modell realisiert werden, was sowohl Kosten als auch Entwicklungszeit senkt.
Ein weiterer potenzieller Nutzen liegt in der Möglichkeit, dass dieselben Gewichte, die visuelle Inhalte generieren, gleichzeitig für die Planung und Ausführung von Roboteraktionen verwendet werden können. Das eröffnet Szenarien, in denen ein KI‑System ein Video analysiert, daraus Handlungspläne ableitet und unmittelbar physische Systeme steuert – ein Schritt hin zu wirklich integrierten KI‑Assistenzsystemen.
Ob Rho‑1 diese Vision in der Praxis verwirklichen kann, wird erst in den kommenden Monaten klar werden, wenn unabhängige Forschungsgruppen und Unternehmen das Modell in realen Anwendungsfällen testen. Die nächsten Schritte werden wahrscheinlich offene APIs und Pilotprojekte mit Industriepartnern umfassen, um die Versprechen des Omni‑Modells zu validieren.
Für die deutsche Tech‑Community bleibt abzuwarten, ob das Modell nicht nur ein beeindruckendes technisches Kunstwerk ist, sondern tatsächlich als zuverlässige Grundlage für produktive Anwendungen dient.
Quellen
- Rho-1: collapsing the multimodal stackReka AI · 5. Oktober 2026
- Reka AIs Omni-Modell Rho-1 vereint Text, Bild, Video und RobotersteuerungThe Decoder · 5. Oktober 2026



