Reka presenteert Rho‑1, een omni‑model van 19 billion parameters voor tekst, beeld, video en robotbesturing
Op 5 oktober 2026 kondigde Reka AI Rho‑1 aan, een enkel model met 19 billion parameters dat tekst, afbeeldingen, video, redeneren en robotacties in één tokenstroom verwerkt, met realtime videogeneratie en directe robotbesturing.

Op 5 oktober 2026 presenteerde Reka AI tijdens een virtueel lanceringsevenement haar nieuwste onderzoekssysteem, Rho‑1. Het model bestaat uit een enkele, van de grond af opgevoerde architectuur met 19 billion parameters en is ontworpen om tekst, afbeeldingen, video, logische redenering en robotacties allemaal in één doorlopende tokenstroom te verwerken.
Waar de meeste hedendaagse AI‑stacks voor elke modaliteit afzonderlijke, gespecialiseerde netwerken inzetten, zet Rho‑1 elke invoer‑ en uitvoerbron om in tokens die een gemeenschappelijke context delen. Dit betekent dat er geen aparte visie‑, taal‑ of besturingspijplijnen meer nodig zijn; dezelfde gewichtsmatrix interpreteert en genereert over alle domeinen heen.
Eén tokenrepresentatie voor alles
Reka legt uit dat tekst, afbeeldingspatches, videoframes en robotcommando's eerst worden geconverteerd naar een uniform tokenformaat. Dankzij die gedeelde context kan het model informatie uit eerdere interacties behouden, waardoor een afbeelding of video in meerdere iteratieve stappen kan worden aangepast zonder de interne staat te resetten.
De basisversie van Rho‑1 zou video kunnen genereren met een snelheid van 0,79× realtime, wat inhoudt dat de weergave ongeveer zes seconden na een verzoek start. In interne tests produceerde een gedistilleerde variant, teruggebracht tot acht stappen, een clip van 5,3 seconden in ongeveer één seconde, hoewel deze cijfers nog niet door derden zijn geverifieerd.
Prestaties en trainingsdetails
Volgens een rapport van The Decoder duurde de trainingsrun van Rho‑1 ongeveer drie maanden en maakte gebruik van 320 Nvidia H100‑GPU's. Het enorme compute‑budget onderstreept de ambitie om de multimodale stack te comprimeren tot één enkele architectuur, een stap die Reka ziet als een richting naar systemen die de wereld kunnen waarnemen, begrijpen en handelen met één verenigd model.
Een van de opvallende eigenschappen is het vermogen van het model om visuele media te genereren, te bewerken en te vergelijken over meerdere iteraties heen. Gebruikers kunnen bijvoorbeeld vragen om de belichting van een scène aan te passen, objecten toe te voegen of beweging te wijzigen, terwijl Rho‑1 een consistente interne representatie van de scène behoudt.
Robotbesturing met dezelfde gewichten
Reka demonstreerde ook dat exact dezelfde set gewichten kan worden hergebruikt voor robotbesturing. Een inverse‑dynamica‑module zet publiek beschikbare internetvideo's om in actiesignalen die robotactuatoren aansturen. Deze aanpak suggereert een route waarbij visueel leren direct motorisch gedrag informeert, zonder een aparte besturingsmodule.
- 19 billion parameters in één netwerk
- Vanuit de grond getraind tijdens een drie‑maanden, 320‑GPU H100 run
- Eén tokenstroom voor tekst, afbeelding, video en robotcommando's
- Basisversie genereert video met 0,79× realtime, opstart ~6 seconden
- Gedistilleerde acht‑stappen variant claimt 5,3‑seconden clip in ~1 seconde
De aankondiging positioneert Rho‑1 als een proof‑of‑concept voor wat Reka een "omni‑model" noemt: een systeem dat soepel kan schakelen tussen waarneming, taal en actie. Door de traditionele multimodale pijplijn te comprimeren, stelt het bedrijf dat ontwikkelingscycli verkort en integratiecomplexiteit verminderd kunnen worden.
Critici wijzen erop dat de prestatieclaims, vooral voor de gedistilleerde variant, nog niet zijn gevalideerd door onafhankelijke tests. Onafhankelijke benchmarks zullen cruciaal zijn om te bevestigen of Rho‑1 daadwerkelijk de geadverteerde snelheids‑ en kwaliteitsvoordelen levert ten opzichte van gespecialiseerde modellen.
Wat dit betekent voor Nederlandstalige organisaties
Voor bedrijven in Nederland en Vlaanderen kan Rho‑1 de AI‑infrastructuur vereenvoudigen door een reeks aparte modellen te vervangen door één enkele dienst. Content‑makers profiteren van snellere iteratieve videogeneratie, marketeers kunnen multimodale assets on‑the‑fly produceren, en fabrikanten kunnen experimentele visie‑gestuurde robotbesturing testen zonder dedicated control‑netwerken te trainen.
De gedeelde token‑benadering belooft bovendien meer consistente cross‑modale redenering, waardoor fouten die ontstaan wanneer outputs van verschillende systemen aan elkaar worden gekoppeld, mogelijk worden verminderd.
Een praktisch voorbeeld: een logistiek bedrijf zou met Rho‑1 zowel de visuele inspectie van pakketten als de bijbehorende beschrijvende rapportage in één stap kunnen uitvoeren, waarna hetzelfde model direct de robotarm kan aansturen om defecte items te sorteren.
Hoewel de technologische sprong indrukwekkend is, blijft de vraag hoe schaalbaar de oplossing is wanneer er duizenden gelijktijdige verzoeken binnenkomen. Reka heeft nog geen details vrijgegeven over de cloud‑infrastructuur of prijsmodellen die organisaties kunnen verwachten.
De komende maanden zullen onafhankelijke onderzoeksinstellingen en grote AI‑conferenties waarschijnlijk de eerste diepgaande evaluaties van Rho‑1 publiceren, wat meer helderheid zal geven over de daadwerkelijke prestaties en mogelijke beperkingen.
Voor nu blijft Rho‑1 een fascinerend experiment dat laat zien hoe ver de ambitie reikt om één enkel model te bouwen dat tekst, beeld, video en robotica naadloos combineert, en het zet de toon voor toekomstige ontwikkelingen in de multimodale AI‑ruimte.
Bronnen
- Rho-1: collapsing the multimodal stackReka AI · 5 oktober 2026
- Reka AIs Omni-Modell Rho-1 vereint Text, Bild, Video und RobotersteuerungThe Decoder · 5 oktober 2026



