Reka dévoile Rho‑1, modèle omni‑de 19 milliards de paramètres pour texte, image, vidéo et robotique
Le 5 octobre 2026, Reka AI a présenté Rho‑1, un modèle unique de 19 milliards de paramètres capable de traiter texte, images, vidéos, raisonnement et commandes robotiques via un flux de tokens partagé, promettant génération vidéo en temps réel et contrôle direct de robots.

Reka AI a introduit Rho‑1 lors d’un événement virtuel le 5 octobre 2026. Le modèle est présenté comme un système « de recherche » construit de zéro avec 19 milliards de paramètres, conçu pour gérer plusieurs modalités — texte, images, vidéo, raisonnement logique et actions physiques — au sein d’un même réseau neuronal.
Contrairement aux piles d’IA actuelles qui reposent sur des modèles spécialisés distincts pour chaque modalité, Rho‑1 encode chaque entrée et sortie sous forme de tokens partageant un contexte commun. Cette architecture supprime le besoin de pipelines séparés de vision, de langage ou de contrôle, permettant à la même matrice de poids d’interpréter et de générer dans tous les domaines.
Représentation token unifiée
Reka explique que le texte, les patchs d’image, les images‑clés vidéo et les commandes robotisées sont tous convertis en un format token uniforme avant d’être traités par le modèle. Le contexte partagé permet au système de conserver les informations des interactions précédentes, rendant possible la modification d’une image ou d’une vidéo sur plusieurs étapes itératives sans réinitialiser l’état.
L’entreprise affirme que la version de base de Rho‑1 peut générer de la vidéo à 0,79 × la vitesse réelle, en démarrant la lecture environ six secondes après la requête. Dans des évaluations internes, une variante distillée — réduite à huit étapes — aurait produit un clip de 5,3 secondes en à peu près une seconde, bien que ces chiffres n’aient pas encore été vérifiés de façon indépendante.
Performances et détails de l’entraînement
Selon The Decoder, la phase d’entraînement a duré approximativement trois mois et a mobilisé 320 GPU Nvidia H100. Ce budget de calcul intensif reflète l’ambition de condenser la pile multimodale en une architecture unique, objectif que Reka décrit comme une étape vers des systèmes capables de percevoir, comprendre et agir dans le monde avec un seul modèle.
La capacité du modèle à générer, éditer et comparer des médias visuels sur plusieurs tours est mise en avant comme un différenciateur clé. Les utilisateurs peuvent demander une série d’ajustements — changement d’éclairage, ajout d’objets ou modification du mouvement — tout en conservant une représentation interne cohérente de la scène.
Contrôle robotique avec les mêmes poids
Reka montre également que le même ensemble de poids peut être réutilisé pour le contrôle robotique. Un composant d’inverse‑dynamique traduit des vidéos publiques disponibles sur Internet en signaux d’action qui pilotent les actionneurs robotisés. Cette approche suggère une voie où l’apprentissage visuel alimente directement le comportement moteur, sans module de contrôle distinct.
- 19 milliards de paramètres dans un réseau unique
- Entraînement de zéro sur trois mois, 320 GPU H100
- Flux de tokens unifié pour texte, image, vidéo et commandes robotisées
- Version de base génère vidéo à 0,79 × temps réel, démarrage ~6 secondes
- Version distillée à huit étapes revendique un clip de 5,3 secondes en ~1 seconde
L’annonce place Rho‑1 comme une preuve de concept de ce que Reka appelle un « omni‑modèle » — un système pouvant passer fluidement de la perception au langage puis à l’action. En condensant le pipeline multimodal traditionnel, l’entreprise soutient que les cycles de développement pourraient être raccourcis et les complexités d’intégration réduites.
Les critiques soulignent que les performances annoncées, notamment pour la variante distillée, restent non validées par des tests tiers. Des benchmarks indépendants seront essentiels pour confirmer si Rho‑1 offre réellement les gains de vitesse et de qualité annoncés par rapport aux modèles spécialisés.
Implications pour les organisations francophones
Pour les entreprises opérant dans les marchés francophones, Rho‑1 pourrait simplifier l’infrastructure IA en remplaçant une suite de modèles séparés par un service unique. Les créateurs de contenu bénéficieraient d’une génération vidéo itérative plus rapide, les marketeurs pourraient produire des actifs multimodaux à la volée, et les industriels pourraient expérimenter un contrôle robotique guidé par la vision sans entraîner de réseaux de contrôle dédiés. L’approche token unifiée promet également un raisonnement cross‑modal plus cohérent, réduisant les erreurs liées à l’assemblage de sorties provenant de systèmes disparates.
sources”: [ {
Sources
- Rho-1: collapsing the multimodal stackReka AI · 5 octobre 2026
- Reka AIs Omni-Modell Rho-1 vereint Text, Bild, Video und RobotersteuerungThe Decoder · 5 octobre 2026



