Reka apresenta Rho‑1, modelo omni de 19 mil milhões de parâmetros para texto, imagem, vídeo e controlo de robôs
Em 5 de outubro de 2026, a Reka AI revelou o Rho‑1, um modelo único de 19 mil milhões de parâmetros que processa texto, imagens, vídeo, raciocínio e acções robóticas num único fluxo de tokens, prometendo geração de vídeo em tempo real e controlo directo de robôs.

A Reka AI introduziu o Rho‑1 num evento de lançamento virtual a 5 de outubro de 2026. O modelo é descrito como um sistema de "grau de investigação" construído do zero com 19 mil milhões de parâmetros, concebido para lidar com múltiplas modalidades — texto, imagens, vídeo, raciocínio lógico e acções físicas — dentro de uma única rede neural.
Ao contrário da maioria das pilhas de IA contemporâneas, que dependem de modelos especializados distintos para cada modalidade, o Rho‑1 codifica toda a entrada e saída como tokens que partilham um contexto comum. Este desenho elimina a necessidade de pipelines separados de visão, linguagem ou controlo, permitindo que a mesma matriz de pesos interprete e gere em diferentes domínios.
Representação unificada de tokens
A Reka explica que texto, fragmentos de imagem, frames de vídeo e comandos de robô são todos convertidos num formato de token uniforme antes de serem processados pelo modelo. O contexto partilhado permite ao sistema reter informação sobre interacções anteriores, tornando possível modificar uma imagem ou vídeo ao longo de vários passos iterativos sem reiniciar o estado.
A empresa afirma que a versão base do Rho‑1 pode gerar vídeo a 0,79× a velocidade real, iniciando a reprodução cerca de seis segundos após o pedido. Em testes internos, uma variante destilada — reduzida a oito passos — produziu um clip de 5,3 segundos em cerca de um segundo, embora estes números ainda não tenham sido verificados independentemente.
Desempenho e detalhes do treino
Segundo o The Decoder, a corrida de treino durou aproximadamente três meses e utilizou 320 GPUs Nvidia H100. O orçamento intensivo de computação reflete a ambição de colapsar a pilha multimodal numa única arquitetura, objetivo que a Reka enquadra como um passo rumo a sistemas que podem perceber, compreender e agir no mundo usando um modelo unificado.
A capacidade do modelo de gerar, editar e comparar media visual ao longo de múltiplas interacções é destacada como um diferencial chave. Os utilizadores podem solicitar uma série de refinamentos — como mudar a iluminação, acrescentar objetos ou alterar o movimento — enquanto o modelo preserva uma representação interna coerente da cena.
Controlo robótico com os mesmos pesos
A Reka também demonstra que o mesmo conjunto de pesos pode ser reutilizado para controlo de robôs. Um componente de dinâmica inversa traduz vídeos disponíveis publicamente na internet em sinais de acção que conduzem os actuadores robóticos. Esta abordagem sugere um caminho onde a aprendizagem visual alimenta directamente o comportamento motor sem um módulo de controlo separado.
- 19 mil milhões de parâmetros numa única rede
- Treinado do zero num período de três meses, com 320 GPUs H100
- Fluxo de tokens unificado para texto, imagem, vídeo e comandos de robô
- Versão base gera vídeo a 0,79× tempo real, arranque ~6 segundos
- Variante destilada de oito passos afirma clip de 5,3 segundos em ~1 segundo
O anúncio coloca o Rho‑1 como uma prova de conceito do que a Reka chama de "omni‑model" — um sistema que pode transitar fluidamente entre perceção, linguagem e ação. Ao colapsar o pipeline multimodal tradicional, a empresa argumenta que os ciclos de desenvolvimento podem ser encurtados e as complexidades de integração reduzidas.
Os críticos salientam que as reivindicações de desempenho, especialmente para a variante destilada, permanecem não validadas por testes de terceiros. Benchmarks independentes serão essenciais para confirmar se o Rho‑1 entrega realmente as vantagens de velocidade e qualidade anunciadas em relação a modelos especializados.
O que isto significa para organizações lusófonas
Para empresas que operam em mercados de língua portuguesa, o Rho‑1 pode simplificar a infraestrutura de IA ao substituir um conjunto de modelos separados por um único serviço. Criadores de conteúdo beneficiariam de uma geração de vídeo iterativa mais rápida, departamentos de marketing poderiam produzir ativos multimodais sob demanda, e indústrias de fabrico poderiam experimentar controlo robótico guiado por visão sem necessidade de treinar redes de controlo dedicadas. A abordagem de token unificado também promete um raciocínio cross‑modal mais consistente, reduzindo erros que surgem ao combinar saídas de sistemas distintos.
Fontes
- Rho-1: collapsing the multimodal stackReka AI · 5 de outubro de 2026
- Reka AIs Omni-Modell Rho-1 vereint Text, Bild, Video und RobotersteuerungThe Decoder · 5 de outubro de 2026



