Reka lança Rho‑1, modelo omni de 19 bilhões de parâmetros para texto, imagem, vídeo e controle de robôs
Em 5 de outubro de 2026, a Reka AI anunciou o Rho‑1, um modelo único de 19 bilhões de parâmetros que processa texto, imagens, vídeos, raciocínio e ações robóticas em um fluxo de tokens compartilhado, prometendo geração de vídeo em tempo real e controle direto de robôs.

A Reka AI apresentou o Rho‑1 em um evento de lançamento virtual em 5 de outubro de 2026. O modelo é descrito como um sistema de "nível de pesquisa" construído do zero com 19 bilhões de parâmetros, projetado para lidar com múltiplas modalidades — texto, imagens, vídeo, raciocínio lógico e ações físicas — dentro de uma única rede neural.
Ao contrário da maioria das pilhas de IA contemporâneas, que dependem de modelos especializados separados para cada modalidade, o Rho‑1 codifica cada entrada e saída como tokens que compartilham um contexto comum. Esse design elimina a necessidade de pipelines distintos de visão, linguagem ou controle, permitindo que a mesma matriz de pesos interprete e gere em diferentes domínios.
Representação token unificada
A Reka explica que texto, patches de imagem, quadros de vídeo e comandos de robô são todos convertidos para um formato token uniforme antes de serem processados pelo modelo. O contexto compartilhado permite que o sistema retenha informações sobre interações anteriores, tornando possível modificar uma imagem ou vídeo em várias etapas iterativas sem reiniciar o estado.
A empresa afirma que a versão base do Rho‑1 pode gerar vídeo a 0,79× a velocidade real, iniciando a reprodução em cerca de seis segundos após a solicitação. Em testes internos, uma variante destilada — reduzida a oito passos — produziu um clipe de 5,3 segundos em aproximadamente um segundo, embora esses números ainda não tenham sido verificados independentemente.
Desempenho e detalhes do treinamento
Segundo o The Decoder, o treinamento durou aproximadamente três meses e utilizou 320 GPUs Nvidia H100. O orçamento intensivo de computação reflete a ambição de colapsar a pilha multimodal em uma única arquitetura, objetivo que a Reka apresenta como um passo rumo a sistemas que podem perceber, entender e agir no mundo usando um modelo unificado.
A capacidade do modelo de gerar, editar e comparar mídia visual ao longo de múltiplas interações é destacada como um diferencial chave. Usuários podem solicitar uma série de refinamentos — como mudar a iluminação, adicionar objetos ou alterar o movimento — enquanto o modelo preserva uma representação interna coerente da cena.
Controle robótico com os mesmos pesos
A Reka também demonstra que o mesmo conjunto de pesos pode ser reutilizado para controle de robôs. Um componente de dinâmica inversa traduz vídeos disponíveis publicamente na internet em sinais de ação que acionam atuadores robóticos. Essa abordagem sugere um caminho onde o aprendizado visual informa diretamente o comportamento motor sem um módulo de controle separado.
- 19 bilhões de parâmetros em uma única rede
- Treinado do zero em três meses, usando 320 GPUs H100
- Fluxo token unificado para texto, imagem, vídeo e comandos de robô
- Versão base gera vídeo a 0,79× tempo real, início ~6 segundos
- Variante destilada de oito passos afirma clipe de 5,3 segundos em ~1 segundo
O anúncio posiciona o Rho‑1 como uma prova de conceito do que a Reka chama de "omni‑model" — um sistema que pode transitar fluidamente entre percepção, linguagem e ação. Ao colapsar o pipeline multimodal tradicional, a empresa argumenta que os ciclos de desenvolvimento podem ser encurtados e as complexidades de integração reduzidas.
Críticos observam que as alegações de desempenho, especialmente da variante destilada, ainda não foram validadas por testes de terceiros. Benchmarks independentes serão essenciais para confirmar se o Rho‑1 realmente entrega as vantagens de velocidade e qualidade anunciadas em relação a modelos especializados.
O que isso significa para organizações de língua portuguesa
Para empresas que operam em mercados de língua portuguesa, o Rho‑1 pode simplificar a infraestrutura de IA ao substituir um conjunto de modelos separados por um único serviço. Criadores de conteúdo ganhariam geração de vídeo iterativa mais rápida, profissionais de marketing poderiam produzir ativos multimodais sob demanda, e fabricantes poderiam experimentar controle de robôs guiado por visão sem treinar redes de controle dedicadas. A abordagem de token unificado também promete raciocínio cross‑modal mais consistente, reduzindo erros que surgem ao combinar saídas de sistemas distintos.
Fontes
- Rho-1: collapsing the multimodal stackReka AI · 5 de outubro de 2026
- Reka AIs Omni-Modell Rho-1 vereint Text, Bild, Video und RobotersteuerungThe Decoder · 5 de outubro de 2026



