Sistema HomeBody liga GPT‑6 Astra ao robot Unitree G1 para limpeza autónoma de cozinhas desconhecidas
Investigadores de Stanford e Caltech apresentam o HomeBody, que une o modelo de visão‑linguagem GPT‑6 Astra a um robot Unitree G1, permitindo explorar, mapear e limpar uma cozinha nova sem camadas de controlo pré‑treinadas.

Num esforço conjunto, investigadores da Universidade de Stanford e do Instituto de Tecnologia da Califórnia (Caltech) introduziram o HomeBody, uma arquitetura inovadora que conecta o grande modelo de visão‑linguagem GPT‑6 Astra directamente a um robot quadrúpede Unitree G1. A integração ultrapassa a pilha de controlo tradicional, treinada separadamente, e passa a depender do modelo de linguagem para emitir comandos de alto nível, que são traduzidos em acções robóticas através de uma biblioteca extensível de competências.
A premissa central do HomeBody é que um único modelo de visão‑linguagem intercambiável pode servir como cérebro de um agente físico. O GPT‑6 Astra recebe a entrada visual das câmaras do robot, interpreta a cena e invoca um catálogo de competências pré‑programadas – como agarrar, navegar e manipular gavetas – para executar o comportamento instruído.
Exploração e Criação de Gêmeo Digital
Antes de iniciar qualquer operação de limpeza, o robot Unitree G1 realiza uma varredura exploratória da cozinha. Durante esta fase capta imagens RGB, constrói uma representação tridimensional dentro do Nvidia Isaac Sim e regista as identidades dos objetos e as suas coordenadas espaciais numa estrutura de memória dedicada. Este gêmeo digital permite ao robot recuperar itens que mais tarde ficam fora de vista, proporcionando-lhe efetivamente um modelo persistente do mundo.
O sistema de memória foi deliberadamente concebido para ser consultável pelo GPT‑6 Astra. Quando o modelo planifica uma sequência de acções – por exemplo, “apanha a chávena vermelha do balcão e coloca‑a na máquina de lavar loiça” – pode referir‑se às localizações armazenadas para localizar a chávena mesmo depois de o robot se ter afastado e o objecto já não estar visível.
Planeamento Dirigido por Linguagem e Auto‑Correção
A execução da tarefa segue um processo de ciclo fechado. O modelo de linguagem recebe uma instrução de alto nível, como “limpar a cozinha”, decompõe‑a em sub‑objectivos e emite comandos para a biblioteca de competências. Se uma acção falhar – por exemplo, se uma gaveta não abrir – o GPT‑6 Astra detecta o erro através do feedback visual, revê o plano e tenta uma manobra corretiva.
Os investigadores atribuem explicitamente esta capacidade de auto‑correção à aptidão do modelo para raciocinar sobre as suas próprias saídas e reavaliar o estado visual após cada passo. Nenhuma supervisão externa ou sinal de reforço é necessário durante as execuções de teste.
Desempenho em Benchmarks de Navegação Zero‑Shot
Para avaliar a competência de navegação do GPT‑6 Astra isoladamente, a equipa testou o modelo no benchmark R2R‑CE, um teste de navegação incorporada zero‑shot que fornece apenas imagens monoculares RGB. O modelo atingiu uma taxa de sucesso de 79 %, superando o melhor resultado zero‑shot previamente reportado em 13 pontos percentuais e o melhor resultado supervisionado em 6,9 pontos.
Estes números demonstram que o modelo de linguagem pode traduzir fluxos visuais brutos em decisões de navegação sem qualquer ajuste fino específico da tarefa. A métrica de sucesso reflete a capacidade do robot de alcançar uma localização‑alvo dentro de uma tolerância predefinida após seguir o plano do modelo.
- A latência do modelo Astra retarda a emissão de comandos.
- O sobreaquecimento dos servos dos dedos do robot limita a agarragem prolongada.
- O elevado custo computacional impede a implementação em tempo real em hardware modesto.
- Desvios de rota e falhas em passagens estreitas persistem em layouts complexos.
Apesar dos números encorajadores nos benchmarks, a avaliação evidenciou modos de falha recorrentes. O robot por vezes desviava da rota ótima, encontrava dificuldades em atravessar corredores estreitos e confundia se tinha realmente alcançado o objetivo pretendido. No cenário de ultra‑raciocínio do benchmark, foram registadas 21 falhas, muitas das quais deixaram o robot a vários metros do destino.
Os autores salientam que o benchmark estava limitado a um conjunto de validação de 100 episódios. Não foram utilizados ajustes finos específicos de navegação, mapas pré‑construídos ou módulos de predição de pontos de passagem. Assim, a taxa de sucesso reportada reflete uma capacidade bruta, zero‑shot, e não um sistema otimizado.
A demonstração do HomeBody foi realizada num único ambiente de cozinha desconhecida. O robot recebeu a instrução “limpar a cozinha” e procedeu a explorar, mapear e manipular objectos de forma autónoma. Todas as acções foram conduzidas pelo planeamento do GPT‑6 Astra e pela biblioteca de competências, sem qualquer intervenção humana.
Limitações e Questões em Aberto
Várias restrições técnicas emergiram dos experimentos. A latência inerente à consulta a um modelo de linguagem de grande escala através de uma API externa introduz atrasos perceptíveis entre a perceção e a actuação. Além disso, os servos dos dedos do Unitree G1 apresentaram acumulação de calor durante agarragens repetidas, obrigando o sistema a pausar ou reduzir a força de preensão para evitar danos.
A exigência computacional também representa uma barreira. Executar o GPT‑6 Astra simultaneamente ao Nvidia Isaac Sim e ao motor de execução de competências requer GPUs de alto desempenho e memória substancial, limitando a viabilidade de implementar o HomeBody em dispositivos edge ou em contextos sensíveis a custos.
Por fim, o âmbito da avaliação permanece estreito. O conjunto de validação de 100 episódios não cobre a total diversidade de disposições de cozinhas, variedades de objectos ou complexidades de instruções que implementações reais encontrariam. Os autores solicitam testes mais amplos em tarefas variadas, percursos de navegação mais longos e múltiplos ambientes para medir a generalização.
Implicações Práticas para as Organizações
Para organizações que consideram robots de serviço autónomos, o HomeBody demonstra um caminho para reduzir o esforço de engenharia necessário para programar controladores de baixo nível para cada novo ambiente. Ao aproveitar um modelo de visão‑linguagem que pode ser trocado, uma única plataforma robótica poderia, em princípio, adaptar‑se a domínios diferentes simplesmente ao atualizar o modelo ou ao expandir a biblioteca de competências.
No entanto, as atuais restrições de hardware e latência significam que a operação em tempo real em contextos movimentados continua a ser desafiante. As empresas precisam avaliar se a infraestrutura computacional exigida para executar o GPT‑6 Astra em escala está alinhada com o seu orçamento e com as tolerâncias de latência.
Os modos de falha documentados sugerem ainda que aplicações críticas de segurança exigirão salvaguardas adicionais, como planificadores de navegação de reserva ou sistemas de monitorização em tempo real, para mitigar desvios de rota e garantir a verificação fiável dos objetivos.
Em resumo, o HomeBody oferece uma prova de conceito convincente de que grandes modelos de visão‑linguagem podem conduzir directamente agentes incorporados em espaços domésticos não estruturados. A abordagem reduz a dependência de treinos específicos de controlo, mas introduz novos desafios de engenharia relacionados com computação, gestão térmica e robustez, que as organizações terão de superar antes de uma adopção em larga escala.
Fontes
- Researchers plug GPT-6 Astra directly into a robot and let it clean up an unfamiliar kitchenThe Decoder · 27 de setembro de 2026
- GPT-6-Astra Lights Up Embodied Navigation Evaluation in Zero-Shot Vision-and-Language Navigation in Continuous EnvironmentsarXiv · 26 de setembro de 2026



