Simulador mundial interativo para treinamento e avaliação de políticas de robôs


Simulador mundial interativo para treinamento e avaliação de políticas de robôs
Think about que você queira ensinar um robô a empurrar um objeto sobre uma mesa. A receita padrão no aprendizado de robôs é coletar centenas de demonstrações de especialistas em um robô actual, treinar uma política de aprendizagem de imitação com base nesses dados e, em seguida, avaliar a política executando-a muitas vezes no mesmo robô actual. Ambas as etapas (coleta e avaliação de dados) são lentas, caras e difíceis de reproduzir: quebras de {hardware}, mudanças de iluminação, objetos saindo do lugar e cada nova tarefa significa mais horas no laboratório.

Uma questão pure é se podemos substituir parte deste trabalho de robô actual por um simulador. Os simuladores clássicos baseados na física são poderosos, mas construir um para uma nova tarefa significa modelar manualmente geometrias, contatos, atrito e deformação, e o simulador resultante muitas vezes ainda não corresponde à realidade o suficiente para que as políticas treinadas dentro dele possam ser transferidas.

Em nosso trabalho, seguimos um caminho diferente. Nós construímos um Simulador Mundial Interativo: um modelo de previsão de vídeo aprendido e condicionado à ação que, dada a imagem atual e uma sequência de ações do robô, prevê os próximos quadros puramente no espaço de pixels, sem mecanismo de física interno. Você pode conectar um dispositivo de teleoperação e controlar o robô por meio deste modelo de mundo aprendido por mais de 10 minutos a 15 FPS em um único RTX 4090, e o vídeo previsto permanece estável e fisicamente plausível.

A ideia principal é que, se o simulador for suficientemente fiel, poderemos desbloquear dois gargalos de longa knowledge na aprendizagem do robô:

– A geração de dados para treinamento fica barata, pois podemos coletar demonstrações dentro do simulador.
– A avaliação de políticas torna-se escalável e reproduzível, porque podemos lançar muitas políticas através do simulador sob condições idênticas.

O que o simulador mundial pode fazer
Treinamos nosso simulador mundial em quatro tarefas de manipulação que abrangem regimes físicos muito diferentes: empurrão em T (contato com corpo rígido), roteamento de corda (interação deformável-rígida com um clipe), agarrar caneca (dinâmica de pinça refinada) e varrer pilha (manipular pilhas de objetos). Todos os quatro comportamentos são aprendidos apenas a partir de dados de interação, sem nenhuma física prévia codificada.

Alguns exemplos do que o modelo captura:

Roteamento da corda: distingue corretamente entre a corda que está sendo inserida no clipe e a corda que passa por ela sem fazer contato. Crucialmente, não influencia nenhum dos resultados – segue o que as ações implicam.

Agarrar a caneca: captura efeitos refinados, como a caneca escorregando da pinça ou a alça sendo empurrada e girada.

Varredura de pilha: pode gerar vídeo para vários pontos de vista de forma consistente

Você pode tentar isso diretamente em nosso página do projeto: basta abrir um navegador e brincar com ele usando o teclado!

Como construímos o simulador mundial interativo

Em alto nível, o Interactive World Simulator é treinado em duas etapas. Primeiro, treinamos um autoencoder que compacta imagens RGB em representações latentes 2D compactas e as reconstrói em imagens. Isso permite que o modelo raciocine em um espaço de dimensão inferior enquanto ainda produz resultados de alta fidelidade em nível de pixel.

Em segundo lugar, congelamos este autoencoder e treinamos um modelo dinâmico condicionado pela ação no espaço latente. Dadas as latentes visuais anteriores e as ações do robô, o modelo prevê o próximo estado latente, que é então decodificado novamente em uma imagem. No momento da inferência, esse processo é repetido de forma autorregressiva: os quadros previstos tornam-se parte do contexto para prever os quadros futuros. Como a previsão acontece no espaço latente e usa modelos de consistência, o simulador pode ser executado de forma interativa enquanto permanece estável em longos horizontes.

Como é diferente dos trabalhos anteriores?

Isso difere de várias abordagens existentes para simulação de robôs e modelagem mundial. Os simuladores de física clássica podem ser poderosos, mas muitas vezes exigem a especificação handbook da geometria do objeto, da dinâmica de contato, do atrito e da deformação, e a simulação resultante ainda pode ter uma grande lacuna entre o sim e o actual. Os métodos recentes de geração de vídeo e de modelo mundial oferecem uma alternativa mais baseada em dados, mas muitos não estão explicitamente condicionados às ações do robô, são muito lentos para interação em tempo actual, de código fechado ou instáveis ​​em implementações de longo horizonte.

Em contraste, nosso Simulador Mundial Interativo é condicionado à ação, produz previsões fisicamente precisas em nível de pixel e suporta interações estáveis ​​por mais de 10 minutos a 15 FPS em uma GPU RTX 4090 de consumidor único. Isto o torna prático não apenas como modelo de previsão visible, mas também como mecanismo interativo para coletar dados de treinamento de políticas e avaliar políticas de robôs de forma reproduzível. Possui múltiplas aplicações.

Aplicação 1: geração de dados escaláveis

Se o nosso simulador for bom o suficiente, as demonstrações coletadas usando este modelo mundial podem realmente substituir demonstrações reais para treinar políticas de aprendizagem por imitação?

Para responder a isso, coletamos demonstrações inteiramente dentro de nosso simulador mundial e, em seguida, treinamos políticas de imitação de aprendizagem com 0% de dados do mundo actual e 100% de dados gerados. Implantamos as políticas treinadas diretamente no robô actual. As políticas implementadas não apenas completam as tarefas. Eles permanecem robustos sob contínuas perturbações humanas. Isto demonstra que a qualidade dos dados gerados é comparável aos dados reais.

Aplicação 2: avaliação fiel de políticas

Avaliar uma política de robô no mundo actual é difícil: você precisa redefinir o cenário, executar novamente a política muitas vezes e comparar os pontos de verificação sob condições correspondentes. Na prática, isso não é escalonável e reproduzível.

Em contraste, poderíamos implementar políticas no nosso modelo mundial para uma avaliação reprodutível. Avaliamos as mesmas quatro políticas (DP, ACT, π0, π0,5) dentro do simulador e no robô actual, com as mesmas configurações iniciais. Cada ponto da nossa avaliação é um ponto de verificação de políticas, pontuado tanto no mundo actual como no modelo mundial. Observamos uma forte correlação entre as duas pontuações, entre tarefas e entre políticas. Qualitativamente, boas políticas que têm sucesso no simulador também têm sucesso no robô actual, e más políticas que falham no simulador também falham no robô actual.

Esperando ansiosamente

A previsão de vídeo condicionada à ação há muito tempo mostra um grande potencial para a robótica, mas as abordagens existentes têm sido muito lentas para uso interativo ou muito frágeis sob inferência de longo horizonte. Ao abordar ambos – estabilidade e eficiência computacional – o Simulador Mundial Interativo torna-se um mecanismo prático para duas coisas ao mesmo tempo: treinar políticas de imitação em dados gerados por simuladores que tenham desempenho comparável àqueles treinados em demonstrações do mundo actual, e avaliar políticas de uma forma que acompanhe de perto o desempenho no mundo actual.

No futuro, ampliaremos a estrutura para ambientes mais diversos e tarefas de manipulação cada vez mais complexas, para desbloquear ainda mais o potencial dos dados robóticos em grande escala. Uma direção importante para trabalhos futuros é estudar como o desempenho dos modelos mundiais aumenta com quantidades crescentes de dados de interação e recursos computacionais. A compreensão desses comportamentos de escala poderia orientar o projeto de modelos mundiais maiores e mais capazes para a robótica.




Yixuan Wang
é doutorando do último ano em Ciência da Computação na Universidade de Columbia e cientista pesquisador no NVIDIA Seattle Robotics Lab.

Yixuan Wang é doutorando do último ano em Ciência da Computação na Universidade de Columbia e cientista pesquisador no NVIDIA Seattle Robotics Lab.

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *