Previsão de vídeo egocêntrica condicionada de corpo inteiro – The Berkeley Synthetic Intelligence Analysis Weblog



Previsão de vídeo egocêntrica condicionada de corpo inteiro – The Berkeley Synthetic Intelligence Analysis Weblog

Previsão de vídeo centrado no ego a partir de ações humanas (PEVA). Dados os quadros de vídeo anteriores e uma ação que especifica uma mudança desejada na pose 3D, o PEVA prevê o próximo quadro de vídeo. Nossos resultados mostram que, dado o primeiro quadro e uma sequência de ações, nosso modelo pode gerar vídeos de ações atômicas (a), simular contrafactuais (b) e suportar geração de vídeos longos (c).

Os últimos anos trouxeram avanços significativos nos modelos mundiais que aprendem a simular resultados futuros para planeamento e controlo. Da física intuitiva à previsão de vídeo em várias etapas, esses modelos têm se twister cada vez mais poderosos e expressivos. Mas poucos são projetados para agentes verdadeiramente incorporados. Para criar um Modelo Mundial para Agentes Incorporados, precisamos de um actual agente encarnado que atua no actual mundo. UM actual o agente incorporado tem um espaço de ação complexo fisicamente fundamentado, em oposição aos sinais de controle abstratos. Eles também devem atuar em diversos cenários da vida actual e apresentar uma visão egocêntrica em oposição a cenas estéticas e câmeras estacionárias.

💡 Dica: Clique em qualquer imagem para visualizá-la em resolução máxima.

Por que é difícil

  • A ação e a visão dependem fortemente do contexto. A mesma visão pode levar a movimentos diferentes e vice-versa. Isso ocorre porque os humanos agem em ambientes complexos, incorporados e direcionados a objetivos.
  • O controle humano é altamente dimensional e estruturado. O movimento de corpo inteiro abrange mais de 48 graus de liberdade com dinâmica hierárquica e dependente do tempo.
  • A visão egocêntrica revela a intenção, mas esconde o corpo. A visão em primeira pessoa reflete os objetivos, mas não a execução do movimento; os modelos devem inferir consequências de ações físicas invisíveis.
  • A percepção fica atrás da ação. O suggestions visible geralmente chega segundos depois, exigindo previsão de longo horizonte e raciocínio temporal.

Para desenvolver um Modelo Mundial para Agentes Incorporados, devemos basear a nossa abordagem em agentes que cumpram estes critérios. Os humanos rotineiramente olham primeiro e agem depois – nossos olhos se fixam em um objetivo, o cérebro executa uma breve “simulação” visible do resultado e só então o corpo se transfer. A cada momento, nossa visão egocêntrica serve como entrada do ambiente e reflete a intenção/objetivo por trás do próximo movimento. Quando consideramos os movimentos do nosso corpo, devemos considerar tanto as ações dos pés (locomoção e navegação) quanto as ações das mãos (manipulação) ou, mais genericamente, o controle de todo o corpo.

O que fizemos?

Treinamos um modelo para Preditar Ecentrado Video de humano UMações (PEVA) para previsão de vídeo egocêntrica condicionada pelo corpo inteiro. Condições PEVA em trajetórias de pose cinemáticas estruturadas pela hierarquia conjunta do corpo, aprendendo a simular como as ações humanas físicas moldam o ambiente a partir de uma visão em primeira pessoa. Treinamos um transformador de difusão condicional autorregressivo em Nymeria, um conjunto de dados em grande escala que combina vídeo egocêntrico do mundo actual com captura de pose corporal. Nosso protocolo de avaliação hierárquica testa tarefas cada vez mais desafiadoras, fornecendo uma análise abrangente das habilidades incorporadas de previsão e controle do modelo. Este trabalho representa uma tentativa inicial de modelar ambientes complexos do mundo actual e comportamentos incorporados de agentes por meio de previsão de vídeo na perspectiva humana.

Método

Representação de ação estruturada a partir de movimento

Para unir o movimento humano e a visão egocêntrica, representamos cada ação como um vetor rico e de alta dimensão, capturando tanto a dinâmica do corpo inteiro quanto os movimentos articulares detalhados. Em vez de usar controles simplificados, codificamos a translação international e as rotações relativas das juntas com base na árvore cinemática do corpo. O movimento é representado no espaço 3D com 3 graus de liberdade para translação da raiz e 15 articulações da parte superior do corpo. Usar ângulos de Euler para rotações relativas de juntas produz um espaço de ação de 48 dimensões (3 + 15 × 3 = 48). Os dados de captura de movimento são alinhados com o vídeo usando carimbos de knowledge/hora e depois convertidos de coordenadas globais para um quadro native centrado na pelve para invariância de posição e orientação. Todas as posições e rotações são normalizadas para garantir um aprendizado estável. Cada ação captura mudanças de movimento entre quadros, permitindo que o modelo conecte o movimento físico com consequências visuais ao longo do tempo.

Projeto de PEVA: Transformador de Difusão Condicional Autoregressivo


Embora o Transformador de Difusão Condicional (CDiT) da Navigation World Fashions use sinais de controle simples, como velocidade e rotação, a modelagem do movimento humano de todo o corpo apresenta desafios maiores. As ações humanas são de alta dimensão, estendidas temporalmente e fisicamente restritas. Para enfrentar esses desafios, estendemos o método CDiT de três maneiras:

  • Timeskis aleatórios: permite que o modelo aprenda dinâmicas de movimento de curto prazo e padrões de atividade de longo prazo.
  • Treinamento em nível de sequência: modela sequências de movimento inteiras aplicando perda em cada prefixo de quadro.
  • Incorporações de ação: Concatena todas as ações no tempo t em um tensor 1D para condicionar cada camada AdaLN para movimento de corpo inteiro de alta dimensão.

Estratégia de amostragem e implementação

No momento do teste, geramos quadros futuros condicionando um conjunto de quadros de contexto passados. Codificamos esses quadros em estados latentes e adicionamos ruído ao quadro alvo, que é então progressivamente eliminado usando nosso modelo de difusão. Para acelerar a inferência, restringimos a atenção, onde a atenção dentro da imagem é aplicada apenas ao quadro alvo e a atenção cruzada de contexto é aplicada apenas ao último quadro. Para previsão condicionada à ação, usamos uma estratégia de implementação autorregressiva. Começando com quadros de contexto, nós os codificamos usando um codificador VAE e acrescentamos a ação atual. O modelo então prevê o próximo quadro, que é adicionado ao contexto enquanto descarta o quadro mais antigo, e o processo se repete para cada ação na sequência. Finalmente, decodificamos as latentes previstas no espaço de pixels usando um decodificador VAE.

Ações Atômicas

Decompomos movimentos humanos complexos em ações atômicas – como movimentos das mãos (para cima, para baixo, esquerda, direita) e movimentos de todo o corpo (para frente, rotação) – para testar a compreensão do modelo sobre como movimentos específicos no nível das articulações afetam a visão egocêntrica. Incluímos alguns exemplos aqui:

Lançamento longo

Aqui você pode ver a capacidade do modelo de manter a consistência visible e semântica ao longo de horizontes de previsão estendidos. Demonstramos algumas amostras de PEVA gerando lançamentos coerentes de 16 segundos condicionados ao movimento de corpo inteiro. Incluímos algumas amostras de vídeo e amostras de imagens para uma visualização mais detalhada aqui:


Sequência 1

Sequência 2

Sequência 3

Planejamento

O PEVA pode ser usado para planejamento, simulando múltiplos candidatos à ação e pontuando-os com base na sua semelhança perceptual com o objetivo, conforme medido pelo LPIPS.



Neste exemplo, descarta caminhos que levam à pia ou ao ar livre para encontrar o caminho correto para abrir a geladeira.



Neste exemplo, ele exclui caminhos que levam a pegar plantas próximas e ir para a cozinha, enquanto encontra uma sequência razoável de ações que levam à prateleira.

Permite capacidade de planejamento visible

Formulamos o planejamento como um problema de minimização de energia e realizamos a otimização de ações usando o Método de Entropia Cruzada (CEM), seguindo a abordagem introduzida em Navigation World Fashions (arXiv:2412.03572). Especificamente, otimizamos as sequências de ação para o braço esquerdo ou direito, enquanto mantemos outras partes do corpo fixas. Exemplos representativos dos planos resultantes são mostrados abaixo:



Nesse caso, somos capazes de prever uma sequência de ações que eleva nosso braço direito até a vareta. Vemos uma limitação em nosso método, pois prevemos apenas o braço direito, portanto não prevemos mover o braço esquerdo para baixo de acordo.



Neste caso, somos capazes de prever uma sequência de ações que chega até a chaleira, mas não a agarra como no gol.



Nesse caso, conseguimos prever uma sequência de ações que puxa nosso braço esquerdo para dentro, semelhante ao gol.

Resultados Quantitativos

Avaliamos o PEVA através de múltiplas métricas para demonstrar sua eficácia na geração de vídeos egocêntricos de alta qualidade a partir de ações de corpo inteiro. Nosso modelo supera consistentemente as linhas de base em qualidade perceptual, mantém a coerência em horizontes de longo prazo e mostra fortes propriedades de escala com o tamanho do modelo.

Métricas Perceptivas de Linha de Base

Comparação de métricas perceptivas de base em diferentes modelos.

Desempenho de ação atômica

Comparação de modelos na geração de vídeos de ações atômicas.

Comparação de FID

Comparação de FID entre diferentes modelos e horizontes temporais.

Dimensionamento

PEVA tem boa capacidade de dimensionamento. Modelos maiores levam a um melhor desempenho.

Direções Futuras

Nosso modelo demonstra resultados promissores na previsão de vídeos egocêntricos a partir do movimento de todo o corpo, mas continua sendo um passo inicial em direção ao planejamento incorporado. O planejamento limita-se a simular ações de braços candidatos e carece de planejamento de longo horizonte e otimização completa da trajetória. Estender o PEVA para controle de circuito fechado ou ambientes interativos é o próximo passo elementary. Atualmente, o modelo carece de condicionamento explícito sobre a intenção da tarefa ou objetivos semânticos. Nossa avaliação usa similaridade de imagens como objetivo proxy. Trabalhos futuros poderiam aproveitar a combinação do PEVA com o condicionamento de metas de alto nível e a integração de representações centradas em objetos.

Agradecimentos

Os autores agradecem a Rithwik Nukala por sua ajuda na anotação de ações atômicas. Nós agradecemos Katerina Fragkiadaki, Philipp Krähenbühl, Bharat Hariharan, Guanya Shi, Shubham Tulsiani e Deva Ramanan pelas sugestões e feedbacks úteis para melhorar o artigo; Jianbo Shi para a discussão sobre teoria de controle; Yilun Du pelo apoio ao Forçamento de Difusão; Brent Yi por sua ajuda em trabalhos relacionados ao movimento humano e Alexei Efros para a discussão e debates sobre modelos de mundo. Este trabalho é parcialmente apoiado pelo ONR MURI N00014-21-1-2801.


Para mais detalhes, leia o artigo completo ou visite o web site do projeto.

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *