Como gerar vídeos de IA usando Gemini


Os modelos Gemini sempre acompanharam os avanços da IA. Dos chatbots baseados em texto em 2023, o Gemini evoluiu para um sistema multimodal capaz de compreender e gerar texto, áudio, imagens… e agora vídeos.

A geração de vídeo por IA não é mais uma ferramenta independente. Com Gêmeos Omnia criação de vídeo se torna fashionable.

Gêmeos Omni não é importante porque gera vídeos.

É importante porque a geração de vídeo está se tornando apenas mais uma capacidade de um assistente de IA

Quando usado corretamente, os casos de uso podem ser muito criativos (se você conseguir olhar além das grades de proteção).

Frase ou Imagem → Vídeo

Sim, você leu certo. No mínimo, o Gemini Omni pode trabalhar com uma única imagem ou uma linha de texto para criar um vídeo inteiro!

Como gerar vídeos de IA usando Gemini

Isso é possível porque o Gemini Omni não trata texto, imagens, áudio e vídeo como tarefas separadas.

Em vez disso, ele os entende como diferentes formas de informação. Como resultado, um immediate simples como “Um drone voando sobre montanhas cobertas de neve ao nascer do sol” pode ser expandido em uma sequência de vídeo completa com movimento, transições de cena e detalhes cinematográficos.

Da mesma forma, os usuários podem fornecer uma imagem estática e pedir ao Gemini Omni para animá-la, gerando movimento pure da câmera, movimento do objeto e efeitos ambientais a partir de uma única entrada visible.

Casos de uso do Gemini Omni

Aqui estão os três principais casos de uso do Gemini Omni:

1. Geração de imagem para vídeo

Teste: Carregue uma imagem e anime-a em um vídeo.

Imagem de entrada para Gemini Omni

Incitar: “Esta é a silhueta de um personagem fictício parecido com um assassino (como o personagem principal de American Psyc*o). Quero que você a anime de uma forma que transmita uma personalidade furtiva e perigosa, mantendo o estilo do vídeo consistente com a imagem.”

Resultado:

Além do BGM, o vídeo foi incrível. O estilo foi um pouco mantido na imagem de entrada (embora eu quisesse que tudo fosse codificado em 2D).

Observação: Embora esta tarefa devesse usar apenas uma imagem para a geração do vídeo, um immediate suplementar teve que ser fornecido para algum contexto.

2. Geração de texto para vídeo

Teste: Gere uma cena cinematográfica usando apenas um immediate de texto.

Incitar:

TITLE: The Cloud Painter

STYLE: Whimsical animated quick movie. Charming, lighthearted, visually polished. Smooth storybook aesthetic. Excessive-quality animation. Constant character design all through your entire video.

PROMPT:

A small, spherical white rabbit sporting a yellow raincoat stands alone in an unlimited inexperienced meadow beneath an overcast sky.
The rabbit stays the identical measurement, look, clothes, and proportions all through your entire video.
In its paw, the rabbit holds a tiny paintbrush that glows with comfortable golden gentle.
Curious, the rabbit reaches upward and gently paints a streak throughout a low-hanging cloud.
Wherever the comb touches, the grey cloud transforms into colourful shapes.
The rabbit paints a small fish-shaped cloud. The fish lazily swims by means of the sky.
The rabbit laughs and paints a bird-shaped cloud. The cloud hen flaps its wings and joins the fish.
Excited, the rabbit continues portray. The sky step by step fills with playful cloud creatures: whales, turtles, foxes, and dragons, all made fully from comfortable fluffy clouds.
The rabbit by no means modifications clothes, by no means modifications species, and all the time stays a small white rabbit in a yellow raincoat.
A delicate breeze carries the cloud creatures throughout the sky. The rabbit watches proudly from the meadow beneath.
Golden daylight slowly breaks by means of the clouds, illuminating the scene with heat afternoon gentle.
The cloud animals collect overhead and kind an enormous coronary heart form within the sky.
The rabbit sits quietly within the grass and admires its work.

Last shot: a large cinematic view of the meadow, the rabbit sitting peacefully beneath a sky full of stunning residing cloud creatures drifting into the sundown.

VISUAL REQUIREMENTS:

• One character solely
• Constant rabbit look in each shot
• Constant yellow raincoat
• Smooth pastel coloration palette
• Mild digicam actions
• Storybook-quality visuals
• Cute however elegant design
• No dialogue
• Excessive visible coherence
• Clean animation
• Robust character consistency

NEGATIVE PROMPT:

Character altering look, altering clothes, further limbs, lacking limbs, human palms, life like people, a number of rabbits, duplicated characters, distorted anatomy, flickering objects, inconsistent proportions, textual content, subtitles, watermark, emblem, horror, darkness, aggressive motion, chaotic movement.

Resultado:

Um ótimo vídeo para o immediate fornecido. A animação foi consistente com o immediate.

Observação: Um alerta negativo é basicamente uma lista de coisas que você está dizendo ao modelo:

Por favor, não faça isso.

Pense no immediate principal como o acelerador e no immediate negativo como a proteção.

3. Edição de vídeos

Teste: Use um vídeo como entrada e edite-o de acordo com o immediate.

Incitar: Transforme esse vídeo do meu gameplay no estilo anime. Painéis preto e branco e todas essas coisas boas.”

Resultado:

Veredicto Last

Esses três testes cobrem a maioria dos casos de uso do mundo actual: criação de vídeos do zero, animação de imagens existentes e manutenção da consistência usando imagens de referência. Juntos, eles fornecem uma imagem clara de onde o Gemini Omni se destaca e onde suas limitações atuais se tornam aparentes.

Onde Gemini Omni ainda fica aquém

Aqui estão algumas das limitações do Gemini Omni:

  • O limite de uso se esgota ao gerar de 3 a 5 vídeos no máximo. Um único vídeo de 10 segundos para este artigo consumiu aproximadamente 22% do limite de uso.
Limites de uso no Gemini Pro
  • A duração do vídeo é limitada em torno 10 segundos no máximo.
  • Os vídeos gerados incluem marca d’água de IA through SynthID.
  • O acesso requer um plano pago do Google AI: Plus, Professional ou Extremely.
  • Você pode enviar apenas um vídeo como entrada/referência.
  • Alguns recursos são restritos por região, especialmente avatares e edição de vídeo para vídeo.
  • Os limites de uso dependem do plano do usuário e podem ser atingidos rapidamente porque a geração de vídeo utiliza mais computação.
  • Certos recursos de semelhança/avatar podem não funcionar com todas as imagens pessoais ou humanas, dependendo da política e da disponibilidade.

O maior problema do Gemini Omni é a sua política de direitos autorais e guarda-corpos de terceiros. Você quase nunca poderia trabalhar com um conteúdo que mostrasse isso:

  1. Consiste em uma celebridade
  2. É proveniente de um native respeitável na Web

Mesmo se você estiver enviando algo completamente novo, poderá ser saudado com isto:

Gêmeos não consegue gerar vídeos

A duração da geração do vídeo (< um minuto na maioria dos casos) e os limites de uso são problemas secundários. Para mim, a constante negação da geração por diversos motivos foi a parte mais irritante da minha experiência com o Gemini Omni.

Como acessar o Gemini Omni

Existem 2 maneiras de acessar o Gemini Omni:

  • Assinaturas Gêmeos: Usando o seguinte assinaturas pagas:
    • Google AI Plus
    • Google IA Professional
    • Google IA Extremely
  • Acesso do desenvolvedor: Os desenvolvedores podem acessá-lo through:

Os limites de acesso e a disponibilidade podem variar de acordo com o plano e a região. Gemini usa limites baseados em computação que variam de acordo com a complexidade do vídeo, seu tamanho e outros fatores semelhantes.

Conclusão

Gemini Omni deixa uma coisa clara: A geração de vídeo AI não é mais uma novidade separada. Através de edição de imagem para vídeo, texto para vídeo e edição de vídeo, ele mostra como um simples immediate ou referência pode se transformar em uma sequência visible utilizável com velocidade, estilo e alcance criativo surpreendentes.

Mas a experiência não é isenta de atritos. Durações curtas, limites de uso, marca d’água, restrições regionaise proteção de conteúdo estritaainda o seguramos. Por enquanto, Gemini Omni parece um vislumbre poderoso de como seria a geração contínua de vídeo no futuro.

Sou especializado em revisar e refinar pesquisas, documentação técnica e conteúdo orientados por IA relacionados a tecnologias emergentes de IA. Minha experiência abrange treinamento de modelos de IA, análise de dados e recuperação de informações, o que me permite criar conteúdo que seja tecnicamente preciso e acessível.

Faça login para continuar lendo e desfrutar de conteúdo com curadoria de especialistas.

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *