BestAIVideo
Carregando
Prompt0 / 20,000
204Créditos
Créditos restantes:
Público

BestAIVideo

Dirija planos cinematográficos com o Veo 3.1 e seu som integrado

O Veo 3.1 é o modelo de vídeo do Google que gera diálogos, efeitos e som ambiente junto com a imagem. Comece por um prompt, anime um primeiro quadro ou envie até três imagens de referência; depois escolha o nível Lite, Fast ou Quality e veja o custo exato em créditos antes de gerar.

O que o Veo 3.1 oferece no gerador de vídeo

O Veo 3.1 foi pensado para clipes curtos e bem acabados, já com áudio. O gerador traz três níveis para você ajustar o custo à etapa em que o projeto está.

Três níveis, uma só família de modelos

O Lite é a opção mais barata, o Fast é o padrão equilibrado e o Quality serve para as versões finais. Os três oferecem 720p, 1080p e 4K, e o 1080p já vem selecionado.

Áudio que você não precisa adicionar depois

Todo clipe chega com diálogos, efeitos sonoros e som ambiente gerados. Não existe um botão de áudio, então escreva no prompt o som que você quer ouvir.

Quadros e referências

Anime um primeiro quadro, acrescente um último quadro se quiser, ou use a Referência multimodal com uma a três imagens nos níveis Lite e Fast para manter um personagem ou produto consistente.

Durações e formatos para cada canal

Escolha 4, 6 ou 8 segundos, sendo 8 o padrão, e uma proporção de 16:9, 9:16 ou automática para clipes horizontais, verticais ou guiados pelo quadro.

Como escrever prompts para o Veo 3.1

O guia de prompts do Google para o Veo 3.1 divide um bom prompt em partes. Use essas partes como lista de conferência, não como um modelo para copiar.

Use a fórmula de cinco partes

Combine cinematografia, sujeito, ação, contexto e estilo com atmosfera. Abrir com o tipo de plano e o movimento de câmera faz o enquadramento ser uma escolha, e não um acaso.

Coloque as falas entre aspas

Escreva o diálogo entre aspas e diga quem fala, por exemplo uma mulher diz uma frase curta. Mantenha as falas breves o bastante para caber em um clipe de poucos segundos.

Nomeie os sons

Inclua indicações como “SFX” para um efeito e “Ambient noise” para o som do ambiente ou da paisagem. Descrever o som separado da ação evita que ele seja ignorado.

Use marcas de tempo para os momentos

O prompt pode marcar instantes, como os dois primeiros segundos e os três seguintes. É texto simples, por isso funciona nesta caixa única de prompt.

Três clipes do Veo 3.1 e o que cada um ensina

Um gato de origami andando por um bairro de papel

Um gato laranja dobrado caminha por um caminho de pedra, entre árvores de papel, uma rosa e uma cerca branca, com o som ambiente correspondente. O exemplo mostra como um prompt pode definir o material de um mundo inteiro e ainda pedir um movimento natural, com peso.

Um motociclista espalhando glitter pelas dunas

Um piloto de vermelho inclina a moto numa curva enquanto poeira brilhante e luzes flutuantes preenchem o quadro. Prompts estilizados como este funcionam melhor quando citam um sujeito e um movimento e deixam o cenário criar o espetáculo.

Um cavaleiro atravessando uma pradaria dourada ao pôr do sol

Um plano lateral de acompanhamento segue um cavaleiro de chapéu largo pela relva iluminada, com o sol baixo ao fundo. O prompt de uma cena assim indica a posição da câmera, a direção da luz e os sons discretos do ambiente.

Notas de produção para o Veo 3.1

Escolha o nível conforme a etapa

Explore no Lite, refine no Fast e reserve o Quality para o plano que vai ao ar. O mesmo prompt vale para os três níveis, então trocar de nível não significa reescrever.

As referências ficam com Lite e Fast

Se um plano depende de um produto ou personagem consistente, escolha Lite ou Fast para usar a Referência multimodal, porque o nível Quality não tem modo de referência.

Escreva uma única ação clara

Oito segundos passam rápido. Um único sujeito fazendo uma coisa, com um só movimento de câmera, funciona muito melhor do que uma lista de acontecimentos.

Onde o Veo 3.1 mais compensa

Anúncios com som integrado

Produza versões em 16:9 e 9:16 de um comercial curto sem uma etapa separada de áudio.

Animação de produtos

Anime uma foto de produto a partir de um primeiro quadro e acrescente um último quadro para que o plano termine na pose que o seu layout pede.

Personagens consistentes

Use de uma a três imagens de referência nos níveis Lite ou Fast para levar um personagem ou produto por vários clipes.

Rascunhos que cabem no orçamento

Explore em 720p no Lite por 24 créditos e depois renderize a ideia escolhida no Fast ou no Quality.

Entrega em 4K

Aumente a resolução para 4K em qualquer nível quando o clipe for para uma tela grande ou para uma edição final.

Cenas conduzidas por diálogo

Escreva uma fala entre aspas, com som ambiente e efeitos, para testar uma cena antes de uma gravação ou de uma locução.

Perguntas frequentes sobre o Veo 3.1

O Veo 3.1 é o modelo de geração de vídeo do Google DeepMind. Ele cria clipes curtos a partir de texto, imagens ou referências e gera o áudio ao mesmo tempo que a imagem.


O Lite é o mais barato, o Fast é o padrão equilibrado e o Quality é o nível de maior custo, para as versões finais. O Google afirma que o Lite custa menos da metade do Veo 3.1 Fast, e neste site o Quality custa cerca de quatro vezes o Fast em 720p.


O preço é por vídeo e não muda com a duração nem com a proporção. Em 720p são 24 créditos no Lite, 48 no Fast e 200 no Quality. Em 1080p são 28, 52 e 204, e o 4K começa em 120 créditos no Lite.


720p, 1080p ou 4K em todos os níveis, e clipes de 4, 6 ou 8 segundos. Os padrões são 1080p e 8 segundos.


Texto para vídeo, geração por quadros com um primeiro quadro obrigatório e um último quadro opcional, e Referência multimodal. A Referência multimodal aceita de uma a três imagens e está disponível no Lite e no Fast, mas não no Quality.


Sim, sempre. Diálogos, efeitos e som ambiente são gerados junto com o vídeo, e você os conduz pelo prompt.


Coloque as palavras faladas entre aspas e diga quem está falando. Mantenha as falas curtas, porque um clipe dura apenas alguns segundos.


16:9, que é o padrão, 9:16 e automática.


Sim. Os prompts são traduzidos para o inglês antes da geração, então você pode escrever no idioma em que se sente mais à vontade. Deixe claros os termos-chave, como os movimentos de câmera.


Um prompt pode ter até 20.000 caracteres. As imagens de primeiro quadro, último quadro e referência são aceitas em formatos comuns, como JPG, PNG e WebP, cada uma com menos de 30 MB.


Veja primeiro o sujeito e a ação, depois o movimento de câmera e a luz. Por fim, escute de olhos fechados: o tempo das falas e o som ambiente são fáceis de avaliar quando você não está olhando a imagem.


Comece um plano com o Veo 3.1

Escolha o nível, escreva o prompt com o som que você quer e veja o custo em créditos antes de gerar.