Escolha o nível conforme a etapa
Explore no Mini, refine no Fast e reserve o Standard para a renderização que você vai entregar. O mesmo briefing serve para os três, então trocar de nível não significa reescrever tudo.
BestAIVideo
O Seedance 2.0 é o modelo de vídeo multimodal da ByteDance Seed e, aqui, ele vem nos níveis Standard, Fast e Mini para que o custo acompanhe a etapa do seu projeto. Comece por um texto, ancore um plano com quadros ou envie até nove imagens, três clipes de vídeo e três clipes de áudio, e veja o preço exato em créditos antes de gerar.
A ByteDance Seed descreve o Seedance 2.0 como um modelo unificado para entrada de texto, imagem, vídeo e áudio, com som sincronizado no resultado. Estas são as configurações que o gerador oferece.
O Standard entrega o maior nível de detalhe e é o único nível com 1080p e 4K. O Fast itera mais depressa, e o Mini é a escolha leve para prévias e exploração em lote. O Fast e o Mini vão até 720p.
Escolha qualquer número inteiro de segundos dentro dessa faixa. O padrão é 5. O áudio é gerado junto com a imagem, e um interruptor nas opções avançadas o desativa quando você quer um clipe mudo.
Texto para vídeo, geração por quadros com um primeiro quadro obrigatório e um último quadro opcional, ou a Referência multimodal, que aceita até 9 imagens, 3 clipes de vídeo e 3 arquivos de áudio em um único pedido.
No modo de texto para vídeo, você pode ativar a pesquisa na web para que um prompt sobre um assunto atual se apoie em informações recentes. Ela vem desativada por padrão e não altera o preço.
A orientação da ByteDance para o Seedance 2.0 trata cada upload como uma parte numerada do briefing. Os hábitos abaixo mantêm legível um pedido cheio de arquivos.
Cite Imagem 1, Vídeo 2 e Áudio 1, numerando cada tipo a partir de um, na ordem em que você enviou. Diga o que aproveitar de cada um, como a roupa da Imagem 1 ou o movimento de câmera do Vídeo 1.
Escreva cada fala entre aspas duplas, diga quem fala e indique uma referência de áudio quando quiser uma voz específica. Descreva a música pelo momento em que ela entra.
Se o clipe começa a partir de uma foto, defina a proporção como adaptável ou recorte a foto no formato desejado. A diferença entre os dois é a causa mais comum de distorção e saltos no início.
A ByteDance recomenda ficar abaixo de cerca de 1.000 palavras em inglês, porque prompts longos perdem detalhes. Uma lista com marcação de tempo, como os dois primeiros segundos e depois os três seguintes, funciona bem dentro desse limite.
Uma mulher de vestido vermelho prende camisas brancas em um varal enquanto o sol baixo brilha sobre os telhados e um cesto de madeira repousa ao lado dela. É um exemplo de briefing calmo e de um único sujeito, em que a luz e o som ambiente fazem o trabalho.
Dois lutadores, um de túnica branca e outro com capa de palha e chapéu cônico, giram e se chocam em um chão de lama, sob a névoa. Um combate assim fica mais fácil de controlar quando o prompt lista cada troca de golpes em ordem, com a posição da câmera para cada uma.
Uma tomada de cima de dedos acariciando pelo sintético ao lado de placas de acrílico e plástico-bolha sobre uma mesa bege, gravada com um som próximo e tátil. Ela mostra como o Seedance 2.0 pode construir um clipe em torno de textura e áudio, e não de uma história.
Explore no Mini, refine no Fast e reserve o Standard para a renderização que você vai entregar. O mesmo briefing serve para os três, então trocar de nível não significa reescrever tudo.
A geração por quadros e a Referência multimodal são modos separados. Se um plano exige primeiro e último quadro exatos, use a geração por quadros e descreva as referências extras em palavras.
A ByteDance observa que a saída em 4K usa uma codificação que alguns reprodutores e navegadores não abrem diretamente, então teste a reprodução no dispositivo de destino antes de planejar uma entrega em 4K.
Faça rascunhos em 480p no Mini, onde um clipe de 5 segundos custa 38 créditos, e guarde apenas as ideias que merecem uma renderização melhor.
O Standard é o nível para a entrega, com 408 créditos por um clipe de 1080p de 5 segundos e 832 em 4K.
Envie até nove imagens para que uma pessoa, um produto ou um cenário continue reconhecível ao longo de vários clipes.
Envie um clipe de referência e descreva o movimento a emprestar, com uma taxa de créditos menor do que a de um pedido sem vídeo.
Adicione até três arquivos de áudio junto com uma imagem ou um vídeo para conduzir a voz, a batida ou o clima.
Use um primeiro quadro e um último quadro para decidir onde o clipe começa e onde ele termina.
O Seedance 2.0 é o modelo de vídeo multimodal da ByteDance Seed, anunciado em fevereiro de 2026. Ele recebe texto, imagens, vídeo e áudio como entrada e produz vídeo com o som gerado junto com a imagem.
O Standard tem mais detalhe e oferece 480p, 720p, 1080p e 4K. O Fast é mais rápido e o Mini é o mais leve, e ambos vão até 720p. Os três compartilham os mesmos modos e configurações.
O preço varia conforme a duração e a resolução. Para um clipe de 5 segundos em 720p, são 164 créditos no Standard, 132 no Fast e 82 no Mini. Em 480p, são 76, 62 e 38. O gerador mostra o valor exato antes de você enviar.
Sim. Quando o pedido inclui um vídeo de referência, vale uma taxa por segundo menor para os segundos que você gera. Um clipe de 5 segundos em 720p no Standard custa 100 créditos com vídeo de referência, contra 164 sem ele.
Qualquer número inteiro de segundos de 4 a 15, com 5 como padrão. Para cenas mais longas, o Seedance 2.5, também disponível neste site, passa de 15 segundos.
No modo Referência multimodal, até 9 imagens, 3 vídeos e 3 arquivos de áudio. É preciso pelo menos um arquivo, e as imagens devem ter menos de 30 MB, os vídeos menos de 50 MB e os áudios menos de 15 MB.
1:1, 4:3, 3:4, 16:9, 9:16, 21:9 e adaptável, com 16:9 já selecionada. Em clipes guiados por imagem, a opção adaptável segue a sua imagem.
Sim. O áudio vem ativado por padrão e um interruptor nas opções avançadas o remove. Essa configuração não altera o preço.
O Seedance 2.0 faz clipes de 4 a 15 segundos com até 9 imagens, 3 vídeos e 3 arquivos de áudio. O Seedance 2.5 chega a 30 segundos e aceita muito mais referências. Neste site, 1080p e 4K existem apenas no Seedance 2.0 Standard.
Coloque cada fala entre aspas duplas, nomeie quem fala e, se você enviou uma amostra de voz, diga qual arquivo de áudio a voz deve seguir. Mantenha as falas curtas o bastante para a duração do clipe.
No modo de texto para vídeo, ela permite que o modelo consulte informações atuais enquanto interpreta o seu prompt. É opcional, vem desativada por padrão e não está disponível nos modos de quadros e de referência.
Escolha um nível, defina como começar e veja o preço em créditos antes de gerar.