Elige el nivel según la fase
Explora con Mini, afina con Fast y reserva Standard para el render que vas a entregar. El mismo brief sirve para los tres, así que cambiar de nivel no obliga a reescribir.
BestAIVideo
Seedance 2.0 es el modelo de vídeo multimodal de ByteDance Seed, y aquí se ofrece en los niveles Standard, Fast y Mini para que el coste acompañe a la fase de tu proyecto. Empieza desde texto, fija un plano con fotogramas o dale hasta nueve imágenes, tres clips de vídeo y tres clips de audio, y consulta el precio exacto en créditos antes de generar.
ByteDance Seed presenta Seedance 2.0 como un modelo unificado que admite texto, imagen, vídeo y audio de entrada y devuelve sonido sincronizado en la salida. Estos son los ajustes que expone el generador.
Standard ofrece el mayor detalle y es el único nivel con 1080p y 4K. Fast itera más deprisa, y Mini es la opción ligera para previsualizaciones y exploración por lotes. Fast y Mini se quedan en 720p.
Elige cualquier número entero de segundos dentro de ese rango. El valor por defecto es 5. El audio se genera junto con la imagen, y un interruptor en las opciones avanzadas lo desactiva cuando quieres un clip silencioso.
Texto a vídeo, generación por fotogramas con un fotograma inicial obligatorio y un fotograma final opcional, u Omni Reference, que acepta hasta 9 imágenes, 3 clips de vídeo y 3 archivos de audio en una sola solicitud.
En el modo de texto a vídeo puedes activar la búsqueda web para que un prompt sobre un tema de actualidad se apoye en información reciente. Viene desactivada por defecto y no cambia el precio.
La guía de ByteDance para Seedance 2.0 trata cada archivo subido como una parte numerada del brief. Los hábitos de abajo mantienen legible una solicitud cargada.
Habla de Image 1, Video 2 y Audio 1, numerando cada tipo desde uno según el orden en que lo subiste. Indica qué tomar de cada uno, por ejemplo el vestuario de Image 1 o el movimiento de cámara de Video 1.
Escribe cada frase hablada entre comillas dobles, indica quién habla y señala un audio de referencia cuando quieras una voz concreta. Describe la música según el momento en que entra.
Si un clip parte de una foto, fija la relación de aspecto en adaptativa o recorta la foto a la forma deseada. Un desajuste es la causa habitual de deformaciones y saltos al principio.
ByteDance recomienda no pasar de unas 1.000 palabras en inglés, porque los prompts largos pierden detalles. Una lista con tiempos, como los dos primeros segundos y después los tres siguientes, funciona bien dentro de ese margen.
Una mujer con vestido rojo cuelga camisas blancas de un tendedero mientras el sol bajo destella sobre los tejados y una cesta de madera descansa a su lado. Es un modelo de brief tranquilo y de un solo sujeto en el que la luz y el sonido ambiente hacen el trabajo.
Dos combatientes, uno con túnica blanca y otro con capa de paja y sombrero cónico, giran y chocan sobre un suelo embarrado entre la niebla. Un combate así se controla mejor cuando el prompt enumera cada intercambio por orden, con la posición de cámara de cada uno.
Un plano cenital de dedos que acarician piel sintética junto a placas de acrílico y plástico de burbujas sobre una mesa beige, grabado con un sonido cercano y táctil. Muestra cómo Seedance 2.0 puede construir un clip en torno a la textura y el audio en lugar de en torno a una historia.
Explora con Mini, afina con Fast y reserva Standard para el render que vas a entregar. El mismo brief sirve para los tres, así que cambiar de nivel no obliga a reescribir.
La generación por fotogramas y Omni Reference son modos distintos. Si un plano necesita un fotograma inicial y uno final exactos, usa la generación por fotogramas y describe con palabras las referencias adicionales.
ByteDance señala que la salida en 4K usa una codificación que algunos reproductores y navegadores no pueden abrir directamente, así que comprueba la reproducción en tu dispositivo de destino antes de planificar una entrega en 4K.
Haz borradores en 480p con Mini, donde un clip de 5 segundos cuesta 38 créditos, y quédate solo con las ideas que merezcan un render mejor.
Standard es el nivel para la entrega, con 408 créditos por un clip de 5 segundos en 1080p y 832 en 4K.
Aporta hasta nueve imágenes para que una persona, un producto o un escenario siga siendo reconocible a lo largo de varios clips.
Sube un clip de referencia y describe el movimiento que quieres tomar prestado, con una tarifa de créditos más baja que en una solicitud sin vídeo.
Añade hasta tres archivos de audio junto a una imagen o un vídeo para orientar la voz, el pulso o el ambiente.
Usa un fotograma inicial y uno final para decidir dónde empieza el clip y dónde termina.
Seedance 2.0 es el modelo de vídeo multimodal de ByteDance Seed, presentado en febrero de 2026. Toma texto, imágenes, vídeo y audio como entrada y produce vídeo con el sonido generado junto a la imagen.
Standard tiene el mayor detalle y ofrece 480p, 720p, 1080p y 4K. Fast es más rápido y Mini es el más ligero, y ambos se quedan en 720p. Los tres comparten los mismos modos y ajustes.
El precio crece con la duración y la resolución. Para un clip de 5 segundos en 720p son 164 créditos en Standard, 132 en Fast y 82 en Mini. En 480p son 76, 62 y 38. El generador muestra la cifra exacta antes de enviar.
Sí. Cuando una solicitud incluye un vídeo de referencia, se aplica una tarifa por segundo más baja a los segundos que generas. Un clip de 5 segundos en 720p con Standard cuesta 100 créditos con vídeo de referencia frente a 164 sin él.
Cualquier número entero de segundos de 4 a 15, con 5 por defecto. Para escenas más largas, Seedance 2.5 en este sitio supera los 15 segundos.
En el modo Omni Reference, hasta 9 imágenes, 3 vídeos y 3 archivos de audio. Hace falta al menos un archivo, y las imágenes deben pesar menos de 30 MB, los vídeos menos de 50 MB y el audio menos de 15 MB.
1:1, 4:3, 3:4, 16:9, 9:16, 21:9 y adaptativa, con 16:9 preseleccionada. En los clips basados en imágenes, la adaptativa sigue la forma de tu imagen.
Sí. El audio viene activado por defecto y un interruptor en las opciones avanzadas lo quita. Este ajuste no cambia el precio.
Seedance 2.0 crea clips de 4 a 15 segundos a partir de hasta 9 imágenes, 3 vídeos y 3 archivos de audio. Seedance 2.5 llega a 30 segundos y acepta muchas más referencias. En este sitio, 1080p y 4K solo están en Seedance 2.0 Standard.
Pon cada frase entre comillas dobles, nombra a quien habla y, si subiste una muestra de voz, indica qué archivo de audio debe seguir la voz. Mantén las frases lo bastante cortas para la duración del clip.
En el modo de texto a vídeo permite que el modelo consulte información actual mientras interpreta tu prompt. Es opcional, viene desactivada por defecto y no está disponible en los modos de fotogramas y de referencias.
Elige un nivel, decide cómo empezar y consulta el precio en créditos antes de generar.