按阶段选档位
在 Mini 上探索,在 Fast 上打磨,把 Standard 留给要交付的那一条渲染。同一份简报三个档位通用,换档位不用重写。
BestAIVideo
Seedance 2.0 是字节跳动 Seed 团队推出的多模态视频模型,这里提供 Standard、Fast 和 Mini 三个档位,让成本跟着项目所处的阶段走。你可以从文字起步,用首尾帧锁定镜头,也可以一次交给它最多九张图片、三段视频和三段音频,生成之前就能看到准确的积分价格。
字节跳动 Seed 把它描述为一个统一模型,可以输入文字、图片、视频和音频,并在输出中同步生成声音。下面这些就是生成器里开放的设置。
Standard 细节最细腻,也是唯一支持 1080p 和 4K 的档位。Fast 迭代更快,Mini 是轻量之选,适合预览和批量探索。Fast 和 Mini 最高到 720p。
这个范围内的任意整数秒都可以选,默认是 5 秒。音频会随画面一起生成,如果想要无声片段,在高级选项里关掉开关即可。
可以用文生视频,也可以用帧生成(必须有首帧,尾帧可选),还可以用全能参考,在一次请求里最多放入 9 张图片、3 段视频和 3 个音频文件。
在文生视频模式下可以打开联网搜索,让涉及时事话题的提示词用上最新信息。它默认关闭,也不会改变价格。
字节跳动给出的指引,是把每一个上传的素材都当作简报里带编号的一部分。下面这些习惯能让内容繁多的请求依然清晰易读。
用图片 1、视频 2、音频 1 来指代素材,每种类型都按上传顺序从一开始编号。再说明从每个素材里取什么,比如图片 1 里的服装,或者视频 1 里的运镜。
每一句台词都用双引号括起来,写明是谁在说,想要某种特定的声音时,就指向一个音频参考。音乐则描述它在什么时候进入。
如果片段从一张照片开始,就把画幅设为自适应,或者先把照片裁成目标比例。两者不一致,是开头出现拉伸和跳变的常见原因。
字节跳动建议控制在大约 1,000 个英文单词以内,因为太长的提示词会丢失细节。在这个范围内,按时间码列出来的写法效果不错,比如先写前两秒,再写接下来的三秒。
一位红裙女子把白衬衫夹在晾衣绳上,低垂的太阳在屋顶上洒下耀眼的光斑,身旁放着一只木篮。它是安静、单一主体简报的范例,靠光线和环境声来撑起画面。
两名对手,一位身穿白袍,一位披着蓑衣、戴着斗笠,在薄雾笼罩的泥地上周旋、交锋。这类打斗,只要提示词按顺序列出每一个回合,并写明每一回合的机位,就更容易控制。
俯拍镜头里,手指抚过米色桌面上的人造毛皮,旁边是亚克力板和气泡膜,配有贴近的、带触感的声音。它展示了这个模型怎样围绕质感和声音来组织一段视频,而不是围绕故事。
在 Mini 上探索,在 Fast 上打磨,把 Standard 留给要交付的那一条渲染。同一份简报三个档位通用,换档位不用重写。
帧生成和全能参考是两个独立的模式。如果镜头需要精确的首帧和尾帧,就用帧生成,再用文字来描述额外的参考内容。
字节跳动指出,4K 输出使用的编码有些播放器和浏览器无法直接打开,所以在计划 4K 交付之前,先在目标设备上检查一下播放情况。
在 Mini 档以 480p 出草稿,5 秒片段只要 38 积分,只留下值得用更好画质重新渲染的想法。
交付用的是 Standard 档,5 秒的 1080p 片段是 408 积分,4K 是 832 积分。
最多放入九张图片,让一个人物、一件产品或一处场景在多个片段里都能被认出来。
上传一段参考视频,再描述要借用的运动方式,积分费率比不带视频的请求更低。
在图片或视频之外再加最多三个音频文件,来引导人声、节拍或氛围。
用首帧和尾帧来决定片段从哪里开始,又落在哪里。
它是字节跳动 Seed 团队推出的多模态视频模型,于 2026 年 2 月发布。它接受文字、图片、视频和音频作为输入,并生成声音与画面同步产出的视频。
Standard 细节最丰富,提供 480p、720p、1080p 和 4K。Fast 更快,Mini 最轻量,两者都最高到 720p。三个档位的模式和设置完全相同。
价格随时长和分辨率变化。5 秒、720p 的片段,Standard 是 164 积分,Fast 是 132 积分,Mini 是 82 积分。480p 下分别是 76、62 和 38 积分。提交之前,生成器会显示准确的数字。
会。请求里包含参考视频时,你生成的每一秒会按更低的费率计算。Standard 档 5 秒、720p 的片段,带参考视频是 100 积分,不带则是 164 积分。
可以选 4 到 15 之间的任意整数秒,默认是 5 秒。如果需要更长的场景,本站的 Seedance 2.5 可以超过 15 秒。
在全能参考模式下,最多 9 张图片、3 段视频和 3 个音频文件,至少需要一个文件。图片要小于 30 MB,视频小于 50 MB,音频小于 15 MB。
有 1:1、4:3、3:4、16:9、9:16、21:9 和自适应,默认预选 16:9。对以图片为主的片段,自适应会跟随你的图片。
可以。音频默认开启,在高级选项里用开关就能去掉。这个设置不会改变价格。
它用最多 9 张图片、3 段视频和 3 个音频文件生成 4 至 15 秒的片段。Seedance 2.5 可以做到 30 秒,也接受多得多的参考素材。在本站,1080p 和 4K 只在 2.0 版的 Standard 档提供。
把每一句话放进双引号,写明是谁在说,如果上传了声音样本,再说明声音要参照哪个音频文件。台词要简短,能放进片段的时长里。
在文生视频模式下,它能让模型在理解你的提示词时查找最新信息。它是可选的,默认关闭,在帧生成和参考模式下不可用。