按阶段选档位
在 Lite 上探索,在 Fast 上打磨,把 Quality 留给要发布的那一条镜头。同一条提示词可以在三个档位之间通用,换档位不用重写。
BestAIVideo
Veo 3.1 是 Google 推出的视频模型,能把对白、音效和环境声与画面一起生成。你可以从一段提示词出发,也可以让首帧动起来,或者最多给它三张参考图,再选择 Lite、Fast 或 Quality 档位,生成之前就能看到准确的积分消耗。
它擅长制作带音频的精致短片。生成器提供三个档位,让你按项目所处的阶段来匹配成本。
Lite 成本最低,Fast 均衡,是默认选择,Quality 用于最终成片。三个档位都支持 720p、1080p 和 4K,默认预选 1080p。
每段视频都自带生成的对白、音效和环境声。这里没有音频开关,想要什么声音,直接写进提示词即可。
可以让首帧动起来,也可以再加一个尾帧;在 Lite 和 Fast 档位还能使用全能参考,上传一到三张图片,让角色或产品在不同镜头里保持一致。
时长可选 4 秒、6 秒或 8 秒,默认 8 秒;画幅可选 16:9、9:16 或自动,分别对应横屏、竖屏和以画面为准的片段。
Google 提供的提示词指南把一条好提示词拆成了几个部分。把它们当作检查清单来用,不必照抄成模板。
把镜头语言、主体、动作、场景环境以及风格与氛围组合起来。开头先写景别和运镜,构图就是有意为之,而不是碰运气。
对白用引号括起来,并写明是谁在说,比如一位女士说了一句简短的话。台词要简短,才能放进几秒钟的片段里。
加上提示,比如用 SFX 标注音效,用 Ambient noise 标注房间或环境的底噪。把声音和动作分开写,声音就不容易被忽略。
提示词里可以标出具体时刻,比如前两秒发生什么、接下来三秒发生什么。它是纯文本,所以在这个单一的提示词输入框里就能用。
一只折出来的橙色小猫沿着石板路走过纸树、玫瑰和白色尖桩栅栏,配有相应的环境声。它说明提示词可以先定下整个世界的材质,同时仍然要求自然、有分量感的动作。
一名红衣车手压弯过弯,闪亮的粉尘和漂浮的光点充满画面。这类风格化的提示词,最好只写一个主体和一个动作,让环境去负责场面的震撼感。
侧向跟拍镜头跟随一位戴宽檐帽的骑手穿过发光的草地,低垂的太阳在身后。这样的镜头,其提示词会写清机位、光线方向和场景里安静的声音。
在 Lite 上探索,在 Fast 上打磨,把 Quality 留给要发布的那一条镜头。同一条提示词可以在三个档位之间通用,换档位不用重写。
如果镜头依赖一致的产品或角色,请选择 Lite 或 Fast 来使用全能参考,因为 Quality 档位没有参考模式。
八秒很短。一个主体做一件事、配一个运镜,比罗列一堆事件好看得多。
制作一支短广告的 16:9 和 9:16 两个版本,不需要再单独做一轮声音。
从首帧出发让产品展示图动起来,再加一个尾帧,让镜头停在版面需要的姿态上。
在 Lite 或 Fast 档位使用一到三张参考图,让同一个角色或产品出现在多个片段里。
先在 Lite 档以 720p 探索,每次 24 积分,选定想法后再用 Fast 或 Quality 渲染。
当片段要上大屏或进入母版剪辑时,任何档位都可以把分辨率提高到 4K。
写一句带引号的台词,配上环境声和音效,在开拍或录音之前先把场景做个原型。
Veo 3.1 是 Google DeepMind 推出的视频生成模型。它可以根据文字、图片或参考图生成短视频,并在生成画面的同时生成音频。
Lite 最便宜,Fast 均衡,是默认选择,Quality 成本最高,用于最终成片。Google 表示 Lite 的成本不到 Veo 3.1 Fast 的一半,而在本站,Quality 在 720p 下的价格约为 Fast 的四倍。
按条计费,不随时长或画幅变化。720p 下,Lite 是 24 积分,Fast 是 48 积分,Quality 是 200 积分;1080p 下分别是 28、52 和 204 积分;4K 从 Lite 的 120 积分起。
每个档位都支持 720p、1080p 或 4K,时长可选 4 秒、6 秒或 8 秒。默认值是 1080p 和 8 秒。
有文生视频、帧生成(必须有首帧,尾帧可选)和全能参考。全能参考接受一到三张图片,Lite 和 Fast 档位可用,Quality 档位不可用。
是的,始终自带。对白、音效和环境声会随视频一起生成,你通过提示词来引导它们。
把说的话放进引号,并写明是谁在说。台词要简短,因为一段视频只有几秒钟。
可选 16:9、9:16 和自动,其中 16:9 是默认值。
可以。提示词在生成前会被翻译成英文,所以你可以用自己熟悉的语言来写。运镜等关键术语要写得清楚。
提示词最多可以包含 20,000 个字符。首帧、尾帧和参考图支持 JPG、PNG、WebP 等常见格式,每张不超过 30 MB。
先看主体和动作,再看运镜和光线。最后闭上眼睛听一遍:不看画面的时候,语音的时机和环境声最容易判断。