输入与参考素材 · FLUX 3
按用途整理图片、视频和音频,并在同一请求中为每份素材指定明确角色。
BestAIVideo
FLUX 3 将多种媒体决策纳入一个模型系列中。 BestAIVideo 将这些功能构建为一个生产系统:定义可交付成果、将图像和声音事件映射到时间、为每个参考分配一个角色,以及一次检查一个故障变量。
官方版本连接了视觉生成、声音、时间推理和动作预测。 以下媒体是 Black Forest Labs 的官方文档,用于说明已发布的功能。
共享基础模型场景的外观、变化、声音和反应,并有助于保持跨媒体的主题和视觉语言的一致性。 这减少了不相关的创意工具之间的交接。 视频、音频和动作预测在官方页面上进行了演示,图像生成将在稍后的版本中公布。
FLUX 3 视频使用可选本机音频创建长达 20 秒的剪辑,包括多语言语音、效果和氛围。 在一条时间线上规划动作、对话、摄像机移动和环境声音,以便所有视听节拍支持同一场景。
官方功能包括文本到视频转换、图像到视频转换、开始帧和结束帧、有序关键帧以及多个场景或摄像机角度。 尽管这些输入支持有意排序,但仍需要明确的优先级以防止身份、配置和运动参考冲突。
此版本介绍了如何从最后一帧继续剪辑,同时向前移动动量、框架和场景逻辑。 它还强调场景中的精确排版和传统电影作品之外的广泛风格,包括产品、品牌、动作设计、插图和实验方向。
将图像、动作和声音规划为一个摘要而不是三个摘要。 首先建立你的创作逻辑,包括主题身份、时间安排和音频意图,然后决定用哪种方式来传达每个节拍以及它们之间的过渡应该是什么样的。
请选择图像、有声视频、关联序列或动作参考。 记录目标频道、宽高比、播放时间、品牌规则和验收标准,以确保您的简报包含一个可衡量的目标,而不是不相关的请求。
将视频分为开头、有意义的过渡和结尾。 为每个片段分配持续时间、主体动作、摄像机移动、环境变化和过渡。 对于多个场景,解释为什么位置和角度会改变以及什么保持连续性。
按身份、产品、衣柜、位置、构图、灯光、版式或动作标记参考。 注意哪些资产驱动每个决策,对竞争来源进行排名,删除意外的样式,并确保您的最终参考包传达一个一致的视觉方向。
将对话、氛围、效果、音乐、摄像机和动作放入一条时间线。 标记声音引导、跟随或强调视觉事件的时间,有意定义沉默时刻,并确保所有音频提示支持可见的故事节拍。
在添加动作之前为角色身份、产品比例、调色板、灯光、排版和构图构建一致的参考包。 记录每个资产的角色和优先级,删除冲突的来源,并仅保留支持相同创意方向的参考。
写入每个计划镜头的开始状态、结束状态、主要动作、摄像机路径、音频事件和连续性要求。 定义可以锚定下一个镜头的帧。 这将为有序关键帧、多个场景和延续创建一个可测试的计划。
单独检查身份、空间逻辑、运动、计时、版式、口型同步和音频。 记录问题发生的第一秒,并在每次迭代时更改一个变量(提示措辞、参考优先级、关键帧计时、摄像机方向或声音提示)。 保存成功的片段,而不是每次获得结果时重写整个大纲。
按用途整理图片、视频和音频,并在同一请求中为每份素材指定明确角色。
先用短片测试动作,再选择当前模型支持的时长和分辨率。
将提示词、参数和参考素材保存在历史记录中,方便比较并复现结果。
围绕一个产品标识规划静态图像、动作、版式、语音和声音。 定义颜色、徽标处理、产品形状、所需声明和最终消息时间,以确保所有媒体遵循相同的活动系统。
连接上下文、人物动作、位置或角度变化,并在 20 秒内给出清晰的结局。 有序的关键帧和连续性注释有助于防止出现有吸引力但不相关的镜头。
我们一起设计动作、镜头节奏、多语言音频、效果和氛围。 测量关键节拍和嘴巴动作,并定义声音是在场景中捕获、添加为旁白还是在镜头之间使用。
将文本视为场景的一部分,而不是单独的叠加层。 指定需要可读性的文本、位置、材料、灯光交互、进入和退出时间以及框架。
将批准的参考框架组织到拍摄计划中,并在制作前审查构图、舞台、过渡、声音提示和品牌要求。 清晰的预可视化有助于分阶段和评估多个场景的连续性。
准备可重复检查以生成、评估并从成功的最终帧继续。 涵盖身份、移动方向、摄像机高度、照明、环境条件以及剪辑之间的音频切换。
FLUX 3 是 Black Forest Labs 的图像、视频、音频和动作预测的统一模型。 官方页面演示了视频、原生音频、时间推理和动作预测,图像生成将在以后的版本中宣布。
从预期结果开始,定义主体身份、参考角色、场景顺序、时间、摄像机移动和音频意图。 它将图像和声音放在一条时间线上,指示在来源冲突的情况下哪个参考优先,并以可测量的连续性和质量检查结束。
统一多模式模型在一个创意环境中对外观、运动、时间、声音和动作进行推断。 这使得在场景之间协调相同的主题和故事逻辑变得容易,而不是在单独的工具之间传递断开连接的输出。
FLUX 3 涵盖一个模型系列中的图像、视频、音频和动作预测。 视频、原生音频和动作预测在正式版本中进行了演示,而图像生成则在后续版本中宣布。
FLUX 3 视频在一代中创建长达 20 秒的剪辑。 使用定时拍摄计划来调整整个拍摄过程中的场景变化、拍摄对象动作、摄像机移动、对话、效果和情绪。
是。 FLUX 3 支持可选的本机音频,具有与帧一起生成的多语言语音、效果和氛围。 将图像和声音事件放在同一时间线上,以控制每个视听节拍的开始、变化和分辨率。
FLUX 3 支持文本、静止图像、开始帧和结束帧、多个有序关键帧、多个场景或摄像机角度,以及从现有剪辑的最后一帧继续。 为所有投入分配明确的角色和优先级,以便它们相互加强而不是相互矛盾。
使用一组一致的 ID 引用并重复视觉属性的定义,以指定那些不会因位置和摄像机角度而变化的属性。 有序的关键帧、连续性注释和清晰的参考层次结构有助于保留身份、服装、产品几何形状和场景逻辑。
作为单独的通道检查身份、构图、空间逻辑、运动、计时、版式、口型同步和音频。 标记出现问题的第一个点,更改一个变量,然后保存成功的段,以便您可以跟踪每次修改的原因。
使用简洁的主提示、一致的 ID 引用以及定义每个位置、动作、摄像机角度和过渡的有序关键帧或场景注释。 将对话和音频提示对齐到同一时间线,指示哪些细节在整个场景中持续存在,哪些细节可能会发生变化。