统一的视觉风格
图像、视频与音频联合训练,让静帧转为动态场景时,角色、色调和光线保持连贯。
Black Forest Labs 的 FLUX 3 可生成带原生音频与多语言对白的 AI 视频。从文字、图像或关键帧出发,让整段场景保持统一的视觉风格。
图像、视频与音频联合训练,让静帧转为动态场景时,角色、色调和光线保持连贯。
每次生成最长 20 秒的音画视频,为一句对白、一个反应和一次运镜留足展开空间。
将片段连接成更长的多镜头场景。在每条提示词中明确主体、光线与运镜,让镜头自然衔接。
用参考图确定角色、色调和构图,也可以直接从文生视频提示词开始。
描述动作与镜头运动,用首帧、尾帧或关键帧引导画面。
在提示词中加入对白、语言和环境音,原生音频会与画面一同生成。
| 对比维度 | FLUX 2 | FLUX 3 |
|---|---|---|
| 支持模态 | 图像——文生图与图像编辑合于一个模型。 | 图像、视频、音频与动作预测合于一个模型。 |
| 视频 | 非视频模型。 | 单次生成最长 20 秒并带音频。 |
| 音频 | 不支持。 | 原生音频生成,支持多语种对白。 |
| 技术架构 | 潜空间流匹配,将 24B 视觉语言模型与整流流式 Transformer 结合。 | 基于 Self-Flow,在图像、视频与音频上联合训练。 |
| 可用性 | 现已在 YouArt 上线,支持创作与编辑模式。 | 现已在 YouArt 上线。 |
YouArt 提供带同步音频的 FLUX 3 Video,支持 720p 和 1080p。图像生成与编辑可使用 FLUX 2 或 Flux Kontext。
把活动主视觉变为 20 秒广告,制作多语言版本,并保持产品、色调与信息一致。
让商品静图动起来并配上声音,保留消费者需要辨认的形状、颜色与质感。
用带对白、运镜和音效的场景预演,让团队直接判断叙事节奏。
让培训视频中的出镜人物保持一致,并基于同一创意方向生成多语言版本。
一个积分余额,使用 FLUX 3 Video、FLUX 2、Flux Kontext 等模型。
适合爱好者和探索者
适合专业人士
适合高级用户和团队
适合团队和工作室
FLUX 3 是 Black Forest Labs 于 2026 年 7 月 23 日发布的多模态模型,用一个模型覆盖图像、视频、音频与动作预测。它是在这些模态上联合训练出来的,而不是由多个独立系统拼装而成。和任何早期体验版本一样,可用范围与支持的模式仍可能变化;YouArt 目前提供 FLUX 3 Video 供实际生成使用。
可以——FLUX 2 与 Flux Kontext 现已在 YouArt 上线。FLUX 2 支持文生图与参考图引导编辑,提供创作与编辑两种模式;Flux Kontext 则基于单张参考图做指令式编辑,并支持蒙版局部重绘。在 YouArt 使用这些流程,你不需要自己管理任何模型权重。
FLUX 2 是图像模型,在一个模型内同时支持文生图与单图 / 多图参考编辑。FLUX 3 把范围扩展到文生视频、视频、音频与动作预测,并且是单一模型联合训练,单次生成最长可产出 20 秒带音频的视频。
可以——单次生成最长 20 秒带音频的视频,支持多语种对白,并可基于输入的视频与音频继续生成。更长的内容由多个片段串联成多镜头序列,而不是把一次生成硬拉长。
单次生成最长 20 秒。更长的序列由多个片段串联成多镜头场景,而不是把一次生成继续拉长。
YouArt 上所有模型都按同一套积分体系计费。FLUX 3 Video 按时长计费,每秒 55 积分;你可以在价格页查看套餐与各模型的价格。若要为 API 规划预算,先比较渲染时长、分辨率、提示词迭代次数与生产流程需求,再估算单个项目的成本。
在 Black Forest Labs 自行组织的偏好测评中——取自训练中期检查点的初步结果,素材为 10 秒 720p 带音频片段——FLUX 3 相对 Luma Ray 3.2 的获选率为 93%,相对 Runway Gen-4.5 为 77%,面对最强竞品时优势较小。Kling 与 FLUX 3 可能适配不同的视频生成需求,建议按你的项目来比较成片质量、提示词控制力、运动表现、声音以及可用的 API 流程。目前第三方独立评测仍然有限。
可以。FLUX 3 在 YouArt 上以 FLUX 3 Video 提供:输出 720p 或 1080p 带同步原生音频的视频,可以只给提示词,也可以给首帧做动画、给首尾帧补中间运动,或在时间轴上最多钉 10 个关键帧。图像仍由 FLUX 2 与 Flux Kontext 承担。
FLUX、FLUX.2 与 FLUX 3 均为 Black Forest Labs Inc. 的商标。YouArt 与 Black Forest Labs 无隶属或认可关系。
工具之间的每一次交接,都是画面走样的一个环节。FLUX 3 把这些交接收进同一个模型里——你在第一帧认可的东西,到最后一帧还在。对创意团队来说,这意味着更少的模型间搬运、更少的提示词返工,以及从图像到运动再到声音都更一致的结果。
FLUX 3 用一个模型覆盖图像生成与编辑、文生视频、视频和声音,而不是串联多个专用模型——你在定妆图里定下的东西,会一路延续到画面与声音里。模型的多模态理解会在生成开始之前,就把画面方向与声音方向连在一起。
单次生成最长可产出 20 秒带音频的视频——足以承载一个完整的节奏。更长的内容则由多个片段串联成多镜头序列,让故事由一个个有意图的镜头搭起来,而不是把一次生成硬拉到它撑不住的长度。
原生音频随视频一起生成,且支持多语种对白,不必事后再叠一层声音、再一点点对齐。语言版本因此成为提示词阶段的创作决定,而不是另起一条配音替换流程。
图像的生成与编辑和视频处在同一个模型里,你反复打磨的那张静帧,和你要让它动起来的那一帧,来自同一个系统,而不是两个只能大致对上的系统。对于正在走早期体验或模型预览流程的用户,在最终能力还在演进的阶段,这能减少在不完整的工具之间来回搬运素材。
单一模型联合训练。从静帧到运动再到声音,观感统一
单次生成最长 20 秒。一个完整的瞬间,而不是一个碎片
生成时即带原生音频。对白本来就落在画面上
多语种对白。拍一次,出多个语言版本
已经受够把图像模型、视频模型和音频工具串起来,想要一套端到端一致系统的团队。
一个已经用 YouArt 上的 FLUX 2 做出的画面,被推成带对白的镜头——这道交接正是 FLUX 3 想要取消的。从一个想法起步时用文生视频提示词;取景与视觉重心已经定下来时,就用定妆图加关键帧。
只需要快速出一张静帧的场景——那种情况下 FLUX 2 更快。
单一模型联合训练意味着你在静帧里定下的角色、配色与光线,在镜头动起来之后依然在。
足以容纳一句台词和一个反应,而不是一个必须绕着剪的碎片。
原生音频生成省掉了那道通常横在「渲染完成」和「场景完成」之间的对齐工序。
有了多语种对白,第二个语言版本只是再生成一次,而不是重拍一次。
创意总监让同一个视觉想法贯穿静帧、动态镜头与声音,而不必在每个工具里重新确立一遍。
效果营销团队基于同一套观感批量产出变体与语言版本,不用为每一个都重拍一次。
影视创作者带着对白预演场景,让节奏是可以被判断的,而不是靠想象的。
社交内容创作者从一个想法直接做出自带声音的短片,不必先搭一套工具链。