即将上线

FLUX 3

单次生成最长 20 秒 · 带音频

别再用四个模型拼一条工作流了。图像工具不知道视频工具在做什么,两者都听不见声音——FLUX 3 是 Black Forest Labs 给出的答案:一个模型,从第一步起就在图像、视频与音频上联合训练。一张定妆图就此变成 20 秒带对白的镜头,画面逻辑从头到尾保持一致。

有什么不同

三个真正改变做法的变化

一个模型

图像、视频与音频合一

FLUX 3 用一个模型覆盖图像生成与编辑、视频和声音,而不是串联多个专用模型——你在定妆图里定下的东西,会一路延续到画面与声音里。

原生时长

单次生成 20 秒

单次生成最长可产出 20 秒带音频的视频——足以承载一个完整的节奏。更长的内容则由多个片段串联成多镜头序列。

声音本就在画面里

多语种对白

原生音频随视频一起生成,且支持多语种对白,不必事后再叠一层声音、再一点点对齐。

为真实制作而生

为什么“一个多模态模型”很重要

工具之间的每一次交接,都是画面走样的一个环节。FLUX 3 把这些交接收进同一个模型里——你在第一帧认可的东西,到最后一帧还在。

制作中的痛点每种模态换一个模型
FLUX 3 的优势单一模型联合训练
实际结果从静帧到运动再到声音,观感统一
制作中的痛点片段太短,撑不起一个节奏
FLUX 3 的优势单次生成最长 20 秒
实际结果一个完整的瞬间,而不是一个碎片
制作中的痛点声音全靠后期补
FLUX 3 的优势生成时即带原生音频
实际结果对白本来就落在画面上
制作中的痛点每个市场都要重做一版
FLUX 3 的优势多语种对白
实际结果拍一次,出多个语言版本

快速判断是否适合你

适合

已经受够把图像模型、视频模型和音频工具串起来,想要一套端到端一致系统的团队。

最先派上用场的地方

一个已经用 YouArt 上的 FLUX 2 做出的画面,被推成带对白的镜头——这道交接正是 FLUX 3 想要取消的。

不适合

这周就要交付的活儿——FLUX 3 还没登陆 YouArt,眼下该用的是 FLUX 2。

工作原理

怎样才算真正的“一个模型”

事后把多种模态拼在一起,得到的是一条流水线;从一开始就一起训练,得到的才是一个真正理解画面如何看、如何动、如何响的模型。

联合训练

图像、视频与音频同时训练

一个模型,从一开始就在图像、视频与音频上联合训练,而不是事后把多个系统接线在一起。这正是为什么定妆图里立住的角色能在运动中保持一致,也是为什么声音会精准落在动作上,而不是落在动作附近。

20 秒,一次成型

长到真的能算一个镜头

单次生成,20 秒带音频的视频。这就是「必须绕着剪的碎片」和「能承载一句台词、一个反应、一次运镜且中间不留接缝的完整瞬间」之间的差别。

更长的序列

把片段串成多镜头场景

对于超出单次生成的内容,多个片段可以串联成更长的多镜头序列——规模来自镜头的编排,而不是硬把一次生成拉长到它撑不住的地步。

工作流

从一张静帧到一个完整场景

一个多模态模型的意义在于:每一步都继承上一步,而不是每次都从一句提示词重新开始。

1

一切从一张静帧开始

最可控的一步走在最前面:在任何东西开始运动之前,角色、配色与构图先在一张画面里定下来。

2

这一帧动起来

同一帧被带入最长 20 秒的视频。因为两者出自同一个模型,被认可的那个观感就是真正动起来的观感。

3

并且开口说话

原生音频与多语种对白随生成一同到位,场景交付时就自带声音,不必再等一道对齐工序。

从提示词到成片

创作全流程所需要的一切

一个成片需要的不只是第一次生成,还需要一种能继续往下走、又不丢掉已有成果的方式。

视频与音频续写

FLUX 3 可以基于输入的视频及其音频继续生成,把一个镜头自然地往前推,让节奏与声音在场景需要更多空间时依然连贯。

图像生成与编辑

图像的生成与编辑和视频处在同一个模型里,你反复打磨的那张静帧,和你要让它动起来的那一帧,来自同一个系统,而不是两个只能大致对上的系统。

为制作而生

真正贴着制作需求来做

FLUX 3 针对的是这份工作里最费时间的几件事:让观感跨模态保持一致、把片段做到真的够用、不靠额外工序就把声音落准,以及覆盖不止一种语言。

观感经得起交接

单一模型联合训练意味着你在静帧里定下的角色、配色与光线,在镜头动起来之后依然在。

20 秒是个能用的镜头

足以容纳一句台词和一个反应,而不是一个必须绕着剪的碎片。

声音与画面同时到位

原生音频生成省掉了那道通常横在「渲染完成」和「场景完成」之间的对齐工序。

不止一个市场

有了多语种对白,第二个语言版本只是再生成一次,而不是重拍一次。

与 FLUX 2 对比

相比 FLUX 2 有哪些新变化

支持模态
FLUX 2图像——文生图与图像编辑合于一个模型。
FLUX 3图像、视频、音频与动作预测合于一个模型。
视频
FLUX 2非视频模型。
FLUX 3单次生成最长 20 秒并带音频。
音频
FLUX 2不支持。
FLUX 3原生音频生成,支持多语种对白。
技术架构
FLUX 2潜空间流匹配,将 24B 视觉语言模型与整流流式 Transformer 结合。
FLUX 3基于 Self-Flow,在图像、视频与音频上联合训练。
可用性
FLUX 2现已在 YouArt 上线,支持创作与编辑模式。
FLUX 3即将登陆 YouArt。

FLUX 3 登陆 YouArt 时,最终规格将在模型页面公布。视频能力已率先开放早期访问,图像模型随后推出。

各行业应用

FLUX 3 在各行业的应用

一个横跨图像、视频与音频的模型,会以不同方式改变不同类型的工作。

数字广告

广告公司先做出一张主视觉,再把它扩展成 20 秒的广告片并输出多个语言版本,主视觉与剪辑版之间不会走样。

零售与电商

零售品牌把一张产品静帧变成一段带声音的短视频,同时保持图像中确立的确切外形与颜色。

影视与娱乐

制作方把一个段落连同对白一起预演出来,让分镜变成真的能看、能掐节奏的东西。

企业传播

企业团队制作培训与内部视频,让同一位出镜人在各模块中保持一致;面向另一个市场重做版本,只是再生成一次。

适合谁

FLUX 3 为谁而做

跨模态统一到一个模型,对那些正在为「在三个工具之间搬运」付出代价的人最有意义。

创意总监

创意总监让同一个视觉想法贯穿静帧、动态镜头与声音,而不必在每个工具里重新确立一遍。

效果营销

效果营销团队基于同一套观感批量产出变体与语言版本,不用为每一个都重拍一次。

影视创作者

影视创作者带着对白预演场景,让节奏是可以被判断的,而不是靠想象的。

社交内容创作者

社交内容创作者从一个想法直接做出自带声音的短片,不必先搭一套工具链。

套餐与价格

用同一份积分余额,即可调用 FLUX 2、Flux Kontext 以及 YouArt 上的全部模型。

基础版

适合爱好者和探索者

$9.99/月
升级
  • 1000 额度
  • 每月最多 ~200 张图片
  • 每月超过 ~1000 秒视频
  • 智能创意 Agent
  • 视频编辑器
  • 最新图像模型,包括 GPT Image 2 和 Nano Banana Pro
  • 最新视频模型,包括 Seedance 2
  • 真人合规模式
  • 使用 ElevenLabs 生成语音
  • 无水印
  • 50+ AI 特效库

专业版

最受欢迎

适合专业人士

$29.99/月
升级
  • 3300 额度
  • 每月最多 ~1000 张图片
  • 每月超过 ~3300 秒视频
  • 智能创意 Agent
  • 视频编辑器
  • 最新图像模型,包括 GPT Image 2 和 Nano Banana Pro
  • 最新视频模型,包括 Seedance 2
  • 真人合规模式
  • 使用 ElevenLabs 生成语音
  • 无水印
  • 50+ AI 特效库

旗舰版

适合高级用户和团队

$149.99/月
升级
  • 18000 额度
  • 每月最多 ~6000 张图片
  • 每月超过 ~18000 秒视频
  • 智能创意 Agent
  • 视频编辑器
  • 最新图像模型,包括 GPT Image 2 和 Nano Banana Pro
  • 最新视频模型,包括 Seedance 2
  • 真人合规模式
  • 使用 ElevenLabs 生成语音
  • 无水印
  • 50+ AI 特效库

团队版

适合团队和工作室

$329.99/月
升级
  • 36300 额度
  • 每月最多 ~12000 张图片
  • 每月超过 ~36300 秒视频
  • 真人合规模式
  • 与团队共享画布、工作流和素材
  • 每个团队最多 10 名成员
  • 最多 5 个团队
  • 基于角色的管理
  • 团队额度管理与消费上限
  • 成员用量追踪

常见问题

关于 FLUX 3,大家都在问

FLUX 3 是什么?
FLUX 3 是 Black Forest Labs 于 2026 年 7 月 23 日发布的多模态模型,用一个模型覆盖图像、视频、音频与动作预测。它是在这些模态上联合训练出来的,而不是由多个独立系统拼装而成。
现在能在 YouArt 上用 FLUX 生成图像吗?
可以——FLUX 2 与 Flux Kontext 现已在 YouArt 上线。FLUX 2 支持文生图与参考图引导编辑,提供创作与编辑两种模式;Flux Kontext 则基于单张参考图做指令式编辑,并支持蒙版局部重绘。
FLUX 3 和 FLUX 2 有什么区别?
FLUX 2 是图像模型,在一个模型内同时支持文生图与单图 / 多图参考编辑。FLUX 3 把范围扩展到视频、音频与动作预测,并且是单一模型联合训练,单次生成最长可产出 20 秒带音频的视频。
FLUX 3 能生成带声音的视频吗?
可以——单次生成最长 20 秒带音频的视频,支持多语种对白,并可基于输入的视频与音频继续生成。更长的内容由多个片段串联成多镜头序列,而不是把一次生成硬拉长。
FLUX 3 的视频最长能做多久?
单次生成最长 20 秒。更长的序列由多个片段串联成多镜头场景,而不是把一次生成继续拉长。
FLUX 3 在 YouArt 上要多少钱?
YouArt 上所有模型都按同一套积分体系计费。FLUX 3 的积分消耗将在其上线后于模型页面显示;在此之前,你可以在价格页查看套餐与各模型的价格。
FLUX 3 的效果如何?
在 Black Forest Labs 自行组织的偏好测评中——取自训练中期检查点的初步结果,素材为 10 秒 720p 带音频片段——FLUX 3 相对 Luma Ray 3.2 的获选率为 93%,相对 Runway Gen-4.5 为 77%,面对最强竞品时优势较小。目前尚无第三方独立评测。
FLUX 3 什么时候上线 YouArt?
FLUX 3 目前正处于 Black Forest Labs 的早期访问阶段,一旦开放就会登陆 YouArt。届时我们会在本页公布。在此之前,FLUX 2 与 Flux Kontext 今天就能使用。

即将登陆 YouArt

为 FLUX 3 登陆 YouArt 做好准备

FLUX 3 即将登陆 YouArt。FLUX 2 与 Flux Kontext 已在平台上,今天搭好的工作流,FLUX 3 到来后可以直接接上。

FLUX、FLUX.2 与 FLUX 3 均为 Black Forest Labs Inc. 的商标。YouArt 与 Black Forest Labs 无隶属或认可关系。