Black Forest Labs发布FLUX 3多模态流模型,实现图像视频音频统一生成
•1 阅读•2分钟•前沿
Black Forest Labs机器人动作预测FLUX 3Self-Flow多模态生成
•1 阅读•2分钟•前沿
关键发布
2026 年 7 月,Black Forest Labs(黑森林实验室)正式推出多模态基础模型 FLUX 3。该模型在同一套权重下同时支持图像、视频、音频以及机器人动作预测,是首个实现全模态统一生成的 FLUX 系列产品。
技术核心——Self‑Flow
FLUX 3 基于 BFL 早期提出的 Self‑Flow 框架。Self‑Flow 将流匹配目标与自监督特征重建相结合,使用 SiT‑XL/2 结构并在每个 token 上加入时间步条件。训练时采用 25% 的 token 隐蔽率,并通过第 20 层的 EMA 教师模型向第 8 层学生模型进行自蒸馏。相较于前代模型,FLUX 3 在计算规模和数据量上实现了数倍提升。
生成能力
- 文本‑至‑视频:单次生成最长 20 秒,内置同步音频。
- 图像‑至‑视频、视频‑至‑视频:支持参考帧或关键帧引导,保证运动连贯性。
- 音频‑生成:可从文本或视频中生成匹配音效。
- 机器人动作预测(FLUX‑mimic):在 RTX 5090 上推理时延低于 80 ms,适用于实时控制。
BFL 称模型在人脸表情细腻度和声音‑动作对应上表现尤为突出。
人类偏好评测
在 720 p、10 秒文本‑至‑视频任务上,FLUX 3 的偏好率分别为:
- 超过 Luma Ray 3.2 的 93%
- 超过 Runway Gen‑4.5 的 77%
- 超过 Grok Imagine Video 的 69%
- 与 Gemini Omni Flash 持平(52%),接近随机。
生态与开放计划
当前视频与动作功能处于早期访问阶段,图像模型随后开放,完整权重计划在后期逐步公开。BFL 同时提供了 GitHub 上的 Apache‑2.0 参考实现,方便社区复现 Self‑Flow 训练流程。
FLUX 3 的发布标志着多模态生成进入“单流统一”时代,为生成式 AI 在创作、仿真乃至机器人控制等场景提供了更具一致性的技术基石。
本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。