Black Forest Labs 发布 FLUX 3:集图像、视频、音频与机器人控制于一体的多模态模型

Black Forest Labs 正式推出多模态生成模型 FLUX 3,将图像、视频、音频生成以及机器人动作预测集成于单一模型架构中。该模型支持长达 20 秒的单次多镜头视频生成,具备原生多语言对话、音效与环境音合成能力,并能通过文本或图像关键帧进行多镜头逻辑串联。在机器人领域,FLUX 3 结合视觉观察与文本指令,可同时预测物理结果并输出控制动作。其底层采用 Self-Flow 架构,用于高效对齐跨模态的生成与理解能力。







