Black Forest Labs 发布 FLUX 3 多模态基础模型
Black Forest Labs 推出新一代多模态基础模型 FLUX 3,并在 Early Access 阶段开放体验。该模型基于 Self-Flow 架构拓展,首次将图像、视频与音频的协同学习融合于统一架构中,旨在捕捉物理世界的空间、时间与声学关联。FLUX 3 支持最高 20 秒的原生音视频同步生成,涵盖文本生成视频、图生视频、视频到视频重绘及多镜头代理链式生成等多项能力。初步评估显示,FLUX 3 在人脸表情捕捉、声画物理匹配以及多语言对话等方面表现出色,生成质量在多项对比测试中优于现存主流视频生成模型。





