黑森林FLUX3重磅登场:20秒原生音视频一键生成,多模态AI迎来“大一统”时代
在AI多模态赛道日益内卷的今天,黑森林实验室(Black Forest Labs)再次扔出了一枚重磅炸弹。近日,该团队以“抢先体验”(Early Access)的形式正式推出了FLUX3 多模态基础模型。这不仅仅是一次简单的版本迭代,更是向图像、视频与音频“大一统”架构迈出的关键一步。
告别拼凑,20秒原生音视频一气呵成
过去,生成带有完美同步音效的视频往往需要多个模型“接力”完成,而FLUX3彻底打破了这一局限。依托于升级版的Self-Flow(自监督流匹配)学习框架,FLUX3在FLUX.1和FLUX.2的坚实基础上,实现了视、听、图三大模态的同步联合训练。
最令人惊艳的是,FLUX3能够在单次生成中,直接输出最长20秒且自带原生音频的高清视频。无论是文本生成、图像驱动、视频生视频,还是音视频续写、关键帧转换,甚至是多语言对话和多镜头串联,它都能轻松驾驭。
在硬核的“带声音10秒720p视频”人工盲测中,FLUX3交出了一份堪称“碾压”的成绩单:
* 对比 Grok Imagine Video,胜率高达 69%;
* 对比 Seedance 2.0 与 Gemini Omni Flash,胜率均达到 52%。
这组数据充分证明了其在音视频协同生成领域的绝对领先地位。
不止于创作,野心指向“物理世界”
如果说音视频生成是FLUX3的“面子”,那么其在图像处理和实体机器人领域的布局则是它的“里子”。
在图像方面,FLUX3延续了黑森林实验室一贯的高水准,支持全风格、全分辨率及多种宽高比的图像生成与精细编辑。但更让科技圈兴奋的是其跨界尝试——黑森林实验室目前正与 Mimic Robotics 展开深度合作,探索将FLUX3作为机器人行为预测模型。
这一举措释放了一个强烈的信号:FLUX3的野心远不止于做一个优秀的数字内容创作工具。通过赋予实体机器人更精准的行为预测能力,FLUX3正试图跨越屏幕的界限,成为连接数字虚拟世界与物理现实世界的通用多模态引擎。
结语
从FLUX.1的图像惊艳,到如今FLUX3的多模态全能,黑森林实验室正在以极快的速度重塑AI生成的边界。随着FLUX3逐步向更多开发者开放,我们有理由期待,一个音视频完美交融、甚至能驱动现实机器人的AI新纪元,已经悄然拉开帷幕。
