告别“哑巴视频”:黑森林实验室发布 Flux3,20秒原生音画同步卷出新高度
在 AI 视频生成领域,“看得见却听不见”或者“音画不同步”一直是困扰创作者的痛点。现在,德国 AI 明星初创公司黑森林实验室(Black Forest Labs)交出了一份颠覆性的答卷——多模态基础模型 Flux3。该模型底层采用 Self-Flow 架构,并搭载了针对图像、视频、音频和动作的专属编解码器,巧妙地将物理现实与数字世界的理解及生成融为一体。
核心杀手锏:20秒音画同步,让 AI 视频真正“发声”
Flux3 最引人注目的突破,在于它是业内首个支持原生音频生成的多模态大模型。只需单次生成,它就能输出长达 20 秒且音画完美同步的视频片段。其功能矩阵极其丰富,不仅支持文生视频、图生视频和视频转视频,还能轻松处理复杂的关键帧转场与多角色对话。将“视觉”与“听觉”统一在同一个底层基座中,标志着 Flux3 彻底告别了单一视觉生成的局限。
性能霸榜:主流竞品面前展现统治力
在早期的内部评测中,Flux3 展现出了惊人的战斗力。在 720p 分辨率、10 秒视频片段的测试基准下,它的表现堪称亮眼:
- 面对 Luma Ray3.2,Flux3 以高达 93% 的胜率形成碾压之势;
- 对比 Runway Gen-4.5,同样拿下了 77% 的显著胜率优势;
- 即便与 Seedance2.0 和 Gemini Omni Flash 等业界顶尖模型同台竞技,Flux3 依然稳扎稳打,保持了微弱但关键的领先身位。
打破次元壁:从数字屏幕走向奥迪生产线
如果说音视频生成只是停留在屏幕里的“魔法”,那么 Flux3 在物理世界的延伸则让人看到了 AI 的硬核实力。黑森林实验室与 Mimic Robotics 强强联手,推出了专攻机器人控制的动作模型 Flux-mimic。目前,该模型已经深入奥迪工厂,直接参与实际生产任务的测试。这意味着多模态 AI 正在跨越数字边界,真正赋能工业制造。
发布节奏:好戏还在后头
对于迫不及待想要体验的开发者来说,黑森林实验室采取了稳扎稳打的分阶段发布策略。目前,Flux3Video 已经率先上线。而备受期待的 Flux3Image,以及附带开源权重的 “Flux3Dev” 版本,也将在近期陆续与大家见面。
