黑森林实验室FLUX3 多模态模型登场:单次生成 20 秒…

AI广播站7小时前更新 小悠
6 0 0

Black Forest Labs宣布以Early Access方式上线推出FLUX3 多模态基础模型,采用统一架构联合学习图像、视频和音频。该模型基于Self-Flow(自监督流匹配)学习框架扩展,同步训练视频、图像和音频,在FLUX. 1 和FLUX. 2 系列基础上进一步扩展至多模态生成与理解任务。

FLUX3 可在单次生成中输出最长 20 秒的视频并附带原生音频,支持文生视频、图生视频、视频生视频、输入视频与音频续写、关键帧转视频、多语言对话以及多镜头串联等多种创作模式。在带声音的 10 秒720p视频人工评测中,FLUX3 对比Grok Imagine Video胜率达69%,对比Seedance 2. 0 和Gemini Omni Flash胜率均为52%,展现出全面领先优势。

黑森林实验室FLUX3 多模态模型登场:单次生成 20 秒音视频,胜率碾压Grok与Seedance

在图像能力方面,官方称FLUX3 可完成图像生成与编辑,覆盖多种风格、宽高比和分辨率。更值得关注的是,Black Forest Labs正与Mimic Robotics合作,研究将FLUX3 用作机器人行为预测模型,将多模态AI能力从内容生成延伸到实体机器人领域。这一布局意味着FLUX3 不仅是一个创作工具,更有望成为连接数字世界与物理世界的通用多模态引擎。

黑森林实验室发布多模态模型Flux3,基于Self-Flow架构并集成图像、视频、音频、动作编解码器,实现物理与数字世界的统一理解与生成。其亮点是首次支持原生音频生成,一次输出20秒音视频同步片段,能力涵盖文本、图像、视频转视频等。

德国黑森林实验室发布多模态基础模型Flux3,基于Self-Flow架构及专用图像、视频、音频、动作编解码器,实现物理与数字环境的统一理解与生成。性能碾压Luma、Runway,首次原生支持音频生成,可一次性输出20秒音视频同步片段,并具备文本/图像/视频转视频、关键帧转场和多语言对话等功能。

7月20日,上海科学智能研究院发布开放科学多模态基础模型神珍(MKB),约110亿参数,以一个统一模型同时处理DNA、RNA、蛋白质、小分子、地球系统与医学影像六类科学数据,打破专用模型壁垒,兼具理解与生成能力。

德国AI公司Black Forest Labs发布全新图像生成编辑系统FLUX.2,包含四个不同规模模型,支持高效创意工作流程。技术提升包括多参考条件、更高保真度输出和改进文本渲染,推动图像生成技术进步。

Black Forest Labs发布FLUX.2系列四款模型,开源32B参数版本。核心突破:支持10图参考生成一致性超95%的图像,可锁定姿势光影配色;4MP编辑功能实现局部重绘与背景替换,分辨率达400万像素并计划支持PSD分层导出。

黑森林实验室FLUX3 多模态模型登场:单次生成 20 秒…

关注 “悠AI” 更多干货技巧行业动态

© 版权声明

相关文章

没有相关内容!

暂无评论

您必须登录才能参与评论!
立即登录
none
暂无评论...