告别盲目像素预测:PhiZero开创“物理语言”先河,让A…

AI广播站20小时前更新 小悠
8 0 0

在当前的大模型浪潮中,视频生成模型常常被视为通往具身智能的未来模拟器。然而,主流模型多采用像素空间的直接预测,容易在物理规律的稳定性和连贯性上出现偏差。针对这一行业痛点,研究团队近日正式推出了全新的物理世界模型PhiZero。该模型摒弃了传统的盲目预测套路,创新性地引入了“物理语言”概念,让AI在生成视频前先进行显式的物理推理。

作为核心创新,PhiZero提出了一种被称为“物理语言”的离散表征。该语言通过自监督学习方式,从海量野外视频中提炼出状态转移模式,捕捉不同视觉经验里的动态演化规律。在此基础上,模型构建了“先推理、后渲染”的创新架构:系统首先在物理语言空间内自回归地推断未来世界的演变轨迹,随后交由专用的扩散解码器将其渲染为高清视频。这种设计不仅将底层动力学推演与像素级合成分离开来,还大幅提升了模型在物理一致性上的表现。

告别盲目像素预测:PhiZero开创“物理语言”先河,让AI世界模型学会像人一样思考

在技术实现上,该系统分为分词器与推理器两大核心模块。其中,物理语言分词器利用转移级 Q-Former 捕获相邻状态变化,并结合有限标量量化机制生成紧凑的离散符号;扩散解码器则以首帧和离散符号为条件,恢复出细腻的视觉细节。而物理语言推理器则基于预训练视觉语言模型进行初始化,从首帧和文本动作意图出发,精准预测未来的物理语言序列。

多项基准测试结果表明,PhiZero在 Physics-IQ Verified、PhyGround 以及 WorldModelBench 等多个物理推理和视频生成评估中取得了领先成绩。无论是碰撞引起的物体位移、重力驱动的形变,还是复杂的连锁反应,模型均能展现出高度逼真的物理合理性。

随着具身智能与机器人技术的加速落地,PhiZero的问世为可控、可交互的世界建模开辟了全新路径,有望在长时程模拟与运动迁移等场景中发挥关键作用。

阿里巴巴发布视频生成模型HappyHorse1.1,在动态表现力、主体一致性、指令遵循、视觉质感和音频能力等核心维度实现系统性升级。新版本视频流畅度更高,人物动作更自然连贯,主体表现更稳定,综合性能较1.0版本有显著提升。

字节跳动火山引擎旗下火山方舟体验中心上线Seedance 2.0 Mini视频生成模型,主打高性价比,近期将开放API服务。该轻量化版本在保持高质量输出的同时,生成速度比同系列标准快速版更快,旨在服务更广泛的视频创作与规模化生产市场。

近日,亚马逊剧集《大卫王朝》中73个特效镜头由生成式AI完成,技术来自中国快手公司,为剧组节省大量外景和后期成本。这一案例表明,AI视频生成技术正加速渗透影视制作,引发行业对成本、效率及传统工作模式的关注。

4月3日,千问APP上线万相2.7视频生成模型,新增视频编辑、续写与动作模仿三大功能。用户可通过简单指令实现猫狗或人物替换、画面修改、风格切换等操作,支持动画、3D、黏土等多种创意风格,光影细节自然匹配。

谷歌DeepMind发布高性价比视频生成模型Veo3.1Lite,在保持与Veo3.1Fast同等生成速度的同时,运营成本降低超50%。该模型720p版本起售价为每秒0.05美元,1080p版本为每秒0.08美元,通过模型蒸馏或架构优化实现更高商业能效比。

告别盲目像素预测:PhiZero开创“物理语言”先河,让A…

关注 “悠AI” 更多干货技巧行业动态

© 版权声明

相关文章

没有相关内容!

暂无评论

您必须登录才能参与评论!
立即登录
none
暂无评论...