近日,腾讯混元多模态团队经历了一场深度的人事重组与战略调整。原xAI多模态理解负责人蔺旭东已正式加入腾讯混元,担任多模态内容生成算法负责人。此次变动不仅伴随着原多模态理解负责人胡瀚离职创业、前OpenAI研究员田永龙加入等一系列密集调整,更标志着腾讯在多模态大模型研发路线上正发生深层次的路线重构。
回顾腾讯混元过去的多模态发展史,其技术版图主要围绕几大核心产品展开。其中,文生视频模型HunyuanVideo在2024年底首发即成为全球最大开源视频生成模型,随后在2025年密集扩展了图生视频、定制化生成以及数字人驱动等能力。图像生成方面,从早期的HunyuanImage到支持原生2K分辨率的2.1版本及800亿参数的3.0版本,不断向工业级演进。此外,专注于单体3D模型的Hy3D也在电商建模和产品设计中广泛应用。在空间智能领域,腾讯还推出了全球首个开源、支持仿真的沉浸式3D世界生成模型Hy World1.0及其后续版本,深度契合了空间智能的研究方向。

然而,随着腾讯将大语言模型部和多模态模型部合并成立“基础模型部”并由姚顺雨全面接管,腾讯的多模态研发思路正面临深刻转变。在当前的技术路线上,业界对于多模态与智能主线的关系存在不同看法。李飞飞旗下的World Labs等观点认为世界模型作为空间智能的一部分是AGI的重要主线,而DeepSeek等则主张将视觉模态作为服务于语言模型的工具,弱化独立的3D或世界模型路线。
从姚顺雨近期的战略布局与旗舰产品Hy3的落地来看,其更倾向于后者的技术路线。姚顺雨在公开场合多次强调,AI下半场的竞争壁垒在于上下文与推理能力,而非单纯的模型参数量。通过将多模态理解能力深度融合至基础模型主线,优化工具调用稳定性与长上下文承接,腾讯正致力于提升模型在真实办公、GUI Agent等产品落地中的理解与执行效率。蔺旭东的加入,正是为了通过提升多模态理解能力,进一步解决生成模型中前后不一致、缺乏空间稳定性等痛点。这场重组不仅折射出腾讯内部技术路线的交替,也展现了其在AGI下半场竞争中坚定靠拢主线、聚焦生产力落地的战略决心。
演语科技不研发底层大模型,凭多款AI创作应用三年崛起,现启动香港IPO,估值高达30亿美元,引发AI应用层“中间商”商业价值与竞争壁垒探讨。
腾讯大模型布局调整:原混元资深研究员徐灿转岗微信事业群,加入WeLM团队,专注后训练与Agent研发。徐灿曾创建WizardLM并提出Evol-Instruct,在合成数据、强化学习等领域积淀深厚。此举正值微信AI加速落地期。
腾讯混元发布语音识别模型Hy ASR3.0 Preview,基于大语言模型Hy3,融合高精度识别与深度语义理解,实现从“逐字转写”到“理解语境”的质变。模型覆盖十大方言片区,长音频场景优势突出,不依赖标准普通话,让AI不仅能听清字,更能真正听懂话。
腾讯混元发布语音识别模型Hy ASR3.0preview,基于大语言模型Hy3的语言理解能力,融合高精度识别与深度语义理解。它在通用识别、上下文感知、多场景鲁棒性及方言覆盖等方面全面提升,能结合语境给出更准确连贯的转写,实现从逐字转写到理解语义的进化。
腾讯混元发布语音识别模型Hy ASR3.0preview,首次将大语言模型Hy3的语义理解融入识别,实现从逐字转写向“理解语境、一键直出”跨越。在开源评测集上,中文普通话、英语、粤语词错误率分别为3.34%、2.62%、3.12%,整体约3%,多维度表现亮眼。

关注 “悠AI” 更多干货技巧行业动态