今日,腾讯混元正式推出新一代语音识别模型Hy ASR3.0preview,首次将大语言模型Hy3的深度语义理解能力与高精度语音识别深度融合,推动语音识别从“逐字转写、单点优化”向“理解语境、兼容场景、一键直出”跨越。
据官方披露,新模型在多维度评测中表现亮眼:开源评测集上,中文普通话、英语、粤语的词错误率(WER)分别低至3.34%、2.62%、3.12%,整体控制在3%左右;自建评测集覆盖通用识别、10余种方言、上下文语义理解、专业术语识别及高噪、耳语等复杂声学场景,WER同样保持行业领先水平。

技术层面,Hy ASR3.0preview的能力升级源于全链路优化:架构上采用兼顾效率与性能的MoE架构,基座升级为Hy3大模型,同时自研无监督语音Encoder,依托数千万小时级语音数据训练,提升声学特征提取能力;预训练阶段实现语音Encoder与大语言模型联合训练,覆盖多方言、多口音、多声学环境的海量数据,通过多阶段能力注入强化方言识别、上下文感知等特性;后训练环节则构建了覆盖20余个方言小片区的SFT数据集,结合多阶段强化学习,针对性解决复杂场景下的误识别、漏识别问题。
目前,Hy ASR3.0preview已上线腾讯云官网对外开放API,可广泛应用于智能客服、内容理解、语音搜索等领域。腾讯旗下AI助手“元宝”已完成首发接入,用户可通过语音输入体验方言识别、上下文智能纠错、复杂环境稳定转写等功能,相关能力免费开放;WorkBuddy等产品也在陆续接入中。业内认为,此次更新标志着语音识别技术向“更懂用户意图”的方向迈出关键一步,将为多场景语音交互体验带来显著提升。
CodeBuddy与WorkBuddy宣布,Hy3大语言模型免费调用活动延期至2026年8月31日,因用户反响热烈。Hy3仅支持文本任务,无多模态能力;用户若通过两款产品调用其进行图像、视频等生成,系统将自动切换至对应多模态模型,并按正常规则消耗积分。
美团7月27日否认LongCat团队基础模型负责人裴鹏离职传闻,称消息不实。裴鹏毕业于北大,2023年加入美团,先后任基座模型预训练负责人及LongCat基础模型负责人,全面主导大语言模型、多模态模型与Agent智能体的研发,并牵头万亿参数大模型LongCat-2.0的研发与落地。
据7月24日报道,腾讯于7月23日宣布将混元多模态模型部门与大语言模型部门合并,组建基础模型部,由首席AI科学家姚顺雨统率。此举旨在提升研发与协同效率,全力冲刺全模态模型的智能上限。整合早有伏笔,去年12月姚顺雨已接管大语言模型团队,如今双边归一,意味着腾讯集中资源推动多模态与语言深度融合,加速构建新一代统一基础模型,向全模态智能更高峰迈进。
腾讯混元发布Hyra-1.0智能体,遵循“轻框架、广动作”设计哲学,以递归自我改进将算力转化为收益。其核心架构包括Context Agent维护经验库生成灵感、多个执行Agent并行处理任务队列,专注性能导向的研究与工程任务。
Epoch AI研究显示,主流AI文本检测器能近乎完美识别普通AI生成内容,但当大语言模型刻意模仿特定作者写作风格时,准确率明显下降,科学写作最难辨别。实验测试了Pangram、GPTZero和Originality.ai三款工具,采用495篇涵盖博客、小说、科学的人类原创文本(均创作于ChatGPT问世前),发现风格模仿可有效逃逸检测。

关注 “悠AI” 更多干货技巧行业动态