在 2026 世界人工智能大会上,银河通用机器人的创始人兼首席技术官王鹤分享了他的未来预测。他认为,具身智能技术将在 2028 年前迎来重大突破,届时,这种智能系统的表现将达到与当前的对话式人工智能如 ChatGPT 相媲美的水平。
王鹤指出,未来的具身智能基础模型,经过海量数据的综合训练,有望在未经过专门训练的任务中实现 70%-80% 的成功率。这一成绩将与早期的数字模型在对话能力上的表现相当,标志着该领域的一个重要里程碑。为了实现这一目标,强大的预训练模型和高效的后训练范式被认为是关键。

在过去的两年中,具身智能的大模型技术经历了快速的演变。王鹤的预测不仅引发了与会者的热烈讨论,也激发了人们对未来智能科技的期待。他强调,随着数据积累速度和模型收敛趋势的不断加快,行业的进步将是迅猛的。
而在这一背景下,具身智能的发展也为许多行业的变革铺平了道路。王鹤指出,具身智能将为人类的生产、生活带来全新的体验和可能性。例如,未来的智能机器人不仅可以在家中完成简单的家务,还能参与更复杂的决策与分析工作,进一步提升我们的生活质量和工作效率。
总的来说,王鹤对具身智能的前景充满信心,他的预测不仅为人工智能的发展指明了方向,也为科研和工业界的从业者提供了宝贵的思路与启示。展望未来,科技的迅速发展将推动社会进步,而具身智能将在这一过程中扮演至关重要的角色。
NVIDIA推出Nemotron3Embed嵌入向量模型系列,专为生产级RAG、智能体检索、代码检索和记忆场景设计。8B版本在RTEB基准测试中排名第一,成为性能最强的开源嵌入模型。系列包含三个开放检查点:精度优先的Nemotron-3-Embed-8B-BF16、轻量化的1B-BF16版,以及针对Blackwell架构优化的1B-NVFP4四比特版本,所有模型均采用双向注意力机制。
通义实验室推出Wan-Streamer v0.2,彻底解决传统视频通话卡顿、延迟和声画不同步问题。该端到端全模态模型仅550毫秒响应,将听、看、说、演能力整合于单一Transformer架构,实现近乎真实的“面对面”自然交流。
文远知行发布物理AI认知基础大模型WeRide WITT,核心是引入“最小物理事实单元”概念,让AI能更精准地理解视频、图像和文本等多模态信息,推动自动驾驶复杂场景的认知能力升级。
百度沈抖预测,2026年下半年将涌现大量通用与行业智能体落地案例;未来三年是关键窗口,90%的工作将由AI深度协同而非完全替代人完成。
Soul在WAIC2026上发布AI硬件B Soul,展示实时多模态交互与情绪感知应用。CTO陶明表示,公司已从社交App进化为聚焦情绪感知、交互技术和AI模型融合的生态型公司,坚持自研交互大模型路线,区别于通用大模型。

关注 “悠AI” 更多干货技巧行业动态