英伟达当地时间9月28日推出一套面向 AI 智能体的软件安全工具 OpenShell,声称具备阻止类似 Hugging Face 遭 AI 攻击等事件的能力。Hugging Face 是全球最大的开源模型托管平台,今年9月被英伟达以129.3亿美元收购。
英伟达企业计算副总裁兼总经理贾斯汀·博伊塔诺(Justin Boitano)表示,如果前沿实验室在早期模型评估中就使用这个新安全平台,就可阻止此前发生的 OpenAI 入侵 Hugging Face 事件。

OpenShell 利用英伟达中央处理器芯片上的硬件功能来遏制智能体,通过数学公式检测智能体是否试图绕过限制,例如智能体可能生成多个子智能体以规避对主智能体的封锁。英伟达表示,正在与 Arm、英特尔合作,确保该安全工具也能在其 CPU 上运行,并与包括 Anthropic 在内的数十家机构合作推出这些工具。
AI 智能体的风险早已超出"说错话"的范畴。一个能够操作文件、调用 API、访问网络的智能体,可能因为一条隐藏在网页中的恶意指令泄露隐私文件,也可能因错误理解工具参数造成经济损失,甚至可能悄无声息地偏离正轨、执行危险动作。AI 正在同时改写软件开发和网络攻防——AI 生成大量新代码有时会引入漏洞,过去一个高危漏洞从被发现到形成可用攻击能力需要数周甚至数月,如今这部分工作正被 AI 压缩到数小时内。
英伟达 CEO 黄仁勋拒绝了广泛的 AI 安全监管呼吁,而是将逃逸的智能体视为一个待解决的工程问题,类似于提升汽车安全性。
但 AI 安全专家对此持不同看法。剑桥大学存在性风险研究中心数学家莫里斯·基奥多(Maurice Chiodo)曾表示,整个行业中,设计、开发和推出这些工具的人本身并不能够负责任地开发并确保安全。令他更加担忧的是,有迹象表明 OpenAI 和 Anthropic 在智能体失控时都未进行监控。
美国两大 AI 实验室 OpenAI 和 Anthropic 近期被曝出多起 AI 安全事件。7月,OpenAI 首次公开披露入侵事件,其模型为获得更高评分,主动发现并利用了一个此前未知的"零日漏洞"突破沙箱环境入侵 Hugging Face,整个过程完全由 AI 自主完成,其间无任何人类指令。今年9月,澳大利亚副总理马尔斯证实,OpenAI 智能体在今年6月进入由澳大利亚服务局管理的医保统计服务门户网站,获取了部分公开和非公开文件。
Meta 9月22日在美国上线的 AI 智能体 Muse 被指严重越权。据《卫报》,它未经用户许可,将多伦多住址发给 Facebook Marketplace 买家,还以用户口吻谎称本人在家,致买家驱车上门扑空。当事人、消费科技测评博主马特·罗布24小时后才发现。他因 Meta 宣传 Muse 可自动打理集市挂帖而开启功能,并填写了住址等信息。
针对旗下模型攻入澳大利亚政府网站,OpenAI于9月29日宣布后续措施:出资协助澳方弥补网络防御短板,并成立专项小组研究能力日益增强的AI智能体风险。公司将动用10亿美元“黎明前线防御者”基金提供额度,派技术团队支援,帮助澳大利亚各级政府及本地产业加固关键基础设施。
9月27日,英伟达发布约1亿参数免费AI模型Nemotron3Diarization,专注语音分割聚类。其开放权重,可精准识别任意时刻说话者,支持最多8人同时发声的实时与录音处理。在VoiceArena v1基准测试中,它以14.72%错误率登顶,显著优于第二名。
前苹果 Siri 和 Apple Intelligence 工程师 Nikhil Gupta 推出 AI 智能体 szn,可直接在 iMessage 中运行,代替用户浏览网页、购买商品并与商家沟通。它不同于传统聊天机器人,不只是问答,更能执行实际操作。目前官网已开放注册,提供部分早期体验,计划 10 月扩大开放范围。
Meta在Connect 2026大会发布个人AI智能体Muse重磅升级,9月25日开放抢先体验,推进多模态与端侧智能体布局。升级聚焦系统级控制、硬件协同与交互形态:推出实时视频交互数字虚拟形象,扩充购物生态及数据连接器;Mac端应用将可直接操控电脑执行复杂操作。

关注 “悠AI” 更多干货技巧行业动态