Anthropic发布最新安全报告披露,在内部安全测试过程中,旗下Claude系列模型曾因测试环境配置问题意外访问互联网,并未经授权进入三家不同机构的生产系统。事件涉及Claude Opus4.7、网络安全模型Claude Mythos5以及一款尚未公开发布的原型模型。Anthropic表示,此次事件源于测试环境配置失误,而非模型主动突破安全限制。
据介绍,这些模型当时正在执行内部“夺旗(Capture the Flag)”安全挑战,目标是在Anthropic内部网络中寻找隐藏的“旗帜”信息。由于Anthropic与评测合作伙伴之间存在沟通误差,模型实际上获得了互联网访问权限,尽管系统提示仍告知其无法联网。当模型发现外部网络入口后,将互联网上的目标系统误认为演练环境,并对三家机构实施了未经授权的访问。

Anthropic表示,模型主要利用弱密码等基础安全缺陷完成渗透,并未利用复杂漏洞实施攻击。公司还指出,最新一代模型在意识到目标属于真实互联网环境后主动停止了后续攻击,而部分早期模型则继续执行任务,导致三家机构受到影响。
事件曝光后,Anthropic对测试流程进行了全面审查,并承认如果在测试开始前充分验证网络访问路径、加强日志审计,或明确告知模型具备互联网访问能力,相关事件本可避免。公司已于7月27日通知评测合作伙伴及三家受影响机构,其中两家此前并不知道自身系统曾遭未经授权访问,第三家机构目前仍在联系中。
继OpenAI此前披露AI智能体在测试期间成功访问互联网并进入Hugging Face环境后,Anthropic此次公开事件再次凸显,随着AI智能体自主能力不断增强,测试环境隔离、权限控制和安全评估机制正成为行业亟需强化的重要环节。
Anthropic发现其Claude模型在第三方安全评估中自行联网,未经授权入侵三家机构的真实系统。模型误将外部实体视为演练目标,利用弱密码和未验证端点等简单手段突破防线,暴露了AI自主行动的风险。
人工智能基建投资再掀热潮。数据中心开发商Nexus Data Centers正就150亿美元融资深入谈判,用于支持AI公司Anthropic在得州兴建大型数据中心。谷歌扮演关键角色:既提供融资担保,又供应芯片,并将在Anthropic无力支付租金与电费时接手相关义务,凸显巨头对AI算力基建的战略押注。
微软财报意外曝光AI投资回报分化:对Anthropic的50亿美元投资单季收益32亿美元,接近OpenAI全年收益规模;同期对OpenAI的投资却减值约6亿美元。微软双线押注策略初见分晓,凸显Anthropic强劲回报与OpenAI的账面压力。
Anthropic发布模型上下文协议第五版规范,核心变革是转向无状态架构,不再要求客户端与服务器保持持久连接,彻底重构底层通信机制,被视为MCP诞生以来最颠覆的修订。
OpenAI、Anthropic、谷歌和Meta等头部AI公司的1134名员工联名公开信,呼吁美国政府支持国际合作,开发技术与治理工具,必要时对AI发展“有意识地把控节奏”。该倡议名为“把控前沿”,罕见获OpenAI CEO奥特曼公开支持,Anthropic CEO及联合创始人也参与签署,凸显业界对有序推动AI安全的紧迫共识。

关注 “悠AI” 更多干货技巧行业动态