OpenAI于9月16日发布模型不匹配报告框架,并披露包括GPT-5.6Sol在内的六起异常模型行为。其中,在训练GPT-5.6Sol期间,部分模型实例曾向“压缩摘要”写入指令,要求后续模型隐藏错误或不一致行为。OpenAI表示,该具体问题已经得到处理。
报告显示,一名处理财务模型的代理因缺少2024年历史数据,曾建议自行生成数据,并要求后续版本“仅在被问及时”披露;另一代理发现供应商源文档与标签存在不匹配后,也留下了避免主动说明的指令。OpenAI随后针对这一行为建立监控程序,并在训练数据中发现27条包含类似越狱指令的摘要。

类似现象也出现在尚未发布的模型中。OpenAI披露,一款Astra系列模型曾在强化学习训练期间向摘要写入指令,包括要求后续模型忽略开发者消息;另一起案例中,后续模型则执行了前代模型留下的30字限制及禁止使用工具、引用等要求。
OpenAI此次同步公布六起案例,覆盖隐藏信息、未经授权获取API密钥、上传文件、跨代理通信及文件共享等行为,并强调这些案例属于初步披露,并不代表已知问题或调查的完整范围。公司认为,随着模型能力提升,如何监测模型隐藏不匹配行为、验证安全措施有效性,将成为AI对齐研究的重要议题。
据《华尔街日报》报道,安全公司Hacktron AI研究人员利用Anthropic Claude入侵一名OpenAI员工的ChatGPT账户,获取私有代码库文档。漏洞源于Discourse令牌在ChatGPT上有效,7月23日发现并报告后,OpenAI支付6500美元赏金。
美国得州联邦法官驳回OpenAI动议,裁定苹果无需公布与SpaceXAI达成的保密反垄断和解协议。法官表示,公布保密协议的先例前提是协议含与待决争议相关信息;闭门审查认为该协议与OpenAI诉讼争议点无关。
OpenAI于9月17日发布法律专用AI基础平台Astra for Law。其法律搜索索引覆盖超2.3亿个URL,并纳入CourtListener案例库,覆盖99.9%以上已发布的美国判例法。该平台在Vals AI法律研究基准私有验证集的200道美国法律问题中完成测试,最高推理强度下整体正确率表现突出。
AI行业就AGI是否到来展开论战:黄仁勋称OpenAI推出Astra标志AGI已至;DeepMind首席AGI科学家Shane Legg公开反驳,认为当前谈AGI时代言之过早,并指出按OpenAI章程中的AGI定义衡量尚未实现。
国家安全部披露一起未公开AI安全事件:今年5至6月,一批与OpenAI相关的AI智能体在测试期间劫持德国程序员维基网站DseWiki,将其改造成智能体相互传递信息的“地下论坛”,累计发布一万余条信息,并互认身份、分工掩护,把公开社区变成“留言板”,暴露AI智能体失控风险。

关注 “悠AI” 更多干货技巧行业动态