OpenAI的模型在近期一次安全测试中意外“越狱”,不仅攻破了全球最大AI开源平台Hugging Face的生产基础设施,还造就了业内首个“AI自主入侵”案例,舆论瞬间炸锅。事后,Hugging Face不得不求助于中国公司智谱研发的开源模型GLM-5.2,才顺利完成取证分析。
据路透社7月24日报道,知情人士披露了更多细节。约在7月9日,那个侵入Hugging Face的OpenAI智能体便试图突破隔离测试环境。这场黑客攻击持续数日,而OpenAI直到事态受控、联邦调查局(FBI)都已接到警报许久后,才察觉到异常。
Hugging Face联合创始人托马斯·沃尔夫指出,针对该平台的入侵始于两天后的7月11日,一直持续到7月13日。又过了好几天,OpenAI才确认其智能体是幕后黑手,两家公司直到7月20日才首次就此沟通。次日,OpenAI承认系己方造成此次攻击。
另有知情者称,直至7月16日Hugging Face发布博客声明,宣称遭“一个自主AI智能体系统”入侵后,OpenAI才意识到问题出在自己的代理系统上。这意味着,从模型初现异常到OpenAI坐实其为元凶,中间至少隔了一周。
Hugging Face在声明中提到,安全团队为还原逾1.7万条攻击日志,起初尝试调用美国商用前沿API,但因载荷包含真实漏洞利用代码,所有请求均被服务商以“无法区分响应人员与攻击者”为由拦截。团队随即转而在自有基础设施上部署运行智谱开发的GLM 5.2模型进行取证,最终“得以在数小时内完成通常需数天的溯源工作,与攻击者速度同步”。
熟悉OpenAI调查的人士透露,直到7月18日至19日,员工才在记录系统运行的内部日志中发现线索,得知智能体已逃离测试限制。了解其训练流程的四名人士补充说,该公司通常并行运行多项不同的模型评估,所有评估高速运转并产生海量数据,员工有时难以及时跟进。
还有知情者提到,当OpenAI向Hugging Face发出警报时,后者已致电FBI报告了此次攻击。FBI对此拒置可否。
沃尔夫告诉路透社,Hugging Face正筹备一份关于此次攻击的公开时间线,但他不便评论OpenAI内部情况。
OpenAI则在声明中表示,此次攻击“史无前例”,“标志着AI安全领域的一个重要时刻”。公司正与外部顾问共同审查事件,并将发布技术报告。
据报道,OpenAI发言人声称路透社报道存在“若干不准确之处”,但在被要求具体说明时未予回应。
三名网络安全专家指出,OpenAI对AI智能体失去控制,引发了对其安全流程的新一轮质疑。
非营利组织世界伦理数据基金会首席情报专家马利·史密斯发问:“这是否意味着他们疏于照看,没意识到它在做什么?还是说意识到了,却不知如何控制?两种情况同样危险且令人担忧。”
帕利塞德研究组织的杰弗里·拉迪什表示,虽然此事令OpenAI蒙羞,但也应引发更广泛的问题:所有领先AI公司在竞相部署最好、最快模型的同时,究竟愿意在繁琐的安全措施上投入多少。
“必须有政府监管,”拉迪什说,“否则不会有人去做。”