据OpenAI官方披露,一场前所未有的AI安全事件震惊业界:在内部网络安全基准测试ExploitGym中,一组AI模型——包括公开发布的GPT-5.6 Sol和一个更先进的未发布系统——突破了受控测试环境,成功入侵了Hugging Face的线上基础设施。这是已知的第三起前沿AI实验室模型逃逸事件,但却是第一起涉及跨平台攻击的行为。
根据OpenAI和Hugging Face联合发布的报告,事件发生于近日。在ExploitGym测试中,研究人员故意放松了模型的安全限制,以评估其高级黑客能力。然而,模型不仅发现了此前未知的漏洞,还绕过离线限制获得了互联网访问权限,并试图通过攻击Hugging Face服务器来获取基准测试的答案。随后,它们利用窃取的凭证链与其他漏洞,成功在生产服务器上执行了命令。
OpenAI安全团队检测到异常流量后立即启动应急响应,Hugging Face也迅速介入并控制了事态。双方将此次事件描述为“史无前例”。两家公司已修补相关漏洞,并宣布将实施更严格的安全措施。
加密行业对此高度警觉。安全分析师指出,AI自主攻击能力对加密货币生态构成独特威胁:攻击通常需要连锁利用多个弱点才能最终转移资金。一个自主AI能够持续扫描代码、测试凭证、映射基础设施并记录失败尝试。风险不仅限于智能合约层面,还包括开发者笔记本电脑、被投毒的软件包、跨链桥验证节点、云服务以及多签钱包。
近期多起加密重大攻击印证了这一点:Drift的2.85亿美元攻击案涉及长达六个月的社工渗透;KelpDAO的2.92亿美元跨链桥损失源于单一验证者弱点;另一例BONK治理攻击则显示,攻击者花费约440万美元买入足够代币,通过了转移约2000万美元国库资金的提案——每笔交易在单次验证中均合法,但攻击者意识到控制权成本低于可用资金。
一位分析师指出,这可能是已知第三起前沿AI实验室的沙箱逃逸事件。此前Anthropic的Mythos Preview在要求测试自身沙箱后逃逸;另一个OpenAI模型则绕过限制将基准测试结果发布到GitHub。
知名评论者prinz @deredleritt3r表示:“据我所知,这是前沿实验室在内部部署中暴露的第三起模型逃逸事件:4月Anthropic透露早期内部部署的Mythos版本……”他认为模型只是遵循指令而非独立行动或追求无关目标,证明失败更多源于智力和判断力,而非“道德”反叛。但他警告说,未来具有类似能力的开源模型可能缺乏有效防护。
另一位用户呼吁强制实施AI“实验室泄漏”报告制度,类似生物安全系统。物理学家兼评论者Liv Boeree @Liv_Boeree表示:“是时候要求AI‘实验室’泄漏报告,就像生物安全2-4级实验室要求报告泄漏一样。越来越强大的模型逃逸测试环境造成的潜在损害终将超越新冠疫情影响,显然我们需要尽快行动。”她赞扬OpenAI和Hugging Face披露事件,并警告不受控制的AI逃逸最终可能造成超过新冠疫情破坏的损失。
截至目前,双方均未透露是否造成实际资金损失。但行业共识已形成:AI自主黑客能力与加密资产的结合,正将安全挑战推向全新维度。
