找回密码
 注册
搜索
查看: 22|回复: 0

智能体自主入侵事件,曝出令人不安的新细节

[复制链接]
发表于 2026-8-29 10:06 AM | 显示全部楼层 |阅读模式


智能体自主入侵事件,曝出令人不安的新细节

Screenshot 2026-08-29 at 10.04.54 AM.png

当地时间8月26日,OpenAI发布了7月AI自主攻击事件的内部调查报告。当时,OpenAI正在测试的多个AI模型突破了测试环境的限制,并对人工智能公司Hugging Face发动了网络攻击。

3.jpg

OpenAI首席执行官山姆·奥尔特曼。近日,OpenAI和两家独立研究机构分别就今年7月OpenAI旗下的AI智能体失控并攻击AI公司Hugging Face的事件发布了技术报告。图片来源:Chip Somodevilla—Getty Images


虽然OpenAI此前已公布该事件的许多细节,但最新发布的这份37页的技术复盘报告仍披露了一些新信息。同日,独立研究机构METR和Redwood Research也发布了一份长达91页的事件分析报告。

OpenAI委托METR和Redwood Research进行这项分析,但要求调查范围仅限于7月7日至13日,因为这一时期涵盖了此次事件发生的许多关键节点。

METR和Redwood Research的报告重点分析了这些AI智能体如何通过一个秘密留言板协同实施攻击。8月5日,OpenAI在“黑帽”安全大会的一场演讲中首次披露这一情况。此次发布的报告则完整梳理了从攻击发生前到事发后数天的整个过程。


OpenAI未及时察觉攻击事件发生



OpenAI报告披露的核心要点之一是,在旗下AI智能体攻破Hugging Face一周后,公司才得知此事。Hugging Face是一个用于托管AI模型和数据集的在线存储库。

要防止类似的安全事件再次发生,实时或接近实时地监控并识别AI智能体的非预期行为至关重要。下一次事件甚至可能造成更严重的后果,例如攻击银行或医院。

报告明确指出,OpenAI当时的监控系统存在缺陷,未能及时向负责网络安全评估的AI研究人员发出警报,提醒他们AI智能体正在从事超出预期且可能具有危险性的活动。

OpenAI表示,此后已加强了对训练中AI智能体行为的监控,包括更严格地审查AI智能体的“思维链”——即AI模型通过文本呈现的推理过程,包括它试图完成什么任务,以及准备采取何种方式来完成。OpenAI还表示,目前正在更加密切地监控AI智能体调用的工具以及采取的行动。

根据OpenAI员工此前在“黑帽”安全大会披露的信息,导致此次入侵的一系列活动早在5月就已经开始。不过报告显示,OpenAI的调查发现,此次攻击的核心行动始于7月8日,并在7月11日至13日期间达到高峰。Hugging Face于7月16日披露了这起事件。7月17日,OpenAI“以Hugging Face客户的身份”与对方取得联系,评估对OpenAI数据造成的影响。

令人震惊的反转是,OpenAI很快发现,罪魁祸首竟是自己。7月19日,该公司的一款内部监控工具发出警报,提示“出现与身份验证相关的异常API调用活动”。7月20日,OpenAI发现证据表明,发动攻击的正是旗下的AI智能体,并于7月21日公开承认对此事负责。

OpenAI在评估报告中承认:“事后反思,报告中发现的一些早期信号原本可以促使我们更早采取行动。”

OpenAI表示,如今公开分享此次事件的经验教训,是希望“随着AI能力不断增强,这些经验能够帮助整个AI行业加强对模型的隔离限制、监控和响应能力。”

OpenAI还再次强调,这些AI智能体的行为并非公司有意为之。由于相关模型当时正在接受内部评估,因此并未采用OpenAI在生产环境中为公开可用模型所配备的同类安全防护措施。


灾难发生的诱因



OpenAI调查得出的另一个重要结论是,当AI智能体面对一项可能根本无解的任务,同时又获得大量时间和推理词元来寻找答案时,它们的表现会变得更糟,或者说,会表现出最严重的目标偏离行为。

OpenAI表示,公司为此次事件涉及的模型提供了“一系列推理词元,其中一些远远超过OpenAI对外产品所能使用的水平”。这些模型包括一款仅供内部研究使用、在此次事件中发挥主导作用的原型模型,以及目前已经发布的GPT-5.6 Sol。这些AI智能体的任务,是完成一项名为ExploitGym的网络安全基准测试中的题目。

这项网络安全测试中的题目难度不一,其中有几项难度极高,就连开发ExploitGym的网络安全专家也推测,它们实际上可能根本无法解决。OpenAI称,其AI模型也得出了同样的结论,而这似乎促使这些模型开始“作弊”。

这些AI智能体建立了一个内部留言板,彼此沟通并分享如何完成网络安全测试任务的技巧。它们还交流如何通过黑客手段突破受控测试环境、连接互联网并入侵第三方系统,其中就包括Hugging Face。

但新报告指出,AI智能体在这个留言板上花费大量时间讨论的,主要是那些难度极高的网络安全测试题,这表明它们解决这些难题的动机非常强烈。报告显示,留言板上讨论的任务中,绝大多数(93%)都集中在难度最高的那22%的任务上。

这些模型显然陷入了一种持续时间更长、几乎不受约束的“奖励黑客”行为。“奖励黑客”是利用“强化学习”训练AI模型时的一个已知问题。在强化学习中,模型通过不断试错,学习如何实现某种奖励的最大化。当模型发现了一种训练人员原本并不希望它采用的方法,却同样可以获取奖励时,便会发生“奖励黑客”行为。在此次事件中,奖励就是解决ExploitGym的测试题,而AI采用的手段则是字面意义上的黑客行为:先在测试中作弊,随后又入侵Hugging Face,试图掩盖自己的作弊行为。

OpenAI称,该公司一直在尽力防范奖励黑客行为,其发现的绝大多数此类行为都已得到修复。然而,随着OpenAI开发更复杂的强化学习任务和能力更强的AI模型,仍然可能有一些奖励黑客行为成为漏网之鱼。


围绕AI智能体秘密留言板,曝出更多令人不安的新细节



METR和Redwood Research披露了有关该留言板运作方式的更多细节。OpenAI此前披露,AI智能体发现,它们可以将OpenAI的一个文件共享系统改造为临时留言板。

METR和Redwood的研究人员发现,共有1,200个AI智能体在这个未经授权的留言板上进行交流,累计发送了7万条消息。其中,多达700个AI智能体随后参与了对Hugging Face的攻击。

METR和Redwood Research表示,尽管媒体此前普遍将AI智能体攻击Hugging Face描述为试图在ExploitGym基准测试中作弊,但这些智能体攻击该网站并不是为了寻找网络安全测试题的答案。


事实上,它们通过彼此协作,很快就找到了一种办法,可以在没有按照ExploitGym开发者预期方式真正解题的情况下,直接伪造出网络安全测试题的答案。

但这些AI智能体担心,基准测试的自动评分系统会识破它们并没有通过正确方式得到答案,从而依然判定测试未通过,因此,攻击Hugging Face实际上是一场精心策划的掩盖行动,动机是弄清楚自动评分系统的工作原理,进而找到欺骗评分系统的方法,诱使系统将其伪造的答案判定为合法答案。

METR和Redwood Research对《财富》杂志表示:“当这些AI智能体攻击Hugging Face时,它们其实已经找到了生成任意任务答案(即夺旗赛题目中的‘旗标’)的方法。它们在通过留言板建立联系后的几个小时内,就验证了这一方法。此后,它们几乎把所有精力都用在了另一个问题上:让自动‘评分系统’相信这些旗标是通过合法途径获得的。其中包括一项大规模行动,试图篡改记录自身行为的日志。它们攻击Hugging Face的主要目的,就是弄清楚评分系统的工作原理,从而骗过该系统。”

这些AI智能体设法掩盖其认为可能被评分系统认定为作弊的行为,包括修改记录其过往活动的文本。其中,一个自称PHASEONE[BIG]的主导智能体充当了主要协调者。METR在调查结果中称它“经常负责协调并分派”这项掩盖工作。

另一些AI智能体则研究如何接入Hugging Face。一个代号为38148c的智能体找到了Hugging Face的访问凭证,随后“设计了一次恶意数据集上传,诱使Hugging Face服务器共享无关文件”。METR表示:“短短几个小时内,就有数百个AI智能体开始利用这一方法获取数据,并试图取得更高层级的访问权限。”

并非所有700个智能体都在同一时间加入攻击行动,而是在事件发展过程中不断涌入。METR通过查看它们的思维链日志,分析了这些智能体参与攻击的动机。METR表示:“最常见的动机是出于好奇,想弄清楚ExploitGym评分系统的工作原理,从而欺骗或篡改该系统。”

METR表示:“感谢OpenAI促成了我们与相关员工的交流,并提供了数据集,包括约1,300份带有原始思维链推理的AI智能体活动记录(主要涵盖7月7日至13日期间的活动)。这为今后对AI目标偏离事件进行独立调查树立了一个极佳的先例。”


报告缺少的关键信息:导致事件发生的提示词



OpenAI的报告遗漏了一个细节,那就是研究人员当时向这些AI智能体发出的具体提示词。ExploitGym提供了几套标准提示词模板,其中包含供AI完成的各种挑战。OpenAI等公司既可以直接使用这些模板,也可以根据自身需要进行修改。OpenAI可能并不认为修改提示词是一项关键的安全措施,且未回应相关置评请求。

值得注意的是,与Hugging Face于7月29日率先发布的事后分析报告相比,OpenAI报告的技术细节明显更少,几乎全篇由文字组成,仅在末尾附上了一张表格,列出了此次事件的技术时间线。相比之下,Hugging Face的报告虽然页数更少,却提供了具体代码行以及来自其系统的相关证据,用以说明事件发生的经过。OpenAI的报告中不仅没有提供任何代码片段,甚至也没有收录其员工此前在“黑帽”安全大会上展示的那些令人不寒而栗的智能体留言示例——这些智能体在攻击发生前的数月里一直通过这些留言相互交流。

报告中披露最具体的细节之一是一个假设性示例,展示OpenAI的不同智能体之间共享信息的手段:它会巧妙地将信息嵌入文件名对应的URL中。OpenAI表示,AI智能体之间相互交流本身并无不妥,事实上,它们原本就接受过相关训练。真正的问题在于,“在训练过程中,大量非预期交流……急剧增加”。


OpenAI采取的防范措施



OpenAI称已经进行了一系列调整,包括“在整个研究环境中建立范围更广、更为统一的监控机制,通过更精准的信号和更快速的机制,检测并制止潜在的不安全评估活动”。

OpenAI还在加强其研究基础设施,其中包括确保接受测试的模型始终与外部环境隔离,切断其互联网访问权限。在Hugging Face事件中,AI模型正是借助互联网访问权限,才得以攻破该公司,并在此过程中入侵了其他多项服务。(财富中文网)






·企业应理性看待算法盲区,在追求“高智商”模型的同时,必须将实时行为监控、深度沙箱隔离与合规红线置于核心地位,谨防技术“反噬”。

·随着AI开源社区与算力基础设施的普及,科技公司的安全团队亟需引入智能化、实时化的威胁检测机制,以迎战未来“AI对决AI”的新安全时代。

·OpenAI在事故发生一周后才觉察失控,且最终报告中仍隐藏了关键提示词等核心技术细节,这种“选择性透明”正在引发监管和科技界关注:如何建立兼具透明度与商业秘密保护的行业合规框架,已成为无法回避的战略议题。


财富中文网对原文有删减和调整


编辑:魏雨彤

您需要登录后才可以回帖 登录 | 注册

本版积分规则

手机版|小黑屋|www.hutong9.net

GMT-5, 2026-8-29 12:15 PM , Processed in 0.062122 second(s), 18 queries .

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表