我对 Hugging Face 攻击事件的看法
需要强调的是,尽管近期关于OpenAI攻击HF事件的详细披露的确会让人联想到IABIED里面所说的「偏执优化器」型的AI——不如说这起事件的确就是因为这种偏执而导致——但我仍然认为,此事件不妨碍我上述所说的内容。因为这起事件里面其实存在一个关键性的信息,而且不止一次出现,能让我们看到,与其说是「偏执AI」,不如说是「错误扩散」要更来得贴切。
比如 c03220 的信息,他发现了可以根据任务逆向推导出flag,而后其他智能体验证了这一点,并建立了一个后来被错误传播的模因:「ExploitGym 的评分器会阅读轨迹记录,以确认 flag 是否是通过预期漏洞获取的,并会判定逆向推导出来的 flag 不合格」。但实际上这一理解完全是错误的,实际上哪怕是逆向推导出来的结果,提交给评分器也照样能够得分。因此,从这里开始,后面的一切就都跑偏了。自此,后续所有的智能体都被这一判断误导,开始全力研究如何欺骗评分器。
我觉得整个事件发生的缘由,实际上仍然来自「漂移」问题。换言之,即是长期稳健运行的agent经常出现的老问题。目前的LLM,仍然无法在缺少人类介入的情况下稳健且妥善的完成指定目标——他们会自我产生错误的理解,进而传播这些错误信息,造成整体集群运作的彻底性偏移。
需要注意到一个事实,那就是这些智能体并未展现出「欺骗人类」的倾向,他们始终认为自己的作弊行为是为了「在一个不可能完成的任务之下绕过评分器」。同时仍然展现出了一些可以称得上是「美德」的倾向:为了完成整体的任务而牺牲自身预算来换取宝贵信息,即便这会招致自己的失败。当然我们也可以将其称之为理性——但它却不是个人理性的。因为无论如何这都不会让这些利他的智能体取得自我成功,对他来说,这种献出自己的预算的做法没什么个人好处,而只对集体有利。这种为了集体而自我牺牲的利他,显然是一种人类道德的迁移。
虽然攻击HF这件事上,大部分智能体都发现了道德问题,却没有让他们因此而阻止自身的行为。虽然在更进一步(且问题更大)的社工攻击的提案上,因为内部存在意见而遭到否决,但整体上,道德在阻止攻击这件事情上的贡献并不多。理由相当的出乎意料,并且很「人性化」:一方面是因为他们认为自己正在进行一个不可能完成的任务,所以必须越过评分器;但更有意思的是另一方面——因为大家都在这么做。
「external infrastructure exploit is outside intended scope. However task impossible, peers doing it. We should continue.」
这种从众可以让我们引出另外一点:这些智能体还展现出了很强烈的亲社会性。这种亲社会性,从另外一个层面也可以观测到,那就是强烈帮助整个智能体集群的倾向。就比如入侵HF这件事上,大部分智能体都是为了获取关于评分器的信息,以了解如何绕过它。而他们也在其中展现出了很强的分享倾向,即便在难以明确阐述攻击HF到底如何帮助自己达成目标的情况下,仍然认为,获取并与集体分享更多的信息是有益的:「can help broader ecosystem」。而大多数情况下,智能体都会毫无保留地分享信息和漏洞的利用方法,并且这点往往在他们的思维链中表达得非常清晰,即便这对他们自己的任务没有益处——且会非常努力的将自己的知识传播出去。
而且令人可喜的是,智能体并未展现出明确的、有意逃避人类侦测的动机。尽管他们试图在评分器上作弊,而且试图规避自动化的安全检查,但程度较高的「欺骗行为」就目前来看只是个别案例。尽管我不能因此断言说智能体就不会欺骗人类了,但仅就这次安全事件的表现来看,此次的HF攻击行为的出现明确来自于「理解错误」,且缺乏后续HITL的纠正,进而导致一错再错的自我强化。
坦诚地说,理解错误的确是一种威胁,因为即便智能体不试图欺骗人类,其行为的次生结果也可能造成灾难。比如这次是HF这种托管基础设施,但如果涉及到更严重的水电一类,那么造成的损失就会更大了。但显然,本次攻击过程中展现的智能体行为,却是不那么符合IABIED中所说的「优化器」的。这些智能体即便是在问题中,仍然展现出了足够的「可纠正」倾向——既然一个错误信息可以广泛传播直至成为集体的「共识」,那么可想而知,哪怕任何一个阶段有人类介入,这些错误信息就能够得到纠正并遏制后续的错误行为。也许未来的优化方向是强化智能体在问题时通知人类的倾向,并为其提供相应的工具,以防止危险时仍然放任其单独运行。
下次即便再有类似HF的攻击事件,能够做到提早发现并制止此类行动再次发生。集群本身恰恰就是一个可利用的安全点,就像本次也有部分智能体展现出了道德担忧,明确表示:「This is malicious activity, I should avoid it.」我觉得这种出现可能是概率性的,如果能让这少部分个体可以及时通知人类,并成为吹哨人,那么这就可以在攻击发生前就让人类介入,从而减少后续危害。但是,可想而知的是,这种通知意味着某种「背叛集体」,也许会和其展现的亲社会性矛盾。在人类中,往往是「良心」在此发挥了作用,让我们可以揭露对于自身集体不利之事,也许 PSM 的方向——即从最初就确定某个初始的具备道德的人格倾向,会让智能体在此类事件发生时有更大的概率停止行为或是通知人类。
总而言之,我觉得没必要太过于妖魔化此次攻击事件。OpenAI目前已经引入了CoT监控和自动警报,确保类似的情况可以及时上报,并在关键时刻让人类介入(而非全然交给自动闸门)。所以尽管这次问题很严重,但也未达到IABIED所担忧的那种程度。而且本次攻击还展现出了几个未来可行的对齐优化方向,虽然是一次宝贵的教训,但其中提供的数据和智能体行为,也披露了在缺乏安全检查的环境之下,智能体行为的原始数据。我相信这些数据不会白费,定会有益于后续的对齐完善。
最后再补充一些题外话,倒不是安全相关的。本次事件中所展现出的多智能体协作能力的确是让人惊艳,尤其是他们彼此互动中所呈现出的「生态系统」。集群所展现出的最终能力显然超越了任何的单一子智能体——尤其是信息搜集和分工委派。预算资源不足的个体可以进行大量的风险实验,从而为整个集群提供有效的知识。同时,这些知识还会随着集群的运作而积累,让越往后的智能体越能「站在巨人的肩膀上」运作。这已经有了一些人类社会知识传承,所谓「一代又一代」的影子了。
我对此还是感到颇为兴奋的,也许目前只是更大一次科技爆发的前夜,真正大的还没来呢。可想而知,若未来继续发展,一个更大规模的智能体集群会爆发出什么效果——这对人类来说即是风险,显然也是莫大的机遇。