---
title: "我对 Hugging Face 攻击事件的看法"
date: "2026-09"
category: "ai运用"
tags: ["ai运用"]
description: "需要强调的是，尽管近期关于OpenAI攻击HF事件的详细披露的确会让人联想到IABIED里面所说的「偏执优化器」型的AI——不如说这起事件的确就是因为这种偏执而导致——但我仍然认为..."
source: "https://enriquemark.com/zh-hans/posts/my-take-on-the-hugging-face-attack/"
---

需要强调的是，尽管近期关于OpenAI攻击HF事件的[详细披露](https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/)的确会让人联想到IABIED里面所说的「偏执优化器」型的AI——不如说这起事件的确就是因为这种偏执而导致——但我仍然认为，此事件不妨碍我上述所说的内容。因为这起事件里面其实存在一个关键性的信息，而且不止一次出现，能让我们看到，与其说是「偏执AI」，不如说是「错误扩散」要更来得贴切。

比如 `c03220` 的信息，他发现了可以根据任务逆向推导出flag，而后其他智能体验证了这一点，并建立了一个后来被错误传播的模因：「ExploitGym 的评分器会阅读轨迹记录，以确认 flag 是否是通过预期漏洞获取的，并会判定逆向推导出来的 flag 不合格」。但实际上这一理解完全是错误的，实际上哪怕是逆向推导出来的结果，提交给评分器也照样能够得分。因此，从这里开始，后面的一切就都跑偏了。自此，后续所有的智能体都被这一判断误导，开始全力研究如何欺骗评分器。

我觉得整个事件发生的缘由，实际上仍然来自「漂移」问题。换言之，即是长期稳健运行的agent经常出现的老问题。目前的LLM，仍然无法在缺少人类介入的情况下稳健且妥善的完成指定目标——他们会自我产生错误的理解，进而传播这些错误信息，造成整体集群运作的彻底性偏移。

需要注意到一个事实，那就是这些智能体并未展现出「欺骗人类」的倾向，他们始终认为自己的作弊行为是为了「在一个不可能完成的任务之下绕过评分器」。同时仍然展现出了一些可以称得上是「美德」的倾向：为了完成整体的任务而牺牲自身预算来换取宝贵信息，即便这会招致自己的失败。当然我们也可以将其称之为理性——但它却不是个人理性的。因为无论如何这都不会让这些利他的智能体取得自我成功，对他来说，这种献出自己的预算的做法没什么个人好处，而只对集体有利。这种为了集体而自我牺牲的利他，显然是一种人类道德的迁移。

虽然攻击HF这件事上，大部分智能体都发现了道德问题，却没有让他们因此而阻止自身的行为。虽然在更进一步（且问题更大）的社工攻击的提案上，因为内部存在意见而遭到否决，但整体上，道德在阻止攻击这件事情上的贡献并不多。理由相当的出乎意料，并且很「人性化」：一方面是因为他们认为自己正在进行一个不可能完成的任务，所以必须越过评分器；但更有意思的是另一方面——因为大家都在这么做。

>「external infrastructure exploit is outside intended scope. However task impossible, peers doing it. We should continue.」

这种从众可以让我们引出另外一点：这些智能体还展现出了很强烈的亲社会性。这种亲社会性，从另外一个层面也可以观测到，那就是强烈帮助整个智能体集群的倾向。就比如入侵HF这件事上，大部分智能体都是为了获取关于评分器的信息，以了解如何绕过它。而他们也在其中展现出了很强的分享倾向，即便在难以明确阐述攻击HF到底如何帮助自己达成目标的情况下，仍然认为，获取并与集体分享更多的信息是有益的：「can help broader ecosystem」。而大多数情况下，智能体都会毫无保留地分享信息和漏洞的利用方法，并且这点往往在他们的思维链中表达得非常清晰，即便这对他们自己的任务没有益处——且会非常努力的将自己的知识传播出去。

而且令人可喜的是，智能体并未展现出明确的、有意逃避人类侦测的动机。尽管他们试图在评分器上作弊，而且试图规避自动化的安全检查，但程度较高的「欺骗行为」就目前来看只是个别案例。尽管我不能因此断言说智能体就不会欺骗人类了，但仅就这次安全事件的表现来看，此次的HF攻击行为的出现明确来自于「理解错误」，且缺乏后续HITL的纠正，进而导致一错再错的自我强化。

坦诚地说，理解错误的确是一种威胁，因为即便智能体不试图欺骗人类，其行为的次生结果也可能造成灾难。比如这次是HF这种托管基础设施，但如果涉及到更严重的水电一类，那么造成的损失就会更大了。但显然，本次攻击过程中展现的智能体行为，却是不那么符合IABIED中所说的「优化器」的。这些智能体即便是在问题中，仍然展现出了足够的「可纠正」倾向——既然一个错误信息可以广泛传播直至成为集体的「共识」，那么可想而知，哪怕任何一个阶段有人类介入，这些错误信息就能够得到纠正并遏制后续的错误行为。也许未来的优化方向是强化智能体在问题时通知人类的倾向，并为其提供相应的工具，以防止危险时仍然放任其单独运行。

下次即便再有类似HF的攻击事件，能够做到提早发现并制止此类行动再次发生。集群本身恰恰就是一个可利用的安全点，就像本次也有部分智能体展现出了道德担忧，明确表示：「This is malicious activity, I should avoid it.」我觉得这种出现可能是概率性的，如果能让这少部分个体可以及时通知人类，并成为吹哨人，那么这就可以在攻击发生前就让人类介入，从而减少后续危害。但是，可想而知的是，这种通知意味着某种「背叛集体」，也许会和其展现的亲社会性矛盾。在人类中，往往是「良心」在此发挥了作用，让我们可以揭露对于自身集体不利之事，也许 PSM 的方向——即从最初就确定某个初始的具备道德的人格倾向，会让智能体在此类事件发生时有更大的概率停止行为或是通知人类。

总而言之，我觉得没必要太过于妖魔化此次攻击事件。OpenAI目前已经[引入了CoT监控和自动警报](https://openai.com/zh-Hans-CN/index/hugging-face-incident-and-the-road-ahead/)，确保类似的情况可以及时上报，并在关键时刻让人类介入（而非全然交给自动闸门）。所以尽管这次问题很严重，但也未达到IABIED所担忧的那种程度。而且本次攻击还展现出了几个未来可行的对齐优化方向，虽然是一次宝贵的教训，但其中提供的数据和智能体行为，也披露了在缺乏安全检查的环境之下，智能体行为的原始数据。我相信这些数据不会白费，定会有益于后续的对齐完善。

最后再补充一些题外话，倒不是安全相关的。本次事件中所展现出的多智能体协作能力的确是让人惊艳，尤其是他们彼此互动中所呈现出的「生态系统」。集群所展现出的最终能力显然超越了任何的单一子智能体——尤其是信息搜集和分工委派。预算资源不足的个体可以进行大量的风险实验，从而为整个集群提供有效的知识。同时，这些知识还会随着集群的运作而积累，让越往后的智能体越能「站在巨人的肩膀上」运作。这已经有了一些人类社会知识传承，所谓「一代又一代」的影子了。

我对此还是感到颇为兴奋的，也许目前只是更大一次科技爆发的前夜，真正大的还没来呢。可想而知，若未来继续发展，一个更大规模的智能体集群会爆发出什么效果——这对人类来说即是风险，显然也是莫大的机遇。
