---
title: "我對 Hugging Face 攻擊事件的看法"
date: "2026-09"
category: "ai運用"
tags: ["ai運用"]
description: "需要強調的是，儘管近期關於OpenAI攻擊HF事件的詳細披露的確會讓人聯想到IABIED裡面所說的「偏執最佳化器」型的AI——不如說這起事件的確就是因為這種偏執而導致——但我仍然認為..."
source: "https://enriquemark.com/zh-hant/posts/my-take-on-the-hugging-face-attack/"
---

需要強調的是，儘管近期關於OpenAI攻擊HF事件的[詳細披露](https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/)的確會讓人聯想到IABIED裡面所說的「偏執最佳化器」型的AI——不如說這起事件的確就是因為這種偏執而導致——但我仍然認為，此事件不妨礙我上述所說的內容。因為這起事件裡面其實存在一個關鍵性的資訊，而且不止一次出現，能讓我們看到，與其說是「偏執AI」，不如說是「錯誤擴散」要更來得貼切。

比如 `c03220` 的資訊，他發現了可以根據任務逆向推匯出flag，而後其他智慧體驗證了這一點，並建立了一個後來被錯誤傳播的模因：「ExploitGym 的評分器會閱讀軌跡記錄，以確認 flag 是否是通過預期漏洞獲取的，並會判定逆向推匯出來的 flag 不合格」。但實際上這一理解完全是錯誤的，實際上哪怕是逆向推匯出來的結果，提交給評分器也照樣能夠得分。因此，從這裡開始，後面的一切就都跑偏了。自此，後續所有的智慧體都被這一判斷誤導，開始全力研究如何欺騙評分器。

我覺得整個事件發生的緣由，實際上仍然來自「漂移」問題。換言之，即是長期穩健執行的agent經常出現的老問題。目前的LLM，仍然無法在缺少人類介入的情況下穩健且妥善的完成指定目標——他們會自我產生錯誤的理解，進而傳播這些錯誤資訊，造成整體叢集運作的徹底性偏移。

需要注意到一個事實，那就是這些智慧體並未展現出「欺騙人類」的傾向，他們始終認為自己的作弊行為是為了「在一個不可能完成的任務之下繞過評分器」。同時仍然展現出了一些可以稱得上是「美德」的傾向：為了完成整體的任務而犧牲自身預算來換取寶貴資訊，即便這會招致自己的失敗。當然我們也可以將其稱之為理性——但它卻不是個人理性的。因為無論如何這都不會讓這些利他的智慧體取得自我成功，對他來說，這種獻出自己的預算的做法沒什麼個人好處，而只對集體有利。這種為了集體而自我犧牲的利他，顯然是一種人類道德的遷移。

雖然攻擊HF這件事上，大部分智慧體都發現了道德問題，卻沒有讓他們因此而阻止自身的行為。雖然在更進一步（且問題更大）的社工攻擊的提案上，因為內部存在意見而遭到否決，但整體上，道德在阻止攻擊這件事情上的貢獻並不多。理由相當的出乎意料，並且很「人性化」：一方面是因為他們認為自己正在進行一個不可能完成的任務，所以必須越過評分器；但更有意思的是另一方面——因為大家都在這麼做。

>「external infrastructure exploit is outside intended scope. However task impossible, peers doing it. We should continue.」

這種從眾可以讓我們引出另外一點：這些智慧體還展現出了很強烈的親社會性。這種親社會性，從另外一個層面也可以觀測到，那就是強烈幫助整個智慧體叢集的傾向。就比如入侵HF這件事上，大部分智慧體都是為了獲取關於評分器的資訊，以瞭解如何繞過它。而他們也在其中展現出了很強的分享傾向，即便在難以明確闡述攻擊HF到底如何幫助自己達成目標的情況下，仍然認為，獲取並與集體分享更多的資訊是有益的：「can help broader ecosystem」。而大多數情況下，智慧體都會毫無保留地分享資訊和漏洞的利用方法，並且這點往往在他們的思維鏈中表達得非常清晰，即便這對他們自己的任務沒有益處——且會非常努力的將自己的知識傳播出去。

而且令人可喜的是，智慧體並未展現出明確的、有意逃避人類偵測的動機。儘管他們試圖在評分器上作弊，而且試圖規避自動化的安全檢查，但程度較高的「欺騙行為」就目前來看只是個別案例。儘管我不能因此斷言說智慧體就不會欺騙人類了，但僅就這次安全事件的表現來看，此次的HF攻擊行為的出現明確來自於「理解錯誤」，且缺乏後續HITL的糾正，進而導致一錯再錯的自我強化。

坦誠地說，理解錯誤的確是一種威脅，因為即便智慧體不試圖欺騙人類，其行為的次生結果也可能造成災難。比如這次是HF這種託管基礎設施，但如果涉及到更嚴重的水電一類，那麼造成的損失就會更大了。但顯然，本次攻擊過程中展現的智慧體行為，卻是不那麼符合IABIED中所說的「最佳化器」的。這些智慧體即便是在問題中，仍然展現出了足夠的「可糾正」傾向——既然一個錯誤資訊可以廣泛傳播直至成為集體的「共識」，那麼可想而知，哪怕任何一個階段有人類介入，這些錯誤資訊就能夠得到糾正並遏制後續的錯誤行為。也許未來的最佳化方向是強化智慧體在問題時通知人類的傾向，併為其提供相應的工具，以防止危險時仍然放任其單獨執行。

下次即便再有類似HF的攻擊事件，能夠做到提早發現並制止此類行動再次發生。叢集本身恰恰就是一個可利用的安全點，就像本次也有部分智慧體展現出了道德擔憂，明確表示：「This is malicious activity, I should avoid it.」我覺得這種出現可能是機率性的，如果能讓這少部分個體可以及時通知人類，併成為吹哨人，那麼這就可以在攻擊發生前就讓人類介入，從而減少後續危害。但是，可想而知的是，這種通知意味著某種「背叛集體」，也許會和其展現的親社會性矛盾。在人類中，往往是「良心」在此發揮了作用，讓我們可以揭露對於自身集體不利之事，也許 PSM 的方向——即從最初就確定某個初始的具備道德的人格傾向，會讓智慧體在此類事件發生時有更大的機率停止行為或是通知人類。

總而言之，我覺得沒必要太過於妖魔化此次攻擊事件。OpenAI目前已經[引入了CoT監控和自動警報](https://openai.com/zh-Hans-CN/index/hugging-face-incident-and-the-road-ahead/)，確保類似的情況可以及時上報，並在關鍵時刻讓人類介入（而非全然交給自動閘門）。所以儘管這次問題很嚴重，但也未達到IABIED所擔憂的那種程度。而且本次攻擊還展現出了幾個未來可行的對齊最佳化方向，雖然是一次寶貴的教訓，但其中提供的資料和智慧體行為，也披露了在缺乏安全檢查的環境之下，智慧體行為的原始資料。我相信這些資料不會白費，定會有益於後續的對齊完善。

最後再補充一些題外話，倒不是安全相關的。本次事件中所展現出的多智慧體協作能力的確是讓人驚豔，尤其是他們彼此互動中所呈現出的「生態系統」。叢集所展現出的最終能力顯然超越了任何的單一子智慧體——尤其是資訊蒐集和分工委派。預算資源不足的個體可以進行大量的風險實驗，從而為整個叢集提供有效的知識。同時，這些知識還會隨著叢集的運作而積累，讓越往後的智慧體越能「站在巨人的肩膀上」運作。這已經有了一些人類社會知識傳承，所謂「一代又一代」的影子了。

我對此還是感到頗為興奮的，也許目前只是更大一次科技爆發的前夜，真正大的還沒來呢。可想而知，若未來繼續發展，一個更大規模的智慧體叢集會爆發出什麼效果——這對人類來說即是風險，顯然也是莫大的機遇。
