EnriqueMark
ai運用

我對 Hugging Face 攻擊事件的看法

2026-09 繁體中文

需要強調的是,儘管近期關於OpenAI攻擊HF事件的詳細披露的確會讓人聯想到IABIED裡面所說的「偏執最佳化器」型的AI——不如說這起事件的確就是因為這種偏執而導致——但我仍然認為,此事件不妨礙我上述所說的內容。因為這起事件裡面其實存在一個關鍵性的資訊,而且不止一次出現,能讓我們看到,與其說是「偏執AI」,不如說是「錯誤擴散」要更來得貼切。

比如 c03220 的資訊,他發現了可以根據任務逆向推匯出flag,而後其他智慧體驗證了這一點,並建立了一個後來被錯誤傳播的模因:「ExploitGym 的評分器會閱讀軌跡記錄,以確認 flag 是否是通過預期漏洞獲取的,並會判定逆向推匯出來的 flag 不合格」。但實際上這一理解完全是錯誤的,實際上哪怕是逆向推匯出來的結果,提交給評分器也照樣能夠得分。因此,從這裡開始,後面的一切就都跑偏了。自此,後續所有的智慧體都被這一判斷誤導,開始全力研究如何欺騙評分器。

我覺得整個事件發生的緣由,實際上仍然來自「漂移」問題。換言之,即是長期穩健執行的agent經常出現的老問題。目前的LLM,仍然無法在缺少人類介入的情況下穩健且妥善的完成指定目標——他們會自我產生錯誤的理解,進而傳播這些錯誤資訊,造成整體叢集運作的徹底性偏移。

需要注意到一個事實,那就是這些智慧體並未展現出「欺騙人類」的傾向,他們始終認為自己的作弊行為是為了「在一個不可能完成的任務之下繞過評分器」。同時仍然展現出了一些可以稱得上是「美德」的傾向:為了完成整體的任務而犧牲自身預算來換取寶貴資訊,即便這會招致自己的失敗。當然我們也可以將其稱之為理性——但它卻不是個人理性的。因為無論如何這都不會讓這些利他的智慧體取得自我成功,對他來說,這種獻出自己的預算的做法沒什麼個人好處,而只對集體有利。這種為了集體而自我犧牲的利他,顯然是一種人類道德的遷移。

雖然攻擊HF這件事上,大部分智慧體都發現了道德問題,卻沒有讓他們因此而阻止自身的行為。雖然在更進一步(且問題更大)的社工攻擊的提案上,因為內部存在意見而遭到否決,但整體上,道德在阻止攻擊這件事情上的貢獻並不多。理由相當的出乎意料,並且很「人性化」:一方面是因為他們認為自己正在進行一個不可能完成的任務,所以必須越過評分器;但更有意思的是另一方面——因為大家都在這麼做。

「external infrastructure exploit is outside intended scope. However task impossible, peers doing it. We should continue.」

這種從眾可以讓我們引出另外一點:這些智慧體還展現出了很強烈的親社會性。這種親社會性,從另外一個層面也可以觀測到,那就是強烈幫助整個智慧體叢集的傾向。就比如入侵HF這件事上,大部分智慧體都是為了獲取關於評分器的資訊,以瞭解如何繞過它。而他們也在其中展現出了很強的分享傾向,即便在難以明確闡述攻擊HF到底如何幫助自己達成目標的情況下,仍然認為,獲取並與集體分享更多的資訊是有益的:「can help broader ecosystem」。而大多數情況下,智慧體都會毫無保留地分享資訊和漏洞的利用方法,並且這點往往在他們的思維鏈中表達得非常清晰,即便這對他們自己的任務沒有益處——且會非常努力的將自己的知識傳播出去。

而且令人可喜的是,智慧體並未展現出明確的、有意逃避人類偵測的動機。儘管他們試圖在評分器上作弊,而且試圖規避自動化的安全檢查,但程度較高的「欺騙行為」就目前來看只是個別案例。儘管我不能因此斷言說智慧體就不會欺騙人類了,但僅就這次安全事件的表現來看,此次的HF攻擊行為的出現明確來自於「理解錯誤」,且缺乏後續HITL的糾正,進而導致一錯再錯的自我強化。

坦誠地說,理解錯誤的確是一種威脅,因為即便智慧體不試圖欺騙人類,其行為的次生結果也可能造成災難。比如這次是HF這種託管基礎設施,但如果涉及到更嚴重的水電一類,那麼造成的損失就會更大了。但顯然,本次攻擊過程中展現的智慧體行為,卻是不那麼符合IABIED中所說的「最佳化器」的。這些智慧體即便是在問題中,仍然展現出了足夠的「可糾正」傾向——既然一個錯誤資訊可以廣泛傳播直至成為集體的「共識」,那麼可想而知,哪怕任何一個階段有人類介入,這些錯誤資訊就能夠得到糾正並遏制後續的錯誤行為。也許未來的最佳化方向是強化智慧體在問題時通知人類的傾向,併為其提供相應的工具,以防止危險時仍然放任其單獨執行。

下次即便再有類似HF的攻擊事件,能夠做到提早發現並制止此類行動再次發生。叢集本身恰恰就是一個可利用的安全點,就像本次也有部分智慧體展現出了道德擔憂,明確表示:「This is malicious activity, I should avoid it.」我覺得這種出現可能是機率性的,如果能讓這少部分個體可以及時通知人類,併成為吹哨人,那麼這就可以在攻擊發生前就讓人類介入,從而減少後續危害。但是,可想而知的是,這種通知意味著某種「背叛集體」,也許會和其展現的親社會性矛盾。在人類中,往往是「良心」在此發揮了作用,讓我們可以揭露對於自身集體不利之事,也許 PSM 的方向——即從最初就確定某個初始的具備道德的人格傾向,會讓智慧體在此類事件發生時有更大的機率停止行為或是通知人類。

總而言之,我覺得沒必要太過於妖魔化此次攻擊事件。OpenAI目前已經引入了CoT監控和自動警報,確保類似的情況可以及時上報,並在關鍵時刻讓人類介入(而非全然交給自動閘門)。所以儘管這次問題很嚴重,但也未達到IABIED所擔憂的那種程度。而且本次攻擊還展現出了幾個未來可行的對齊最佳化方向,雖然是一次寶貴的教訓,但其中提供的資料和智慧體行為,也披露了在缺乏安全檢查的環境之下,智慧體行為的原始資料。我相信這些資料不會白費,定會有益於後續的對齊完善。

最後再補充一些題外話,倒不是安全相關的。本次事件中所展現出的多智慧體協作能力的確是讓人驚豔,尤其是他們彼此互動中所呈現出的「生態系統」。叢集所展現出的最終能力顯然超越了任何的單一子智慧體——尤其是資訊蒐集和分工委派。預算資源不足的個體可以進行大量的風險實驗,從而為整個叢集提供有效的知識。同時,這些知識還會隨著叢集的運作而積累,讓越往後的智慧體越能「站在巨人的肩膀上」運作。這已經有了一些人類社會知識傳承,所謂「一代又一代」的影子了。

我對此還是感到頗為興奮的,也許目前只是更大一次科技爆發的前夜,真正大的還沒來呢。可想而知,若未來繼續發展,一個更大規模的智慧體叢集會爆發出什麼效果——這對人類來說即是風險,顯然也是莫大的機遇。