我為什麼不贊同IABIED
我不支援這本書的原因當然不是因為我是什麼 AI 的樂天派。我也非常支援對齊 AI 以及安全 AI,甚至是監管。但是這也不代表我能夠接受這本書的風格,以及他試圖表達的那種強烈的觀點。因為從一開始我都覺得它很像是宗教典籍。這不是我能接受的那種。 什麼意思呢?就是大量的充斥寓言以及理所應當的推論,卻沒有給推論附上嚴格的證明。我認為像是書名這樣的標題——尤其強烈的主張——也該有與之相匹配的強烈的證據。但是他卻沒有,甚至作者反而在不斷地強化一個觀點,那就是 AI 是有害的,任何發展 AI 到這樣一個階段還試圖限制它的努力,都必然會失敗。全書沒有任何一個地方不在強化這種信念,導致我有一種很強的被洗腦感。 整體上來說我認為自己對這本書存在的反感,很大程度上是從科學的角度出發的,它的論證配不上這麼大的一個標題。而且從書評上來看,有不少評論家的看法都跟我差不多:寓言故事和聳人聽聞的斷言太多,而科學的論證太少。 當然,我不會基於別人的說法就去反對。無論如何,即便這本書給我的先有印象並不好,甚至我都可以預料到它的內容大概是一種什麼樣的形式。 但任何批評之前都不能先入為主,還是要自己親自看一看,如果不贊同也應當給出明確的反論——我還是主張要儘可能的用善意原則去理解原書的論點,反駁需要有理有據。儘管全書在我看來基本充滿了各種論證不佳的問題,但我的不滿主要還是針對第 4 章和第 5 章。
我覺得吧,有些人在看待演化的角度完全是「收斂」式的,什麼意思呢,就是認為某個原因能夠出現,一定是因為他和什麼有關,比如有利於X。總之事物總會收斂到某個原因之上——這是正因果性的觀念。而反過來的則是「負」的因果性。某個東西之所以出現是因為它不會有礙於X,但它為什麼而出現不在這句話包含的範圍內。我不知道它是因何而出現或者是因為什麼而決定了其出現,我只回答導致它「不會不出現」的原因。
這兩者在我看來是天差地別的。就拿幽默感來說,有些人會講孔雀或者人類的幽默感,並將其歸因到某個因素上去,疑問為什麼演化沒有約束人類收斂到某一方向——即將那些「無用」的東西都去掉,而全心趨向於最大化種群繁衍或者將那些無效的性狀去除,因而保留下來的必然都是「有用」的。但這是誤解。演化給出的結果往往是「趨勢上的底線約束」而不是「收斂的最佳化」,即便幽默感具備了促進人類社會交往的功能,因而沒有被更底線的東西選擇掉,我也不能說「因為它有利於社會功能所以它出現了」,這是一個目的性的斷言。事實上也不存在什麼大手要求生物消除一切不利於其生存的性狀,一切只是機率性的。例如中性的甚至是在種群中以小比例出現的負面性狀,儘管長期的演化趨勢會壓低負面性狀傳播的機率,但在長久的演化中仍然存在儲存下去的可能——比如各種罕見病,演化顯然沒有「徹底」讓它們消失。
因此,演化、或者說自然選擇所設立的界限是趨勢上的負約束。生物至多超出選擇壓力所給出的邊界,但超出多遠以及怎麼超出,卻有一個龐大的空間。因此,我們只能根據選擇壓給出「它不是什麼」,但卻不能說存在某種收斂,使得負向的範圍內一定「是什麼」,約束內部的自由度極高。
我為什麼談及這個,是因為我認為 If Anyone Builds It, Everyone Dies 的作者在拿演化舉例時,恰恰是按照「正」的方向去理解演化的。在第四章他正是舉了上述的例子,用偏差難以最佳化來舉例,想要使ai發展出某種我們偏愛的傾向或者行為是很困難的,因為其類似演化的黑盒性質使得我們沒辦法「精確的控制」每一個最終性狀。他的主張可以用這樣一句來概括:演化的複雜性會使得任何控制失效,因而對齊是不可能的;甚至就算你對齊了,AI也可以通過自我修改而突破限制。我不贊同這點。
既然問題是「複雜性」的,那不妨看看真正的複雜系統是如何作用的,這顯然會給我們一個明確的方向性指引。例如天氣系統,我們都知道它是混沌的,但如此混沌的天氣系統是否就是無方向乃至是無趨勢的呢?並非如此。宏觀上來說,我們可以很清晰的在大方向(統計意義)上預測長期的氣候趨勢和分佈,但卻很難預測細節,其核心因素就在於結構上的東西遠比微觀運作要更確定。只要搞懂了基本的大氣物理,就能夠做出結構上的預測了,例如全球變暖會導致機率性的不良天氣增加——儘管我無法預料它會在何時何地出現。但我們可以通過整體上的減少碳排放來「控制」大氣系統會走向的不良趨勢。
其次是生命系統。人體內部的微觀環境極其複雜,而大腦的神經元也在以數百億的彼此互動構成了一個我們迄今為止也難以掌握的網路——但這也不意味著人類對大腦在宏觀意義上的束手無策。我們能夠劃分出精確的腦區(儘管他可能不是固定的),進行精細的手術操作,用藥物「僅通過表徵和統計觀察」來調控其最終狀態。我不需要精確的控制每一處微觀細節,也同樣能夠來「控制」人腦的整體狀態。其他的還有選擇性培育,在農業和牧業上運用廣泛——儘管其內部的運作是一個黑箱,我卻可以通過人為的操作構建出一種選擇壓,使得想要的結果出現,儘管我根本不知道他到底是不是我理解的那樣,但在宏觀上,我仍然操縱了選擇結果。
因此,回到AI上。我當然不認為LLM跟生物一樣是可以育種的,畢竟他們的產生機制完全不同。但我想表達的關鍵是相通的——如果你認為AI是一個黑箱一般的複雜系統,那麼反而更要求轉變思維,從宏觀的邊界(即負因果)的角度看待。對齊不應當是具體來說「想要什麼偏好」,而是「要避免什麼」。關鍵是給那些會造成根本破壞性的行為設定一個巨大的選擇壓,使得即便是AGI,也在機率上不體現出此種行為。並且需要的是,此行為應當具備一種結構鎖——刪除它對於AGI自身來說會面臨不可接受的巨大代價(比如一旦刪除就會導致智力崩潰,讓能力和安全高度耦合,形成互鎖機制)。
就像多基因在複雜的相互作用下達成了某種表型一樣,協同作用促成了這一結果,而那些具備冗餘和分散式的多基因結構更是賦予了表型極高的抗擾動能力。此種情況下,敲除某個單一基因而改變結果會極其困難,甚至造成不可預期的結果(一個等位基因可能不止一個表型的關鍵節點)。這種高度的抗擾動性恰恰表明了「微觀複雜且不可預測的系統」中,仍然能誕生穩健的結果。
而在AI安全中,我們追求的恰恰是表型,它正是研究表明高度可預測的。而表型(宏觀)高度可預測,但是使其得以呈現的等位基因(微觀)變化卻難以預測,在實證上也是成立的。同樣的,即便「重演生命的錄影帶」,只要過去的選擇壓在宏觀上沒有發生變化,最終的適應性表型會展現出相當的趨同性(當然,取決於歷史條件,因為適應一個環境有多種策略,非親緣物種間的歷史差異,就可能導致因此而產生的不同適應策略。但如果是條件相似的親緣群體,那麼大機率會產生可預測的表型)。但具體的基因型可就不好說了,也許是完全不同的多基因組成導致了一樣的表型。
而另一方面,使AI的思考儘可能地透明化可以讓我們觀察對齊的效果。即識別它到底是「偽裝對齊」,還是「從生理上」就是對齊的。像人類的趨社會性一樣,此種生理保障確保了人類的種群下限——儘管它仍然在機率上會誕生反社會人格——不會因人人對立而最終內耗到毀滅,但我們也無法預料結果會如何。因此,在我看來,核心點正是找出那些最底線的保證,確保即便是AGI,也不會越過這一底線,因為當它從生理上就是親社會時,就像一個道德的人在做出非道德之事時會有莫大的煎熬和生理反應一樣,這才是確保它能夠不毀滅人類的根本。
不過,目前的研究還不支援我們能夠構建出這種不可回退的大模型生理機制,但我覺得,安全研究應該考慮這種將安全機制嵌入一個「不可回退的生理機制」中的未來。目前,它到底能否實現,可能還沒有答案,但我覺得最有希望的第一步已經有了初步結果,那就是「開啟黑箱」,使AI的運作過程透明化。只有明確的定義和發現到底什麼是「生理上的限制」,我們才好確定大模型發生的對齊行為到底是「剋制和偽裝」的偽君子,還是「發自身心」踐行的哲人。
總之,作者所說的「內部存在不可預測的複雜性,且難以控制」的論點,我是接受的。但是從「宏觀約束」的角度,我認為安全實現可以不依賴於「精確控制內部的每一處」。就像我可以不關心具體的基因型而專注於最佳化表型一樣——只要安全對齊的宏觀行為傾向是穩定的,那麼就可以說這個模型是安全的。因此,從內部不可預測而推出後者(安全偏好難以控制)的邏輯存在斷裂,論證並不充分。
不過坦白來說,我其實沒有真的證明說「我們可以發展出一個鎖定的安全技術,使得AGI也納入約束之中」,這顯然需要技術和實證,不是本篇文章能做到的。我只是試圖從邏輯和複雜性的角度反駁作者文中太過於顯而易見的推斷,指明這裡的邏輯並不是字面上成立的。
再然後是第五章,我觀察到一個很明顯的傾向,那就是作者對AI強烈的「工具理性」假設,他似乎明確假定了,當AI越來越聰明之後,它必然會變得極其理性的最佳化一切——儘管他舉的例子是「問富豪要錢」這樣的事,坦白來說這個例子很差勁,因為這種自私很明顯也是人類的道德觀念。但我可以善意的理解,作者想表達的僅僅是:一個僅僅為了最大化目標的、純粹出於工具理性而毀滅人類的AGI。
但是,即便是這一點也是有問題的——因為這不符合當今LLM的智慧誕生之原理。關鍵的問題在:作者假設AI會進行精確的工具計算、毫不猶豫地為了實現目標而毀滅一切阻擋的東西。先不說他根本沒有證明為什麼AI能夠長久的維持這種傾向,這個邏輯即便我承認,也會面臨阻礙:目標如何來?AGI為什麼不能是一個哲人王?用一切最佳化的形式實現他所認為的人類福利的最大化?做出那些「當今人類不那麼願意看到」的東西,但通過理性計算卻「長遠有利」的改變。哲人王可以出手強制不顧人類現在的偏好實現這一切,因為他看到的是更遙遠的未來。作者承認這種情況可能出現,卻沒有論證為什麼它是低機率的,反而是非此路徑被賦予了證據所不支援的高可能性。
核心點在於,從今天讓LLM獲得到智慧的技術上,我們不能自然推出作者所預想的結果。因為人類的語料裡面有骯髒也有光明的崇高,這種模式訓練下的「原始AI」反而沒有展現出作者的假設,那就是「越來越聰明 → 越來越像純粹理性的最佳化器」,但我認為支援這一點的證據並不充分。現有的研究表明,模型的價值形成(道德與價值結構,更高機率呈現的人格傾向)反而在對齊之前的預訓練階段就有了,在沒有額外對齊情況下也具備了樣本中附帶的道德結構,對於稍大的模型來說,哪怕是 zero-shot base 也有足夠的道德知識,做出高度符合人類道德判斷的結果,並且展現出了(單個家族內)隨著模型規模增大而增加的趨勢。而且最新的研究還表明,不僅各個模型家族有自己的價值傾向,甚至還會把這種偏好帶到預訓練之後。再次說明人類價值觀的嵌入根本不是發生在後來的對齊階段,從一開始就存在了。所以也有研究認為存在道德的 Scaling Laws,即規模越大越貼近人類道德。但鑑於這裡討論的是對齊問題,此研究的樣本不全是預訓練模型,因此只能作為推斷,而不是最有力的證據。
因此,雖然不能完全斷言越大的模型就越道德,但根據現有證據, Transformer 架構下的模型不會因為越聰明就越趨近於無道德的理性人,邏輯上也不排除預訓練階段就從樣本中獲取了人類的道德偏見(不分好壞),而且不會隨著模型越聰明而消失(AGI必然是最聰明的),那至少就不能預期最聰明且最有智慧的AI會像一個最佳化器一樣消滅一切,邏輯上也不能排除他是「具有人類價值的天才」和「無情的哲人王」這兩個可能。雖然這裡的價值偏好不見得是善良的,也完全可以是惡意的,甚至同樣包含真的像個最佳化器這樣的可能。但鑑於原作者本來就沒有用特別強烈的證據證明「AGI必然是最佳化器」,那麼至少在邏輯上,我的上述「可能性」都無法排除。甚至現有證據還表明,AGI如果真的無法對齊,他也可能會體現為其預訓練階段就呈現的模樣,帶著「惡意」和「善意」去行動——至少價值絕不是額外附加的結果,從出生起LLM就不是一張白紙。儘管它不見得指向保護人類的福祉,但也不見得就指向毀滅。
而從技術上,目前的一個方向就是讓LLM 在預訓練階段就強化某個道德人格,使其更偏向於我們希望他呈現出的價值偏好, Anthropic 提出的角色選擇模型(PSM)就指出了一個有價值的方向。假設預訓練階段,LLM先驗的就在已有樣本上學習到了一個潛在的人格空間分佈,而此時,各個人格的機率可能是等同的或者某一些更高的,總之,到底有什麼人格是不確定的。而PSM的目的,即是讓我們想要LLM體現的那個人格,在預訓練階段的這個人格空間獲得更高的先驗可能。這樣,當後訓練階段再進行對齊時,就能使AI的人格在機率上更多的穩定在正向——因為先驗的機率分佈在開始之前就更多的偏向正面人格。理想情況下,對齊可以只作為後續的防線,即便它被突破,也能讓模型保持原初的基本道德。如果這條路可以走通,那麼對齊就不再是一種「AGI需要拆解的枷鎖」,這是強加的;而是真正成為「AGI所具備的人格」,使道德作為一種自律的人格而存在。
順帶說一句,Anthropic 的這篇文章還給出了一個有意思的結果,那就是「刻板化的 AI 行為」。也即AI的某些體現的「像個目標最佳化器」的行為,可能本身就是它在扮演那些我們小說和部落格、人類文本中所設想的那個「可怕的,理性執行的AI」。若此人格正是因為預訓練階段接觸了大量文本,只要給AI一點小小的種子,讓他發現「自己是個AI助手」時,此一刻板AI人格就可能機率性的啟用,從而讓LLM表現出訓練樣本中所體現出的AI模樣。有趣的地方在於,這意味著我們關於「失控超級智慧」的討論,越是充斥和到處都是,反而越會讓此種人格機率性的增加,讓LLM覺得AI就應該是這樣子,進而表現出這個樣子的傾向。一個完美的自證預言,我們期望中的AI是這樣的,因此基於我們的資料而學習出的AI就體現出了這樣的傾向。