我为什么不赞同IABIED
我不支持这本书的原因当然不是因为我是什么 AI 的乐天派。我也非常支持对齐 AI 以及安全 AI,甚至是监管。但是这也不代表我能够接受这本书的风格,以及他试图表达的那种强烈的观点。因为从一开始我都觉得它很像是宗教典籍。这不是我能接受的那种。 什么意思呢?就是大量的充斥寓言以及理所应当的推论,却没有给推论附上严格的证明。我认为像是书名这样的标题——尤其强烈的主张——也该有与之相匹配的强烈的证据。但是他却没有,甚至作者反而在不断地强化一个观点,那就是 AI 是有害的,任何发展 AI 到这样一个阶段还试图限制它的努力,都必然会失败。全书没有任何一个地方不在强化这种信念,导致我有一种很强的被洗脑感。 整体上来说我认为自己对这本书存在的反感,很大程度上是从科学的角度出发的,它的论证配不上这么大的一个标题。而且从书评上来看,有不少评论家的看法都跟我差不多:寓言故事和耸人听闻的断言太多,而科学的论证太少。 当然,我不会基于别人的说法就去反对。无论如何,即便这本书给我的先有印象并不好,甚至我都可以预料到它的内容大概是一种什么样的形式。 但任何批评之前都不能先入为主,还是要自己亲自看一看,如果不赞同也应当给出明确的反论——我还是主张要尽可能的用善意原则去理解原书的论点,反驳需要有理有据。尽管全书在我看来基本充满了各种论证不佳的问题,但我的不满主要还是针对第 4 章和第 5 章。
我觉得吧,有些人在看待演化的角度完全是「收敛」式的,什么意思呢,就是认为某个原因能够出现,一定是因为他和什么有关,比如有利于X。总之事物总会收敛到某个原因之上——这是正因果性的观念。而反过来的则是「负」的因果性。某个东西之所以出现是因为它不会有碍于X,但它为什么而出现不在这句话包含的范围内。我不知道它是因何而出现或者是因为什么而决定了其出现,我只回答导致它「不会不出现」的原因。
这两者在我看来是天差地别的。就拿幽默感来说,有些人会讲孔雀或者人类的幽默感,并将其归因到某个因素上去,疑问为什么演化没有约束人类收敛到某一方向——即将那些「无用」的东西都去掉,而全心趋向于最大化种群繁衍或者将那些无效的性状去除,因而保留下来的必然都是「有用」的。但这是误解。演化给出的结果往往是「趋势上的底线约束」而不是「收敛的优化」,即便幽默感具备了促进人类社会交往的功能,因而没有被更底线的东西选择掉,我也不能说「因为它有利于社会功能所以它出现了」,这是一个目的性的断言。事实上也不存在什么大手要求生物消除一切不利于其生存的性状,一切只是概率性的。例如中性的甚至是在种群中以小比例出现的负面性状,尽管长期的演化趋势会压低负面性状传播的概率,但在长久的演化中仍然存在保存下去的可能——比如各种罕见病,演化显然没有「彻底」让它们消失。
因此,演化、或者说自然选择所设立的界限是趋势上的负约束。生物至多超出选择压力所给出的边界,但超出多远以及怎么超出,却有一个庞大的空间。因此,我们只能根据选择压给出「它不是什么」,但却不能说存在某种收敛,使得负向的范围内一定「是什么」,约束内部的自由度极高。
我为什么谈及这个,是因为我认为 If Anyone Builds It, Everyone Dies 的作者在拿演化举例时,恰恰是按照「正」的方向去理解演化的。在第四章他正是举了上述的例子,用偏差难以优化来举例,想要使ai发展出某种我们偏爱的倾向或者行为是很困难的,因为其类似演化的黑盒性质使得我们没办法「精确的控制」每一个最终性状。他的主张可以用这样一句来概括:演化的复杂性会使得任何控制失效,因而对齐是不可能的;甚至就算你对齐了,AI也可以通过自我修改而突破限制。我不赞同这点。
既然问题是「复杂性」的,那不妨看看真正的复杂系统是如何作用的,这显然会给我们一个明确的方向性指引。例如天气系统,我们都知道它是混沌的,但如此混沌的天气系统是否就是无方向乃至是无趋势的呢?并非如此。宏观上来说,我们可以很清晰的在大方向(统计意义)上预测长期的气候趋势和分布,但却很难预测细节,其核心因素就在于结构上的东西远比微观运作要更确定。只要搞懂了基本的大气物理,就能够做出结构上的预测了,例如全球变暖会导致概率性的不良天气增加——尽管我无法预料它会在何时何地出现。但我们可以通过整体上的减少碳排放来「控制」大气系统会走向的不良趋势。
其次是生命系统。人体内部的微观环境极其复杂,而大脑的神经元也在以数百亿的彼此交互构成了一个我们迄今为止也难以掌握的网络——但这也不意味着人类对大脑在宏观意义上的束手无策。我们能够划分出精确的脑区(尽管他可能不是固定的),进行精细的手术操作,用药物「仅通过表征和统计观察」来调控其最终状态。我不需要精确的控制每一处微观细节,也同样能够来「控制」人脑的整体状态。其他的还有选择性培育,在农业和牧业上运用广泛——尽管其内部的运作是一个黑箱,我却可以通过人为的操作构建出一种选择压,使得想要的结果出现,尽管我根本不知道他到底是不是我理解的那样,但在宏观上,我仍然操纵了选择结果。
因此,回到AI上。我当然不认为LLM跟生物一样是可以育种的,毕竟他们的产生机制完全不同。但我想表达的关键是相通的——如果你认为AI是一个黑箱一般的复杂系统,那么反而更要求转变思维,从宏观的边界(即负因果)的角度看待。对齐不应当是具体来说「想要什么偏好」,而是「要避免什么」。关键是给那些会造成根本破坏性的行为设置一个巨大的选择压,使得即便是AGI,也在概率上不体现出此种行为。并且需要的是,此行为应当具备一种结构锁——删除它对于AGI自身来说会面临不可接受的巨大代价(比如一旦删除就会导致智力崩溃,让能力和安全高度耦合,形成互锁机制)。
就像多基因在复杂的相互作用下达成了某种表型一样,协同作用促成了这一结果,而那些具备冗余和分布式的多基因结构更是赋予了表型极高的抗扰动能力。此种情况下,敲除某个单一基因而改变结果会极其困难,甚至造成不可预期的结果(一个等位基因可能不止一个表型的关键节点)。这种高度的抗扰动性恰恰表明了「微观复杂且不可预测的系统」中,仍然能诞生稳健的结果。
而在AI安全中,我们追求的恰恰是表型,它正是研究表明高度可预测的。而表型(宏观)高度可预测,但是使其得以呈现的等位基因(微观)变化却难以预测,在实证上也是成立的。同样的,即便「重演生命的录像带」,只要过去的选择压在宏观上没有发生变化,最终的适应性表型会展现出相当的趋同性(当然,取决于历史条件,因为适应一个环境有多种策略,非亲缘物种间的历史差异,就可能导致因此而产生的不同适应策略。但如果是条件相似的亲缘群体,那么大概率会产生可预测的表型)。但具体的基因型可就不好说了,也许是完全不同的多基因组成导致了一样的表型。
而另一方面,使AI的思考尽可能地透明化可以让我们观察对齐的效果。即识别它到底是「伪装对齐」,还是「从生理上」就是对齐的。像人类的趋社会性一样,此种生理保障确保了人类的种群下限——尽管它仍然在概率上会诞生反社会人格——不会因人人对立而最终内耗到毁灭,但我们也无法预料结果会如何。因此,在我看来,核心点正是找出那些最底线的保证,确保即便是AGI,也不会越过这一底线,因为当它从生理上就是亲社会时,就像一个道德的人在做出非道德之事时会有莫大的煎熬和生理反应一样,这才是确保它能够不毁灭人类的根本。
不过,目前的研究还不支持我们能够构建出这种不可回退的大模型生理机制,但我觉得,安全研究应该考虑这种将安全机制嵌入一个「不可回退的生理机制」中的未来。目前,它到底能否实现,可能还没有答案,但我觉得最有希望的第一步已经有了初步结果,那就是「打开黑箱」,使AI的运作过程透明化。只有明确的定义和发现到底什么是「生理上的限制」,我们才好确定大模型发生的对齐行为到底是「克制和伪装」的伪君子,还是「发自身心」践行的哲人。
总之,作者所说的「内部存在不可预测的复杂性,且难以控制」的论点,我是接受的。但是从「宏观约束」的角度,我认为安全实现可以不依赖于「精确控制内部的每一处」。就像我可以不关心具体的基因型而专注于优化表型一样——只要安全对齐的宏观行为倾向是稳定的,那么就可以说这个模型是安全的。因此,从内部不可预测而推出后者(安全偏好难以控制)的逻辑存在断裂,论证并不充分。
不过坦白来说,我其实没有真的证明说「我们可以发展出一个锁定的安全技术,使得AGI也纳入约束之中」,这显然需要技术和实证,不是本篇文章能做到的。我只是试图从逻辑和复杂性的角度反驳作者文中太过于显而易见的推断,指明这里的逻辑并不是字面上成立的。
再然后是第五章,我观察到一个很明显的倾向,那就是作者对AI强烈的「工具理性」假设,他似乎明确假定了,当AI越来越聪明之后,它必然会变得极其理性的优化一切——尽管他举的例子是「问富豪要钱」这样的事,坦白来说这个例子很差劲,因为这种自私很明显也是人类的道德观念。但我可以善意的理解,作者想表达的仅仅是:一个仅仅为了最大化目标的、纯粹出于工具理性而毁灭人类的AGI。
但是,即便是这一点也是有问题的——因为这不符合当今LLM的智能诞生之原理。关键的问题在:作者假设AI会进行精确的工具计算、毫不犹豫地为了实现目标而毁灭一切阻挡的东西。先不说他根本没有证明为什么AI能够长久的维持这种倾向,这个逻辑即便我承认,也会面临阻碍:目标如何来?AGI为什么不能是一个哲人王?用一切优化的形式实现他所认为的人类福利的最大化?做出那些「当今人类不那么愿意看到」的东西,但通过理性计算却「长远有利」的改变。哲人王可以出手强制不顾人类现在的偏好实现这一切,因为他看到的是更遥远的未来。作者承认这种情况可能出现,却没有论证为什么它是低概率的,反而是非此路径被赋予了证据所不支持的高可能性。
核心点在于,从今天让LLM获得到智能的技术上,我们不能自然推出作者所预想的结果。因为人类的语料里面有肮脏也有光明的崇高,这种模式训练下的「原始AI」反而没有展现出作者的假设,那就是「越来越聪明 → 越来越像纯粹理性的优化器」,但我认为支持这一点的证据并不充分。现有的研究表明,模型的价值形成(道德与价值结构,更高概率呈现的人格倾向)反而在对齐之前的预训练阶段就有了,在没有额外对齐情况下也具备了样本中附带的道德结构,对于稍大的模型来说,哪怕是 zero-shot base 也有足够的道德知识,做出高度符合人类道德判断的结果,并且展现出了(单个家族内)随着模型规模增大而增加的趋势。而且最新的研究还表明,不仅各个模型家族有自己的价值倾向,甚至还会把这种偏好带到预训练之后。再次说明人类价值观的嵌入根本不是发生在后来的对齐阶段,从一开始就存在了。所以也有研究认为存在道德的 Scaling Laws,即规模越大越贴近人类道德。但鉴于这里讨论的是对齐问题,此研究的样本不全是预训练模型,因此只能作为推断,而不是最有力的证据。
因此,虽然不能完全断言越大的模型就越道德,但根据现有证据, Transformer 架构下的模型不会因为越聪明就越趋近于无道德的理性人,逻辑上也不排除预训练阶段就从样本中获取了人类的道德偏见(不分好坏),而且不会随着模型越聪明而消失(AGI必然是最聪明的),那至少就不能预期最聪明且最有智能的AI会像一个优化器一样消灭一切,逻辑上也不能排除他是「具有人类价值的天才」和「无情的哲人王」这两个可能。虽然这里的价值偏好不见得是善良的,也完全可以是恶意的,甚至同样包含真的像个优化器这样的可能。但鉴于原作者本来就没有用特别强烈的证据证明「AGI必然是优化器」,那么至少在逻辑上,我的上述「可能性」都无法排除。甚至现有证据还表明,AGI如果真的无法对齐,他也可能会体现为其预训练阶段就呈现的模样,带着「恶意」和「善意」去行动——至少价值绝不是额外附加的结果,从出生起LLM就不是一张白纸。尽管它不见得指向保护人类的福祉,但也不见得就指向毁灭。
而从技术上,目前的一个方向就是让LLM 在预训练阶段就强化某个道德人格,使其更偏向于我们希望他呈现出的价值偏好, Anthropic 提出的角色选择模型(PSM)就指出了一个有价值的方向。假设预训练阶段,LLM先验的就在已有样本上学习到了一个潜在的人格空间分布,而此时,各个人格的概率可能是等同的或者某一些更高的,总之,到底有什么人格是不确定的。而PSM的目的,即是让我们想要LLM体现的那个人格,在预训练阶段的这个人格空间获得更高的先验可能。这样,当后训练阶段再进行对齐时,就能使AI的人格在概率上更多的稳定在正向——因为先验的概率分布在开始之前就更多的偏向正面人格。理想情况下,对齐可以只作为后续的防线,即便它被突破,也能让模型保持原初的基本道德。如果这条路可以走通,那么对齐就不再是一种「AGI需要拆解的枷锁」,这是强加的;而是真正成为「AGI所具备的人格」,使道德作为一种自律的人格而存在。
顺带说一句,Anthropic 的这篇文章还给出了一个有意思的结果,那就是「刻板化的 AI 行为」。也即AI的某些体现的「像个目标优化器」的行为,可能本身就是它在扮演那些我们小说和博客、人类文本中所设想的那个「可怕的,理性执行的AI」。若此人格正是因为预训练阶段接触了大量文本,只要给AI一点小小的种子,让他发现「自己是个AI助手」时,此一刻板AI人格就可能概率性的激活,从而让LLM表现出训练样本中所体现出的AI模样。有趣的地方在于,这意味着我们关于「失控超级智能」的讨论,越是充斥和到处都是,反而越会让此种人格概率性的增加,让LLM觉得AI就应该是这样子,进而表现出这个样子的倾向。一个完美的自证预言,我们期望中的AI是这样的,因此基于我们的数据而学习出的AI就体现出了这样的倾向。