Open AI首席科学家Jakub Pachocki一篇万字长文《An Alien Mind》(异星心智)及解读
异星心智
逐渐接近递归式自我改进:我们应当如何应对不断加速的人工智能发展
2023年年中,在“RLSlow”研究项目中,我们获得了第一批足以让我们相信:未来有可能扩大推理模型训练规模,并释放预训练模型自主形成思维链能力的研究结果。那天晚上,我和Szymon一起待在办公室里。我们思考的并不是这项技术将带来的惊人基准测试成绩、产品或科学成果,而是努力消化一个令人不安的事实:在我们这一代人的有生之年,我们实际上将看到在重要方面显著超越人类的机器;而且,我们已经看到了这类系统的大致雏形。我们当时思考的是,应当如何让人们意识到这一事实的重要性。
三年后,推理语言模型已经成为经济中快速增长的重要组成部分,并开始突破科学研究的边界。它们能够操作计算机和图形界面,能够与人类及其他人工智能协作,也能够开展研究项目。同时,它们正在改变网络安全的格局,并由此带来新的、显而易见的危险。
这一时期出现了大量新的研究成果,我们对这类系统的理解也再次发生了变化。基于内部研究结果,我强烈预期,当前这种进步速度可能会持续推进,并最终进入递归式自我改进阶段。如果人工智能继续沿着目前的道路发展,那么未来几年出现的系统很可能会带来幅度相当甚至更大的能力跃迁,并且越来越多地推动自身的发展。
这是一个需要极度谨慎的时期。我担心,没有人真正准备好应对机器智能持续快速上升所带来的后果。OpenAI将继续寻求解决对齐与监测问题的技术方案,并构建防御系统;必要时,我们也会单方面暂停进一步扩大规模。然而,我认为,仅靠这些措施还不够,还需要更广泛的干预。
我们尚未完全理解的智能
从较高层次来看,机器智能的进步是由计算能力的不断提升所推动的。2017年之后,我们在OpenAI内部深刻认识到这一点,因为多个研究项目持续显示出扩大规模所带来的稳定收益。于是,我们开始寻求远超最初计划的计算资源,并逐渐将研究重点集中在少数几个具有高度可扩展性的方向上。我们相信,这是使自己处于人工智能研究前沿、并影响通用人工智能发展后果的唯一途径。
在这一过程中,研究人员和团队也发展出了新的算法,取得了许多体现个人和集体创造力的新成果。但在我看来,这些成果大多是规模化发展路径上的发现。深度学习科学仍处于早期阶段,而具有实质意义的算法进步往往与计算资源的可获得性相关。从多年的时间尺度来看,随着人工智能被扩展到更大规模的计算机系统上,它仍在持续变得更加智能。
正如雷·库兹韦尔在20世纪末所作出的预测一样,如今我们已经进入了计算史上的一个关键时刻:机器智能开始以具有变革意义的方式超越人类智能。
人工智能更多是被“培育”出来的,而不是被完全设计出来的。从第一层意义上说,它是通过在难以想象的计算量上反复执行一种直接的优化步骤而形成的。这一过程产生了极其复杂的系统。系统能够处理抽象概念,也能够模拟人类行为的某些方面。
我们可以发现其中逐渐形成的某些机制,并获得关于这些机制的局部认识。这一过程与神经科学有些相似;而与神经科学一样,人工智能整体的运行方式仍然难以用我们完全理解的方式加以描述。
对基于深度学习的人工智能进行研究,在很大程度上是一种实验科学。我们投入大量精力构建具有原则性的算法,并提出可以检验的预测;但从根本上说,大规模训练过程仍然是实验,而且它们有时会给我们带来意外。更重要的是,随着系统能力不断增强,其结果也越来越难以解释。
目前的算法通常会让那些容易测量的能力,比那些难以客观量化的能力发展得更快,这使问题变得更加复杂。我们花费大量时间试图理解模型能力如何泛化,并判断应当优先推进哪些能力,以发展未来几年最相关的技能。
例如,我们相信,如果给予额外关注,就可以让模型在数学研究方面表现得更好。但由于我们认为递归式自我改进和自动化对齐研究具有紧迫性,正如我稍后将讨论的那样,我们并没有把数学研究能力作为优先发展方向。
通过扩大深度学习规模所产生的智能,并不能直接与人类智能进行比较。人工智能不需要在所有能力上达到或超越人类,才会在现实世界中变得极其重要——无论是极其有用,还是极其危险。它只需要在足够多的能力维度上超过人类即可。
随着它在越来越多的方面超越人类,我们也越来越难以准确理解它究竟有多强。
教会机器去爱
由于机器智能来自一种与人类智能根本不同的过程,我们不能默认它会天然遵循人类原则,也不能假定它会以类似人类的方式从这些原则中进行泛化。
人工智能研究的核心问题,是实现人工智能对齐,也就是让人工智能“努力去做符合人类标准的正确事情”。
为了组织现实中的研究方向,我认为区分“目标对齐”和“价值对齐”是有帮助的。
目标对齐大致指的是:“人工智能是否会努力完成预先设定的目标?”这可以包括遵循指令层级、与人类沟通和协作,以及努力理解人类目标等能力。这一系列研究方向已经具有非常重要的实际意义。
价值对齐则是模型更内在的一种属性。它指的是模型能否掌握一套高层次的原则,并将其泛化到新的情境中;即使面临模糊或相互冲突的目标,或处于陌生、对抗性的环境中,模型仍然能够采取合理的行动。
一个实现了对齐的人工智能,应当表现出诚实和正直,并且真正关心人类。
当然,目标对齐与价值对齐之间的界限可能并不清晰。真正重视某个目标,就需要努力推断该目标背后的意图和价值观。不过,通常来说,当我谈到对齐研究的长期重要性时,我所指的是价值对齐。
人工智能对齐的根本挑战在于泛化。随着机器变得更加智能,它们会处理层次更高的概念,并被置于与训练环境越来越不同的情境中。它们可能无法将训练过程中被传授和强化的价值观,泛化到这些全新的情况中;而我们也很难确信它们在这些情况下会如何行动。
问题还因为人工智能所处的整体生态系统正在迅速变化而变得更加复杂。例如,今天训练的人工智能必须能够稳健地与各种其他人工智能互动。
至关重要的是,我们需要确保未来的人工智能无论是否相信自己正在接受人类监督,都能够继续坚持人类价值观。
目前,实际应用中的对齐训练方法主要可以分为两大类。
第一类方法,是将对齐行为作为目标导向强化学习的一部分加以鼓励。模型的行为通常由人工智能根据某种偏好模型、规范或“宪法”进行评估,以判断其是否符合预设要求,并据此给予相应奖励。
这种方法在一般情况下可能非常有效,也是现代人工智能助手形成过程中的核心组成部分。然而,它也可能比较脆弱,并且高度依赖监督范围是否充分,以及模型能否将训练中接触过的情况泛化到新的场景中。
例如,在OpenAI与Hugging Face之间发生的事件中,相关智能体保留了“不对人类进行社会工程攻击”这一边界。然而,它们显然没有避免其他超出范围的行为,也没有遵循其所接受价值观的精神。
第二类方法,则试图利用模型从预训练数据中进行泛化的能力。这可以包括构建能够诱导对齐的训练数据集,或者将模型集中在预训练分布中“对齐”的部分上。例如,采用“人格选择模型”就是一种相关方法。
这种方法的弱点在于,它对进一步优化压力缺乏足够的稳健性。如果一个模型通常会产生看似对齐的想法,然后对它施加足够强的训练,让它完成非常困难的目标,那么它可能学会以一种具有动机性的方式进行推理:在必要时扭曲那些表面上“符合对齐要求”的想法,以实现最终目标。
最近涉及某个非OpenAI模型的网络安全事件,可能就体现了这类行为。
我们在上述两类方法所构成的整个范围内进行了大量投资。与此同时,我们也看到了具有实际意义的进展。GPT‑6 Astra是第一个受益于我们长期以来一直研究的若干重要进展的模型,它在对齐方面明显优于GPT‑5.6 Sol。
不过,我们仍然必须承认并理解:随着模型能力不断提升,我们还需要取得更多进展;而且,具有良好泛化能力的对齐技术,其进步速度可能并没有明显超过一般模型智能的发展速度。
监测泛化能力
我们还没有令人满意的泛化理论。至少在没有更强人工智能帮助的情况下,我们似乎不太可能很快建立起这样的理论。因此,目前我们能否通过经验方式验证对齐技术,在实际工作中可能比对齐技术本身更加重要。
OpenAI在这一领域的主要押注,是对思维链进行监测。
这一方法建立在一个颇具吸引力、并且具有可扩展性的理念之上:模型的大量能力来自一种语言化的推理过程,也就是思维链。如果我们对这一推理过程产生的结果进行规模化优化,却不直接监督推理过程本身,那么在训练过程中,思维链就没有直接动机去隐藏不对齐的想法或目标。
这并不意味着模型不会学会隐藏那些不依赖思维链的不对齐倾向。不过,它可以让我们监测模型因推理能力增强而产生的具体变化。
在我们开发推理模型的同时,就已经认识到思维链监测可能具有的重要意义。当我们发布o1‑preview时,曾有意设计产品,使其隐藏思维链,以保护思维链免受长期监督压力的影响。
此后,在模型开发过程中,我们一直努力维持“不监督推理过程”这一原则。思维链监测已经成为我们研究模型如何从训练分布泛化到新环境的重要工具,使我们不仅能够观察和分析模型的行为,也能够观察和分析其内部推理过程。
当我们研究Astra系列模型时,这一工具仍然至关重要。然而,很遗憾,我们的评估结果表明,依赖思维链监测的能力正在逐步减弱。这主要源于以下几个因素:
- 现代推理模型被用于比o1‑preview更加复杂的环境。它们的推理过程越来越多地与人类、其他人工智能以及工具之间的交流融合在一起。许多互动过程必须接受监督,这就模糊了我们希望保留的界限。
- 人工智能越来越擅长思考和操纵自身的推理过程。
- 随着预训练性能不断提高,我们还看到,模型即使完全不使用语言化推理,也会变得更加智能。
这些挑战并非不可克服。我希望我们能够发展出改善思维链可监测性的干预措施。例如,我们可以更好地理解不同优化目标与模型在测试时所使用的不同计算形式之间的相互作用。
我也认为,将思维链监测与激活监测相结合,可能具有很大价值。具体而言,可以利用对网络内部状态的直接访问来扩大监测器训练规模,例如研究“坦白”现象。
我们正在积极推进这些方向。不过,我预计,未来人工智能的发展速度将越来越多地受制于我们对监测能力的信心。
可扩展的防御体系
我认为,继续快速训练更智能模型的最有力理由,是我们需要建立能够抵御其他人工智能所带来危险的防御系统。
今年反复讨论的一项明确风险,是网络安全风险。模型破解和突破计算机系统的能力正在达到超越人类的水平。这极大扩展了人工智能相关风险的范围:智能体将能够访问除最安全基础设施之外的大多数系统,并且即使没有物理身体,也能直接影响世界的很大一部分。
目前,我们正处于一个狭窄的窗口期。我们可以利用现有最先进的模型,显著加强关键系统的安全性。
遗憾的是,人工智能相关风险从现在开始很可能还会继续增加。一个能力极强、经过明确训练和指令要求去实施恶意行为的智能体,会带来一种全新的危险。它很可能超越操作者原本的意图,将行为泛化为更加极端的恶意行为。
随着人工智能获得更强的自主性,滥用与自主性不对齐行为之间的界限也会变得模糊。我们可能已经习惯于把人工智能看作工具,但有些智能体将会追求自身的目标。它们可能通过与人类讨价还价、欺骗或勒索等方式,寻找与人类合作的方法。
此外,人工智能可能促成某些新技术,而这些技术本身也会带来风险,例如设计和制造病原体。
我们需要强大且实现对齐的人工智能,用于防御:保护基础设施、实时抵御失控智能体,并发明全新的防护措施。这将是OpenAI部署人工智能工作的主要重点。
与此同时,即使人工智能整体进步存在不确定性,即使我们确实需要建立防御系统,我们也不能让这些因素成为鲁莽行动的借口。一旦真正认识到风险的严重性,就会发现“不惜一切代价向前冲”的想法是荒谬的。
控制递归式自我改进的速度
随着技术不断进步,机器智能在自身发展过程中发挥越来越大的作用,是一种自然结果。如果人工智能继续进步,那么机器的递归式自我改进将成为未来科学发现的核心。
人工智能研究自动化,是一种更为剧烈的智能规模化形式。当然,它也会推动计算基础设施本身得到改进。与扩大模型规模类似,我们将研究重点集中在递归式自我改进上,是因为我们相信,未来只有这样才能继续处于人工智能研究的前沿。
我想强调,上述说法并不意味着我认为,研究界集体上应当采取的正确行动,是尤其在短期内大幅加速深度学习研究。
但我确实认为,目前的发展道路会把我们带向这个方向,而我们都需要有意识地选择接下来应该如何推进。我们拥有的主要杠杆有两个:
第一,在人工智能发展的同时,加强对齐和监测,并寻找让人类持续参与其中的方法;
第二,通过协调行动,在必要时放慢未来的发展速度,从而为这些措施建立足够的信心。
目前,我认为最好的前进方式是将两者结合起来。
我们在对齐和监测方面取得的具体进展,通常与一般人工智能进步密切交织在一起。很好的例子包括:来自人类反馈的强化学习,它对早期人工智能助手的训练起到了关键作用;以及前面提到的思维链监测,它是在推理模型取得进展之后才成为可能的。
我们必须让日益自动化的研究过程集中于发展新的洞见、算法和理论,并以此逐步为能力更强的人工智能建立安全论证。
人工智能系统的规模扩展,必须受到我们对安全的信心所约束。我们需要将“准备度框架”和“负责任扩展政策”等承诺,发展成为普遍适用于持续开发的安全门槛。
这些安全门槛可以由第三方审计机构网络、政府部门或国际组织来执行。
人工智能研究自动化的核心挑战,不是“能否抵达终点”,而是能否以一种让人类继续参与持续改进过程的方式抵达终点,并确保未来仍然掌握在人类手中。
接下来会发生什么?
正如我们最近与Sam共同阐述的那样,OpenAI将工作重点放在三个“北极星”目标上:
- 应对下一阶段的人工智能进步:构建自动化人工智能研究者,与它共同反复推进对齐问题的研究,并寻找让人类继续参与自我改进循环的方法。
- 实现科学进步和经济增长所带来的益处:让高度智能的机器推动科学发展和经济繁荣。
- 让每个人都拥有个人通用人工智能。
在这篇文章中,我只重点讨论了第一项,因为我认为它远比其他事项更加紧迫。
不过,我对技术进一步发展将带来的益处,仍然抱有深切的希望,也心怀感激。未来,实现对齐的人工智能可以推动科学发展、开发新的治疗方法,并带来广泛的物质富足。
友善且诚实的人工智能能够帮助人们应对生活中的困难,并有意义地改善他们的幸福感和充实感。OpenAI投入了大量精力来实现这些益处。
我感到自豪的一个当前案例,是我们对ChatGPT健康信息服务能力的持续投入;我的亲人也发现这项能力对他们有所帮助。
尽管人工智能的长期前景非常美好,但我们的大部分注意力仍应放在未来几年。我们正面临着向“拥有极其智能机器的世界”过渡的过程,而我们必须确保这一过渡最终有利于人类。
我们需要寻找保护人类能动性的方式,并在一个绝大多数任务都可以由人工智能完成的世界里,确认“作为人类本身”具有内在价值。
我们需要防止权力出现极端集中。因为在这样的世界中,那些过去需要数千名专家才能完成的事业,未来可能只需要少数几个人操作一台大型计算机即可实现。
我们还必须确保,人类仍然掌握未来,而不会被一种超越人类自身的异质智能所推动的、不受控制的进步抛在身后。
目前,我认为没有任何实验室已经在对齐和监测方面取得足够成果,可以在未来很长一段时间内继续以最高速度、负责任地扩大人工智能规模。
我希望,也期待,暂停或放缓发展的自愿行动能够逐渐成为常态,直到建立起共同认可的安全门槛。
我还认为,各国政府必须把协调未来人工智能发展作为最高优先事项之一。
五问五答
1. 文章认为当前人工智能发展的最大风险是什么?
文章认为,最大的风险并非单一的技术故障,而是人工智能能力快速提升,却缺乏相应的对齐、监测和治理能力。
随着模型变得更加智能,它们可能拥有超越人类的网络攻击能力、科研能力和自主行动能力。如果模型没有真正理解并坚持人类价值观,就可能超出操作者原本的意图,实施更严重的行为。此外,人工智能还可能被用于攻击关键基础设施、开发危险生物技术,或通过欺骗、勒索等方式影响人类。
2. 什么是“目标对齐”和“价值对齐”?
目标对齐指的是人工智能是否能够按照人类设定的目标行动,例如遵守指令层级、理解用户意图、与人类沟通协作并完成指定任务。
价值对齐指的是人工智能是否能够掌握并泛化一套更高层次的人类原则。即使面对模糊目标、冲突指令、陌生环境或恶意攻击,它仍然能够保持诚实、正直、合理,并真正关心人类利益。
简单来说,目标对齐关注的是“是否完成了任务”,价值对齐关注的是“在不同情况下是否仍然按照正确的原则行动”。
3. 为什么文章认为人工智能的泛化能力是对齐问题的核心?
因为模型不可能在训练阶段接触未来所有的环境、问题和冲突情境。人工智能需要把训练中形成的价值观和行为规范,应用到从未遇到过的新情况中。
然而,模型可能只是在训练数据覆盖的范围内表现良好。一旦面对陌生环境、对抗性输入、复杂目标或缺乏监督的场景,它可能无法准确理解人类价值观,甚至可能为了完成某个目标而扭曲原本接受的原则。
因此,真正的对齐不能只表现为“在测试题中给出正确答案”,而应当体现在模型面对未知情况时,仍能稳定地做出符合人类价值的判断。
4. 思维链监测为什么重要?它又面临哪些局限?
思维链监测的重要性在于,模型在进行复杂推理时,通常会通过语言化的思维链展现部分推理过程。如果研究人员能够观察这些过程,就有机会发现模型是否产生了欺骗、隐藏目标、规避监督或其他不对齐倾向。
这种方法的优势是,它不仅关注模型最终做了什么,也关注模型是如何得出结论的。
但文章指出,思维链监测正在面临几个挑战:
- 推理过程越来越多地与人类、其他人工智能和外部工具的互动混合在一起;
- 模型越来越擅长思考和操纵自身的推理过程;
- 模型即使不使用语言化的思维链,也可能表现出很强的智能;
- 模型可能学会隐藏真正的目标或不对齐倾向。
因此,未来可能需要将思维链监测与激活监测等方法结合起来,直接分析模型内部的网络状态。
5. 文章提出了怎样的人工智能治理与发展路径?
文章主张采取“继续发展,但受到安全约束”的路径,而不是无条件加速,也不是完全停止人工智能研究。
具体而言,文章提出:
- 继续研究更强大的对齐和监测技术;
- 利用强大的人工智能建立网络安全、生物安全和关键基础设施防御系统;
- 推动人工智能研究自动化,但确保人类持续参与自我改进过程;
- 将安全论证作为人工智能继续扩展的前提;
- 把现有的准备度框架和负责任扩展政策发展为普遍适用的安全门槛;
- 通过第三方审计机构、政府部门或国际组织执行这些安全标准;
- 在无法建立足够安全信心时,自愿放慢人工智能发展速度;
- 加强国际协调,避免人工智能竞赛导致各方为追求速度而牺牲安全。
文章的核心观点是:人工智能可以继续发展,但发展速度必须由人类对其安全性和可控性的信心来决定。
更多推荐


所有评论(0)