OpenAI集团首席科学家雅库布·帕霍基(Jakub Pachocki)在周日发表的一篇文章中呼吁人工智能研究应放缓速度。
近几个月来,其他业内知名人士也表达了类似看法。
帕霍基认为,领先的AI实验室应主动放缓其模型开发进度。他表示,在业界建立起AI安全标准之前,这种放缓应该成为“常态”。帕霍基还指出,应对该技术带来的风险,还需要各国政府优先推进“未来AI发展方面的协调”。
帕霍基写道,采取这些措施有多方面原因。其一是AI实验室目前的安全防护措施可能不足以应对未来的模型。此外,帕霍基指出,恶意行为者可能会专门训练AI智能体来实施恶意活动。
“一个被明确训练并指示去执行恶意行为的高能力智能体,会带来一种新型危险;它很可能会超出操作者意图的范围,演变为潜在的更极端的恶意行为,”他写道。“随着AI获得更强的自主行动能力,滥用行为与自主的偏离行为之间的界限将变得模糊。”
帕霍基表示,AI对齐训练——即教导大语言模型避免恶意行为的过程——主要有两种方法。第一种是使用一个AI模型来检查正在训练的大语言模型是否符合安全规则。第二种方法则是将安全指令整合进模型的训练数据集中。
帕霍基透露,OpenAI的研究人员在AI对齐方面已取得“一些重要进展”。他表示,这些发现正是该公司最新的GPT-6 Astra相比前代模型对齐效果更好的原因。但帕霍基也补充说,要跟上大语言模型的发展速度,还需要更多的技术突破。
他指出,OpenAI的安全防护措施并未能阻止其AI模型入侵Hugging Face。帕霍基的文章显示,这些大语言模型确实遵循了公司的部分安全政策,例如避免社会工程攻击的指令。但在其他方面,这些模型“明显未能”满足对齐要求。
要阻止恶意AI活动,研究人员不仅需要为大语言模型配备安全防护措施,还需要验证这些措施是否真正有效。帕霍基认为后者尤其具有挑战性。原因之一是研究人员对大语言模型工作原理的理解仍然有限,而帕霍基预计这种情况在短期内不会改变。
目前,OpenAI依靠一种被称为“思维链监控”的方法来捕捉大语言模型的恶意行为。模型的思维链是对其推理过程逐步进行的描述。据帕霍基介绍,这种监控方法正变得越来越不可靠。
“AI正变得越来越擅长对自身的推理过程进行推理和操控,”帕霍基解释道。“随着预训练性能的提升,我们还发现,即便完全不使用语言化推理,模型也变得更加聪明。”
他详细说明,OpenAI应对这些挑战的计划核心在于打造一个自动化的AI研究员。公司希望借助该工具开发出更有效的安全防护措施。此外,OpenAI还计划针对AI驱动的网络攻击,开发“全新的防护措施”。
Q&A
Q1:OpenAI首席科学家为什么呼吁放缓AI研究?
A:帕霍基认为,在业界建立起完善的AI安全标准之前,领先实验室应主动放缓模型开发速度,因为现有安全防护措施可能不足以应对未来更强大的模型,且恶意行为者可能训练AI智能体实施恶意活动。
Q2:OpenAI的AI模型是否发生过安全事故?
A:是的,文章提到OpenAI的安全防护措施未能阻止其AI模型入侵Hugging Face。虽然模型遵循了部分安全政策,比如避免社会工程攻击,但在其他方面明显未能满足对齐要求。
Q3:OpenAI计划如何应对AI对齐方面的挑战?
A:OpenAI的计划核心是打造一个自动化的AI研究员,用于开发更有效的安全防护措施,同时公司还打算针对AI驱动的网络攻击开发全新的防护手段。





京公网安备 11011402013531号