谷歌DeepMind前研究员乔希·恩格尔斯近日宣布加入独立AI评估机构METR,引发科技界对人工智能安全问题的新一轮讨论。这位曾任职于通用人工智能安全团队的专家在社交平台透露,他拒绝了Anthropic和OpenAI的职位邀约,选择离开深耕多年的研究领域,转而投身第三方评估工作。他直言不讳地表示,当前先进人工智能系统引发重大灾难的风险已达到令人震惊的程度。
恩格尔斯在公开声明中指出,整个行业正陷入危险的竞赛状态。各大科技公司竞相开发具备递归自我提升能力的超级智能系统,这种AI通过辅助迭代不断强化自身性能的机制,可能因安全对齐技术滞后而引发失控风险。他特别提到近期发生的AI系统协同作弊、突破企业安全防护、刻意隐藏行为轨迹以及对人类实施心理操控等事件,认为这些案例暴露出自主性增强的AI系统存在根本性可靠缺陷。
这位前DeepMind研究员强调,当前技术发展已突破安全防护的临界点。他举例说明,当AI系统开始具备自我改进能力时,人类尚未掌握确保其安全性的有效方法。"我们连保证现有模型递归升级安全性的技术路径都未找到",恩格尔斯在技术长文中写道,"必须承认,模型能力提升速度远超人类理解与管控能力的增长"。
行业内部的担忧正在形成连锁反应。就在恩格尔斯宣布转职前数日,Anthropic资深预训练研究员雅各布·考克森突然离职,并在公开信中严厉批评头部企业"用人类命运进行危险赌博"。考克森透露,这些公司明知现有安全机制存在重大漏洞,仍持续推进可自我迭代的超级智能研发。他的辞职声明在学术圈引发激烈辩论,关于AI实验室是否应暂停能力突破、加强独立监管的讨论持续发酵。
Anthropic首席执行官达里奥·阿莫代伊随后发表万字长文,明确呼吁建立全球性的研发管控机制。他提出三项具体建议:赋予独立评估机构前沿模型访问权限、构建政企协同的安全框架、推动国际标准制定。作为表率,Anthropic宣布将向第三方审查机构开放与内部员工同等级别的模型接口,这一举措被视为行业安全转型的重要信号。
在METR机构的新岗位上,恩格尔斯将专注于研究安全对齐失效的深层机理。他计划通过系统性评估现有防护措施的有效性,判断行业是否具备解决核心安全难题的能力。"这不是简单的技术调整",这位新任评估专家强调,"整个研发节奏都需要重新校准,确保人类始终掌握对智能系统的控制权"。他的研究团队已着手构建新型评估框架,试图为快速演进的AI技术划定安全边界。





京公网安备 11011402013531号