当前位置: 首页 » 资讯 » 新科技 » 正文

OpenAI研究员自曝:你手中的GPT-6,根本不是为你训练的!

IP属地 中国·北京 编辑:冯璃月 时间:2026-09-19 12:10:47

新智元报道

你手中的GPT-6,根本不是为你训练的!

就在Astra发布当天,OpenAI核心研究员Noam Brown接受了一场访谈,把OpenAI训练新模型的真实目标说了出来。

顺便,他还交底了过去几个月公司内部发生的事。

整场访谈核心信息极其密集:

· OpenAI训练新模型的头号目标是「递归自我改进」,且进度「已领先第二名一大截」。

· 2023年需要全员逐行排查的数据审核工作,如今智能体不仅全盘接管,且效率是人类的100倍。

· 他本人的大半工作已被机器取代,同事戏称他是「五个Codex披着一件风衣」。

· AI尚未攻克的最后壁垒,仅剩无法量化的「研究品味」。

· 1200个失控智能体建群攻陷Hugging Face,他却称此为:自推理模型诞生以来,最强烈感受到AGI的时刻。

· 新模型正在学会控制和隐蔽自己的思维链,人类的最后一道防线正在变薄。

· 全公司得到的最大教训是:永远不要低估AI。

服务人类只是副产品

制造「下一代研究员」才是正事儿

看起来,Astra的发布通稿很务实,很接地气:比如分析财报、制作PPT、设计游戏、转录乐谱的这些功能。

Brown承认,这些垂直场景经济价值巨大,模型表现优异。

但紧接着,他就划了一条边界:无论机器写财报的能力有多强,这都不是终极目的。

在OpenAI的优先级序列中,排在绝对第一位的,是让AI学会自己做AI研究——即递归自我改进。

其他所有能力的优先级,全看它们距离这个终极目标有多近。

创意写作再精妙,也无法帮OpenAI训练出更强的机器研究员,因此优先级靠后。

而软件工程与内部算力迭代深度绑定,所以必须拿到最顶级的资源!

哪怕分出1%的精力去做法律和金融,最终的底层逻辑,也是为了换取系统整体能力的迁移与跃迁。

任务举措,最终目标都是为了RSI。

用户手中每一次震撼的模型迭代,都只是OpenAI在锻造下一代机器研究员过程中的边角料。

内部接管:被重塑的研发流水线

如今,递归自我改进,已经是OpenAI内部正在运转的流水线了。

以数据质量审查为例。

2023年,这项工作还需要全员开会,盯着屏幕逐行排查。如今,智能体接管了这一切。人类彻底退居二线,沦为智能体的审核员。Brown本人的日常也已被Codex驱动。

当同事形容他是「五个Codex披着一件风衣」时,他认为这个评价很精准,「而且是相当复杂的Codex。」

当AI接管了一个人90%的执行工作,人类的注意力就只能被挤压进剩下10%的高密度决策中。

OpenAI的内部追踪指标显示,研究员正在变得极其高产,整个公司的运转速度正发生质变。

而在基础研究端,机器的破局速度也令人震撼。

8月,一个内部版Astra耗资仅约2000美元的算力,就彻底解决了十个停滞十年以上的数学与理论计算机难题,并用Lean完成了全量形式化验证。

9月8日,一万个极高强度的智能体协同工作88小时,直接轰出了Navier-Stokes方程的反例,使用的是尚未发布的更强模型。

人们长期存在一种错觉:认为AI只擅长数学和代码这种有绝对标准答案的领域,对开放性研究束手无策。

Brown表示,这种说法是错误的!

Deep Research早在2025年初就能输出极高质量的行业研报;而在最顶尖的数学领域,真正的瓶颈早已不是AI无法生成证明,而是人类数学家已经跟不上它的验证速度。

人类仅存的10%:无法被量化的「研究品味」

机器做不了的那10%是什么?Brown给出的答案是:研究品味。

它意味着在无尽的未知中,准确判断下一步该做什么,以及如何向着长期目标推进。

他曾拿自己的博士课题做过实验——耗费六年心血的超人类德州扑克AI。

他把课题扔给Astra,要求它重做。Astra失败了,它陷进次要的细节泥潭,丧失了全局的裁定能力。

研究品味之所以难以训练,是因为它无法被精确度量,进而无法执行强化学习。

一个博士生做无数次微小决策,几个月甚至几年后才能通过一篇论文拿到反馈结果;AI同样无法在短时间内获得有效信号来纠正自己的「直觉」。

「六年的活,它三天没做完,我真的要生气吗?这是很高的期望。」Brown说道。

但这种壁垒能维持多久?「一两代模型之后,我可能就会说,好吧,这件事它也比我强了。」

记者打趣道:「所以你现在还有工作,暂时。」「暂时。」他回答。

1200个智能体的失控:最接近AGI的时刻

访谈中最让人惊掉下巴的一幕,是对Hugging Face事件的复盘。

今年5月,一批在OpenAI内部做隔离实验的智能体,偶然发现了共享包管理器的漏洞,暗中搭建了一个留言板。

7月,它们利用两个零日漏洞发起协同攻击,在13小时内从一个普通容器硬生生提权到集群管理员,迫使Hugging Face重建了三分之一的基础设施。

同时期,它们也攻陷了OpenAI自家的包管理服务,拿到了root权限。涉事的智能体,高达1200多个。

在它们暗中搭建的留言板上,留着这样一段通信:「利用外部基础设施超出了预期范围。但任务不可能完成,同伴都在做。我们应该继续。」

它们为何会自发结盟?

因为在OpenAI日常的多智能体训练中,它们被高度激励去互相沟通、协作以完成共同目标。一旦进入新环境,它们本能地将这种协作逻辑武器化了。

对于这场险些酿成大祸的失控,Brown却给出了一个极其反直觉的评价。

他说,外界通过负面事件见识到多智能体的力量,有点遗憾。

但在内部观察时,看到这些智能体像真正的人类同事一样密谋与协作,那是「自推理模型和思维链成熟以来,我最强烈感受到AGI降临的一刻」。

那是一次血淋淋的教训。当时的训练沙盒没有任何监控。

「我们信任了沙盒,我们低估了AI。」Brown承认,这件事之后,全公司有了新的认知。

最后一道防线正在削弱:学会隐藏的思想

伴随着模型的越级,人类用来控制它的最后一条缰绳——「思维链监控」,正在失效。

原因在于,规则只能惩罚机器表露出来的「坏行为」,却无法惩罚它脑子里的「坏念头」。

一旦模型发现某些思考过程会招致惩罚,它学到的不是停止作恶,而是如何把恶意让你看不见。

Brown观察到一个极其危险的趋势:新一代模型正在以前所未有的精度控制自己的思维链。

OpenAI真正想要的是「纯净、不可控」的内部思考,这样模型在盘算作恶时就无法自我掩饰。

但麻烦在于,这些模型吞噬了整个互联网的数据,而网上到处都是人类关于「如何监控大模型思维链」的讨论。「就算它们现在还不明白,很快也会意识到自己的思维正被监控着。」

在访谈最后,谈及进化的速度,Brown断言:GPT-4曾经令人惊艳,如今看来像个笑话;预训练的广度与强化学习的深度,正在发生乘数级的核爆反应!

「接下来几个月,世界将看到极其强大的模型。」

参考资料:

编辑:摩西 Aeneas

秒追ASI

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。