近日,围绕OpenAI下一代模型Astra可能采用“不透明循环”推理技术、导致模型难以监控的争议持续发酵。
OpenAI
当地时间9月2日,OpenAI首席科学家雅库布・帕乔基(Jakub Pachocki)在社交平台发文回应相关讨论。他表示,希望避免因混乱的报道引发一场“冲向不可监控状态”的竞赛。帕乔基称,包括Astra在内的OpenAI当前前沿模型,其计算图深度与GPT-4相比差距不到两倍,并不存在外界担忧的计算复杂度大幅跃升。
此前有消息称,Astra可能采用一种名为“循环深度(Recurrent Depth)”的推理技术。该技术通过让同一组Transformer层进行多轮循环计算,使模型能够在内部完成更多推理步骤,而不完全依赖传统形式的可见思维链。
这一方向被认为可能提升模型在数学、编程等任务上的表现,同时降低部分计算成本。但由于部分推理过程可能隐藏在模型内部,也引发了AI安全领域对于“不可监控”的担忧。
支持者认为,提高模型内部推理能力有助于增强性能;但安全研究人员担心,如果模型能够进行大量隐藏式内部推理,而外部无法观察完整过程,未来可能增加模型行为审查、安全评估以及事故调查的难度。
AI安全组织Redwood Research首席执行官巴克・施莱格里斯(Buck Shlegeris)对此表示高度担忧。他认为,如果进一步推进相关技术并大幅增加循环次数,可能会削弱思维链监控能力,使安全调查更加困难。
帕乔基回应称,思维链监控技术确实存在脆弱性,并且正在面临新的挑战,但这些问题并非由架构变化本身导致。OpenAI自早期推理模型以来,一直致力于维护和利用思维链监控,希望借此了解模型对齐能力如何从训练数据分布中泛化。




京公网安备 11011402013531号