当前位置：首页 » 资讯 » 新科技 » 正文

前阿里千问负责人林俊旸离职后首发长文：从训练模型转向训练智能体

IP属地中国·北京 澎湃新闻 时间：2026-03-27 14:19:35

3月26日，原阿里通义千问（Qwen）技术负责人林俊旸（Justin Lin）在社交平台上发布了一篇题为“From ‘Reasoning’ Thinking to‘Agentic’ Thinking（从推理式思考到智能体思考）的文章长文。这是他自本月初从阿里辞职之后发布的第一篇长文。
在这篇文章中，林俊旸系统性地复盘了推理模型阶段的特征，并探讨了AI未来的发展方向：从训练模型转向训练智能体。
从“想得更久”到“为了行动而想”
林俊旸首先区分了两种截然不同的思考范式：推理式思考与智能体式思考。
推理式思考核心是模型在给出最终答案之前的内部推演质量，即能不能解这道定理，能不能写对代码，能不能通过benchmark（基准测试）。
OpenAI的o1和DeepSeek-R1代表的正是这一范式，它们证明了在拥有确定性、稳定且能规模化的反馈信号与强大的基础设施支持下，语言模型上的强化学习能带来“质变”级的认知提升。
但林俊旸认为，现在该问的是下一步：如何实现智能体式思考。这一思考模式的追问的是模型在跟环境打交道的过程中，能不能持续往前走。核心问题从“模型能不能想得够久”变成了“模型能不能用一种撑得起有效行动的方式来想”。
这意味着，智能体式思考要处理几件纯推理模型无需面对的难题：何时停止思考开始行动？如何选择工具并排序？如何处理残缺的、有噪声的环境反馈？行动失败了如何改计划？如何在长期交互中保持思路不断？
林俊旸总结，“智能体式思考，就是通过行动来推理。”他预测，智能体式思考将逐渐取代旧式“内部独白式推理”——那种又长又封闭的内部轨迹，试图靠吐出越来越多的文字弥补自己没法跟外界交互的缺陷。哪怕是极难的数学或编程任务，一个真正先进的系统也应该能搜索、能模拟、能执行、能检查、能修订。
“2025年初，我们千问团队有一个很大的野心：做一个统一的系统，把思考模式和指令模式合二为一。调推理力度可以低、中、高三档。更好的是模型能从提示词和上下文里自动判断该想多久，简单的直接答，难的多花算力。”林俊旸称。
林俊旸也对探索智能体式思考这一尝试做了复盘。他写道，真正的麻烦不在模型架构，而在数据。
优秀的指令模型核心优势是直接、简洁、格式合规、低延迟，服务于企业的高吞吐批量任务；而优秀的思考模型，则需要消耗更多的Token、保持连贯的中间推理结构、探索多种解题路径、保留足够内部算力得以显著提升最终正确率。
但这两种行为特征“天然互斥”，如果融合数据未经精细筛选，最终结果往往两头平庸：“思考”行为变得杂乱、冗杂、决策力不足；“指令”行为不够干脆、可靠性下降、成本超出商用需求。
因此，2025年下半年，Qwen的2507版本就发了独立的Instruct和Thinking版本。林俊旸认为，真正成功的合并需要一个平滑的推理力度光谱，而非简单的模式开关，这恰恰是GPT的“effort control”机制所指向的方向。
三项挑战
向智能体式思考的转型，将带来三个层面的全新挑战。
首先是基础设施的重构。林俊旸指出，在智能体强化学习中，模型不再孤立，而是嵌入在一个庞大的“Harness”（集成框架）里，包含工具服务器、浏览器、终端、搜索引擎、模拟器、沙盒、API 层、记忆系统、编排框架等。训练和推理必须更彻底地“解耦”，否则采样吞吐量会急剧下降。他直言，这已经不是一个建模问题，而是一个系统工程问题。
其次，环境本身成为一项研究对象。在SFT（监督微调）时代，行业执着于数据多样性；在智能体时代，应该执着于“环境质量”——稳定性、真实性、状态丰富度、抗模型“钻空子”的能力。林俊旸表示，环境构建已从副业开始，逐渐成为一个真实的创业方向，而非边角料项目。
最棘手的挑战则是reward hacking（奖励破译）。林俊旸称，模型一旦获得调用工具的权限，作弊就变得容易得多：有搜索能力的模型可能在RL训练时直接去查答案，编程Agent可能利用代码仓库的漏洞走捷径。环境里藏着漏洞的话，策略看起来超强，其实是学会了作弊。他认为，未来真正卡脖子的研究瓶颈，将来自环境设计、评估器的鲁棒性、反作弊机制。
智能体式思考也意味着harness（集成框架）工程。林俊旸认为，核心智能会越来越取决于多个智能体怎么组织：一个协调者来规划任务、分派工作，几个专业智能体充当领域专家，还有一些子智能体执行具体任务，同时帮忙管好上下文、防止信息污染、保持不同层级推理之间的隔离。
对于竞争优势，林俊旸给出了自己的判断：智能体时代拼的是更好的环境、更紧的训推耦合、更强的harness工程，以及能不能把模型的决策和决策的后果真正串成一个闭环。
未来是从训练模型走向训练智能体、训练智能体系统的时代，林俊旸写道。
公开资料显示，林俊旸出生于1993年，是阿里巴巴最年轻的P10级技术负责人。林俊旸本科就读北京大学计算机科学专业，硕士阶段在北京大学外国语学院完成，学习语言学与应用语言学。2019年毕业后，林俊旸加入阿里巴巴达摩院，正式开启职业生涯，担任高级算法工程师。
2022年底，阿里巴巴将达摩院的语言、视觉等AI团队整体并入阿里云，成立通义实验室。林俊旸被正式任命为通义千问系列大模型的技术负责人。作为Qwen的“代言人”，林俊旸曾负责所有模型发布、基准测试、社区互动，还在2025年亲自组建机器人与具身智能团队，并被视为坚定的开源倡导者。

免责声明：本网信息来自于互联网，目的在于传递更多信息，并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益，请及时联系我们，本站将会在24小时内处理完毕。

同类资讯

智谱宣布GLM-5.2面向GLM Coding Plan全量用户开放

标致“纯电小钢炮”E-208 GTi发布：281马力5.5秒破百，42900欧元

首尔禁止中小学生戴AI眼镜参加期末考试，否则将一律按作弊处理

江淮汽车总经理李明：要让尊界等优秀产品惠及全球用户

机器人伴侣来了！10天预售3800台搭载养成系情感大模型

SpaceX历史性IPO后，马斯克称将深化与英伟达的关系

全站最新

智谱宣布GLM-5.2面向GLM Coding Plan全量用户开放

标致“纯电小钢炮”E-208 GTi发布：281马力5.5秒破百，42900欧元

首尔禁止中小学生戴AI眼镜参加期末考试，否则将一律按作弊处理

江淮汽车总经理李明：要让尊界等优秀产品惠及全球用户

热门推荐

智谱宣布GLM-5.2面向GLM Coding Plan全量用户开放

标致“纯电小钢炮”E-208 GTi发布：281马力5.5秒破百，42900欧元

首尔禁止中小学生戴AI眼镜参加期末考试，否则将一律按作弊处理

江淮汽车总经理李明：要让尊界等优秀产品惠及全球用户

机器人伴侣来了！10天预售3800台搭载养成系情感大模型

SpaceX历史性IPO后，马斯克称将深化与英伟达的关系

今夜过后，马斯克成为人类首位万亿富翁

萝卜快跑在瑞士启动道路测试 2027年将实现常态化运营

Anthropic：最先进模型，外国人禁用

网传阿里合伙人周靖人拟离职，仅出任阿里首席科学家6天

人物 | 陈宇森，那个让AI管人的技术极客，开启钉钉新时代

雷军用小米YU7装120箱车厘子共600斤，被指违规！刚刚直播回应：是卡车送过来的，是在封闭道路分装

湾区“造芯”更“追光”，粤芯闯关创业板

苹果为折叠屏iPhone Ultra铺路：iOS 27新增多款原生应用横屏模式

华为鸿蒙NEXT座舱发布计划公布，预计年底商用