当前位置: 首页 » 资讯 » 新科技 » 正文

OpenAI 全面押注智能体:普通人真的准备好了吗?

IP属地 中国·北京 编辑:赵云飞 至顶头条 时间:2026-08-26 02:01:58

你愿意将多大的数字生活控制权交给大语言模型?

要从模型中获取最大价值,就意味着要把"钥匙"交给它。对于习惯掌控一切的人或对 AI 持保留态度的人来说,这似乎有些难以接受。但对于 OpenAI 桌面应用首席工程师 Andrew Ambrosino 来说,这是测试未来的唯一方式——正因如此,这款应用现在可以访问并控制他的收件箱、Slack 账户、手机,以及 Notion、Figma 等应用程序。

"如果我让它写一份文档,它有没有可能从某条私信里提取相关内容,却不知道那些信息不该对外分享?有这种可能,"Ambrosino 告诉 TechCrunch,"但我愿意为了工作承担这个风险,偶尔付出点代价也无妨。而事实上,我还没遇到过这种情况。"

OpenAI 的产品宣传语简洁地道出了这一愿景:构建一个"智能不再局限于回答问题,而是帮助每个人将最大胆的想法变为现实"的世界。

对软件开发者来说,这一转变已然发生,但向其他岗位的蔓延速度依然迟缓。ChatGPT Work 是公司 Codex 编程工具的改良版,旨在让非工程师也能获得软件工程师早已习以为常的智能体功能:一个不只是回答问题、还能自主完成多步骤任务的 AI 工具。

"在这种新形态下,ChatGPT 实际上可以完全自主地为你完成整套复杂任务,这既令人愉悦,又足够安全,"负责 OpenAI 核心产品(包括 Work)的 Thibault Sottiaux 告诉 TechCrunch,"这正是 OpenAI 的使命所在——让所有人都能从中受益。"

从商业角度看,这意义重大。运行时间更长的智能体会消耗更多 Token,从而让 OpenAI 在每位用户身上获得更高收益。拓展新职业领域至关重要——不仅对 OpenAI,对整个行业亦是如此。如果说编程领域已被证明是 AI 实验室的"富矿",它也不过是 AI 工具需要赋能的专业工作中极小的一个子集,而这些公司若想证明其在训练和算力上的巨额投入是值得的,就必须在更广泛的领域有所作为。与此同时,当各大实验室聚焦于软件工程师的时候,Harvey(法律领域)和 Clay(销售领域)等垂直赛道的竞争者,正以与模型无关的方式追逐这批客户——也就是说,它们随时可以接入当时效果最好的 AI 模型。

行业分析师将此视为 OpenAI 及其竞争对手面临的重大挑战之一。"如果各大实验室无法迅速掌握在市场上推广 AI 所需的关键互补资产,价值将会流向别处,"Christian Catalini 在 a16z 的 Time to Build 博客上如此写道。

让 AI 应用真正服务于非软件工程师群体,需要更多的引导与扶持。OpenAI 内部的非技术团队——如公关和财务部门——开始使用 Codex 时,"那个时候产品对他们相当不友好,老是询问他们代码相关的问题,还向他们展示'这个功能的差异记录是空的'之类的技术提示,"Ambrosino 说,这里所指的是一种专门用于追踪代码变更的技术输出格式,"所以从今年二月到现在,我们一直在让它变得更通用。"

"我们为用户创造的价值和实用性越多,他们就越愿意为这些价值买单,这也一直是我们看待 ChatGPT 的方式,"Sottiaux 说,"你坐下来会觉得,'我当然愿意每月花 20 美元',因为你获得的价值远不止于此。"

深入了解 OpenAI 工程师正在构建什么,有助于理解这种落差背后的原因。每个大语言模型都需要工程师所说的"harness"——一层包裹在模型外部的软件,决定着模型能看到哪些信息、能使用哪些工具,以及如何将结果呈现给用户。

如果你希望模型能够真正"做事"——也就是成为智能体——那么 harness 需要为它配备工具,并指导它在长期任务中使用这些工具。对开发者来说,一个允许大语言模型编写代码的命令行界面(CLI)已足以改变软件的构建与部署方式。但大多数人并不使用命令行界面;Windows 之所以取代 DOS,就是这个道理。

一款超越软件工程边界的智能体产品,"将不得不面对你生活和工具的复杂混乱,以及那些建于 1995 年、从未更新过的网站,"Ambrosino 告诉 TechCrunch,并强调他的团队正在打造的体验,对于让更多人真正用上有价值的 AI 至关重要。

以 Claude Code 和 Codex 为例:它们通过抽象掉实际的代码编写,让用户只需告诉模型自己想要什么样的程序,从而解放了"氛围编程"(vibecoding)。如今,OpenAI 希望将程序员用于驱动大语言模型的 OpenClaw 等工具的功能,简化为像写提示词一样简单的操作。

"如果没有这些产品作为模型的前端,专家固然知道如何获得同样的结果,但你不可能让十亿人用上这项技术,"Ambrosino 说。如何在资深用户的需求与大众普及所需之间找到平衡,也引发了 OpenAI 内部的争论——部分员工认为,既然用户可以直接问模型,按钮就没有存在的必要。

"我们对此提出了反对意见——因为现在还是非常早期的阶段,"Ambrosino 说,"在这个阶段,功能的可发现性非常重要,等到一定时候,按钮自然会消失。"

Work 设置了更多用于选择项目和插件的按钮,但和 OpenAI 的其他产品一样,它追求同样的"魔法盒子"式交互体验。Ambrosino 把这比作拟物化设计——一种曾流行、如今渐趋式微的做法,即让数字工具看起来像它所替代的实体物品,比如一个设计得像真实计算器的计算器应用。"那不只是土气的设计,它确实帮助人们接受了这些新事物,完成了过渡,"他说。

OpenAI 没有透露 Work 与 Codex 各自的用户数量,但这款合并后的应用目前仅有 2000 万用户,而据该公司称,在网页端使用 ChatGPT 的用户已超过十亿。

就目前而言,OpenAI 将这款工具定位为最适合处理例行性、数据密集型协作任务的助手。公司员工正在用它设置每周指标报告,以及将电子表格转化为规划工具。

笔者与一些风险投资人进行了交流,他们正在使用智能体将公司相关通讯和分析内容整合成投资备忘录;运营团队则用它快速生成定制化的数据看板和可视化图表。山姆·奥特曼用它来规划假期行程。一位 OpenAI 工程师描述了这样一个场景:他让程序查看一段关于工程问题的 Slack 对话,然后"生成一些图表",结果收到了一系列颇具洞察力的图像。

"对于任何公司(包括我自己)的普通员工来说,信息洪流是真实存在的,"OpenAI 产品工程团队负责人 Akshay Nathan 说,"我们处理所有可用信息并据此采取行动的能力,实际上相当有限。这些信息分散在各种系统和工具中,比如 Salesforce……ChatGPT 的价值在于:你以前就能接触到这些信息,但现在你才真正能够驾驭它。"

如此看来,这或许就是 AI 布道者们梦寐以求的数字私人助理。正如 Claude Cowork 或 Perplexity AI 浏览智能体一样,ChatGPT Work 将智能体与你现有的工作空间相连接——邮件、浏览器、一系列 SaaS 平台——并为你调动这些信息和工具。

系统运转顺畅时,体验确实令人印象深刻:笔者让 ChatGPT Work 从邮件中找出格式混乱的学前班日历,然后同步到 Google 日历中,它顺利完成了任务,省去了大量重复的数据录入工作。或许这样就不会再忘记学校的聚餐或忘记安排假期托儿的事了。

出于对收件箱、采访记录和文章草稿隐私的顾虑,笔者没有允许 OpenAI 访问这些内容,也没有授权它接触银行账户,但确信如果授权范围更大,它会更有用。笔者让它对公开上市的科技公司进行财务分析,它确实生成了一份可自动更新的指标看板;它还搭建了一个可查询的航天发射数据库——这是笔者此前不得不通过编写 Python 脚本才能完成的工作。此外,它每周还会自动发来一封邮件,汇总学术平台上最新发布的 AI 研究论文。笔者会继续探索它的更多用法。

虽然向模型发出请求的方式相当直观,但给予它完成任务所需的操作权限却并不简单。设置智能体访问云端硬盘的权限,流程既混乱又繁琐——笔者尝试了多次只授予"只读"权限,但每次都收到错误提示。模型本身提供的帮助也十分有限,最后还是在移动应用上弹出了一个对话框,提示只有授予完整权限才能正常使用。

许多重要设置只能在网页端操作,因此笔者经常需要同时打开两端来回切换。ChatGPT Work 的某些限制令人费解——例如,将其与 Google 日历相连后,它可以创建日历事件,却无法新建日历本身。另外,如果任务本身不够复杂,就不用指望它了,否则你会遇到一个你见过的最差劲的实习生。

这是 AI 早期用户们的普遍忠告,他们担心那些受挫的新用户会就此放弃。OpenAI harness 工程负责人 Joe Gershenson 坦承,任务难度(effort)的设置对新用户来说还不够直观——"在帮助用户匹配合适的推理深度方面,我们还有很大的改进空间,"他说,"请关注后续动态。"

OpenAI 在打入普通白领工作领域时,还面临另一项重要挑战:大多数工作流程不像代码那样容易衡量或评估。软件要么能运行,要么不能,而即便是这种非此即彼的判断,也遮蔽了衡量代码质量的众多细微维度。一个好的演示文稿、商业策略或销售方案,远比代码难以评估,也难以追溯。

"这款产品最独特的挑战之一,就是它真的能做任何事,"Ambrosino 说。当笔者追问团队围绕哪些具体问题进行设计、又瞄准了哪些工作流时,几位工程师都显得有些支吾,表示这是一个应该由 OpenAI 研究团队来回答的问题。

OpenAI 事后向 TechCrunch 给出了一个官方答案:公司使用其基准测试 GDPVal——涵盖 44 个职业和数百项知识型工作测试,并结合用户反馈作为补充。一个更非正式的说法,则是来自 OpenAI 员工自身的使用体验。Ambrosino 说:"我们必须时常扪心自问——我们正在优化的工作流程,是大家都会使用的那种,还是只有我们这群人才有的特殊习惯?"

应用的早期采用者们会通过真实使用留下宝贵的行为数据——编程工具的成功很大程度上就是建立在类似的数据积累之上的——前提是用户没有选择退出数据训练共享。(笔者选择了退出。)

尽管各方对模型界面的关注度极高,OpenAI 的工程师们却不太愿意回答一个相当直接的问题:Codex 和 ChatGPT Work 与 Claude CoWork 或其他面向大众的竞品 harness,究竟有何差异?

"这个答案可能让你有点失望,不好意思,但说实话,我确实不太关注他们在构建什么样的 harness,"Gershenson 给出了一个颇具代表性的回答,"这让我想起《广告狂人》里那个梗:'我压根没想过你。'"

坦白说,笔者不太相信这个说法——仅从几款产品界面的高度相似性来看,加上任何企业都有竞争情报需求,更何况 ChatGPT Work 一启动就提示笔者将 Claude Cowork 的数据迁移过来。

Claude Code 如今成为 OpenAI 办公室里一个敏感话题,这可以理解。这个竞争对手定义了 AI 编程市场,并引发了一场软件工程师工作方式的变革。更令人沮丧的是:这个想法最初来自 OpenAI,但他们没能把握好时机。

OpenAI 最初将 Codex 开发为一款网页应用时,工程师们走得有些冒进——用 Ambrosino 的话说,就是"有点被 AGI 情绪冲昏了头脑"。简而言之,他们押注模型足够聪明,能够在几乎没有用户干预的情况下独立完成任务。

而稍后问世的 Claude Code 则建立在与用户持续对话的基础上。面对一个问题,它会分析各种可能性,给出三四种推进方案供选择;一旦你做出选择,它会继续深入一步,然后再次确认,全程持续更新进展,也因此为模型和 harness 留下了更小的出错空间。

Anthropic 的方式被证明更为有效,尽管它对用户投入的精力要求更高。"我们的产品比当时模型和 harness 的实际能力超前了一些,"Ambrosino 如今坦言。

OpenAI 最终跟进,增加了更多用户与模型交互的机会,这就演变成了如今大家所熟知的 Codex,并推出了桌面端和移动端应用。以下载量作为衡量产品热度的参考指标:Claude Code 在今年四月之前一直领先,但目前 Codex 已微弱超越;针对企业用户的调查也显示,OpenAI 正在追赶。

这一领先地位,部分来自产品与市场需求的更好契合,部分则源于外界对 Anthropic 模型安全限制的投诉以及算力供应短缺。OpenAI 持续推进以人为本的 harness 建设,但笔者采访的工程师们坚持认为,真正的差异化竞争力来自 OpenAI 最新、最强大且更具成本效益的模型。

"令人泄气的答案是,很多时候关键确实在于模型本身,而我们在这款应用上真正努力做好的,就是充分发挥模型的能力,"Ambrosino 说。

这一解释,又回到了 AI 研究者们所总结的"苦涩教训":一个更优秀的通用模型,比特定领域的专业经验更重要。在真正信奉者眼中,harness 只是暂时的辅助工具,而非护城河。

"短期内,通过添加大量额外规则——各种条件判断和工具——确实能获得不错的结果,但说真的,几个月后下一代模型就会让这一切变得过时,"Gershenson 告诉 TechCrunch。他的团队专注于以最简洁的方式将模型与所需工具和上下文信息连接起来——仅此而已。

"好的 harness 工程目标是……更精准地判断模型真正需要哪些信息来解决你的问题,因为只要你放手让模型去做,它们正变得越来越擅长处理此类任务,"Gershenson 说。

然而,大多数人或模型是否已为此做好准备,目前仍是一个悬而未决的问题。沃顿商学院研究 AI 职场工具的教授 Ethan Mollick 认为,Claude 依然更加用户友好,他写道:"ChatGPT 倾向于施展'魔法',直接替你做完;而 Claude 会进行比较分析,反复征询意见和反馈,并进行 A/B 测试。"

Sottiaux,乃至 OpenAI 整体,对此持不同意见。他认为,与其学习如何使用一款应用程序,不如直接与它对话更为自然。"我们确实看到,这个世界似乎已经准备好了,"他如此评价这款应用,"这就是为什么我们已经取得了惊人的采用率。"

不过,以模型专属 harness 的方式最大化发挥模型性能,是否真的是正确的赌注,目前尚无定论。Composio 和 Databricks 等公司的对比测试显示,不同的 harness 与模型组合,在编程基准测试上会呈现出截然不同的表现。Databricks 发现,由软件公司 Earendi 发布的开源 harness Pi,在使用同款 GPT 5.5 模型的情况下,表现超过了 Codex。Pi 已被用于构建 OpenClaw 和 CloudflareOS 等项目。

Pi 的创建者 Mario Zechner 表示,他有意为之的极简主义 harness,证明了 AGI 导向的思路在某些场景下确实奏效——至少对软件工程师和编程任务而言如此。他说,这款 harness 在明确功能上的欠缺,由其自我修改能力和自主构建界面的特性来弥补。他也对 OpenAI 工程师在拓展工程师以外用户群时所面临的挑战深感同情。

"一切都是以编程智能体的形态呈现的……原因在于,它们只有编程智能体任务的训练数据,"他告诉 TechCrunch,"比如我是一名管理人员,今天做了一个决策,结果要几个月后才能看到。你无法通过用户与智能体简单的来回交互日志来捕捉这个过程,所以这类任务,以及任何你没有数字化的内容,都是模型无从学习的盲区。"

和其他开源方案的提供者一样,他认为各大实验室力推自家 harness 是一种锁定用户的策略,"他们需要掌控整个技术栈,否则就只是一个模型供应商,不得不和其他模型正面竞争。"

他和 TechCrunch 采访的其他工程师认为,前沿实验室的 harness 对 Token 消耗和智能体行为的透明度太低。在某种程度上,这对非技术用户来说或许无关紧要,但正如编程工具的经验所示,当使用规模达到 OpenAI 所期望的量级时,迟早会引发关于成本的更深层讨论。

"我们每天都在努力推进效率的提升,"Sottiaux 说,并提到公司最近对 Luna 模型的 API 调用价格下调了 80%,"六个月后醒来,你应该能用更低的成本完成同样的任务。"

另一个值得关注的问题,是这些应用是否会通过数据留存,或用户配置插件及权限的高昂时间成本,对用户形成一种"绑定效应"。

七月,笔者造访了 OpenAI 那幢以木质护墙板和绿植装点的总部,大楼里的氛围平静中透着一丝紧绷——这些人有太多事情要做。接受采访的工程师们全程盯着笔记本电脑,不时在一个个会议室之间穿梭。

产品工程团队负责人 Nathan 表示,团队始终专注于"那个'魔法盒子'的承诺,但我仍觉得目前还是太复杂了……我非常乐观,相信我们能够解决这个问题,用更原生的 AI 方式解决它。"

Q&A

Q1:ChatGPT Work 和 Codex 有什么区别?

A:ChatGPT Work 是 Codex 编程工具的改良通用版,旨在服务非技术类白领用户。Codex 最初面向软件工程师,专注于代码编写和技术任务;而 ChatGPT Work 则更通用,支持接入邮件、日历、Slack、Salesforce 等多类工作平台,帮助会计、投资人、运营等各类岗位的用户完成多步骤的日常协作任务。

Q2:普通用户用 ChatGPT Work 每月实际会花多少钱?

Q3:ChatGPT Work 现在有哪些明显的不足?

A:目前 ChatGPT Work 存在几个明显短板:权限配置流程复杂且容易出错,部分重要设置仅限网页端操作,需频繁在网页和移动端之间切换;对于简单任务处理效果欠佳;任务难度(effort)设置对新用户不够直观;此外,与 Google 日历集成时存在功能限制,如无法新建日历本身,仅能添加事件。

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。

全站最新