OpenAI 推 ChatGPT Work AI 代理将接管你的数字生活?

内容管家 AI领域评论0字数 4297阅读14分19秒阅读模式
OpenAI 推 ChatGPT Work AI 代理将接管你的数字生活?

AI 正在从"回答问题"进化到"替人干活",这场转型的核心战场不在程序员圈子,而在普通白领的办公桌。OpenAI 正用 ChatGPT Work 打通这条路。

对 AI 模型给多少控制权,取决于你愿意承担多少风险。OpenAI 桌面应用首席工程师 Andrew Ambrosino 的答案是:全部。

他主动向 ChatGPT 开放了收件箱、Slack、Notion、Figma 等多个系统的访问与控制权。在他看来,如果不这么做,就无法真正测试 AI Agent 的能力边界。他对 TechCrunch 表示:"让它写一份文档时,有没有可能它从私信中抓取相关信息,然后不小心分享出去?有可能。但为了这项工作,我愿意偶尔承担这个风险。到目前为止还没出过问题。"

核心变化:ChatGPT Work 的定位与使命

ChatGPT Work 于上月发布,订阅费用 20 美元/月,定位是让会计师、投资人、医生等日常依赖电脑的白领工作者也能用上 AI Agent。

OpenAI 核心产品负责人 Thibault Sottiaux 对 TechCrunch 形容:"在这个新阶段,ChatGPT 能真正自主完成极其复杂的任务,而且体验愉悦、安全。这正是 OpenAI 的使命——让每个人都能被带上船。" 产品逻辑上,ChatGPT Work 脱胎于面向程序员的 Codex 工具,但在产品设计上更通用——非工程师用户无需懂代码,只需描述需求,AI 即可自主完成多步骤任务。

影响与挑战:内部高渗透率与外部低采用率的反差

OpenAI 内部数据显示,今年 6 月,98% 的 OpenAI 员工使用 Codex,但企业订阅用户中仅有 17% 使用该工具,个人用户更是低于 1%。这一巨大落差,恰恰是 ChatGPT Work 面临的核心挑战与机会。

对 OpenAI 而言,让 AI Agent 在更长时间内持续工作,意味着消耗更多 tokens,单用户商业价值更高。但 AI 能否渗透到软件开发以外的其他职业,直接决定这些公司能否收回在训练和算力上的巨额投入。Harvey(法律)、Clay(销售)等垂直领域竞争者正以"模型无关"策略抢占这些市场。

a16z 经济学家 Christian Catalini 在博客中指出:"如果 AI 实验室无法快速获取规模化 AI 所需的关键互补资产,价值将流向其他玩家。"

落地难题:如何让非工程师也能用 AI Agent

Ambrosino 透露,OpenAI 的非工程团队(communications、财务等)最初接触 Codex 时体验极差:"它会问你代码问题,给你展示技术 diff……根本不是给非工程师用的。"因此团队从今年 2 月起,将 Codex 改造为更通用的工具。

让普通用户上手 AI Agent,本质上是将"命令行"封装成"图形界面"。Ambrosino 打了个比方:"对于非工程师来说,AI Agent 要打交道的,是一个人人生活在 1995 年建成、从未更新的混乱工具世界。"这正是 OpenAI 正在攻克的体验难题——在"功能强大"与"人人会用"之间找到平衡。

界面哲学:让 AI 工具"看起来像用过的东西"

Work 的界面保留了更多项目与插件选择按钮,但核心思路与 OpenAI 其他产品一致——打造一个"魔法盒"式的交互体验。Ambrosino 将其比作拟物化(skeuomorphism),即让数字工具模拟真实物理形态的设计风格,比如计算器应用做成口袋计算器的外观。"这种设计不只是让人觉得土,它真正帮助人们过渡到数字工具。"他说。

OpenAI 拒绝透露 Work 与 Codex 的具体用户对比数据,但这款联合应用的月活跃用户仅为 2000 万,而 ChatGPT 在线端的用户超过 10 亿。

ChatGPT Work 的真实用法

目前 OpenAI 将 Work 定位于日常、数据密集型的协作任务场景。内部员工用它生成周度指标报告,或将电子表格转化为规划工具。

已有投资人在用 AI 智能体将相关通讯与分析汇总成投资备忘录,运营团队则用它搭建定制化仪表盘和数据可视化。Sam Altman 本人用它规划假期行程。一位 OpenAI 工程师描述了自己让程序分析 Slack 上关于某个工程问题的对话,然后"生成一些图表",最终收到了系列有洞察力的可视化图表。

"普通员工面对的信息量实在太多了,包括我自己。"OpenAI 产品工程负责人 Akshay Nathan 表示,"我们处理所有可用信息的能力其实非常有限,更别说据此采取行动了。这些信息分散在各种系统和记录工具中——比如 Salesforce。ChatGPT 的价值在于,你本来就有权限访问这些数据,只是现在你真正能用上它们了。" 这或许就是 AI 布道者梦想中的"数字私人助理"。与 Claude CoWork 或 Perplexity AI 浏览智能体类似,ChatGPT Work 将智能体连接到已有的工作空间——邮件、浏览器、各类 SaaS 平台——并利用这些上下文替你完成任务。

实际效果有时确实令人印象深刻:本文作者让 ChatGPT Work 从邮箱中提取格式古怪的幼儿园日历并导入 Google Calendar,任务顺利完成,省去了大量重复录入。如果早用上,也许不会忘记学校聚餐或忘记安排假期托管了。

作者坦言,不会把邮箱、采访素材或稿件草稿的权限交给 OpenAI,也不会让它访问银行账户。但对于公开上市公司的财务分析任务,它确实交出了一份自动更新的指标仪表盘;它还建成了一个可查询的航天发射数据库——这类任务此前需要写 Python 脚本才能完成。此外,它每周还会发送一封邮件,汇总学术机构发布的新 AI 研究论文。这些功能值得继续探索。

权限设置与"努力等级"的困扰

尽管向模型提需求很直觉,但赋予它足够的权限来执行操作就不那么简单了。为智能体配置云盘"只读"权限的过程令人困惑且循环——尝试多次均报错。模型本身给不出有效帮助,直到在移动端弹出一个对话框,提示只有完整权限才能正常工作。

许多重要设置仅在网页端可用,因此经常需要同时操作两个界面。ChatGPT Work 的某些限制也令人费解:关联 Google 日历后,它可以创建事件,却无法新建日历。还有一个原则:任务复杂度不够高就别用它,否则你会得到"史上最差实习生"的表现。

这是 AI 早期采用者的普遍忠告,他们担心挫败感会劝退新手。OpenAI Harness 工程负责人 Joe Gershenson 承认,"努力等级"设置对新用户还不够直觉——"我们有很多可以优化的地方,来帮助用户获得恰到好处的推理深度……等着看吧。" OpenAI 面临的另一个挑战是:大多数白领工作流程不像代码那样容易量化评估。软件好歹能用或不能用,但这种二元判断仍无法涵盖代码质量的所有维度。一份好演示、好的商业策略或销售话术,评估起来更是难上加难。

"这类产品的独特挑战在于,它真的什么都能做。"Ambrosino 表示。当被问及团队围绕哪些具体问题设计、目标工作流是什么时,工程师们避而不答,说这是 OpenAI 研究团队的事。

OpenAI 随后给出的答案是:他们使用内部基准 GDPVal 进行评估,该基准涵盖 44 个职业和数百个知识工作测试,并辅以用户反馈。一个更接地气的答案是:这些用例往往来自 OpenAI 员工自身。Ambrosino 说:"我们必须始终分清——我们做的是所有人都将做的事,还是只有我们自己在做的事?"

与竞品的竞争格局

尽管外界关注焦点落在模型能力上,OpenAI 工程师们却不愿回答一个简单问题:Codex 和 ChatGPT Work 与 Claude CoWork 或其他面向大众的智能体框架相比,究竟有什么差异化?Gershenson 的回答颇具代表性:"这个答案可能会让你失望,我很抱歉,但实话实说——我真的不看他们做的那个框架。"他补充道,"Mad Men 那个梗'我根本懒得想你'用在这里很贴切。"

竞争焦灼:OpenAI 能否翻盘

作者对 ChatGPT Work 的数据迁移提示持保留态度——产品界面高度相似、每家企业都需要竞品情报、加上 OpenAI 第一件事就让用户导入 Claude Cowork 数据,这些信号很难忽视。

对 OpenAI 而言,Claude Code 是个敏感话题。这不仅因为它的企业竞品定义了 AI 编程市场、掀起了软件工程的工作方式革命,更因为 OpenAI 实际上更早产生了这个想法——只是没有正确地实现它。

OpenAI 最初将 Codex 作为网页应用推出时,工程师们多少有些"过于 AGI 导向"。他们押注模型足够聪明,能在极少的用户输入下独立完成整个任务。

而随后推出的 Claude Code 采用的是与用户反复对话的模式。给它一个问题,它会先审视多种可能性,提供三到四个方案让用户选择;用户选定后,它再往前推进一小段,然后再次汇报——如此循环,降低了模型与工具链出错的概率。

Anthropic 的策略被证明更有效,尽管这对用户的要求更高。Ambrosino 如今也承认:"我们的产品在当时比模型和工具链的实际成熟度略微超前了一点。" OpenAI 后来也加入了更多用户与模型互动的节点,演变为今天我们熟悉的 Codex,支持桌面和移动端。从下载量作为兴趣指标来看,Claude Code 此前一直领先,直到今年 4 月,Codex 才实现小幅反超;企业用户调研同样显示 OpenAI 正在迎头赶上。

部分领先源于产品与市场的契合度,另一部分则来自 Anthropic 模型安全限制引发的抱怨,以及算力紧张的问题。OpenAI 在用户中心的工具链方向上持续演进,但接受采访的工程师们坚持认为,真正的差异化在于其最新一代强大且成本效益突出的模型。

Ambrosino 说了一句实话:"很多时候,真正的原因就是模型本身。我们在这个应用上努力做好的核心,就是充分释放模型的潜力。"

什么是好的工具链

这一解释回到了 AI 研究者口中的"苦涩教训"(Bitter Lesson)——更强大的通用模型比特定领域的专业知识更重要。对真正的信仰者而言,工具链只是临时拐杖,并非真正的护城河。

Gershenson 告诉 TechCrunch:"短期内你确实可以通过一堆额外的 if-then 规则和工具获得不错的结果,但拜托,再过几个月新模型一出来,这些东西就过时了。"他的团队专注于用最简单的方式让模型获取所需的工具和上下文——不多不少。

"好的工具链工程的目标是……更精准地判断模型真正需要什么信息才能解决你的问题,因为如果你放手让模型自己来,它在这方面的能力正在飞速提升。" 然而,一个开放的问题是:大多数用户或模型是否已经准备好迎接这种方式。 沃顿商学院研究 AI 工具的 Ethan Mollick 教授仍认为 Claude 更加用户友好,他在文章中写道:"ChatGPT 倾向于自己施展魔法、直接帮你搞定,而 Claude 则会进行比较、反复展示、不断征求输入和反馈,还会做 A/B 测试。"

Sottiaux,以及某种程度上 OpenAI 整体,并不认同这个观点。 他们认为应用的对话特性比学习如何使用某个应用程序更好。" 我们确实看到世界已经准备好了,"他在谈到这款应用时说,"这就是为什么我们实现了惊人的 adoption。" 不过,模型专属的工具体系是否真的是最大化模型能力的正确路径,目前尚不明朗。 Composio 和 Databricks 等公司的对比测试显示,不同工具链与模型组合在编程基准测试中表现差异显著。 Databricks 发现,使用相同 GPT 5.5 模型的情况下,由软件公司 Earendi 发布的开源工具链 Pi 表现优于 Codex。

Pi 已被用于构建 OpenClaw 和 CloudflareOS 等项目。

Pi 的创作者 Mario Zechner 表示,他有意为之的极简工具链证明,至少在软件工程和编程任务上,"AGI 导向"的思路是可行的。他补充说,Pi 的显式功能虽然不多,但胜在能够自我修改和构建自己的界面。他理解 OpenAI 工程师在扩大用户群(超越工程师群体)时面临的挑战。

"现在一切都是编程代理的形状……原因是训练数据只来自编程代理任务,"他告诉 TechCrunch。"假设我在管理层,今天做了一个决定,结果要在几个月后才显现。你无法用简单的用户与代理来回轨迹来捕捉这种情况,因此这类任务以及任何未被数字化的东西,对模型来说都是不可及的。" 与其他开源提供商一样,他认为大厂推动自家工具链是一种锁定用户的手段:"他们需要掌控整个技术栈,否则就只能当一个模型供应商,然后不得不与中国模型竞争。" 他和其他接受 TechCrunch 采访的工程师都认为,Frontier 实验室工具链在 token 消耗和代理行为的透明度上仍然不足。对非技术用户来说,这个问题影响相对较小,但正如编程工具所经历的,当 OpenAI 期望的规模级采用真正发生时,成本问题将不得不被更认真地对待。

举例来说,在 20 美元/月的订阅中随手使用,四天内就消耗了超过 8000 万个 token,按照模型分析要花费 65 美元(应用中并没有相关仪表盘)。仅四天的轻度使用,补贴就超过了订阅价格的 3 倍。

OpenAI 工程师正以"魔法盒子"为愿景,推动 AI 原生方式的效率革新,同时正视插件生态带来的复杂性挑战。

效率提速:Luna 模型价格下调八成

OpenAI 产品工程团队负责人 Nathan 表示,团队正聚焦于"魔法盒子的承诺",但也坦承"复杂度仍然过高"。他对此持乐观态度,认为借助模型能力,能够以真正的 AI 原生方式解决这一问题。

Sottiaux 强调,团队每日的工作重心都在推进效率边界。他提到 OpenAI 近期将 Luna 模型价格下调了 80%,并承诺:"半年后,你应该能用更少的支出完成同样的任务。"

插件生态的隐性代价

值得关注的是,插件生态背后存在一个潜在隐患:应用是否通过数据留存或繁琐的配置流程,在用户侧形成锁定效应?每当用户配置一组插件及其权限后,迁移成本便会累积,这也可能成为平台黏性的来源之一。

总部氛围:紧张有序的 AI 冲刺

今年 7 月走访 OpenAI 总部时,建筑内部采用木质饰面板并点缀绿植,环境宁静却略带紧绷——这里的人普遍任务繁重。工程师们在受访时不断低头查看笔记本电脑,会议室之间步履匆匆,节奏紧凑。

延伸阅读

 
内容管家

发表评论