从「聊天机器人」到「执行任务」:企业 AI 正在发生什么变化
2025 年被不少人称作「Agent 元年」。2026 年初回望,这个说法背后到底发生了什么?这篇用一条带日期的事件线,讲清行业如何从「回答问题」转向「完成任务」,基准数字该怎么冷静解读,以及企业现在该用什么姿势入场。
核心结论
2024 年 10 月 Anthropic 发布 Computer Use,12 月 Google 公布 Project Mariner,2025 年 1 月 23 日 OpenAI 推出 Operator,3 月 6 日 Manus 引发邀请码热潮,7 月 17 日 Operator 并入 ChatGPT 的 agent 模式——一年多时间,行业主线从「回答问题」转向「完成任务」。但基准数据(OSWorld 38.1%,人类 72.4%)说明 Agent 能干活、远未到无人值守,企业现阶段的合理形态是 AI 起草、人来确认。

把时间拨回 2024 年底以前:那时企业里的 AI 应用,主流形态还是一个聊天窗口——你问,它答;答完之后,复制粘贴、打开系统、填表提交,全是人的事。2025 年这一年,「让 AI 自己把事做完」从实验室话题变成了产品竞赛。现在是 2026 年 1 月,「Agent 元年」的说法已经被讲了一年,值得回头看看:这一年真实发生了什么,又走到了哪一步。
一条事件线:从「会动手」到「进入主产品」
2024 年 10 月,Anthropic 发布 Computer Use:Claude 3.5 Sonnet 以公测形式获得了「操作电脑」的能力——看屏幕截图、移动光标、点击、输入,像人一样使用图形界面。能力还很初级,但方向意义明确:主流模型第一次被正式产品化地允许「动手」,而不只是回答。
2024 年 12 月,Google 公布 Project Mariner,路线更聚焦:在 Chrome 浏览器里代用户执行网页操作。浏览器是绝大多数业务系统的入口,这个选址本身,就说明了各家对「Agent 先在哪落地」的判断。
2025 年 1 月 23 日,OpenAI 以研究预览形式推出 Operator。支撑它的 CUA(Computer-Using Agent)模型,把 GPT-4o 的视觉能力和强化学习训练结合起来,在云端浏览器里替用户完成订位、填表、下单这类操作。OpenAI 同时公布了基准成绩:在模拟真实电脑操作的 OSWorld 测试中,成功率 38.1%,同一测试中人类是 72.4%;在网页任务基准 WebVoyager 上,成功率 87%。这组数字,后面单独说。
2025 年 3 月 6 日,国内团队(Monica 背后的蝴蝶效应)发布通用 Agent 产品 Manus:给它一个任务,它自己拆解步骤、查资料、操作工具、交付结果。产品采用邀请制,邀请码在二手市场一度被炒到数百元至数万元,官方随后澄清从未付费发码;到 2025 年 5 月,Manus 全面开放注册。
2025 年 7 月 17 日,OpenAI 把 Operator 的能力并入 ChatGPT 的 agent 模式,独立站点退役。这个动作常被读作产品线调整,其实更像一个信号:「会执行」不再是一个单独的产品,而是主流 AI 助手的默认能力之一。

38.1% 与 72.4%:这组数字怎么读
对 OSWorld 的成绩,两种误读都很常见。乐观的误读是只看趋势、不看绝对值:不到四成的任务成功率,意味着放手让它跑,大约每三个任务就有两个需要人善后——「无人值守」在 2025 年并不成立,这也是为什么当年的主流产品都保留了确认和接管机制。悲观的误读是把 38.1% 当成天花板:它只是特定基准下的快照,旁边还放着 WebVoyager 的 87%——任务越结构化、边界越清楚,Agent 的可用度越高。诚实的结论在中间:能干活,挑活干。
邀请码被炒到数万元,量出来的是期待
Manus 的邀请码热潮,是这条事件线上最有社会学味道的一幕。一个还在邀请制的产品,访问资格被炒到数万元,量出了市场对「AI 替我干活」的期待有多强;而 5 月开放注册后热度自然回落,又量出了期待跑在能力前面多远。对企业决策者,这一幕的教益很直接:听到「Agent」先别掏预算,回到任务本身——它到底能稳定完成你的哪个流程,出了错谁兜底。
对企业意味着什么:该入场,但姿势要对
把 2025 年的进展换算成企业动作,结论是:该开始了解、该小范围试,但现阶段的合理形态是「AI 起草+人确认」——让 Agent 负责跑腿和初稿(查资料、汇总、填单、起草回复),把提交、发送、付款这类不可逆动作留给人。如果还分不清 Agent 和普通聊天机器人的差别,可以先读AI Agent 是什么;而多数企业的真实起点未必是 Agent——流程固定的事,交给工作流反而更稳,这个取舍在AI 工作流和 AI Agent 怎么选里有一套判断方法。
评估「Agent 产品」,先问三个问题
接下来,带着「Agent」标签的产品只会越来越多,演示一个比一个惊艳。判断值不值得试,三个问题比演示有效:
- 它接了什么工具?能真实连上你的业务系统——表格、CRM、工单、邮箱,还是只能在演示环境里表演;
- 权限怎么管?它能动哪些数据、执行哪些操作,哪些动作必须人批准,权限能不能按人、按场景收紧;
- 出错怎么办?有没有完整的操作日志,动作能不能回滚,人能不能随时接管——出错的代价,决定了能托付给它什么。
带着什么预期进入 2026
整条事件线看下来,从 Computer Use 到 agent 模式,行业用一年多完成了一次方向确认:AI 的下一站是执行,不是更会聊天。但方向确认不等于能力到位,38.1% 到 72.4% 之间的差距,就是 2026 年要继续填的坑。对企业,这反而是一段难得的窗口期——技术还没成熟到「不用就出局」,又已经真实到「值得动手试」。在低风险流程里积累使用经验和判断力,比等一个完美产品更划算。