从 Chatbot 到 Agent:LLM 的下一轮竞争不只是“会回答”

从 Chatbot 到 Agent:LLM 的下一轮竞争不只是“会回答”

去年这个时候,企业评估大模型还在比拼谁更擅长回答脑筋急转弯,C-Eval 和 MMLU 的榜单分数是 POC 里的硬指标。到了今年,同样的客户却在招标书里写道:“需要自动完成从邮件询价、检索产品规格、计算报价到发送回函的完整流程。”需求变了——企业不再满足于一个口才很好的对话框,他们要的是能独立干活的数字员工。大模型的竞争焦点,正从语言生成能力转向多步骤任务执行能力。

规划能力:从预测下一个词到预测下一步行动

Chatbot 的核心是 next-token prediction,本质上是对话接龙;而 Agent 的核心是 planning,即在开放环境里制定并调整行动计划。当用户说“帮我准备下周去深圳供应商大会的行程”,模型不能只是生成一段包含航班建议的文本,而必须自主拆解出:检查护照有效期、查询签证政策、比对机票和高铁价格、预订离会场三公里内的酒店、在日历中锁定时间、生成包含天气和交通提示的行程单。

这种拆解涉及条件分支和动态修正。Anthropic 为 Claude 引入的 extended thinking 模式,会在内部生成显式的思维链,对每一步的必要性进行自我检查;OpenAI 的 o1 系列则在数学和编程测试中展现出多步骤推理时的自我纠错能力。对于一家年采购额超过十亿的制造企业来说,这意味着大模型不再只是 RAG 知识库的语音界面——它开始替代那些依赖固定 SOP(标准作业程序)的人工操作岗位。

工具调用:走出对话框,接入真实系统

Tool use 是 Agent 触碰现实世界的第一根手指。早期模型只能给人类发一份“待办事项”,如今的模型可以直接调用 API、查询数据库、触发业务事件。Salesforce 在 2024 年推出的 Agentforce 已经允许其客服模型同时查询 CRM 客户记录、物流追踪系统和库存管理数据库,在一个对话回合内完成“我的订单到哪了”的完整链路。更关键的是,工具调用正从单步走向编排:模型需要先调用天气 API,再根据结果决定是触发航班改签接口还是酒店延期接口。

微软在 Copilot Studio 的年末更新中披露,企业客户为 Agent 配置的自定义连接器数量平均已达 12 个,复杂工作流通常涉及 3 到 5 个工具的串行或并行调用。这带来了一个新的工程挑战:当第三个工具返回超时或异常时,模型不能崩溃,而需要具备重试、降级或向人类申请权限的能力。没有这种鲁棒性,Agent 就进不了生产环境。

浏览器与代码:两个最先突破的垂直场景

在具体的 Agent 形态里,browser use 和 coding agent 是目前进展最快、企业买单意愿最强的两条赛道。OpenAI 年初演示的 Operator 展示了模型如何在云端浏览器中像人一样点击、滚动、填表,完成从购买日用品到预订餐厅的任务。对于消费品公司的市场研究岗位,这意味着过去需要实习生花两小时手动扒取的竞品电商价格,现在可以由 Agent 在十分钟内按固定格式填入内部系统。

Coding agent 的进化更为直观。GitHub Copilot 的早期版本只是自动补全一行代码,而今天的 Cursor、Windsurf 以及 Claude Code 已经能读取整个代码库,执行“将这段 Python 脚本重构为 Go 微服务,并补全单元测试与 CI 配置”的多小时任务。Replit 的内部报告指出,开启 Agent 模式的用户,其项目从零到可运行演示的平均时间缩短了 63%。企业 IT 部门不再把它当作程序员的玩具,而是开始纳入正式的开发排期,用来处理技术债清理和跨语言迁移这类高耗时的脏活。

企业采购标准:从答题准确率到任务闭环率

技术范式的转移直接改写了甲方的评估体系。一年前,CIO 们问的是模型能不能通过司法考试或高考;现在,POC 的验收标准是端到端任务完成率。一家跨国药企在 2024 年第四季度的 AI 招标中明确要求:投标方案必须能在无人工干预的情况下,完成接收临床实验数据邮件、提取附件、核对患者脱敏规则、上传至内部数据仓库并返回确认回执的七步流程,且连续 50 次测试的成功率不得低于 85%。

这种需求也解释了为什么单纯的模型参数竞赛正在降温。如果模型在第三步调用数据库时幻觉了一个不存在的字段名,整个工作流就会中断,前功尽弃。因此,编排层的重要性急剧上升:LangChain 的 LangGraph、OpenAI 的 Agents SDK,以及各类可视化 Workflow 编排工具,解决的问题不是让模型更博学,而是让模型的行动轨迹可观察、可回滚、可审计。这与传统 RPA 的区别在于,RPA 处理的是确定性的规则,而 Agent 处理的是有模糊边界的意图——但两者最终都要接受同一个考验:是否能在生产环境里 7×24 小时稳定跑完。

结语

大模型正在经历从“会说话”到“会干活”的成人礼。对企业而言,一个能准确复述公司年假政策的 Chatbot 固然省下了 HR 的话务量,但一个能自动走完请假审批、检查日程冲突、在余额不足时触发年假结转并通知直属上级的 Agent,才是真正值得投入预算的生产力工具。下一轮竞争的胜负手,不再是谁的困惑度(Perplexity)更低,而是谁能把复杂工作流的闭环率做到足够高、足够可靠。

返回到行业好文 | | 作者:爆老师 Boson 发表于 09/23/2026

『查看更多与(从 Chatbot 到 Agent:LLM 的下一轮竞争不只是“会回答”)相似文章』