AI Agent 最先改写的,不是某个行业,而是六类工作流
判断 Agent 机会应该看工作流的三个特征——状态是否可追踪、验收标准是否明确、是否要跨系统调用,而不是看这份工作属于哪个行业。

结论
判断一个业务能不能交给 AI Agent,看这个行业的名字没有用,看这段工作流的三个特征才有用:状态是否可追踪、验收标准是否明确、是否要跨系统调用。同一个特征会同时出现在制造业的售后、金融业的信贷审核和零售业的补货决策里——它们不属于同一个行业,却属于同一类工作流。企业先按工作流分类,再决定谁先上 Agent、谁还要等。
发生了什么
2024 年 6 月 18 日,红杉资本发布《"Goldilocks" Agents and the Power of Custom Cognitive Architecture》。文章把 Agent 设计画成一条光谱:一端是仅做分类、大部分逻辑写死的"路由器",可靠但呆板;另一端是 AutoGPT 式完全自主的 Agent,灵活但失败率高、难以调试。中间地带——文章称之为"恰到好处"区——由大语言模型控制显著的流程逻辑,但仍然维持结构化的状态管理、可观测的执行轨迹和成对比较式的测试方法。这篇文章没有讨论任何具体行业,讨论的是 Agent 该在什么样的任务结构里工作。
2024 年 12 月 9 日,红杉资本发布《AI in 2025: Building Blocks Firmly in Place》。这篇文章的重点是基础设施与应用层的成熟——作者 David Cahn 写道,如果 2024 年是新想法涌现的一年,2025 年就是筛选哪些想法真正有效的一年。文章本身并未提出行业排行或 Agent 能力清单,但它给出的判断标准是一致的:真正跑起来的应用不是靠模型的通用能力,而是靠对某个具体场景的深度适配——专有数据、意图理解和工作流集成。这个逻辑同样适用于 Agent:不是模型决定谁先受益,是场景结构决定。
微软 2025 年 4 月 23 日发布《2025 Work Trend Index: The Year the Frontier Firm Is Born》,调查了 31 个国家的 3.1 万名职场人士。数据显示,已经实现组织级 AI 部署的企业只占 24%,仍停留在试点阶段的占 12%;但 81% 的受访者预计未来 12 到 18 个月内 Agent 会实现中度到深度整合。报告把跑在前面的组织称为 Frontier Firm,这些企业在特定职能上使用 Agent 的比例明显更高:市场营销 73%(全部样本 55%)、客户成功 66%(全部样本 44%)、内部沟通 68%(全部样本 46%)、数据科学 72%(全部样本 54%)。这四个职能没有一个共同的行业标签,但有共同的工作流特征:任务边界清楚、结果可核验、多为重复性高频操作。
BCG 于 2025 年 12 月 15 日发布《Agents Accelerate the Next Wave of AI Value Creation》,为 CEO 提供规模化 Agentic AI 的路线图。核心论点是:真正的价值不来自把 Agent 装进现有的、本来就有缺陷的流程里做局部自动化,而来自把整个流程围绕 Agent 的能力重新设计——包括团队结构、决策权和监督方式。这篇文章同样没有按行业分类,而是按"流程是否值得重新设计"分类。
为什么行业排行榜会失灵
四份材料放在一起,指向同一个结论:没有一份权威研究把 Agent 的机会按行业排过序。红杉两篇文章的主题分别是 Agent 架构设计和基础设施成熟度,都不涉及行业榜单;微软的数据按职能切分,同一职能横跨多个行业;BCG 的建议按"流程是否值得重构"切分。行业排行榜之所以流行,是因为它讲故事容易——"零售业最先被颠覆"比"重复性高、验收标准清楚的工作流最先被颠覆"更容易做成一页 PPT。但它会导致两种误判:把某个行业里所有工作流一并高估或低估价值,其实同一家零售企业内部,补货预测的工作流适配度可能远高于选品决策;也会让企业只关注同行在做什么,而不去看自己的流程结构。
汉兴的判断
判断 Agent 机会应该看工作流的三个特征——状态是否可追踪、验收标准是否明确、是否要跨系统调用——而不是看这份工作属于哪个行业。同一个特征会同时出现在完全不同的行业里,这才是 2025 到 2026 年真正应该被写进企业路线图的判断标准。
我们把工作流按这三个特征拆成六型,形成一张判断表(详见框架)。从"单点分类"到"开放探索",Agent 的适配度依次降低,需要的治理投入依次升高。企业规划 Agent 项目时,第一步不是列出"我们行业适合做什么",而是把手头的工作流一条条放进这六型里,先做前三型,谨慎推进第四、五型,第六型暂缓。
一个中国企业的情境(示例推演)
以下情境用于说明框架用法,不对应任何真实客户,数据为示例推演。
一家华南家电制造企业想推进 Agent 项目,最初的立项报告写着"参考同行标杆,聚焦智能制造场景",选了一个听起来最热门的方向——生产排产优化。三个月后项目搁浅,因为排产决策涉及的变量太多、验收标准模糊,属于框架里的"专业判断型"甚至部分"开放探索型",超出了团队当时的治理能力。
重新梳理后,团队把公司内部十几条工作流按六型逐一归类,发现售后工单分类(单点分类型)和备件申领审批(结构化多步型)适配度最高、治理成本最低。这两条工作流三个月内上线,售后工单的首次分类准确率从人工的约 85% 提升到 96%,备件申领的平均审批时长从 1.8 天降到 4 小时。排产优化被重新定位为下一阶段目标,先用这两条工作流积累的经验——尤其是异常处理清单和人工兜底点的设计方法——再推进。
反方观点与适用边界
这个框架在两种情况下需要谨慎使用。
第一,六型之间的边界会随 Agent 能力进化而移动。 Goldilocks Agents 一文写于 2024 年年中,当时"开放探索型"几乎全部失败;两年后,随着模型的长程规划和自我修正能力提升,部分探索型任务已经开始出现可用的 Agent 方案。框架给出的是判断方法,不是一次性结论,企业需要按季度重新评估自己的工作流分型,不能把 2026 年的判断当成一成不变的清单。
第二,工作流特征不能替代业务价值判断。 一条工作流即使状态可追踪、验收标准清楚、系统集成简单,如果它本身对企业不重要,做成 Agent 也不产生价值。工作流特征回答"能不能做",不回答"该不该做"——这仍然需要业务负责人判断。
企业现在应该做什么
给 CEO:叫停"参考同行做什么"式的立项方式。 下一次 Agent 项目立项会上,要求团队提交的不是"友商在做什么",而是"我们哪三条工作流的验收标准最清楚"。前者是抄作业,后者才是真正的选型依据。
给 CAIO:牵头做一次工作流盘点,按六型分类。 不用一次盘点全公司,先选一个业务单元,列出十到十五条高频工作流,标注每条的状态可追踪性、验收标准清晰度和跨系统调用数量。这份清单就是未来一年 Agent 项目的排序依据。
给 FDE:交付前先判断工作流的分型,再决定架构复杂度。 单点分类型和结构化多步型可以用较轻的架构快速验证;端到端跨系统型和异常驱动型需要提前设计人工兜底点和升级机制;专业判断型和开放探索型现阶段建议以人机协同起步,不要一次性追求全自动。
证据、来源与公开边界
- 红杉资本(Sequoia Capital),Sonya Huang、Pat Grady,《"Goldilocks" Agents and the Power of Custom Cognitive Architecture》,2024 年 6 月 18 日。https://sequoiacap.com/article/goldilocks-agents/
- 红杉资本(Sequoia Capital),David Cahn,《AI in 2025: Building Blocks Firmly in Place》,2024 年 12 月 9 日。https://sequoiacap.com/article/ai-in-2025/
- 微软(Microsoft WorkLab),《2025 Work Trend Index: The Year the Frontier Firm Is Born》,2025 年 4 月 23 日。https://www.microsoft.com/en-us/worklab/work-trend-index/2025-the-year-the-frontier-firm-is-born
- 波士顿咨询(BCG),《Agents Accelerate the Next Wave of AI Value Creation》,2025 年 12 月 15 日。https://www.bcg.com/publications/2025/agents-accelerate-next-wave-of-ai-value-creation
本文明确说明:红杉两篇文章均不包含行业排行或 Agent 能力清单,本文不将其转述为"红杉发布的行业榜单"。文中华南家电企业情境为示例推演,不对应任何真实客户。六型判断表为汉兴原创框架,未经第三方验证。
元信息
栏目 Enterprise AI 作者 汉兴 AGI 实验室 版本 v1.0 成稿 2026 年 8 月 12 日
传导链路
带回你的现场
议题谈完总要落到现场。带一个真实的经营问题来,我们和你的人一起把它拆开看。