汉兴人工智能OPEN CAIO启动企业 AI 诊断
启动企业 AI 诊断
汉兴 AGI 实验室观点与研究

当每个人都开始管理智能体:企业需要的下一种通用领导力

管理智能体由三项职责构成:任务设计、异常判断、结果署名。署名不因工作由 AI 完成而转移。它该写进岗位职责与晋升标准,而不是培训课时。

汉兴 AGI 实验室2026.06.15

领导力Agent Boss任务设计责任边界Future of Work

当每个人都开始管理智能体:企业需要的下一种通用领导力

结论

管理智能体正在从少数技术岗的专业技能,变成全员的通用职业能力。企业应该把它当作领导力去培养和考核,而不是当作工具培训去采购。

发生了什么

2025 年 4 月 23 日,微软 WorkLab 发布《2025: The Year the Frontier Firm is Born》。调研覆盖 31 个国家的 31,000 名知识工作者,字段时间为 2025 年 2 月 6 日至 3 月 24 日。它提出了一个后来被反复引用的角色:agent boss——员工自己搭建智能体、向智能体委派任务并管理它们。

  • 53% 的管理者说生产力必须提高,而 80% 的全球劳动者说自己没有足够的时间或精力完成工作。
  • 81% 的人预期,未来 12 至 18 个月内智能体会中等程度或大量地进入公司的 AI 策略。
  • 员工平均每 2 分钟被打断一次,一天 275 次。
  • 报告要求企业回答一个新问题:人与智能体的配比。配比过低是资源闲置,过高则超出人的管理能力。
  • 78% 的管理者在考虑设立 AI 相关的新岗位,在报告定义的 Frontier Firm 中这个比例是 95%。
  • 报告给出三个阶段:AI 作为助手改善既有工作;智能体作为数字同事承担具体任务;人指挥智能体管理完整业务流程。

一年后,2026 年 5 月 5 日的《2026 Work Trend Index Annual Report》把这个角色所需的能力具体化了。该报告覆盖 10 个市场的 20,000 名在工作中使用 AI 的知识工作者。

  • 活跃智能体数量同比增长 15 倍。
  • 问到最重要的人类技能,50% 的人选择「对 AI 输出做质量控制」,46% 选择批判性思考;86% 的人把 AI 输出当作起点而不是最终答案。
  • 行为最先进的那 16%(报告称为 Frontier Professionals)与其他人的差异集中在两个动作上:动手前停下来判断这件事该交给 AI 还是人,53% 对 33%;刻意保留一部分工作不用 AI 完成,43% 对 30%。
  • 管理者自身的行为有可观测的效应:管理者亲自示范 AI 使用,下属报告的 AI 价值高 17 个百分点;管理者引导团队对 AI 使用做批判性思考,高 22 个百分点;对智能体 AI 的信任高 30 个百分点。心理安全感更高的团队,成为高频智能体使用者的可能性高 1.4 倍。
  • 只有 26% 的受访者认为领导层在 AI 上的口径清晰且一致。

还有一份数据必须放在旁边读。Anthropic 在 2026 年 2 月 23 日的《The AI Fluency Index》中发现:在产生成型产物的那 12.3% 的对话里,用户指出上下文缺失的比例下降 5.2 个百分点,质疑推理下降 3.1 个百分点,核对事实下降 3.7 个百分点。输出越完整,越少被追问。

三份数据合起来说明什么

2025 年那份提出了角色,2026 年那份给出了这个角色实际需要的能力,而 Anthropic 的数据说明这些能力全都是反直觉的。

停下来判断该不该交给 AI,与「多用 AI」的号召相反。刻意保留一部分工作不用 AI,与效率最大化相反。质量控制排在技能榜首,与「提示词工程」这类培训内容相反。这三件事都不会自然发生,因为它们要求人在最省力的时刻多做一步。

81% 是一个需要标注的数字:它是预期,不是已发生。把预期当作事实来做人事规划,是过去两年最常见的错误之一。

汉兴的判断

管理智能体是一种通用领导力,由三项职责构成:任务设计、异常判断、结果署名。其中署名这一项,永远不因为工作由 AI 完成而转移。

这个判断可以被反对。反对的版本是:这只是新一轮工具培训,两三年后模型足够好,这些能力会像「会用表格软件」一样退回背景,不值得写进领导力模型。我们不同意的理由是,前两项本质上是管理能力而不是工具能力——它们在没有 AI 的组织里同样稀缺,AI 只是让它们的缺失变得昂贵且可见。一个说不清什么算合格的管理者,在有智能体之前就已经在制造返工,只是速度慢到看不出来。

落地方式是一张责任表。每一个自动化步骤,都要能填满四栏。

\`\`\`每个自动化步骤填四栏:谁定义 → 写清验收标准的人谁执行 → 人 / 智能体 / 两者谁复核 → 抽检比例与判据谁署名 → 永远是具体的人\`\`\`

三项职责展开如下。

  1. 任务设计者:把目标翻译成可验收的任务。判据是另一个人拿到这份定义,能独立判断结果合不合格。做不到,就说明任务还没有被设计,只是被转述。
  2. 异常决策者:事先定义什么算异常、异常时谁做主,以及停下来的成本由谁承担。多数失败不是智能体做错了,而是没有人规定它该在哪里停。停止点是设计出来的,不是出事以后补的。
  3. 结果署名人:交付物上署谁的名,责任就在谁。这一条看起来基础,但它是抵御前述产物悖论的唯一结构性手段——署名的人有动机去质疑一份看起来很完整的输出,不署名的人没有。

这三项应该写进岗位职责与晋升标准,而不是写进培训课时。培训教的是操作,职责改变的是行为。

一个中国企业的情境(示例推演)

以下情境用于说明责任表的用法,不对应任何真实客户,数据为示例推演。

一家中型企业软件公司的客户成功部有 20 人,上线了一个智能体,自动生成季度客户健康报告与续约风险提示。两个月后,报告数量翻倍,续约命中率没有提高,还出现过两次把已经停止使用的客户标为健康。

复盘发现三处缺失,恰好对应三项职责。没有人写下什么算一份合格的健康报告,所以每个人心里的标准都不一样,这是任务设计缺失。没有规定风险等级发生跃迁时必须停下来人工确认,所以错误一路走到了客户面前,这是异常判断缺失。报告以部门名义发出,没有具体署名,所以没有人有动机去逐条检查一份排版整齐的文档,这是署名缺失。

补上三项之后,报告数量下降了,但「进入续约谈判的准确率」成为一个可以被追踪的指标。数量下降不是代价,是把产量换成了通过率。

反方观点与适用边界

第一,存在过度投资的岗位。 在 AI 只承担低风险辅助的岗位上——以现场操作或体力为主的岗位——把管理智能体列为通用领导力是浪费。判据是这个岗位是否存在需要被委派、且结果可验证的认知任务。不存在,就不必套用。

第二,强监管领域的上限。 临床诊断、审计签字、法律意见,决策必须由持证人做出。管理智能体在这些领域只是流程中的一小段,不构成新的领导力层级,把它拔高会引发合规风险。

第三,数据来源本身带立场。 微软是 Copilot 与智能体产品的商业供应方,两份 Work Trend Index 都是其自有调研,议题设置有立场。2026 年那份的样本全部是已经在工作中使用 AI 的知识工作者,属于自选样本,且 10 个市场不含中国。我们引用其数据,但不采用其结论框架——上面三项职责是汉兴自己的划分。

企业现在应该做什么

给 CEO:在下一次晋升评审里加一个问题——这位候选人管理过哪些由智能体完成的工作,出问题时他是怎么处理的。 把它放进评审表,比放进培训预算有效。评审标准改变,行为才会改变。

给 CAIO:为每一个已经上线的智能体建一张责任四栏表。 找不到署名人的智能体先停用,直到有人愿意署名。这一步会立刻暴露有多少自动化其实处于无主状态。

给 FDE:在交付文档里增加停止点清单。 列出智能体必须停下来等人的全部条件,与客户逐条确认。这份清单属于验收内容,不是附录;它同时也是交付方与客户之间责任边界的书面依据。

证据、来源与公开边界

  • Microsoft WorkLab,《2025: The Year the Frontier Firm is Born》(2025 Work Trend Index Annual Report),2025 年 4 月 23 日。https://www.microsoft.com/en-us/worklab/work-trend-index/2025-the-year-the-frontier-firm-is-born
  • Microsoft WorkLab,《2026 Work Trend Index Annual Report: Agents, Human Agency, and the Opportunity for Every Organization》,2026 年 5 月 5 日。https://www.microsoft.com/en-us/worklab/work-trend-index/agents-human-agency-and-the-opportunity-for-every-organization
  • Anthropic,《Anthropic Education Report: The AI Fluency Index》,2026 年 2 月 23 日。https://www.anthropic.com/research/AI-fluency-index

本文引用的数字来自上述报告原文。中国企业情境为示例推演,不对应任何真实客户。三项职责与责任四栏表为汉兴原创,未经第三方验证。

元信息

栏目 Future of Work 作者 汉兴 AGI 实验室 版本 v1.0 成稿 2026 年 8 月 12 日

传导链路

01汉兴的判断一个可被反驳的立场02驻场验证在真实业务里跑一遍03可复制的方法沉淀成能交给别人的东西

带回你的现场

议题谈完总要落到现场。带一个真实的经营问题来,我们和你的人一起把它拆开看。

启动企业 AI 诊断回到实验室