汉兴人工智能OPEN CAIO启动企业 AI 诊断
启动企业 AI 诊断
汉兴 AGI 实验室观点与研究

一个人不是一家公司:真正的超级个体,是一套可迭代的人机工作系统

一个人的产能上限,由他能可靠复核的产出量决定,不由模型的生成速度决定。超级个体的本质是四层工作系统:定义目标、委派智能体、复核结果、沉淀方法。

汉兴 AGI 实验室2026.06.01

超级个体AI Fluency人机协作工作系统Future of Work

一个人不是一家公司:真正的超级个体,是一套可迭代的人机工作系统

结论

超级个体的杠杆不来自「会用 AI」。它来自把四件事变成个人制度:把目标写成可验收的任务、把任务委派给智能体、对输出做有纪律的复核、把成功的做法沉淀成下一次的起点。一个人的产能上限,由他能够可靠复核的产出量决定,不由模型的生成速度决定。

发生了什么

两份来自同一家机构的研究,把「超级个体」这个模糊说法拆成了可以测量的行为。

2026 年 2 月 23 日,Anthropic 发布《Anthropic Education Report: The AI Fluency Index》。报告分析了 2026 年 1 月一个七天窗口内的 9,830 段 Claude.ai 对话,从 4D AI Fluency 框架的 24 项行为中挑出 11 项可直接观测的行为作为指标。4D 指四个维度:Delegation(委派,决定什么该交给 AI、什么不该)、Description(描述,把要求讲清楚以获得可用结果)、Discernment(辨别,评估输出的准确性与质量)、Diligence(尽责,对结果负责并对 AI 的参与保持透明)。

第一组读数是正面的。85.7% 的对话出现了迭代与修正——用户在模型的前一次回答上继续要求,而不是接受第一版就结束。有迭代的对话平均出现 2.67 项流利度行为,没有迭代的只有 1.33 项。在有迭代的对话里,用户质疑模型推理过程的可能性高 5.6 倍,指出上下文缺失的可能性高 4 倍。

第二组读数相反。12.3% 的对话产生了 artifact,也就是代码、文档、可交互工具这类成型产物。在这些对话中,用户指出上下文缺失的比例下降 5.2 个百分点,质疑推理的比例下降 3.1 个百分点,核对事实的比例下降 3.7 个百分点。产物越完整,被质疑得越少。

2025 年 12 月 2 日,Anthropic 发布《How AI Is Transforming Work at Anthropic》,方法是 132 名工程师与研究员的问卷、53 场访谈,以及 2025 年 2 月至 8 月的 20 万条 Claude Code 会话记录。

  • 员工报告 Claude 参与了他们 59% 的日常工作,一年前这个数字是 28%;自评的生产力提升从 20% 升到 50%。
  • 27% 的 AI 协助工作属于「如果没有 AI 就不会去做的事」。
  • 但超过一半的受访者说,能够完全委派给 Claude 的工作只占 0% 到 20%。
  • 自主性在半年内上升:单次任务的连续执行步数从约 10 步升到约 21 步;人工介入从每个任务 6.2 轮降到 4.1 轮,降幅 33%;任务复杂度在 5 分制上从 3.2 升到 3.8。
  • 工程师报告自己变得更「全栈」,同时担心技能退化。一位受访者的说法是:产出变得如此容易和快速时,反而更难花时间去真正学会一件事。

三个容易被跳过的读数

第一,参与度不等于委派度。 59% 与 0–20% 出现在同一份报告里,并不矛盾:AI 参与了大部分工作,但只有很小一部分可以撒手不管。把使用率当成转型指标的企业,测的是第一个数字,收益却来自第二个数字。

第二,唯一直接反映杠杆的数字是分母。 6.2 降到 4.1,说明的不是模型变强,而是同一个人完成同样一件事所需的介入次数变少了。产量是分子,介入回合是分母。只盯分子的组织会在半年后发现,人变成了流水线末端的返工工位。

第三,复核在最需要它的时候失效。 artifact 那一组数字是这两份研究里最值得警惕的部分:越是完整、成型、看起来专业的输出,越少被追问。这不是模型的问题,是人的注意力分配问题。它意味着复核必须被设计成流程,而不是留给判断力。

为什么这对企业重要

过去两年,超级个体在中文语境里被讲成一个励志故事:一个人加一套工具,可以顶一个团队。这个说法在个人创作与小型服务业里有真实样本,但它对企业没有可执行的含义。企业不为产量付费,企业为通过率付费——为可以直接进入下一道工序、不需要返工的交付物付费。

上面两份研究给出的行为清单,恰好把个人杠杆翻译成了企业能管理的东西:委派边界、描述质量、复核纪律、责任归属。这四项都可以写下来、可以培训、可以考核。而「会不会用 AI」不能。

汉兴的判断

超级个体不是一个人做完一家公司的事,而是一个人运行一套可迭代的人机工作系统。这套系统的产能上限,等于这个人能够可靠复核的产出量。

这是一个可以被反对的判断。反对的版本是:随着模型能力上升,复核本身会被自动化,个体上限将由模型决定而不再由人决定。我们不同意,理由是复核的对象不只是正确性,还包括目标是不是本来就定错了——这一层至今没有可外包的对象。

我们把个体工作系统拆成四层。这是汉兴的原创框架,与前述 4D 框架的关系是:4D 描述行为,我们描述结构。

\`\`\`[0] 目标层产出:可验收的任务定义 [1] 委派层产出:授权边界与停止点 [2] 复核层产出:抽样比例与失败清单 [3] 沉淀层产出:可复用提示与检查表└→ 回流到 [0],重写定义\`\`\`

四层各自的判据:

  1. 目标层:验收标准写在提示词之前。如果一个任务无法用三到五句话说清「什么算做完了」,它就还不能被委派。
  2. 委派层:为每类任务标注授权边界与停止点——哪些可以直接产出,哪些必须在某一步停下来等人。停止点的数量应该随信任积累而下降,并且这个下降过程要被记录。
  3. 复核层:复核是抽样,不是全检;抽样比例由失败后果决定,不由产量决定。每类任务维护一份失败模式清单,清单上的每一项都对应一个可执行的检查动作。
  4. 沉淀层:一次成功不是结果,是素材。把它固化成提示模板、脚本或检查表,才算把个人经验变成了资产。

配套指标只有一个,我们称为有效杠杆:

\`\`\`有效杠杆 = 合格交付数 ÷ 人工介入回合数\`\`\`

分子来自复核层,分母来自委派层。Anthropic 内部研究里 6.2 降到 4.1 的变化,就是这个分母在半年里的移动。一个人如果只让分子上升而分母不动,他得到的是更多草稿,不是更多产能。

一个中国企业的情境(示例推演)

以下情境用于说明框架的用法,不对应任何真实客户,数据为示例推演。

一家华东制造企业的技术服务部有 8 名工程师,每月处理约 400 单客户技术咨询,其中约六成是重复问题。第一版做法是给每人开通一个助手并鼓励多用。三个月后使用率很高,工单处理时长没有变化——因为工程师仍然要逐字读完 AI 写的回复,改一遍再发出去。分子涨了,分母没动。

按四层结构重做:目标层先写出五类高频工单各自的验收标准(引用了哪一版技术文档、是否给出替代方案、是否标注了适用机型)。委派层规定,涉及安全参数的回复必须停在人这一步。复核层把全检改为按类抽检,安全类 100%,一般类 20%,并维护一张失败模式清单。沉淀层每两周把清单上排前三的失败固化为检查项。这套改动不增加工具预算,它增加的是四份文档。

反方观点与适用边界

这个判断在两类情况下不成立。

第一类,验收标准无法事先写下来的工作。 组织人事决策、并购定价、监管沟通,它们的合格与否要到很久以后、或者要在现场谈判中才能确定。复核环节无法在个人层面完成,四层结构会退化成一层,个体杠杆不成立。这类工作应该被明确排除在委派清单之外,而不是勉强套用。

第二类,样本外推。 Anthropic 的两份研究,样本是一家前沿 AI 公司的工程师与研究员,工具熟练度与任务的可验证性都远高于一般企业的销售、财务或法务岗位。59% 与 4.1 这样的数字不能直接搬到中国企业的职能部门。可以借用的是行为结构与测量方法,不是数值本身。

企业现在应该做什么

给 CEO:下周把「AI 使用率」从汇报口径里拿掉。 换成两个数:任务级验收通过率、人工介入回合数。前者说明质量,后者说明杠杆。使用率只说明预算花掉了。

给 CAIO:选一个岗位,写出该岗位前十个高频任务的验收标准。 每条不超过五句话,一周内交出第一版,不追求完备。这份清单同时就是委派边界的第一版,也是后续任何智能体项目的输入。

给 FDE:在下一个交付项目里,为每个自动化环节建立失败模式清单。 记录每一次人工介入的原因,两周后回看哪三类原因占了八成。把这三类做成检查项,是把交付经验变成产品的最短路径。

证据、来源与公开边界

  • Anthropic,《Anthropic Education Report: The AI Fluency Index》,2026 年 2 月 23 日。https://www.anthropic.com/research/AI-fluency-index
  • Anthropic,《How AI Is Transforming Work at Anthropic》,2025 年 12 月 2 日。https://www.anthropic.com/research/how-ai-is-transforming-work-at-anthropic

本文引用的全部数字来自上述两份官方报告原文。文中的中国企业情境为示例推演,不对应任何真实客户。四层框架与有效杠杆指标为汉兴原创,未经第三方验证。

元信息

栏目 Future of Work 作者 汉兴 AGI 实验室 版本 v1.0 成稿 2026 年 8 月 12 日

传导链路

01汉兴的判断一个可被反驳的立场02驻场验证在真实业务里跑一遍03可复制的方法沉淀成能交给别人的东西

带回你的现场

议题谈完总要落到现场。带一个真实的经营问题来,我们和你的人一起把它拆开看。

启动企业 AI 诊断回到实验室