汉兴人工智能OPEN CAIO启动企业 AI 诊断
启动企业 AI 诊断
汉兴 AGI 实验室观点与研究

Anthropic 经济指数报告:经济原语

Anthropic 经济指数第四版,首次用「经济原语」量表衡量 AI 的真实使用方式。核心发现:增强式使用重新超过自动化(52% 对 45%)、美国各州差距快速收敛而全球格局纹丝不动、提问水平与输出水平相关系数超过 0.92,并提出「有效 AI 覆盖率」——评估岗位影响要称时间,不能数任务。

Anthropic2026.08.17

AI 经济学增强与自动化生产率

Anthropic 经济指数报告:经济原语
两条实体带在画面中部交叉换位:上行的一条压过下行的一条,脚下是被它们穿过的一格格具体任务。

一、为什么需要一套新量表

此前衡量 AI 经济影响的方式,大多停留在"哪些职业的哪些任务被覆盖了"。问题在于,同一个任务标签底下的实际工作量可能天差地别——同样叫"修改软件以纠正错误",可以是一个小修补,也可以是一次全面重构。只看任务标签,等于把这两件事算成一件。

报告因此引入五类基础可量化指标,称为经济原语:

任务复杂度——人类在没有 AI 时完成任务所需的时间、有 AI 在场时的时间、以及用户是否在同时处理多个任务。人与 AI 的技能水平——理解用户提示词与理解 AI 回复各自需要多少年正规教育,以及用户能否独立完成该任务。使用场景——工作、课业还是个人用途。AI 自主程度——从主动协作到完全交接的委派程度,用 1 到 5 分量表衡量。任务成功率——AI 对自身是否成功完成任务的自我评估。

第四项与"自动化对增强"这个老口径的区别值得单独说明:它们不是一回事。报告举的例子是翻译任务表现为高自动化但低自主度——用户把整段文本交出去,却并没有把决策权交出去。

报告对这套量表的诚实态度同样值得记录:各项度量只是"方向性准确",并不完美;它的价值在于组合信号,而不在于单项精度。验证过程中团队还发现了一个反直觉的现象——简单的分类器有时优于复杂版本,尤其在成功率这一项上,表现不佳的分类器被直接丢弃。

二、使用高度集中,编程仍居首位

在面向个人的 100 万条对话中,最常见的 10 类任务占全部对话的 24%;在企业 API 端,前 10 类任务占 32%。使用频率最高的单项任务是"修改软件以纠正错误",独占全部使用量的 6%。

集中度本身在小幅上升——这说明经过几年扩散,AI 的高频用途并没有像很多人预期的那样发散到长尾,反而在少数几个价值明确的动作上进一步聚拢。这与后文"嵌入深度决定价值"的结论是同一件事的两面。

职业大类的分布则出现了迁移。计算机与数学类的占比从 2025 年 3 月的峰值有所回落,而教育指导类的占比明显上升,主要来自课业帮助与教学材料开发;艺术、设计与媒体类在 8 月到 11 月间跳升,逆转了此前的下降,驱动因素是写作类任务,特别是文字编辑与虚构作品润色。企业 API 端则相反,计算机与数学类占比继续上升,办公与行政支持类上升约 3 个百分点,指向企业在自动化邮件管理、文档处理、客户关系管理与排期这些工作流。

三、"增强"重新超过"自动化"

2025 年 11 月,面向个人的产品上增强式对话占比升至 52%,自动化降至 45%——这逆转了 8 月时向自动化移动的趋势。

要理解这个反转,先要看清报告怎么划分这两类。自动化侧包含两种模式:指令式(用户下达任务、极少来回)与反馈回路(用户自动化但提供纠偏反馈)。增强侧包含三种:学习(求解释、找信息)、任务迭代(协作式打磨)、验证(请 AI 对用户自己的作品给反馈)。反转的驱动力是广泛的,主要来自"任务迭代"而非"学习"——也就是说,人们不是更多地在向 AI 提问,而是更多地在与 AI 一起打磨具体产出。

报告对归因的措辞很克制,只说该期间的产品变化——文件创建能力、持久化记忆、用于工作流定制的技能——可能把使用模式推向了更协作、更有人参与其中的交互。

同一时点的企业 API 端则是另一幅图景:约四分之三是自动化。这个分化本身就是本报告最有价值的结构性发现——同一个模型,装在不同的接口后面,就变成了两种截然不同的经济行为。

四、地理:美国内部在收敛,全球没有

美国各州的使用率正在快速收敛。以基尼系数衡量,从 2025 年 8 月的 0.37 降至 11 月的 0.32。按此速度推算,各州人均使用率有望在两到五年内趋于均等——这一速度约是 20 世纪其他重大技术扩散速度的 10 倍,那些技术通常需要约 50 年完成地理扩散。

报告自己给这个推算加了很重的告诫:估计仅基于三个月的数据,存在高度不确定性,扩散在未来的月份和年份里最终可能进行得更慢。

全球层面则完全没有收敛的迹象。8 月到 11 月之间几乎无变化——没有证据显示低使用国家在追赶,也没有证据显示高使用国家在拉开。使用强度仍与人均 GDP 强相关:人均 GDP 每增加 1%,人均使用量约增加 0.7%。使用量排名前五的国家是美国、印度、日本、英国、韩国。

用途结构也随收入分层:工作用途占比最高的是巴尔干地区和巴西;课业用途占比最高的是印度尼西亚以及总体上的低收入国家;个人用途占比最高的是高收入国家。更高收入的国家更倾向于协作式使用而非完全委派。这一发现与微软的同期研究趋同。

五、"提问水平决定输出水平"

这是全报告最该被贴在墙上的一条发现。用户提示词的教育水平与 AI 回复的教育水平几乎完美相关(相关系数超过 0.92),这个关系在国家层面和美国州层面都成立。

你怎么提问,它就怎么回答。

这个结论的含义是双向的。对个人而言,它意味着 AI 不会把你抬到你够不着的高度——它的输出上限受你的输入水平约束。对国别与组织而言,它意味着教育水平较高的群体可能更有条件从 AI 中获益,因此 AI 可能加剧而非缩小人力资本的不平等。

还有一个反直觉的配套发现:在国家层面,任务成功率与人类教育水平呈负相关。报告的推测是,受教育程度更高的人群会去尝试更难的任务,因而成功率反而更低。这提醒我们,成功率这个指标不能孤立解读——低成功率有时恰恰是野心的证据。

六、加速与成功率的权衡

速度提升的定义是人类独立完成时间除以人机协作时间。需要 12 年教育(高中水平)的任务约有 9 倍加速;需要 16 年教育(大学水平)的任务约有 12 倍加速。企业 API 用户在所有复杂度区间的加速倍数都更高。

但成功率是反向的:低于高中水平的任务成功率约 70%,大学水平任务约 66%。更复杂的任务,加速更多,成功率更低。报告明确指出教育梯度在调整成功概率后依然存在——也就是说,即使把失败重试的成本算进去,复杂任务的收益仍然更大。

任务时长上还有一个结构性观察:在企业 API 场景中,成功率随任务时长下降得较快;而在多轮对话场景中,成功率随任务长度下降得慢得多。机制在于多轮对话允许中途纠偏。但报告同时点出这里存在双向的选择效应——用户只会挑他们预期 AI 能搞定的任务来做,而 API 场景代表的是预先筛选过、适合自动化的任务。这个限定条件不能省略,否则两个场景的数字会被完全误读。

七、"有效 AI 覆盖率":一个比任务覆盖率更实在的指标

报告提出的这个新指标,是全篇对企业最有操作价值的方法论贡献。它衡量的是一个劳动者的一天中,能被 AI 成功完成的时间百分比——计算方式是任务成功率的加权和,每个任务的权重是它占该劳动者时间的份额,并按任务发生频率调整。

它与传统"任务覆盖率"的差别,用几个职业一对比就清楚了。数据录入员的任务覆盖率很低——九个任务里只有两个被覆盖——但有效覆盖率最高,因为被覆盖的那个核心任务"从源文档读取并录入数据"恰好占据了绝大部分时间且成功率高。放射科医师同样是任务覆盖率低但有效覆盖强,因为最耗时的任务是解读诊断影像和撰写报告。医疗转录员的排名大幅上移,原因也一样。

反例是微生物学家:AI 覆盖了其一半的任务,但错过了大部分最耗时的工作——动手的实验设备操作仍未被覆盖。

这个方法论对企业的直接含义是:评估某个岗位的 AI 影响,不能数任务,要称时间。一个岗位有 80% 的任务能被 AI 做,可能只对应 20% 的工时;反过来也成立。

八、去技能化:一个必须正面谈的净效应

AI 被使用的任务,平均需要 14.4 年教育年限;而整体经济中的任务平均为 13.2 年。差值约 1.2 年——AI 的使用集中在比经济体平均水平教育要求更高的任务上。

净效应因此是去技能化:因为 AI 移走的是教育要求相对更高的任务,留下来的任务教育要求更低。报告给的例子很具体——技术写作者失去的是高教育要求的任务,保留的是较低的;旅行代理人若 AI 承担了复杂行程规划与定价,剩余工作退化为出票与收款;教职人员的评分、咨询建议、基金申请写作被承担,保留下来的是面授讲课和课堂管理。

但报告也给了唯一一个升技能化的反例:房地产经理失去的是维护记录、租金审核这类行政任务,保留下来的是争取贷款、谈判、董事会会议——剩余任务需要更多专业判断和面对面互动。

决定方向的不是 AI 有多强,而是这个岗位上"最耗时的部分"恰好落在教育要求的哪一端。

九、生产率:从 1.8 降到 1.0 到 1.2

初始分析估计 AI 可使美国劳动生产率每年增长 1.8 个百分点——这个结果在两个样本上都能复现。但考虑任务成功率后,该估计下降至每年约 1.0 个百分点(企业 API)或 1.2 个百分点(个人产品)。

报告特别强调了这个数字背后的关键假设:假设一次性的全要素生产率提升在十年内兑现,包含资本深化效应,并且对于没有观测到加速的任务,假定生产率变化为零。引用这个数字时,这些假设不应被省略。

即便如此,每年 1 个百分点的生产率增长也很可观——报告自己给的校准是:持续十年,将使美国生产率增速回到 1990 年代末与 2000 年代初的水平。

汉兴评述:三条可以直接落到管理动作上的结论

第一,"增强还是自动化"应该成为一个被主动设计的选择,而不是一个事后统计的结果。报告最有信息量的对照是:同一个模型,装在对话界面后面是 52% 增强,装在 API 后面是约 75% 自动化。这说明这个比例主要由接口和流程设计决定,而不是由技术决定。企业在设计每一个 AI 环节时,实际上都在替员工做这个选择——只是大多数时候没意识到自己在选。

第二,"有效 AI 覆盖率"这个方法论,可以直接搬进岗位分析。不要问"这个岗位有多少任务能被 AI 做",要问"这个岗位最耗时的三件事里,AI 能可靠完成几件"。数据录入员与微生物学家的对照说明,这两个问题的答案可以完全相反。用错问题,整个人力规划就会建立在错误的前提上。

第三,去技能化不是一个道德判断,是一个必须被管理的人才结构问题。当 AI 系统性地拿走教育要求较高的那部分任务,一个岗位剩下的工作会变得更简单——短期看是效率提升,长期看是这个岗位不再培养人。房地产经理那个反例指出了破局方向:主动重新分配剩余任务,让人留在需要判断、谈判和面对面互动的那一端,而不是留在流程的末端。这件事不会自动发生,它需要被设计。

延伸阅读:Anthropic Economic Index Report, January 2026(Anthropic 官方原文)

「AI可能加剧而非缩小全球人力资本的不平等」

传导链路

01Anthropic公开研究与数据02汉兴的判断落到中国企业的语境03企业现场变成可执行的下一步

带回你的现场

议题谈完总要落到现场。带一个真实的经营问题来,我们和你的人一起把它拆开看。

启动企业 AI 诊断回到实验室