博客
研究 2026年8月28日 8 分钟阅读 OpenAI

AI 就业转型(四):模型会做,企业为何还没用起来

模型能够影响的工作,远多于企业真正交给它完成的工作。缩小这道差距,需要上下文、权限、评估和工作流重构,而不是更多 prompt 技巧。

J

Jonathan

创始人

AI 就业转型 · 4/6

人们常把 AI 采用描述成一种自然扩散:模型能力提高,员工开始使用,生产率随后扩散到整家公司。真实情况是,这三步之间存在很大的断层。

OpenAI 的就业框架比较了理论暴露度与实际暴露度。前者衡量 AI 能够影响多少工作,后者衡量这些工作有多少真正出现在工作相关的 ChatGPT 使用中。所有职业类别的实际使用都明显落后于模型能力。

可能因 AI 扩大就业的职业,理论暴露度为 92.8%,实际暴露度只有 24.6%;较高自动化风险职业为 91.0% 对 22.8%;将重组职业为 76.7% 对 18.4%;短期变化较小的职业也只有 17.8% 对 3.6%。

报告称之为“能力采用差距”。对企业来说,它更像是工作系统没有准备好。

模型会做,不等于公司可以放心委派

Benchmark 证明的是模型能否在规定条件下完成任务。公司需要的是:使用正确数据,在真实流程中,以可接受的成本和风险,重复完成同一类工作。

模型必须知道当前处理的是哪个客户、合同、政策和历史决定;它需要读取正确系统的权限,同时不能接触无关数据;它还需要调用工具、验证结果,并在不确定时升级给人。

缺少这些条件,员工只能用 AI 完成零散的草稿和检索。模型看起来很强,组织仍然要人工承担协调、核查和执行。

采用缓慢不一定是员工抗拒

在法律、医疗、金融、教育和企业运营中,一个看似合理的错误,成本可能远高于节省的时间。

员工不知道哪些数据进入模型、谁能看到、答案是否过期,以及出错后由谁处理,就不会放心委派。管理者看不到使用过程,也无法衡量质量。安全团队发现 Agent 的权限大于任务需要,自然会阻止上线。

这些是系统设计问题,不是态度问题。培训员工写更好的 prompt,无法补上身份、权限、来源追踪、eval 和回滚机制。

Harness 把模型能力变成组织产能

一个可用的 AI-native 工作流,需要在模型周围建立 Harness:

  • 能说明任务和当前状态的上下文;
  • 范围明确的工具与权限;
  • 清晰的完成标准;
  • 覆盖质量、政策和业务结果的 eval;
  • 可以检查每一步操作的日志;
  • 面向高风险和模糊情况的人工升级;
  • 能改进下一次执行的反馈。

这些条件齐备后,公司才能委派一条完整工作流,而不是让员工在多个系统之间手工复制模型输出。到这一步,模型能力才真正变成可重复的组织产能。

衡量委派深度,而不是开通了多少账号

License 数量和周活跃用户无法说明 AI 是否进入真实工作。企业应该衡量:

  1. 哪些工作流已经有明确负责人?
  2. 实际有多少任务量交给了 AI?
  3. 人需要多频繁地修复输出?
  4. 经过验证的周期和质量改善是多少?
  5. 哪类失败阻止了进一步委派?
  6. 每次执行是否留下了改进系统的证据?

目标不是让 AI 使用率最大化,而是把适合的工作安全、经济地交给系统,并让组织能够验证结果。

下一代模型变强,不会自动消除能力采用差距。更强的模型只会继续扩大技术边界,公司仍然必须搭建从可能性通向生产环境的桥梁。

参考来源

AI 就业转型系列

ai-jobs-transition capability-overhang adoption agents harness