AI 让合格执行变便宜:团队真正的杠杆在判断层
生成式 AI 把合格执行迅速拉到及格线,被重估的是团队为判断、把关和担责这一层付费的账;对经营者而言,该重做的是用人结构和衡量产出的方式。

同一件工具,重估的是团队的成本结构
关于 AI 会不会取代员工的争论,多数停在一个对经营者没什么用的问题上。对一个要决定招谁、给谁加薪、如何编排团队的人来说,真正要问的是:当这件工具普及,一支团队为哪些能力付费的账,被重新算了一遍。麻省理工的诺伊(Shakked Noy)和张(Whitney Zhang)在一项发表于《科学》的实验里,让 453 名受过大学教育的专业人士完成写作任务,用上 ChatGPT 的一半人平均耗时下降 40%,产出质量提高 18%,而且员工之间的差距被压缩——能力较弱的人受益最大。这个结论已经被反复引用,几乎成了共识:AI 抬高执行的下限,把新手迅速拉到及格线。共识本身没错,但它对经营者的含义还没被认真算过。如果一份还算像样的初稿、一段能跑的代码、一封措辞得体的邮件都能被工具迅速产出,那么“多雇一个能交出合格产出的中层执行者”这件事的边际价值,正在向调用工具的成本靠拢。你付的钱买的,已经不是产能的吞吐——那部分接近免费;剩下值钱的,是决定哪些任务该做、在流畅的输出里认出错误、并为最终结果签字的那一层判断。AI 是一根杠杆:投进去平庸的判断,它只会以更快的速度、更低的成本堆出大量平庸的东西;投进去清晰的问题定义和可靠的验收标准,它抬高的才是判断的产出。对经营者而言,团队里最该被重估的一层,正是过去被当作标配的中层执行。
便宜的是执行,蒸发的是中层执行的溢价
布林约尔松(Erik Brynjolfsson)、李(Danielle Li)和雷蒙德(Lindsey Raymond)追踪了一家财富 500 强公司 5,179 名客服人员使用生成式 AI 助手的过程,发现每小时解决的问题数平均提升 14%,但增益极不均匀:新手和低技能员工提高了 34%,经验丰富的高技能员工几乎没有变化。原因是这套工具把资深人员的隐性做法提炼出来,直接喂给了新人。微软和 GitHub 的研究者做过另一个受控实验,让开发者用 JavaScript 写一个 HTTP 服务器,用上 Copilot 的一组比对照组快了 55.8%。规律很清楚:AI 抬高的是下限。它让新手和熟手在常规任务上的产出迅速靠拢,这正是“合格执行变便宜”的准确含义。对管理者来说,这条结论直接改写用人账本:一支过去按“一个资深加一批中层执行”搭起来的团队,如今执行层明显配置过剩,判断和把关那一层却配置不足;靠中层执行能收到的溢价,正随合格产出的边际成本一起下滑。有人会顺势推断:过去中国和东南亚团队靠“更便宜地交出一份合格产出”参与全球分工,这条路会被工具直接抹平。这个推断在逻辑上说得通,但要点明证据的边界——上面这些实验几乎都取自美国和欧洲的企业与岗位样本,把它们的数字直接外推到跨境外包与离岸团队,目前并没有对应的研究支撑。合格执行的议价权是否已经在这些市场被压缩,还不能下定论,只能作为一个需要本地数据去验证的方向。
每小时解决问题数平均提升14%,但增益几乎全归新手;资深执行者近乎无变化,靠合格执行收取的溢价被抹平。数据源自布林约尔松等对某财富500强企业5,179名客服的追踪。
锯齿状边界:值得付溢价的是知道 AI 什么时候会错
哈佛商学院与波士顿咨询公司合作的一项实地实验,最能说明溢价该付给谁。758 名顾问被随机分组,在 AI 能力范围内的任务上,用上 GPT-4 的人多完成 12.2% 的任务,速度快 25.1%,四成人交付了明显更高质量的结果。但研究者故意安排了一个落在 AI 能力边界之外的复杂管理任务:在这类任务上,用 AI 的顾问给出正确答案的概率反而低了 19%。他们把这种能力分布称作“锯齿状的技术边界”——两个看起来难度相近的任务,一个落在 AI 能轻松胜任的一侧,另一个落在它会自信地给出错误答案的一侧,而使用者很难自行分辨。这条边界决定了一个经理该为什么样的人付溢价:不是提示词写得多花哨,而是能判断哪些任务可以放心交给 AI、哪些必须自己盯住,以及在一堆看似流畅的输出里认出那个错的。举个具体的例子,让 AI 起草一份面向海外客户的报价,模型能瞬间给出结构完整、措辞得体的版本,但汇率口径对不对、当地合规条款有没有漏、交付周期承诺是否现实,这些都在它的边界之外。会把草稿逐条对照真实约束去核验的人,替公司挡下的是真金白银的风险;把流畅当成正确、直接转发的人,则是在替模型的错误背书。招聘和加薪时真正该认出的,就是前一种人——这种判断不会写进简历的工具清单,却正是该付溢价的东西。
| 管理问题 | 需要的证据 | 建议动作 |
|---|---|---|
| 任务失败是否可逆 | 沙盒失败日志、回滚记录、人工接管时间 | 先限权试点 |
| 数据是否敏感 | 脱敏方案、权限边界、访问审计记录 | 保留人工确认 |
| 责任是否可追踪 | 供应商监控承诺、事故响应流程、内部负责人 | 责任未清楚前不进入生产 |
进入生产前,管理层需要同时看到任务可逆性、数据敏感度、人工接管和审计证据。
责任无法外包:省成本的账,动的是判断力的供给
诺伊和张的实验里有一个常被忽略的细节:AI 主要替代的是“打草稿”这类体力活,把工作重心推向构思和编辑。顺着这条线索,员工身上真正无法被外包的部分浮现出来——对结果负责。模型可以生成一份合同、一段代码、一封给客户的邮件,但当这些东西真的发出去、上线、进入法庭,承担后果的始终是人。布林约尔松那项客服研究里,AI 同时改善了客户满意度并提高了员工留存率;速度只是一部分,更关键的是有人在系统里持续把关、纠正、对最终交付负责。对经营者来说,这里藏着一个容易算错的成本账。世界经济论坛 2025 年《未来就业报告》预计,到 2030 年 AI 与信息处理技术会创造约 1.7 亿个新岗位、淘汰约 9,200 万个,净增约 7,800 万,同时近四成核心技能会改变,85% 的雇主准备靠再培训来应对。这些数字背后是一个供给问题。为了省成本,用 AI 直接接管初级岗位的杂活,当期账面立刻好看:薪资支出下降、人均产出上升。但能为结果签字、出事时兜底的资深判断力,历来是新人从这些杂活里一路做出来的——今天你依赖的那批人,正是当年从打草稿、跑数据、改初稿里熬出来的。把初级岗位一次性用工具替掉,省的是当期现金,动的却是未来这类人的供给:机器可以把活儿做完,却不会在出事时站出来解释、补救、承担;一旦能承担的人后继无人,再便宜的工具也补不上这个缺口。所以经理要在成本结构里做的一件事,是持续把新人推到判断和责任面前,为将来还签得下字的人保住供给——这笔投入不在当期最省的方案里,却决定了几年后还有没有人接得住责任。

别统计谁在用 AI,去量产出到底变了没有
把前面的证据收拢到一处,指向同一个经营结论:合格执行越来越便宜,团队的价值重心整体上移到判断、把关和担责这一层,而工具本身谁都能买到、谁都会用。难点在于,这一层很难自我证明——判断藏在脑子里,老板只看得见结果。于是最该被重做的,是团队衡量 AI 的方式。多数组织现在统计的是“有多少人在用 AI”“买了多少工具账号”“收藏了多少提示词模板”,这些数字一个都不说明产出到底变好了没有。真正该追踪的只有一件事:同一类任务,用 AI 前后,速度、错误率和返工次数有没有可测量的变化,以及是谁的哪一步判断带来了这个差别。一支团队如果只统计采用率、却从不核对产出,很可能在为一场没有结果的效率表演买单。这条界线还改写了几个具体决定。招聘上,值得付溢价的不再是能快速交出合格产出的人——那已经接近免费——而是能在锯齿状边界上做判断、并愿意为结果签字的人。组织设计上,与其奖励“最会用工具”的员工,不如去奖励那些能拿出前后产出对照、说得清自己改对了哪一步的人。至于最持久的优势,属于那个敢把成本结构围绕判断层重新搭一遍、并且真的去量产出差异的组织;靠一个人手握几十个提示词模板,撑不起这种优势。触发这套逻辑生效的条件很朴素:你手里有速度、质量和返工的前后对照。需要警惕的反向信号同样清楚:采用率一路走高,产出的这些数字却纹丝不动——那说明练出来的只是工具的手感,团队真正的产出能力没有变。杠杆两端的距离,最终就是这条界线:一端把 AI 当成表演,一端把它变成实打实的产出。
资料来源
5 个公开来源,按文章核验用途列出。
- 学术资料Generative AI at Work
- 学术资料Experimental evidence on the productivity effects of generative artificial intelligence
- 学术资料The Impact of AI on Developer Productivity: Evidence from GitHub Copilot
- 公开报道Navigating the Jagged Technological Frontier: Harvard–BCG field experiment
- 权威机构WEF Future of Jobs Report 2025: key findings
