AI 文明AI Civilization

Prompt 会过期,工单不会:AI 时代真正稀缺的是把目标写成任务

会写提示词正在被模型和算法自己吃掉,它不构成长期优势。真正稀缺的,是把模糊目标变成能执行、能检查、能交付的任务,并在 AI 时对时错的输出里认出错误、为结果负责。

跨境
一张手写任务便签在暖光下清晰置于桌面前景,背景一段悬浮的发光文字正在消散成光尘,象征提示词贬值、任务定义留存

提示词会过期:为什么「会写提示词」不是长期优势

两年前,「提示词工程师」被普遍看好会成为热门职业。到 2025 年,这个判断基本落空。Indeed 的数据显示,「prompt engineer」的搜索热度从 2023 年 4 月每百万次搜索约 144 次的峰值,跌到如今的每百万次二三十次;微软 AI at Work 部门负责人 Jared Spataro 的说法很直接——「你不再需要那条完美的提示词了」。

原因不在于人们突然不用 AI,而在于「写好提示词」这件事正在被模型和算法自己吃掉。IEEE Spectrum 报道过 VMware 的一项研究:研究者让算法自动搜索提示词,结果自动生成的版本在几乎每一个测试里都胜过人手精心调过的提示词,而且只需几小时而非几天。其中一条被算法挑中的「最优」提示词,竟是一段《星际迷航》式的台词——「指挥官,我们需要你穿过这片湍流,定位异常的源头」,它莫名其妙地让模型在小学数学题上表现更好。研究者 Rick Battle 的结论近乎宣判:「任何人都不该再手动优化提示词了。」英特尔实验室的 NeuroPrompts 工具做过类似的事——把一句朴素的「男孩骑马」自动扩写成带画风和细节的长提示词,用于图像生成,效果同样超过被当作训练基准的人类专家提示词。VMware 团队还发现,同一个技巧(比如思维链)在一个模型上有用、换个模型或任务就可能有害,用他们的话说,「唯一真实的规律,也许就是没有规律」——既然连规律都不稳定,靠背诵几条「好用的提示词」积累起来的经验,自然也留不住。

更根本的问题是提示词本身并不稳定。班贝格大学的一项研究(《人类和大型语言模型一样脆弱吗?》)测量发现,措辞、标签顺序,甚至一个拼写错误这样的细微改动,都会让模型输出的分布发生显著偏移;相比之下,人类对这些扰动更稳健。这意味着今天好用的一条提示词,换个模型版本、换种措辞就可能失灵。把提示词当成核心技能,等于把职业押在模型表层那层随时会变的花纹上——它不构成任何长期优势。

稀缺的是把模糊目标写成一份工单

如果提示词只是最后一厘米的措辞,那么真正决定结果的,是这一厘米之前的所有工作:把一个含糊的意图,变成一件能执行、能检查、能交付的任务。可以把它想成一份工单——写清楚目标是什么、边界和约束在哪里、什么样的结果算验收通过、哪里有风险需要提前拦下。AI 能帮你把这件任务执行得又快又好,却没法替你决定这件任务本身该怎么定义。

这恰恰是大多数人跳过的一步。「帮我写一封催款邮件」,和「帮我写一封催款邮件:对象是逾期 30 天、过去合作良好的老客户,语气要保住关系、给出两个新的付款时间选项、不能提及法律后果、结尾约一个 15 分钟的通话」——两者调用的是同一个模型,得到的东西却天差地别。差别不来自提示词技巧:前者根本没想清楚自己要什么,后者已经把判断做完了。后一句话里其实藏着四样东西——目标(约到一次通话)、约束(保住关系、不提法律)、验收标准(两个可选时间、控制在 15 分钟)、风险(老客户逾期但值得挽留)。把这四样想清楚,是任何一个执行者都需要的交接说明,无论执行的是一名新入职的下属,还是一个模型;提示词只是把这份说明翻成模型听得懂的话,是最后、也最容易被自动化的一步。

世界经济论坛《2025 未来就业报告》连续第三份把「分析性思维」列为雇主眼中的头号核心技能,约七成公司认为它不可或缺;创造性思维、韧性与好奇心紧随其后。这些排在最前面的能力,没有一项是「工具操作」——它们指向的都是如何定义问题、拆解目标、设定判断标准。工具越普及,这部分越稀缺。

错误识别比生成更值钱:AI 会把错误写得同样流畅

哈佛商学院与波士顿咨询公司(BCG)合作的一项预注册实验,给了这件事最硬的证据。758 名顾问被随机分组:在能力范围之内的任务上,用上 GPT-4 的顾问平均多完成 12.2% 的任务、快 25.1%,产出质量高出约 40%。但研究者故意设置了一道落在模型能力范围之外的题——不用 AI 的顾问有 84% 答对,用了 AI 反而掉到六到七成,正确率下降约 19 个百分点。

研究者由此点出一个反直觉的分布:AI 在一些任务上极强,在另一些看起来难度相仿的任务上,却会自信地给出错误答案,而且外表毫无破绽。麻烦正在这里——模型不会预先告诉你这一次它落在能力范围之内还是之外,它把错误答案也写得流畅、自信、结构完整。能不能拦下这种错误,取决于你有没有在动手之前把验收标准定清楚:知道什么样的结果才算通过,才认得出那段读着很顺、其实站不住的输出。实验里那些正确率反而更低的顾问,多半不是被难倒,而是采信了一段看上去很有道理、其实站不住的输出。能分辨输出哪里对、哪里错,什么时候该采信、什么时候该推翻,是模型自己给不了的判断,也正是它把普通使用者拖下水的地方。

同一项研究还记录了两种用法:「半人马」式的人把人和机器的分工划清,按各自强项分配任务;「赛博格」式的人则与模型深度交织、反复迭代。两种用法都要求使用者始终握着判断权。生成本身正在变便宜,真正值钱的是那双能看出「这段答案不对」的眼睛。

边界之外:用了 AI 反而更容易答错
不用 AI84
用了 AI65

在落在模型能力范围之外的那道题上,不用 AI 的顾问 84% 答对(来源实测),用了 AI 反而降到六到七成,正确率下滑约 19 个百分点——图中 65% 为按此区间估算值。错误被写得同样流畅,识别错误因此比生成更值钱。

责任无法外包:签字的人,才是定义任务的人

同一场 BCG 实验里还有一个容易被忽略的细节:原本排名靠后的顾问,用了 AI 之后提升最大——最低一档的表现跃升约 43%,而顶尖顾问的增量小得多。这说明 AI 会把「普通水平的产出」迅速拉平、变得廉价。当每个人都能生成看起来合格的东西,差异就从产出的平均质量,转移到两件机器给不了的事情上——任务由谁定义、错误由谁拦下。

再往上一层,是责任。一份财务模型、一条合同条款、一段上线代码,如果 AI 写错了、而人照单交了出去,这个后果由签字的人承担,不由模型承担。客户关系、合规义务、对结果的问责,都落在具体的人身上;一个塞满提示词模板的团队,并不会因此把这份责任转移出去。提示词模板可以共享,判断和问责却不能:把同一套模板发给全组,能力范围之外的错误会以同样的方式在每个人手里重演,除非有人真的去核对、真的对交付出去的东西负责。

于是能力的分层就清楚了:会调用工具的人越来越多,能把任务定义清楚、能为结果负责的人始终稀缺。前者是可复制的操作,后者是无法外包的判断。

AI 时代能力分层判断表(AI Bridge 框架):哪些该考核,哪些只是基础
能力项能否外包给 AI是否随模型更新贬值稀缺性管理层动作
提示词写作 / 工具操作会(措辞、模型版本一变即失灵)低——门槛趋近于零,人人可得视作基础技能,不单列为核心考核;不奖励囤积「万能咒语」
任务定义(目标 / 约束 / 验收标准 / 风险)不能——AI 能执行,定义不了不会高——世界经济论坛连续三年将「分析性思维」列为头号核心技能写进招聘与晋升标准;要求调用 AI 前先写工单,先有工单再有调用
错误识别(分辨流畅但站不住的输出)不能——模型不自报身处能力范围内外不会高——BCG 实验中越界任务正确率反降约 19 个百分点在动手前定清验收标准,设独立复核环节,别让「读着很顺」的输出直接过关
结果问责(签字承担后果)不能——责任落在具体的人身上不会高——客户关系、合规、交付后果均不可外包明确每份交付的责任人;提示词模板可共享,问责不随模板转移

把「工具操作」从核心考核里剔除,把预算与晋升标准压到任务定义、错误识别、结果问责这三项 AI 替不了、也不随模型更新贬值的能力上。

从定义任务开始:一个触发条件,一个反证信号

把这条判断落到可操作的层面,有一个具体的触发动作值得盯住:一名员工在打开 AI 之前,先花几分钟写下这次任务的目标、约束、验收标准和主要风险——先有工单,再有调用。这个顺序一旦变成习惯,提示词写得漂不漂亮就退成了次要问题,因为最难的判断已经在前面做完了。这一步不需要任何新工具,一张便签就够;它真正改变的,是你在开口问 AI 之前,已经替自己想清楚了多少。

同样要盯住一个反证信号:如果一个团队热衷于积累提示词库、互相分享「万能咒语」,交付的质量却和半年前没有区别,那说明他们把表层的工具操作误当成了能力本身。提示词库会随模型更新而贬值,真正沉淀下来的,是把问题定义清楚、把错误拦在交付之前的那套判断。

工具正在变成人人都有的东西,而人人都有的东西,不会成为任何一个人的优势。当调用 AI 的门槛趋近于零,能把优势留在自己这边的,是在动手之前就把一个模糊意图写成说清目标、约束、验收与风险的那份说明——先有工单,再有调用。写在调用之前的这份判断,正是 AI 替你执行、却替你定义不了的那部分工作。

来源核验

资料来源

5 个公开来源,按文章核验用途列出。

  1. 权威机构AI Prompt Engineering Is Dead
  2. 权威机构Centaurs and Cyborgs on the Jagged Frontier
  3. 学术资料Are Humans as Brittle as Large Language Models?
  4. 公开报道Prompt Engineering Jobs Are Obsolete in 2025 – Here's Why
  5. 网络资料The Top Skills for the Future of Work (reporting WEF Future of Jobs Report 2025)