买模型是最后一步:企业 AI 落地真正的顺序
MIT、RAND 与 Gartner 的证据指向同一处:多数企业 AI 项目失败在问题定义、数据就绪与流程改造,而非模型能力。真正跑通的团队,都是先把目标工作流和数据摆平,才去谈买哪个模型或平台。

九成的钱没换来回报,卡点不在模型
2025 年,MIT 的 NANDA 团队访谈了 52 家企业的代表与 153 位高管,复盘了 300 多个公开的 AI 项目,算出一个让预算负责人难堪的数字:全球企业在生成式 AI 上砸下三四百亿美元,约 95% 的组织没能拿到任何可以计入损益表的回报。比例本身还不是最要紧的,报告对原因的判断才是——这道落差“看起来并非由模型质量或监管造成,而是取决于做法”。
翻成决策语言:多数企业把顺序做反了。被推到最前面的动作,通常是先挑一个模型、先谈定一个平台,仿佛落地的头道难题是“买哪家、押哪个模型”。这背后有一套很自然的心理——模型能立刻演示、能写进采购预算、能对董事会交差,问题定义和数据治理则又慢又难拿去汇报,于是被一路往后拖。厂商的销售节奏也在推波助澜:报价单、基准跑分和一场顺滑的演示,天然把讨论引向“选哪个模型”,而把“先解决什么、数据够不够”这两道更根本的题挤到会议纪要的末尾。可模型恰恰是整条链条上最接近标准品、也最容易替换的一环:今天选定的那个,半年后大概率有更便宜更强的平替,真正难以外包、也无法一次买断的,是把业务问题讲清楚和把数据理干净这两件事。决定成败又最耗功夫的工作,几乎都发生在下单之前——把要解决的问题定义到能验收,把数据准备到真的可用。先签下采购单,等于把最不该最先做的一步摆到了最前面,而这几乎就是那 95% 的共同动作。
把失败案例摊开来看,问题定义、数据就绪与流程改造这三个上游环节反复出现,模型能力反而很少是真正卡住项目的那一环。
第一道裂缝出现在问题定义环节
RAND 在 2024 年做过一项 AI 项目失败的根因研究。它的总体判断先给人泼了盆冷水:按一些估计,八成以上的 AI 项目以失败收场,差不多是不含 AI 的传统 IT 项目失败率的两倍。而排在所有原因之首的一条,和算法、算力都无关——各方对“这个项目到底要解决什么问题”的理解和沟通,从一开始就没对齐;这道裂缝在任何技术被选定、任何模型被训练之前,就已经存在。研究列出的其余几条同样朝上游指:组织手里没有训练模型所需的数据、团队沉迷于追逐最新最炫的技术而把“解决真实问题”放在了后面、把 AI 用到了它根本啃不动的难题上。
落到日常,很多项目立项时手里只有一句“我们要上 AI”,却拿不出一句能验收的问题陈述:要改善哪个具体决策、由谁在什么场景里使用、做到什么程度算成功、用哪个指标判定。缺了这句话,后面选型再讲究,也是在给一个没画清楚的靶子挑弓箭。把“我们要用 AI 提升客服”改写成“把工单首次响应时间从 8 小时压到 1 小时以内,由一线客服在现有工单系统里使用,用解决率和转人工率来验收”,这中间的差距,往往比任何两个模型之间的差距都决定项目生死。定义问题这一步几乎不花钱,返工一个方向定错的项目却要花掉数月预算,这笔账本身就说明它该排在最前。MIT 那份报告从买方一侧给出印证:真正跑通的企业,坚持按自己的流程做深度定制,并且拿业务结果当验收标准,而把软件跑分放到次要位置。Google Cloud 面向企业的 AI 采纳框架也把落地拆成人、流程、技术、数据四块,技术只占其一,而且要求从具体用例和数据可得性倒推回来。把问题写成一句能验收的话,是买任何东西之前就该交的作业。

数据没就绪,再强的模型也空转
数据这一层的证据更直白。Gartner 预测,到 2026 年,约六成缺乏 AI-ready 数据支撑的 AI 项目会被放弃;它还判断,到 2025 年底,至少三成生成式 AI 项目会在概念验证之后下马,原因集中在数据质量差、风险控制不足、成本失控和价值说不清。Informatica 的一项调研里,39% 的受访者把“数据不足”列为头号障碍,43% 指向“数据质量与就绪度”——在所有拦路石里排到最前。
容易被误读的是 AI-ready 这个说法。它衡量的从来是针对具体用例的那批数据是否可用、干净、口径统一、有清晰的来源与权限、可被治理;数据仓库里存量再大,也不代表就绪。一份把 AI 就绪度界定为组织学习问题的研究给出了更扎眼的数字:约 42% 的企业在技术上已经把项目跑通,却在进入生产前放弃;约八成拿不到可见的业务价值。症结依旧在上游——数据与流程的成熟度没有走在技术前面,先有能用的数据和理顺的流程,技术才谈得上兑现。这张核对清单其实很具体:这批数据分散在几个系统、口径是否一致、有没有可追溯的来源和标注、访问权限和合规边界是否清楚、脏数据和缺失值占多大比例。任何一项没过关,模型再强也只是在垃圾输入上快速产出垃圾输出。数据就绪度本应是下单之前就能逐项核对的清单,现实里却常被当成上线之后再慢慢补的欠账,等演示做完、预算花掉,才发现最基础的口径和权限都没理顺。
| 管理问题 | 需要的证据 | 建议动作 |
|---|---|---|
| 任务失败是否可逆 | 沙盒失败日志、回滚记录、人工接管时间 | 先限权试点 |
| 数据是否敏感 | 脱敏方案、权限边界、访问审计记录 | 保留人工确认 |
| 责任是否可追踪 | 供应商监控承诺、事故响应流程、内部负责人 | 责任未清楚前不进入生产 |
进入生产前,管理层需要同时看到任务可逆性、数据敏感度、人工接管和审计证据。
把 AI 接到没改的流程上,只能拿到边际收益
MIT 报告里最反直觉的一句,是把扩展 AI 的核心障碍归到一个容易被忽略的地方:学习——系统能不能留住反馈、贴合流程、随时间变好;基础设施、监管和人才都排在它后面。一组漏斗数字很能说明落地之难:在企业级定制工具上,约 60% 的组织评估过,20% 进到试点,最后只有 5% 真正进入生产;掉队的共同原因是流程太脆、缺乏情境学习、和日常操作对不上。同一份研究还发现,只有约两个行业出现了结构性变化,其余七个大多停在“广泛试验、鲜有转型”的状态。钱还常常投错位置——超过一半的生成式 AI 预算流向销售和营销这类显眼的前台功能,而报告测到回报最高的其实是后台自动化:削减外包、压缩外部代理成本、把运营流程理顺。预算跟着“看得见”走、没跟着回报走,本身就是把顺序做反的又一种表现。
一个侧面更有意思:大约 40% 的公司买了正式的 LLM 订阅,但在九成受访公司里,员工早已用个人账号的 AI 工具处理日常工作。自下而上、贴着真实任务的用法先跑了起来,自上而下、先采购后推广的项目却卡在试点。买还是自建也回到同一个顺序问题——向专业厂商采购并建立合作的成功率,大约是纯自建的两倍(约 67% 对其三分之一上下)。这未必说明外部模型更强,更可能是外部合作逼着团队把工具贴到真实流程上。年收入过亿美元的大企业投入最多、试点最多,却是从试点走向规模化最慢的一档:从试点到全面上线往往要九个月以上,而动作快的中型企业九十天就能走完。决定性的变量落在流程一侧——工作方式有没有为 AI 改造,使用中的反馈有没有接回系统。
掉队集中在流程太脆、缺乏情境学习、和日常操作对不上,而非模型能力;数据源自 MIT NANDA 2025 报告。
先把题目和数据摆平,再谈买哪家
把问题、数据与流程这三层并起来看,结论是硬的:绝大多数失败活在流程与数据两层,而不在模型能力本身。于是要预判一支团队会走向哪种结局,最灵的单一观测点不在他们最后挑了哪个模型,而在采购动作落在时间线的哪个位置——签下那张模型或平台订单的时刻,究竟排在问题被定义清楚、数据被理顺之前,还是之后。
顺序对了的样子很具体:团队能指出某一天,他们先把要改善的决策写成一句能验收的话,拿着一份逐项核对过的数据就绪清单,确认了用哪个指标验收、数据够不够干净可治理、流程要跟着怎么改,然后才把选型当成一道收尾题去比价。最该拉响的警报正是反过来的时间戳:采购单的日期早于任何一份能验收的问题定义、早于任何一次数据就绪核对——钱已经花出去,团队却还答不上来这笔投入到底要解决哪个问题、跑在哪批数据上。对正在国内外模型与平台之间反复比价的中国和东南亚企业,真正该盯的从来不是最后签了哪一家,而是那张订单的签署时刻落在上游的问题与数据工作之前还是之后。这个先后,比任何两个模型之间的差距都更早、也更准地告诉你,这个项目会停在演示,还是走进生产。
资料来源
6 个公开来源,按文章核验用途列出。
- 学术资料The GenAI Divide: State of AI in Business 2025
- 学术资料Why AI Readiness Is an Organizational Learning Problem, Not a Technology Purchase
- 公开报道MIT report: 95% of generative AI pilots at companies are failing
- 行业资料The Surprising Reason Most AI Projects Fail — And How to Avoid It at Your Enterprise
- 行业资料Why AI initiatives fail
- 权威机构Google Cloud's AI Adoption Framework (whitepaper)
