一家外卖公司,为交易入口造了一整条自研模型线
2025 年 9 月 12 日,美团让「小美」App 开启公测——一个能用一句自然语言点外卖、要它推荐餐厅、订座导航的本地生活小助手。第一个容易被略过的细节要先钉住:小美不是嵌在美团主 App 里的一项新功能,而是一个独立的 C 端 App。这个形态选择本身就是判断——把 AI 助手从既有流量里拆出来单独立户,意味着美团不打算让它只做主站的一个入口按钮,而是想验证它能不能独立承接一类交互,成为交易的新起点。
它的底座是自研的 LongCat-Flash-Chat:总参数 560B、每个 token 平均只激活约 27B 的混合专家(MoE)模型,接的是美团亿级用户的真实交易与评价数据。一家以配送履约见长的公司,没有停在调用外部实验室的模型,而是造了一整条近前沿的 MoE 模型线,再把它接回自己的交易入口。这条路线的动作本身已经透露了美团对护城河的重新定义:从「谁送得更快」这类履约效率,挪向「入口和模型都攥在自己手里」这对组合。
需要对公开材料的边界保持诚实。目前能查到的是产品能力与技术路线,不是可外推的留存或 GMV 数据——小美好不好用、留不留得住人,仍要等后续季度的数字说话。但战略意图不必等数据就能读出:模型所有权,被美团当成了下一阶段竞争的地基,而不是一项外采服务。
两个刻度:Flash-Chat 与 LongCat-2.0,别当成一回事引用
这条自研线的上限,在 2026 年 6 月 30 日露了出来:美团开源 LongCat-2.0,总参数 1.6 万亿、激活 33B–56B,面向 agentic 编程,在五万卡国产算力集群上跑通了训练与推理全流程,SWE-bench Pro 拿到 59.5,一度在 OpenRouter 上领先。这些数字很容易被拿去和小美混在一起讲,那是引用错误。
把事实说准:小美此刻跑的是 Flash-Chat(560B、约 27B 激活),万亿参数与 agentic 编程那套指标属于后来开源的 LongCat-2.0。两者是同一条自研路线上的两个刻度——一个已经嵌进交易入口,负责把自然语言翻成本地生活的下单动作;一个标出了这条线够得到的天花板,证明这套训练体系能推到近前沿。把 1.6T 的成绩安到小美头上,等于用能力上限去替产品现状背书,会高估现在、也误判风险所在。
两个刻度分开看,反而更能读懂美团的打法。Flash-Chat 说明它已经有一条能落到消费级产品、且单次推理成本可控的模型;LongCat-2.0 说明这条线的工程能力、数据管线和国产算力栈能撑起万亿级训练。前者回答「现在能不能用」,后者回答「这条路能走多远」。对投资人而言,真正值得盯的信号,是两个刻度之间的时间差与迭代节奏:从 560B 的消费级模型到 1.6T 的近前沿模型,中间隔了多久、复用了多少同一套基础设施——这才是「自研能力是不是真的在复利」的证据,比盯住某一个刻度的绝对分数更有用。
自建模型的成本优势只在调用量足够大、算力利用率足够高时才会反超按次付费的 API;调用量不够大的平台,自建是把钱烧进一个自己摊不平的成本里。
MoE 的机制:把「能力」与「单次成本」拆成两件事
要看懂美团这步棋,得先看懂它造的是什么样的模型。MoE 的关键,是把「模型有多强」和「回答一次要花多少算力」拆成了两件事。Flash-Chat 总参数 560B,但每个 token 平均只激活约 27B;LongCat-2.0 是 1.6 万亿总参数、激活 33B–56B。能力随总参数一起长,单次推理的成本却只跟着被激活的那一小块专家走。
这不是技术花边,它正是「自建能不能算过账」这道题的分母。稠密模型里,参数量涨一倍,推理成本大体也跟着涨,能力和单价被绑死;MoE 把这根绳子剪断——你可以用一个很大的总参数池装下更强的能力,同时让每次调用只唤醒其中一小撮专家,把单次成本压在一个远低于总规模的水平。对一个日均要处理海量下单意图的入口来说,单次成本是决定这套模型能不能规模化铺开的那个变量,而不是参数总量。
机制也有它会破的地方,得摆在明处。MoE 的省,是「平均激活」的省——路由把 token 分给不同专家,前提是负载能被均匀摊开。真实流量里专家利用率不均、热点专家被反复调用、长尾请求触发更多激活,都会让实际单次成本高于「27B」这个理论均值。同时,560B 的总参数无论是否激活都要常驻显存,这是一笔跑不掉的固定占用。所以 MoE 压低的是**边际**推理成本,压不低**入场**的算力门槛。它让「调用量够大时自建更划算」这件事成立,但没有让「小体量也能自建」成立——这个区别,正是下面三个前提要逐一算清的原因。
把这层拆分落到一笔粗账上更直观:每个 token 参与运算的参数只有约 27B,相对 560B 稠密同规模模型不到二十分之一,而单次推理的主要算力开销随激活参数走,因而被压到远低于总规模的水平。这个量级差,正是「亿级日调用」能不能被自有集群吃下的关键——单次成本被压低一个数量级,等于把「值得自建」所需的调用门槛也压低了一个数量级。对美团这种调用量,MoE 把自建从账面上根本不可行,推到了账面上可行。
| 判断维度 | 美团的读数 | 触发「自建」的条件 | 对多数平台的含义 |
|---|---|---|---|
| 调用量能否摊平固定成本 | 即时零售日订单 1.2 亿–1.5 亿单,激活约 27B/560B 压低单次算力 | 调用量越过 API 线性成本与自有集群固定成本的交叉点,且利用率够高 | 分发不够密、调用量不够大:闲置的自有算力比 API 更贵,应 buy |
| 数据是否独特到值得写回权重 | 7.7 亿交易用户、单季 71 亿即时配送订单的本地意图闭环 | 数据独特到能形成「用得越多、越懂本地场景」的实时反馈,微调/RAG 够不到 | 通用场景数据:架在 API 上的微调即可,无需自建底座,应 buy |
| 算力是否可得且需要主权 | LongCat-2.0 在五万卡国产集群跑通训练与推理全流程 | 需要摆脱外部供应商与出口管制对迭代节奏、成本结构的牵制(此层为分析推断) | 借用外部前沿模型换来的速度与专注更实在,应 buy |
| 综合判断 | 三样同时成立——屈指可数的少数玩家之一 | 三条全部越过交叉点:自建成为可摊平的基础设施投资 | 任一条不成立即回落到 buy:把钱烧进一个自己摊不平的成本 |
只有当调用量、数据独特性、算力主权三样同时把交叉点顶得够高时,自建才可能压过借用;美团三样都够,多数分发不密、调用量不足的平台理性答案仍是 buy。
数据闭环:7.7 亿用户、71 亿笔订单喂出的本地意图
顺着「单次成本」这个分母,自建对美团的第一个前提可以落到数字上:数据闭环。美团 2024 年交易用户数破 7.7 亿,单季即时配送订单 71 亿笔。这背后是一套别家拿不到的本地意图语料——「附近、便宜、能马上送到」这类需求,连同它对应的商家供给、时段、履约结果,构成了通用互联网语料里几乎不存在的一层。
关键在于这层数据能不能写回模型的权重。借用第三方前沿模型,能做微调、能挂 RAG,把美团的知识以外挂形式喂进去;但那够不到底座——你没法把每一次真实交互沉淀成模型自己的参数更新,形成「用得越多、越懂本地场景」的闭环。架在别人 API 之上的微调更像一层贴膜,动不了下面的玻璃。自建把这层数据变成可以反复回炉的训练燃料:小美每一次把「想吃点辣的、二十分钟内送到」正确翻成一组下单动作,都可以成为下一轮训练的样本,让模型对本地意图的理解越走越深。
这里要给一个诚实的边界。「数据能写回权重就一定带来体验优势」是机制上的可能,不是已被公开数据证实的结果——目前没有对外的指标能证明小美对本地意图的应答确实优于接通用模型的竞品。这恰恰是后面「验证点」一节要盯的东西。但从建模逻辑看,7.7 亿用户和 71 亿笔订单构成的独特语料,是美团敢自建、而多数平台不该自建的第一条硬理由:数据越独特,自研的回报越可能压过外采。
举个具体例子就知道这层数据有多难替代。一个通用模型知道「川菜」「麻辣」是什么,却不知道「这个小区周五晚八点、预算三十元、还能在半小时内送到的那几家川菜馆」——后者是供给、时段、地理、履约时效四者交叉出来的知识,只存在于美团自己的交易流里。通用模型能靠检索把这类信息临时拼进上下文,却没法把「这一带的人到点就想要什么」沉淀成自己的直觉。自建的价值,是让这类交叉知识从一次性检索,变成权重里长期累积的理解。
摊平量与算力主权:把交叉点压到自己够得着的高度
自建的第二、第三个前提,是调用量摊得平和算力拿得到。美团即时零售日订单在 2025 年 7 月冲到 1.2 亿至 1.5 亿单。API 的成本随调用次数近似线性上涨,自有集群的大头却是固定成本——只有当调用量越过某个交叉点,自建的单次成本才有机会反超按次付费的 API。日均过亿的调用量,正是把这个交叉点顶到「值得自建」那一侧的分母。MoE 又把交叉点往下压了一档:每次推理只激活约 27B 而非全部 560B,单次算力更省,够着自建门槛所需的调用量也就更低。
要标注清楚的是,这条只在利用率够高时成立。自有集群一旦闲置,固定成本没有订单去摊,单次成本会比 API 更贵。所以「自建更省」不是一个恒真判断,它挂在一个条件上:调用量要稳定压在交叉点之上。对美团,日均过亿的即时零售订单让这个条件大概率满足;对一个调用量还在爬坡、需求有明显波峰波谷的平台,同一套账算出来会是反的。
第三个前提是算力主权。LongCat-2.0 在五万卡国产集群上跑通训练与推理全流程,这是可查证的事实。顺此推断,美团的迭代节奏与成本结构也更少受外部供应商与出口管制牵制——需要标明,这一层是分析推断,不是已被逐项证实的结论。但方向是清楚的:当训练和推理都能落在自己能掌控的国产算力栈上,模型的演进速度就不再被别人的供货和政策窗口卡住,这对一条要长期复利的自研线,是比单次成本更深的一重保险。
build 还是 buy:答案不在口号,在你的交叉点落在哪
把小美放到区域视野里,一道选择题就清楚了。面对同一波 agentic AI,平台大致两条路:一条向外部前沿实验室借模型,换来速度与专注,把力气放在把 AI 铺进自己的场景;另一条自建,换来主权与黏性,让模型成为自己的基础设施。美团选了后者,但这道题没有放之四海的标准答案。
对美团这个具体选择,可以给一个明确判断:自建大概率是对的,而且几乎只有它这类玩家做得起。理由就是前几节那个交叉点——一个平台该造还是该借,取决于它的调用量、数据独特性、算力可得性把交叉点顶到了多高。美团三样都够:1.2 亿日订单顶起摊平自建的调用量,7.7 亿用户的交易数据喂出借模型换不来的实时反馈,国产万卡集群给了算力主权。三样同时成立的公司屈指可数。所以「自建」对美团是理性选择,对绝大多数分发密度不够、调用量不够大的平台,却是把钱烧进一个自己摊不平的固定成本。
这里要给区域读者一条可操作的决策规则,而不是一句口号:先估自己的交叉点,再决定 build 还是 buy。三个可量化的输入——日均调用量能不能稳定顶起固定成本?自有数据是否独特到值得反复写回权重?算力能不能自主拿到、不被供货和管制卡脖子?三个都是「是」,自建才进入理性区间;缺任何一个,外采几乎都是更省的答案。喊没喊出「自研」两个字无关紧要,交叉点落在哪,才决定这笔账算不算得过来。

区域对照:押模型所有权,还是押前台效率
同一批区域样本里,各家把 agentic AI 押在了不同的地方,正好把美团的选择照得更清楚。有的平台把赌注放在「让智能体站到一线去替人做决定」——把 AI 铺进客服、运营、决策的前台流程,赌的是前台效率的提升,模型仍以外采或轻度定制为主。美团押的是另一头:把模型本身收成自有基础设施,赌的是入口与权重的所有权。
这两条路无所谓对错,都是交叉点落在不同高度后的不同理性解。押前台效率的平台,往往调用量或数据独特性还不足以把自建的账算平,于是把有限资源投到「用现成模型改造流程」上,回报更快也更确定;这对它们是对的。美团的调用量和数据把交叉点压得足够低,自建才从「烧钱」变成「筑基」。同一道选择题,输入不同,理性答案就相反——把美团的自研当成所有超级应用都该抄的模板,是最容易犯的错。
对出资人,这提供了一把审视被投企业 AI 战略的尺子:不要被「自研/不自研」的表态带着走,去看它的交叉点是否真的够低。一个调用量和数据都不足的平台高调自研,多半是在为一个摊不平的成本结构讲故事;一个交叉点很高、老老实实外采并把 AI 焊进自己独特场景的平台,可能才是更清醒的资本配置。判断力在于读懂交叉点,而非听懂口号。
这也把美团这篇案例和「让智能体站到前台替人做事」那一类部署区分开了。别处的看点,多在智能体进入流程后、责任与人工接管的边界怎么划;美团的看点在更靠下的一层——模型本身归谁所有、那笔自建的账靠什么摊平。前者问的是「智能体能不能被安全地用起来」,美团问的是「模型该不该被自己造出来」。两个问题都真实,落点却不同:一个在使用侧,一个在所有权侧,这也是美团这篇不与前台效率类案例撞车的地方。
反方与风险:自建会在哪里破
一个负责任的判断,必须写出它可能错在哪。自建这条路对美团有三处真实的失败面,值得逐条盯。
其一,摊平假设失效。前面算过,自建更省挂在「调用量稳定压在交叉点之上」这个条件上。即时零售的订单有明显的峰谷和季节性,一旦小美这类新入口的实际调用量远低于主站履约订单,专门为它配置的算力就会长期闲置——那部分固定成本没有足够调用去摊,单次成本反而高于直接买 API。**触发条件**:小美公测后活跃调用量长期在低位徘徊。**反面信号**:若几个季度后小美的日活与调用量持续爬坡、并能与主站算力共享调度,这一风险就被证伪。
其二,前沿差距被拉开。LongCat-2.0 拿到 SWE-bench Pro 59.5、一度在 OpenRouter 领先,是某一时点的成绩;前沿模型迭代极快,自研线要持续追上外部最强模型,需要不断投入算力与人才。**触发条件**:外部前沿模型的能力代差扩大到用户可感知,而自研线迭代跟不上。**反面信号**:若美团能维持「Flash-Chat 到 2.0」那种在同一套基础设施上快速拉升刻度的节奏,说明自研能力在复利,而非一次性冲高。
其三,产品价值没兑现。模型再强,若小美对本地意图的应答体验拉不开与通用模型竞品的差距,「数据写回权重」的优势就只停在机制层面,没有变成用户留得住的理由。这一条是最根本的风险,也直接引出下一节的验证点。三处风险合起来看,自建不是一个已经赢下的赌注,而是一个下注方向清晰、但仍要靠后续数据兑现的判断。
养这条线的代价:能力上限之外,还有一本持续投入的账
前面反复讲自建的收益,得把成本也摆平。养一条从 560B 到 1.6T 的自研 MoE 模型线,要持续吃掉巨大的算力、人才与时间——五万卡国产集群的搭建与运维、训练与推理管线的工程化、专家团队的长期投入,都是逐年发生的固定支出,而不是一次性投入。这也是为什么「够得着这条线的公司本就没几家」:不是技术不可得,是这本持续投入的账,只有足够大的体量才摊得平。
这本账里还有一项容易被低估的成本:机会成本。同样的资源投进自研模型,就投不进别处。对美团,赌注是「模型所有权带来的长期黏性与主权」值得这笔投入;但这个赌注要成立,前提是入口足够重、交叉点足够低,让自研的长期回报能盖过「把同样的钱用现成模型铺满更多场景」的短期回报。对绝大多数平台,这个天平是倒向外采的——它们该做的,是把有限资源投到能立刻见效的场景落地上,而非追逐一条自己摊不平的模型线。
所以美团这个案例真正稀缺的,是它同时满足了让自建成立的全部苛刻条件:亿级日调用、独特的本地数据、自主的国产算力,加上一个愿意为长期主权承受持续投入的体量。把任何一个条件抽走,这本账就翻向外采。案例的价值正落在这组门槛的高度上,它标出了自建大模型到底需要什么;对区域读者最有用的,是把这组条件当成一张可以逐条核对的清单——照着核对自己的交叉点,再决定要不要动手。
结论:把一个宏大战略,压成几个季度内见分晓的产品指标
对新加坡与 ASEAN 的超级应用和出资人,美团的价值不在小美这个产品,而在它把 build-vs-buy 这道题摆成了一笔能照着算的账:先估自己的交叉点——调用量够不够顶起固定成本、数据独不独特到值得写回权重、算力拿不拿得到——再决定该造还是该借。多数平台此刻的合理答案仍是借用外部模型,把 AI 焊进自己的场景,回报更实在。
美团走的是另一侧,而这一步很快就有具体的验证点。**触发条件**:小美公测后接下来几个季度的产品数据——用户留存与复购,以及它对「附近、便宜、马上送到」这类美团独有需求的应答,是否明显好过接通用模型的竞品。**如果**这些指标兑现,小美会成为「入口够重、交叉点够低就该自建」这条路线的第一个实证;**反面信号**:若留不住人、或体验拉不开差距,那么再厚的入口也撑不起自研这笔持续投入,结论就该反过来——对美团尚且如此,对交叉点更高的平台更是如此。
这个案例最利落的地方正在于此:一个原本要靠宏大叙事去争论的战略选择——超级应用到底该不该自建大模型——被压成了一组几个季度内就见分晓的产品指标。不必等一个关于「垂直整合是不是未来」的哲学结论,只要盯住小美的留存曲线和它对本地意图的应答质量,答案会自己浮出来。对任何在同一道题前的区域平台,这比任何战略口号都更值得抄下来的,是这套「先算交叉点、再用产品指标验证」的方法,而不是「自研」这个动作本身。
编辑判断
美团自建 LongCat、把超级应用做成点单智能体,是一道 build-vs-buy 的判断:只有入口够重、耦合够深的少数玩家,自建才算得过来。

