新加坡 ASEANSingapore & ASEAN

SEA-LION:谁握着东南亚的话筒

东南亚是十几种语言与文化判断叠在一起的复合市场。SEA-LION 要做的,是把模型、数据、评测和安全这套装置攥回区域手里,让本地语境自己定义标准——真正的问题是它能不能从跑分走到出货。

新加坡ASEAN跨境
一支话筒的网罩由东南亚群岛与半岛的轮廓构成,立在暖色舞台灯下,身后却连着一台造型冷峻、来自外部的巨大音箱,隐喻区域握住话筒却仍借用外来扩音器。

前沿模型进入东南亚语言就集体掉档

一名在泰国打工的缅甸移工想弄清楚一份劳动合同的条款。他用泰语提问,模型用流利的泰语回答——句子通顺,语气礼貌,看上去无懈可击。问题藏在回答的来处:这套判断是在英语和中文语料里长成的,它能把泰语说得像模像样,却未必理解泰国劳动法里那条对跨境移工格外重要的细则。话筒握在模型手里:替这名移工做出理解与判断的,是一套在别处长成的系统。翻译准不准只是表层,真正的问题是由谁来替一整片语言人口做判断。 AI Singapore 的区域评测 SEA-HELM 把这道题摆到了台面上。它把大模型放进五个维度——经典 NLP、大模型特有能力、东南亚语言、东南亚文化与安全——结果相当直白:在英语榜单上强势的模型,一进入东南亚语言、知识与文化就集体掉档。GPT-4o 在这套评测上的东南亚平均分约为 68.9,印尼语尚有 74.5、菲律宾语 73.0,泰语只剩 64.7,泰米尔语更低到 64.2;而 Mistral、Claude 等主流模型干脆不支持其中若干种语言。分数越往低资源语言走,缺口越大,几种拥有官方地位、上千万使用者的语言反而最吃亏——排行榜上那枚“多语言”标签,遮住的正是这段被平均值抹平的落差。 论文点出的病根并不复杂:这些语言在互联网上既缺训练数据也缺测试数据,模型只能用英语和中文的先验去推测泰语和马来语,再用机器翻译拼出评测集——自动翻译会漏掉目标语言里固有的文化语境,制造出研究者所称的“文化抹除”,把并不多元的视角当成默认答案。正因如此,SEA-HELM 坚持用人工翻译和本地参与式设计来搭建题库,让本地的常识、禁忌与语气由熟悉本地的人写进题目。

SEA-LION 押注的是一整套区域化装置

SEA-LION 要补的正是这道缺口。它由 AI Singapore 主导——这是新加坡国家研究基金会支持、挂靠在新加坡国立大学的国家级 AI 项目——目标很明确:让东南亚语境拥有一套自己的模型、数据、评测与安全体系。这条线并非从零起步:v3 一代已经拿出 Llama-SEA-LION-v3-8B 与 Gemma-SEA-LION-v3-9B 等指令模型,覆盖英语、中文、印尼语、越南语、马来语、泰语、缅甸语、老挝语、菲律宾语、泰米尔语和高棉语共十一种语言,并被 IJCNLP-AACL 2025 收录,走的是大规模多语言持续预训练,加上多阶段指令微调、对齐与模型融合的路子。 2026 年 5 月发布的 v4.5 换了打法,用知识蒸馏和模型融合在成熟的前沿开源模型上做快速专精,一次给出三个版本:约 20 亿参数的 Gemma-SEA-LION-v4.5-E2B,270 亿参数、支持约 26 万 token 长上下文的 Qwen-SEA-LION-v4.5-27B,以及一个用块扩散推测解码把吞吐拉到每秒三四百 token 的加速版,官方称推理效率最高提升约六倍。它还第一次把重心放到 agentic 能力上:在一套三百道任务的智能体评测里,开启思考的 27B 版通过率约四成半,为本地客服、审批一类流程里的工具调用铺路。模型开源、允许商用,可在 Hugging Face、Ollama 和主流云上直接取用,官方称覆盖 11 种以上东南亚语言。 但只发一个模型并不足够。SEA-LION 真正下注的是围绕模型的一整套装置:做区域评测的 SEA-HELM、按东南亚文化尺度做内容审核的 SEA-Guard,以及让社区贡献本地数据集的 Project ATLAS。这里有一道必须说清的裂缝:v4.5 的底子仍是 Qwen 与 Gemma——话筒是区域的,扩音器却还是外来的。区域化的价值因此落在数据、评测和安全这几层由谁说了算,那才是参数量替代不了的部分。

定义“说得对”和“算安全”的那一层

真正决定一个模型该怎么回答的,是它背后的评测与安全标准。SEA-HELM 的五根支柱里,有两根专门盯着“东南亚文化”和“安全”——它要问的不止是模型泰语说得顺不顺,更是它懂不懂泰国的社会常识、答得合不合当地的价值判断。评测集坚持母语者人工翻译,把常识、禁忌和语气交给熟悉本地的人来定,机器转写连带搬运的偏见也就被挡在题库之外。 SEA-Guard 把这套控制向前推了一步,把内容审核的尺度校准到东南亚的文化规范上:什么话在马来语社群里算冒犯,什么表达在印尼的宗教语境里越界,交由一套本地训练的模型来裁定。这一层还有实打实的安全含义——以英语为主训练的模型,常在低资源语言里被绕过护栏,用泰语或缅甸语就能诱出英文里问不出的东西,而区域化的安全模型正是补这道缝。更关键的是,评测和安全依赖的语料由谁供给,那一方的判断就会被固化进去——Project ATLAS 让本地社区把自己的数据集贡献进来,目的是让这套标准由区域自己喂养,从源头上替换掉那份从外部灌来的现成答案。 这层控制权比模型排名重要得多。掌握评测,就等于掌握了“什么答案算对”的定义;校准安全,就等于替一整个语言社群划下了可说与不可说的边界。过去这条线由英文安全数据默默画好,东南亚只能接受一个在别处成型的判断,连申辩用的语言都不在题库里。SEA-HELM 论文也留了希望:一个经过针对性微调、参数在 70 到 90 亿之间的模型,就能在东南亚任务上逼近 GPT-4o 这类庞然大物。模型不必更大,真正需要更换的,是定义标准的那一方。

一张框架图:区域自主掌握的评测、安全、数据三层叠在上方,最底下的模型底座仍是外来的 Qwen 与 Gemma,指出区域化价值落在上三层而非参数量。
区域化的四层:话筒在手,底座仍外来

从跑分到出货:一道市场准入题

评测和安全说到底要落到生意上。对一家想用本地语言服务客户的东南亚企业来说,真正的问题很具体:客服机器人能不能用地道的马来语、泰语、越南语回应投诉;企业内部的检索增强问答(RAG)能不能直接读懂本地合同、政策与工单,而无需把一切先翻成英文再处理;这些数据能不能留在区域之内,而不必送去海外 API。对金融、政务、医疗这些握着敏感数据的机构,最后一条往往是硬约束——把客户资料喂给境外大模型,本身就过不了合规。中英文的前沿模型在这三件事上都不是天然合格的答案。 这正是一个开源、可商用、可本地微调的区域模型的位置。企业可以拿 SEA-LION 直接做领域微调,把内部知识灌进去,而不必长期受制于境外 API 的价格、延迟和数据政策。GovInsider 记录的一个案例里,它帮助身份背景各异的移工在泰国跨境处理法律纠纷——AI Singapore 的 Mark Pereira 说,SEA-LION 在多语言翻译之外多给的那一层,是“理解这些人从哪里来”的语境。v4.5 把重心压到 agentic 工作流上,也是想让模型不只回答问题,还能在本地客服、审批、外联这类流程里真正干活。 落地的裂缝同样明显:眼下更多是试点、非营利项目和政府内部助手,公开可查的规模化企业出货还很稀薄,离“日常业务都跑在上面”尚有距离。开源和可商用降低了门槛,却不自动带来采用——企业要的是稳定的服务、可控的成本和敢签的合规承诺,而这些要靠一个个真实上线的系统慢慢攒出来。第一批敢把核心业务押上去的行业,很可能是本地语言占比最高、又对数据出境最敏感的那几个——银行、电信和公共服务。

区域模型采用决策表:按场景分工,而非全盘替换(AI Bridge 框架估计)
业务场景 / 需求前沿中英文模型的短板SEA-LION 区域模型提供的能力建议决策
本地语言客服(马来语 / 泰语 / 越南语投诉应答)低资源语言掉档,语气与本地社会常识不足官方称覆盖 11 种以上东南亚语言,按本地文化尺度做内容审核(SEA-Guard)优先试点区域模型
区域内 RAG(直接读本地合同、政策、工单)需先翻成英文再处理,机器翻译丢失文化语境可直接读本地语言语料,支持领域微调灌入内部知识区域模型 + 领域微调
敏感数据留存与合规(金融 / 政务 / 医疗)数据送往境外 API,本身过不了合规开源可商用、可本地部署,数据留在区域之内硬约束:区域模型作为准入前提
agentic 流程(本地客服、审批、工具调用)英文能力强,但本地流程与工具调用未经验证v4.5 三百题智能体评测中开启思考的 27B 版通过率约四成半先试点验证,暂不押核心业务
通用英文推理与内容生成仍占优势非必需,收益有限沿用前沿模型

区域语言覆盖、文化对齐与数据合规是区域模型不可替代的准入价值,纯英文推理仍应交给前沿模型——决策按场景分工,敏感数据留存是硬约束而非加分项。

区域语言能不能变成一门生意

东南亚从来就是十几种语言、多套宗教与文化判断叠在一起的市场,任何想覆盖全区域的生意,都绕不开这层异质性。区域语言覆盖之所以要紧,原因很实在:它是本地企业进入这个市场的准入门槛——一家银行、一家电信商、一个政务平台,若无法用客户真正在用的语言去服务、去合规、去留住数据,就会被挡在市场门外,无论它的英文能力有多强。 所以判断 SEA-LION 这类模型有没有真正拿回主动权,标准落在生产采用上,而不在跑分或排行榜名次。可以盯住的触发信号很清楚:当企业级 RAG 和客服系统真的用上 SEA-LION 量级的开源模型,在马来语、泰语、越南语里上线运营、承接真实工单,而不再停留于发布 demo,话筒才算接上了扬声器。到那一步,区域语言就从一项被评测证明过的能力,变成一门真在收钱的生意。衡量的尺子也很朴素:数一数有多少笔真实交易、多少条客服会话、多少份合规文件,是用本地语言、在本地模型上完成的。 反过来,若这些模型始终留在评测榜和论文之内,却拿不到规模化的生产采用,那它们就仍旧只是一场关于代表权的演示。区域能不能真正掌握自己的语言 AI,最终由市场而非评测来裁定:要看有多少企业愿意把银行、电信、政务这类核心业务,长期放在本地模型上运营。这套装置真正攥进区域手里的标志,很可能就是那几个最敏感、又最离不开本地语言的行业率先把身家押了上去。

来源核验

资料来源

5 个公开来源,按文章核验用途列出。

  1. 原始资料SEA-LION: Introducing the SEA-LION v4.5 Suite — Agentic Power and Speed
  2. 原始资料SEA-LION: Empowering Open Multilingual AI for Southeast Asia
  3. 学术资料SEA-HELM: Southeast Asian Holistic Evaluation of Language Models
  4. 学术资料SEA-LION: Southeast Asian Languages in One Network
  5. 权威机构What Singapore's SEA-LION teaches us about the makings of local-language AI