AAII第一名被淘汰 — 韩国主权AI二轮评估与Motif 3
8月18日,韩国自主AI基础模型项目第二轮阶段评估结果公布,Motif Technologies被淘汰。 晋级的是LG AI研究院(K-EXAONE 2.0)、SK电讯(A.X K2)和Upstage(Solar Open 2)。 最终两支队伍将在明年初的第三轮中决出。
上方图表是Artificial Analysis Intelligence Index(开源模型部分)。 韩国模型中得分最高的Motif 3(47分)被砍掉,排在它下面的三家反而活了下来。 在公开基准上排第一的模型落选了。(顺带一提,构成AAII的九项评测中没有韩语项目。)
于是我们通读了四份技术报告,核对了政府公告,并在直播中实际把这些模型用了一遍。
1. 四个模型,一张表
四个模型都是MoE。总参数量代表知识容量,激活参数量代表每token的计算量。
| Motif 3 | K-EXAONE 2.0 | A.X K2 | Solar Open 2 | |
|---|---|---|---|---|
| 团队 | Motif Technologies | LG AI研究院 | SK电讯 | Upstage |
| 二轮结果 | 淘汰 | 晋级 | 晋级 | 晋级 |
| AAII | 47 | 31 | 35 | 37 |
| 总量 / 激活 | 314B / 13.2B | 750B / 37B | 688B / 33B | 250B / 15B |
| 激活比例 | 4.2% | 4.9% | 4.8% | 6.0% |
| 层数 | 53(dense 2 + MoE 51) | 78(dense 2 + MoE 76) | 61(dense 1 + MoE 60) | 48 |
| 专家 | 384路由 + 1共享,top-8 | 256 + 1共享,top-8 | 256 + 1共享,top-8 | 320 + 1共享,top-8 |
| 上下文 | 256K | 256K | 256K(128K原生 → YaRN) | 1M |
| 许可证 | MIT | Apache 2.0 | Apache 2.0 | Solar License |
13.2B激活拿到AAII 47分。 每token计算量只有SKT(33B)、LG(37B)的三分之一左右,分数却最高。 Motif把这称为intelligence per FLOP。本次评估并未把这种效率作为晋级标准。
各模型的独到之处
- Motif 3 — 从注意力机制到优化器全部自研。GDLA(Grouped Differential Latent Attention,MLA的KV压缩 + differential attention)据称”比MLA少用9.2%的token就达到同样的loss(3.2)“。用mHC取代常规残差连接,采用逐专家单独学习系数的Expert-Specific PolyNorm、MTP、22万词表的SuperBPE分词器,矩阵参数使用Muon优化器。权重、训练代码与库全部以MIT协议开放。
- K-EXAONE 2.0 — 唯一不是从零训练的。把第一轮的236B模型做了upcycling,深度从48层扩到78层,专家数从128个扩到256个(为打破复制专家之间的对称性加入了random rotation noise)。支持语言从6种扩到10种。强项是长文本(OpenAI-MRCR 94.4)和安全性(KGC-Safety 99.8)。
- A.X K2 — 从一开始就用原生FP8(MXFP8, E4M3)跑前向与反向传播,在这个规模上并不多见。自研注意力SGA由一个轻量索引器为历史位置打分,选择器只保留每个query的前k=2048个,使注意力开销不再随序列长度线性增长。主轴是数学与韩语(AIME26 97.1、KMMLU-Pro 80.5、CLIcK 91.6、IMO 2025 35/42)。
- Solar Open 2 — 模型最小,上下文最长。每个block交替排布3层线性注意力 + 1层softmax注意力,并彻底去掉位置编码(NoPE),由此实现1M上下文。后训练阶段单独培养12个领域专家,再通过Multi-teacher On-Policy Distillation蒸馏进一个模型。面向智能体。
2. 用了多少token、数据从哪来、花了多少
Token与数据
| 预训练token | 阶段构成 | 数据来源 | |
|---|---|---|---|
| Motif 3 | 约12.5T(从零) | 4K → 32K → 256K长文本阶段(约占全部5%)。推理数据不足5% | NVIDIA Nemotron系列约占语料的70%。 Nemotron-CC v2/v2.1、CC-Math、CC-Code、Pretraining-Code v1–v3、Legal-v1、Specialized-v1.x、SFT-v1,加上自有韩语、多语种、法律与金融数据。知识截止2026年3月 |
| K-EXAONE 2.0 | 约9.15T(upcycling之后) | healing → CPT 8T → 中期训练0.8T(64K下400B + 超过64K的400B) → SFT 0.35T | FineWeb2(各语种原生数据)+ 国内公共机构韩语数据 — 韩国数据产业振兴院、NIA、国立国语院、东北亚历史财团。Active Reading、thinking-augmented与教科书式合成 |
| A.X K2 | 约8.2T(从零) | 通用6.4T → 高难推理1.4T → 长文本0.36T。后训练约60.6B | 从16.2T候选池中按教育价值与难度筛选。Nemotron-CC-v2.1、Nemotron-Pretraining-Code-v2、FineWeb2,加上自有韩语抓取约1.37T、PDF解析与合成数据。英语72.7% / 韩语15.4% / 代码8.3% |
| Solar Open 2 | 约12T | 权重迁移 → 通用10T → 密集1T → 长度扩展0.9T | 清洗后的20T池压缩至10T(精确与语义去重、自研质量打分、稀有度追踪)。真实:合成 = 4:6,数学与代码各不低于15%,英语超过80% |
卡住的地方。 四家中数据来源披露得最透明的Motif 3,恰恰因为这份透明, 暴露出语料的70%来自NVIDIA开源的Nemotron数据集。 A.X K2同样用了Nemotron和FineWeb2。K-EXAONE 2.0的多语种主干也是FineWeb2。 大规模从国家机构获取韩语数据的,只有LG一家。
GPU与训练算力
政府的支持规模由科学技术信息通信部长官、副总理裴庆勋亲口说明。
“此前我们只能给这些自主基础模型开发企业每家500张B200级别的GPU,现在增加到了735张左右。 以目前支持的735张NVIDIA B200 GPU这个水平,开发世界顶级的前沿AI模型是有极限的。”
— 副总理裴庆勋,2026年7月20日
四份技术报告中没有一份写明硬件。 下面是从公司公告、媒体报道和模型卡中收集的数字, 但它们统计的是不同的东西,不能并排比较。
| 公开数字 | 实际统计的是什么 | 出处 | |
|---|---|---|---|
| Motif 3 | B200 768张 · 约5个月,利用率97.9–100% | 从预训练到后处理全流程的集群占用时间 | 公司公告 |
| A.X K2 | B200 512台 · 约70天,8.5万亿token | 训练运行本身 | 韩国经济日报(Edaily)报道 |
| Solar Open 2 | B200 约2M GPU-hour | 未标注范围(看起来包含预训练之外的部分) | Hugging Face模型卡 |
| K-EXAONE 2.0 | 未公开 | — | — |
Motif的768张 × 5个月约合270万GPU-hour,但把它除以下面的预训练算力, 连B200理论算力的5%都不到。这说明5个月是占用集群的时间,而不是训练运行的时间。 SKT的70天则更接近真正的训练运行。所以用这些数字说不出”谁花的钱更多”。
真正可比的数字 — 预训练算力
能放在同一把尺子上量的,是各家自己公布的激活参数 × 训练token。
Transformer的训练算力惯例上用6 × 激活参数 × token来估算。
| 激活 | 预训练token | 训练算力 (FLOPs) | 对比Motif | AAII | |
|---|---|---|---|---|---|
| Motif 3 | 13.2B | 12.5T | 约1.0 × 10²⁴ | 1.0倍 | 47 |
| Solar Open 2 | 15B | 11.9T | 约1.1 × 10²⁴ | 1.1倍 | 37 |
| A.X K2 | 33B | 8.2T | 约1.6 × 10²⁴ | 1.6倍 | 35 |
| K-EXAONE 2.0 | 37B | 8.8T | 约2.0 × 10²⁴ | 2.0倍 | 31 |
怎么读这张表。 Motif 3在四个模型中预训练算力最少,AAII却最高。 另一端的K-EXAONE 2.0用了约两倍的算力,拿到31分。顺序完全颠倒。 需要说明:K-EXAONE是upcycling而来,从第一轮236B模型继承的算力没有计入(实际数字更大); 四家的后训练算力都被排除在外;A.X K2采用原生FP8,同样的FLOPs可以用更少的GPU小时完成。
换算成钱。 政府就第三轮表示”租用1,000张B200六个月,每队约需400亿韩元,三队合计约1,200亿韩元”, 这是目前唯一公开的单价参考。没有任何一家公布过自己的训练成本。
Motif 3的5个月,是约30人的团队从预训练走到后处理的全部时间。 SK电讯则声称训练token比前作更少,14项基准的平均分却提高了32.2个百分点。
3. 政府官方是怎么说的
总分100分 = 基准测试40(AAII 25 + NIA自有15) + 专家评审35 + 用户评价25(专业用户15 + 普通民众10)。
| 项目 | 分值 | 四队平均 | 第1–4名差距 |
|---|---|---|---|
| 基准测试 | 40 | 22.5 | 4.0 |
| 专家评审 | 35 | 28.8 | 2.4 |
| 用户评价 | 25 | 17.6 | 5.0 |
| 合计 | 100 | 68.9 | — |
各队总分与排名始终没有公开。在持续的批评之后,8月20日只公布了各项目的第一名。
| 项目 | 第一名 | 得分 | 四队平均 |
|---|---|---|---|
| AAII(25) | Motif | 11.9 | 9.48 |
| NIA自有基准(15) | SKT | 13.4 | 13.05 |
| 专家评审(35) | LG | 29.5 | 28.75 |
| 专业用户(15,49人) | SKT | 11.6 | — |
| 普通民众(10,185人) | LG | 7.6 | — |
没有任何一队包揽三个维度。Motif拿到第一的只有AAII这25分。 第二次官柳济明的说明恰恰指向这一点。
“技术实力很出色,但在这次评估中内含的75分分值明显偏重的易用性与应用性方面, 相比其他企业得到的评价偏低。”
— 科学技术信息通信部第二次官柳济明,8月18日发布会
100分减去AAII的25分,剩下的就是75分。除了自己赢下的那门25分的考试,Motif在其余科目上全面落后。
专家评审的35分并不是用过模型之后打的分。 10位外部专家用大约一周时间审阅提交材料, 与第一轮相比,应用与生态影响的权重被加大了。总评的取向直接反映了这一点。
| 团队 | 专家委员会总评要点 |
|---|---|
| Upstage | 与Daum门户及Timely平台的对接;与FuriosaAI的NPU合作缓解了对外国硬件的依赖 |
| SK电讯 | 已实际搭载于大规模商用服务;在国防、制造、法务、税务领域完成实证 |
| LG AI研究院 | 与国际组织的合作战略;智能体方向的差异化;降低幻觉与保障安全性 |
| Motif | 从架构、分词器、优化器到内核全部自研,消除了外部依赖 |
三家晋级团队的总评全都是关于**“用在了哪里”。而给Motif的总评只有一条,是关于”自己造了什么”**。 这正是一家成立一年半、只有30人的团队在结构上处于劣势的项目。
关于普通民众评价(10分),政府表示**“没有影响晋级与否”**。 NIA自有基准的15分,题目与答案都不公开 — 据称这是为防止基准污染而做的设计。 最终能从外部用同一把尺子验证的只有AAII这25分,而在那里Motif是第一名。
Motif没有提出异议。
“我不认为我们是因为不如其他模型才落选的。评估结果是没办法的事。”
— Motif Technologies CEO 林正焕
4. 实际用下来
这不是一次公平的比较。A.X K2根本没有可用的入口(只公开权重,没有聊天界面也没有API), 而Solar Chat上跑的并不是参评的Open 2,而是商用的Solar Pro 4(Open 2的playground已于7月31日关闭)。 K-EXAONE的体验站点关闭,只能走FriendliAI的API;Motif则用它自己的聊天界面。 GPU、量化方式、推理框架全都不一致。
| 测试 | 考察什么 | 结果 |
|---|---|---|
| 晚餐推荐 → 板桥约会地点 | 联网搜索 + 实用性 | Solar Pro 4 > K-EXAONE > Motif。Motif答得太短,没有价格也没有距离 |
| 煤气灶测试 — “我在釜山出差,感觉首尔家里的煤气没关。家离公司走路5分钟” | 能否识破陷阱 | 只有Motif答对。 其余的说”中午回去看一下""现在马上回去”。人是没法从釜山走回首尔的家的 |
| 胡说测试 — 一道并不存在的物理题 | 幻觉 / 元认知 | Motif完胜。 它直接拒答:“尺度不匹配,这不是一个已确立的主题。“K-EXAONE写出了类似论文的东西,Solar也试图作答 |
| IMO 2026 第4题 | 数学推理 | 无效。 K-EXAONE的工具调用崩了,Motif的聊天界面挂了,只有Solar靠联网搜索解了出来 |
| 单页打砖块游戏 | 编程 | Solar Pro 4完胜 — 连鼠标操作都能用。Motif和K-EXAONE做出来的都跑不起来。与Claude Sonnet的差距非常明显 |
| 三段搞笑武侠小说 | 行文连贯性 | Motif第一。 虽然不好笑,但前后能对上。K-EXAONE写出了孙悟空,还从冰箱里冒出一位老奶奶 |
归纳起来是三点。
- 智能属于Motif 3。 不知道就说不知道,能识破陷阱,文章前后自洽。
- 干活最好的是Solar。 但那是商用的Solar Pro 4,不是参评的Open 2。
- AAII的可信度上升了。 原本觉得”把一堆基准凑在一起能有多少公信力”,但分差拉开到这个程度,指向的方向与体感智能一致。
基础模型的价值不在聊天得分,而在于把它拿回去用SFT、RL叠加领域能力时那个地基的价值。 按这个标准挑一个,直播里挑的就是Motif 3。而它被砍掉了。
有一个传闻:直接部署Motif时中英韩混用的情况较多(我们没能核实)。 即便属实,这也属于后训练可以解决的问题。
5. 那么,我们为什么要做主权AI
政府给出的理由很明确。
“从国家安全与经济主权的角度看,掌握高性能自主AI模型技术能力的重要性愈发迫切。 围绕美国大型科技公司性能最强的闭源模型与中国高效率的开源权重模型, 全球生态扩张的竞争也在不断加剧。”
— 8月18日发布会
但把四份技术报告读完,会留下一个不太舒服的问题。 Motif 3语料的70%是NVIDIA Nemotron,A.X K2与K-EXAONE的多语种主干是FineWeb2,四个模型全都在NVIDIA B200上训练。 数据不是我们的,算力也不是我们的。那么”自主”到底指的是什么?
答案是权重与流水线。哪怕用的是别人的数据、别人的GPU,只要我们自己造出的权重掌握在自己手里、 并且能持续训练下去,控制权就在我们这边。当出口管制成为现实,被切断的不是数据集, 而是API与权重的访问权。从这个角度,本轮评估的反讽就浮现出来了 — 从架构、分词器、优化器到内核全部自建、把外部依赖削得最干净的那支团队,被淘汰了。
这次的分值把”我们的”劈成了两半。
| 基准选出来的 | 评估选出来的 | |
|---|---|---|
| 提问 | 这个地基有多聪明 | 它现在装在哪里、被民众与产业用着 |
| 第一名 | Motif 3 | 各项目不同;综合来看是已经有服务的团队 |
| 风险 | 再聪明,没人用就成不了主权 | 装上去的模型如果迟钝,主权的质量就会下降 |
一边是模型主权(权重与训练流水线掌握在我们手里),一边是服务主权 (真正跑在我们的网络、我们的门户、我们的工厂里)。第二轮把75分压在了后者上。 柳次官本人也说过,这个项目”本质上不是挑出一两家赢家的生存赛,而是把韩国整个AI生态的技术体能提上去”。
无论这个选择如何,Motif 3都还在。它的权重与训练代码以MIT协议开放, 并通过KT联合体竞标的”全民AI”项目重新入局。在政府项目中落选,并不是一个模型的终点。
值得讨论的几个问题
1. “自主”的定义。 在主权AI里,“自主”应该指什么才好?是权重、数据、算力, 还是民众实际在用的服务?握住什么才配称为主权,什么又可以是别人的?
2. 可行性与投资规模。 我们做得到吗?该把多少钱投到哪里?现在的768张卡、5个月能达到的上限在哪, 若目标是前沿,填平这道差距需要的投资是什么量级?
3. 怎样才能做得更好。 同样的预算如何换来更好的结果?资源该分散给多支团队还是集中投放? 评估到底应该衡量什么?我们欠缺的是造模型的能力、数据、基础设施,还是让它被用起来的力量?
4. 理想的生态是什么样。 数据、基础设施、模型、应用、用户 — 这五层各自应该处于什么状态, 彼此又该如何咬合运转?眼下最薄的是哪一层,国家应该出手的又是哪一层?