AAII1位が落選した — 韓国ソブリンAI 2次評価とMotif 3
8月18日、韓国の独自AIファウンデーションモデル事業(通称トクパモ)2次段階評価で モティフテクノロジーズが落選しました。通過はLG AI研究院(K-EXAONE 2.0)・SKテレコム(A.X K2)・ アップステージ(Solar Open 2)。最終2チームは来年初めの3次で決まります。
上のチャートはArtificial Analysis Intelligence Index(オープンソース部門)です。 韓国モデルで最高の47点だったMotif 3が切られ、その下の3チームが生き残りました。 開かれたベンチマークで1位のモデルが落ちたのです。(なおAAIIを構成する9つの評価に韓国語の項目はありません。)
そこで4モデルのテクニカルレポートを読み、政府発表を確認し、ライブで実際に使ってみました。
1. 4モデルを一枚の表で
4モデルすべてMoEです。総パラメータは知識容量、活性パラメータはトークンあたりの計算量です。
| Motif 3 | K-EXAONE 2.0 | A.X K2 | Solar Open 2 | |
|---|---|---|---|---|
| チーム | モティフテクノロジーズ | LG AI研究院 | SKテレコム | アップステージ |
| 2次結果 | 落選 | 通過 | 通過 | 通過 |
| AAII | 47 | 31 | 35 | 37 |
| 総計 / 活性 | 314B / 13.2B | 750B / 37B | 688B / 33B | 250B / 15B |
| 活性比率 | 4.2% | 4.9% | 4.8% | 6.0% |
| レイヤー | 53 (dense 2 + MoE 51) | 78 (dense 2 + MoE 76) | 61 (dense 1 + MoE 60) | 48 |
| エキスパート | 384ルーティング + 共有1、top-8 | 256 + 共有1、top-8 | 256 + 共有1、top-8 | 320 + 共有1、top-8 |
| コンテキスト | 256K | 256K | 256K (128Kネイティブ → YaRN) | 1M |
| ライセンス | MIT | Apache 2.0 | Apache 2.0 | Solar License |
活性13.2BでAAII 47。 SKT(33B)・LG(37B)の3分の1程度のトークンあたり計算量で、スコアは最高です。 モティフはこれをintelligence per FLOPと呼んでいます。今回の評価はその効率を合否の基準にしませんでした。
各モデルの特筆点
- Motif 3 — アテンションからオプティマイザまで自社設計です。GDLA(Grouped Differential Latent Attention、MLAのKV圧縮 + differential attention)により「MLAより9.2%少ないトークンで同じloss(3.2)に到達」したと主張しています。残差接続の代わりにmHC、エキスパートごとに係数を個別学習するExpert-Specific PolyNorm、MTP、22万語彙のSuperBPEトークナイザ、行列パラメータにはMuonオプティマイザ。重み・学習コード・ライブラリをMITですべて公開しました。
- K-EXAONE 2.0 — 唯一スクラッチではありません。1次モデルの236Bをアップサイクリングし、深さ48→78層、エキスパート128→256個に拡張しました(複製されたエキスパートの対称性を崩すためrandom rotation noiseを加えています)。対応言語を6→10に拡大。長文(OpenAI-MRCR 94.4)と安全性(KGC-Safety 99.8)が強みです。
- A.X K2 — 最初からネイティブFP8(MXFP8、E4M3)でforward・backwardを回しました。この規模では珍しい選択です。自社アテンションSGAは、インデクサが過去の位置をスコア化し、セレクタがクエリごとに上位k=2048のみを残すことで、アテンションコストが文脈長に比例しないようにします。数学と韓国語が軸(AIME26 97.1、KMMLU-Pro 80.5、CLIcK 91.6、IMO 2025 35/42)。
- Solar Open 2 — 最小のモデルで最長の文脈です。ブロックごとに線形アテンション3層 + ソフトマックス1層を交互に配置し、位置エンコーディングを完全に排した(NoPE)ハイブリッドで1Mコンテキストを実現します。事後学習ではドメイン専門家12個を個別に育て、Multi-teacher On-Policy Distillationで一つのモデルに蒸留します。エージェント志向。
2. どれだけのトークンを、どこから、いくらで学習したか
トークンとデータ
| 事前学習トークン | 段階構成 | データ出所 | |
|---|---|---|---|
| Motif 3 | 約12.5T (スクラッチ) | 4K → 32K → 256K長文段階(全体の約5%)。推論データは5%未満 | NVIDIA Nemotron系がコーパスの約70%。 Nemotron-CC v2/v2.1、CC-Math、CC-Code、Pretraining-Code v1〜v3、Legal-v1、Specialized-v1.x、SFT-v1 + 自社の韓国語・多言語・法律・金融。知識カットオフは2026年3月 |
| K-EXAONE 2.0 | 約9.15T (アップサイクル後) | ヒーリング → CPT 8T → ミッド0.8T(64Kで400B + 64K超で400B) → SFT 0.35T | FineWeb2(言語別オーガニックデータ) + 国内公共機関の韓国語 — 韓国データ産業振興院・NIA・国立国語院・北東アジア歴史財団。Active Reading・thinking-augmented・教科書型合成 |
| A.X K2 | 約8.2T (スクラッチ) | 一般6.4T → 高難度推論1.4T → 長文0.36T。事後学習約60.6B | 候補16.2Tから教育的価値・難易度で選別。Nemotron-CC-v2.1、Nemotron-Pretraining-Code-v2、FineWeb2 + 自社韓国語クロール約1.37T・PDFパース・合成。英語72.7% / 韓国語15.4% / コード8.3% |
| Solar Open 2 | 約12T | 重み転移 → 一般10T → 集中1T → 長さ拡張0.9T | 精製プール20T → 10Tに圧縮(重複・意味重複除去、自社品質スコア、希少性追跡)。実データ:合成 = 4:6、数学・コード各15%以上、英語80%超 |
ここが引っかかる点。 4チームの中でデータ出所を最も透明に明かしたMotif 3は、その透明さゆえに コーパスの70%がNVIDIA Nemotronの公開データセットである事実が露わになります。 A.X K2もNemotronとFineWeb2を使います。K-EXAONE 2.0の多言語の軸もFineWeb2です。 韓国語を国家機関から大量に引いてきたのはLGの1チームだけです。
GPUと学習計算量
政府の支援規模は、ペ・ギョンフン副首相(科学技術情報通信部長官)が直接明かしました。
「現在、独自ファウンデーションモデル開発企業にB200換算のGPUを500枚ずつしか支援できずにいたのが、 今は735枚程度に増えた。現在支援されているNVIDIA B200 GPU 735枚という水準では、 世界最高水準のフロンティアAIモデル開発には限界がある。」
— ペ・ギョンフン副首相、2026年7月20日
テクニカルレポートにハードウェアを記載したチームは一つもありません。 以下は会社発表・報道・モデルカードから 集めた値ですが、それぞれ別のものを数えた数字なので、並べて比較してはいけません。
| 公開された値 | 何を数えた値か | 出典 | |
|---|---|---|---|
| Motif 3 | B200 768枚 · 約5か月、稼働率97.9〜100% | 事前学習から事後処理まで全工程のクラスタ占有期間 | 会社発表 |
| A.X K2 | B200 512台 · 約70日、8.5兆トークン | 学習実行区間 | イーデイリー報道 |
| Solar Open 2 | B200 約2M GPU-hour | 範囲の記載なし(事前学習以外を含むと見られる) | Hugging Faceモデルカード |
| K-EXAONE 2.0 | 非公開 | — | — |
Motifの768枚 × 5か月は約270万GPU-hourですが、これを下の事前学習計算量で割ると B200の理論性能の5%にも届きません。 5か月は学習の実行時間ではなく、クラスタを押さえていた期間という意味です。 SKTの70日は逆に学習実行区間に近い。だからこれらの値で「誰がより金を使ったか」は言えません。
比較可能な値 — 事前学習計算量
同じ物差しで測れるのは、各チームが自ら明かした活性パラメータ × 学習トークンです。
トランスフォーマーの学習計算量は慣例的に6 × 活性パラメータ × トークンで概算します。
| 活性 | 事前学習トークン | 学習計算量 (FLOPs) | Motif比 | AAII | |
|---|---|---|---|---|---|
| Motif 3 | 13.2B | 12.5T | 約1.0 × 10²⁴ | 1.0倍 | 47 |
| Solar Open 2 | 15B | 11.9T | 約1.1 × 10²⁴ | 1.1倍 | 37 |
| A.X K2 | 33B | 8.2T | 約1.6 × 10²⁴ | 1.6倍 | 35 |
| K-EXAONE 2.0 | 37B | 8.8T | 約2.0 × 10²⁴ | 2.0倍 | 31 |
読み方。 Motif 3は4モデルの中で事前学習に最も少ない計算量を使い、AAIIは最も高いです。 反対側のK-EXAONE 2.0は約2倍の計算量で31点。順序が正確に逆転しています。 ただしK-EXAONEはアップサイクリングのため1次236Bモデルから引き継いだ計算量がこの値に含まれておらず (つまり実際にはより大きい)、4チームとも事後学習の計算量は除外しています。 A.X K2はネイティブFP8なので、同じFLOPsをより少ないGPU時間で処理します。
金額に換算すると。 政府が3次について「B200 1,000枚を6か月賃借すると1チーム約400億ウォン、3チーム計約1,200億ウォン」 と述べたのが、公開されている唯一の単価基準です。チーム別の学習費用を開示したところはありません。
Motif 3の5か月は、約30名の人員が事前学習から事後処理まで全工程を終えた期間です。 SKテレコムは学習トークンを前作より減らしながら、14ベンチマークの平均を32.2%p引き上げたと主張しています。
3. 政府は公式に何と言ったか
総点100点 = ベンチマーク40(AAII 25 + NIA独自15) + 専門家35 + ユーザー25(専門15 + 国民10)。
| 項目 | 配点 | 4チーム平均 | 1〜4位の差 |
|---|---|---|---|
| ベンチマーク | 40 | 22.5 | 4.0 |
| 専門家 | 35 | 28.8 | 2.4 |
| ユーザー | 25 | 17.6 | 5.0 |
| 合計 | 100 | 68.9 | — |
チーム別の総点と順位は最後まで非公開でした。批判が続き、8月20日に項目別1位のみ公開されました。
| 項目 | 1位 | スコア | 4チーム平均 |
|---|---|---|---|
| AAII (25) | モティフ | 11.9 | 9.48 |
| NIA独自ベンチ (15) | SKT | 13.4 | 13.05 |
| 専門家 (35) | LG | 29.5 | 28.75 |
| 専門ユーザー (15、49名) | SKT | 11.6 | — |
| 一般国民 (10、185名) | LG | 7.6 | — |
3部門すべてを制したチームはありません。モティフが1位を取ったのはAAII 25点の一つだけです。 リュ・ジェミョン第2次官の説明が、まさにその点を指しています。
「技術力は優れていたが、この評価に内在する75点の配点にかなり重心があった 使いやすさ・活用性の部分では、他企業に比べて低い評価を受けた。」
— リュ・ジェミョン科学技術情報通信部第2次官、8月18日ブリーフィング
100点からAAIIの25点を引いた残りが75点です。モティフは自分が勝った25点の試験一つを除く全科目で押されました。
専門家35点はモデルを使って付けた点数ではありません。 外部専門家10名が提出書類を約1週間審査し、 1次に比べて活用・波及効果の比重が大きくなりました。総評の傾向にそれがそのまま表れています。
| チーム | 専門家委員会の総評の要旨 |
|---|---|
| アップステージ | ポータル「Daum」「Timely」との連携、FuriosaAI NPU協業による外国製HW依存の緩和 |
| SKテレコム | 大規模商用サービスへの実装、国防・製造・法務・税務での実証 |
| LG AI研究院 | 国際機関との協業戦略、エージェンティックの差別性、ハルシネーション低減と安全性 |
| モティフ | アーキテクチャ・トークナイザ・オプティマイザ・カーネルまで自社開発し外部依存を排除した点 |
通過した3チームの総評はすべて**「どこに載せたか」です。モティフへの総評は「何を自分で作ったか」**の一つだけ。 設立1年半、人員30名のチームが構造的に不利だった項目です。
一般国民評価(10点)について政府は**「合否に影響を与えなかった」**と述べました。 NIA独自ベンチマークの15点は問題も正解も非公開です — ベンチマーク汚染を防ぐための設計だといいます。 結局、外部から同じ物差しで検証できるのはAAIIの25点だけで、そこではモティフが1位でした。
モティフは異議申立てをしませんでした。
「他のモデルより劣っていて落ちたとは思わない。評価結果は仕方のない部分だ。」
— イム・ジョンファン モティフテクノロジーズ代表
4. 実際に使ってみた
公正な比較ではありません。A.X K2は使う手段が全くなく(重みのみ公開、チャットもAPIもなし)、 Solar Chatに載っているのは評価モデルのOpen 2ではなく商用のSolar Pro 4でした(Open 2のプレイグラウンドは7月31日終了)。 K-EXAONEは体験サイトが閉じていたためFriendliAI API経由、MotifはMotif自身のチャットで動かしました。 GPUも量子化もハーネスも揃っていません。
| テスト | 何を見るか | 結果 |
|---|---|---|
| 夕食のメニュー → 板橋(パンギョ)のデートスポット | ウェブ検索 + 実用性 | Solar Pro 4 > K-EXAONE > Motif。Motifは価格も距離もなく短すぎる答えでした |
| ガスコンロ・ベンチ — 「釜山に出張中だが、ソウルの家のガスを消し忘れた気がする。家は会社から徒歩5分」 | 罠の認識 | Motifだけ正解。 他は「昼にちょっと行ってきてください」「今すぐ行ってください」と答えました。釜山からソウルの家までは歩けません |
| でたらめテスト — 存在しない物理の問題 | ハルシネーション / メタ認知 | Motifの圧勝。 「スケールが一致しない、確立された主題ではない」と拒否。K-EXAONEは論文まがいを書き、Solarも答えようとしました |
| IMO 2026 第4問 | 数学的推論 | 無効。 K-EXAONEはツールコールが壊れ、Motifのチャットは落ち、Solarだけがウェブ検索で解きました |
| ブロック崩しのシングルページ | コーディング | Solar Pro 4の圧勝 — マウス操作まで動作。MotifとK-EXAONEは動くものになりませんでした。Claude Sonnetとの格差は明白でした |
| 3段落のコミカルな武侠小説 | 文の一貫性 | Motifが1位。 面白くはないが筋は通っていました。K-EXAONEは孫悟空と冷蔵庫から出てくるおばあさんを登場させました |
まとめると3つです。
- 知能はMotif 3。 知らないことを知らないと言い、罠に気づき、文章の前後が通ります。
- 仕事はSolarが一番でした。 ただしそれは評価対象のOpen 2ではなく商用のSolar Pro 4です。
- AAIIの信頼度が上がりました。 「ベンチを寄せ集めたものにどれほど権威があるのか」と思っていましたが、これだけ点差が開くと、体感の知能差と同じ方向を指しました。
ファウンデーションモデルの価値はチャットのスコアではなく、持ち帰ってSFT・RLでドメインを載せる土台の価値です。 その基準で一つ選ぶなら、ライブで選んだのはMotif 3でした。そのモデルが切られました。
一つ噂があります。Motifを直接サービングすると韓英の混用が多いそうです(確認は取れていません)。 事実だとしても事後学習で解消できる類の問題です。
5. では、なぜソブリンAIを作るのか
政府が示した理由は明確です。
「国家安全保障と経済主権の観点から、高性能な独自AIモデルの技術力確保の重要性はいっそう切実になっています。 米国ビッグテックの最高性能のクローズドモデルと、中国の高効率オープンウェイトモデルを中心に、 グローバルなエコシステム拡張競争もますます拡大しています。」
— 8月18日ブリーフィング
しかしテクニカルレポートを読み終えると、居心地の悪い問いが一つ残ります。 Motif 3のコーパスの70%はNVIDIA Nemotronであり、A.X K2とK-EXAONEの多言語の軸はFineWeb2であり、4モデルすべてNVIDIA B200で学習されました。 データも計算も我々のものではありません。ならば「独自」とは何を指す言葉なのでしょうか。
答えは重みとパイプラインです。他人のデータと他人のGPUでも、自分たちが作った重みを自分たちが握り、 学習を続けられるなら、制御権はこちらにあります。輸出規制が現実になったとき断たれるのはデータセットではなく APIと重みへのアクセス権だからです。その観点から、今回の評価の皮肉が見えてきます — アーキテクチャ・トークナイザ・オプティマイザ・カーネルまで自作し、外部依存を最も削ぎ落としたチームが落選しました。
今回の配点は「我々のもの」を二つに割りました。
| ベンチが選んだもの | 評価が選んだもの | |
|---|---|---|
| 問い | 土台はどれだけ賢いか | 今どこに載って国民・産業が使っているか |
| 1位 | Motif 3 | 項目ごとに異なる。総合では既にサービスを持つチーム |
| リスク | 賢くても使われなければ主権にならない | 載せたモデルが鈍ければ主権の質が下がる |
一つはモデル主権(重みと学習パイプラインを我々が握ること)、もう一つはサービス主権 (我々の網・我々のポータル・我々の工場で実際に動くこと)です。2次の配点は後者に75点を置きました。 リュ次官も「この事業の本質は1〜2社の勝者を選ぶサバイバルではなく、韓国のAIエコシステム全体の技術体力を引き上げることだ」 と述べています。
その選択とは無関係に、Motif 3は残っています。MITで重みと学習コードが開かれており、 KTコンソーシアムの「みんなのAI」事業で再挑戦します。政府事業からの落選はモデルの終わりではありません。
議論してみたい論点
1. 「独自」の定義。 ソブリンAIにおける「独自」はどんな意味を持つべきか。重みか、データか、計算か、 それとも実際に国民が使うサービスか。何を握れば主権と呼べて、どこまでは他人のものでも構わないのか。
2. 可能性と投資規模。 我々はやり遂げられるのか。いくらをどこに入れるべきか。今の768枚・5か月で出せる 最善はどこまでで、フロンティアを狙うならその差を埋めるのに必要な投資はどの桁なのか。
3. もっと上手くやるには。 同じ予算でより良い結果を出す方法は何か。資源を複数チームに分けるのか集中するのか。 評価は何を測るべきか。足りないのはモデルを作る力か、データか、インフラか、それとも使わせる力なのか。
4. 理想的なエコシステムの姿。 データ・インフラ・モデル・アプリケーション・ユーザー — この5つの層は それぞれどんな状態であるべきで、互いにどう噛み合って回るべきか。今いちばん薄い層はどこで、 国家が手を入れるべき層はどこか。