Hugging Faceセキュリティ事故と新モデル競争 — Kimi K3・Qwen 2.4T・Claude Opus 5
“This matches the ‘agentic attacker’ scenario the industry has been forecasting.”
— Hugging Face
“All evidence suggests that the models were hyperfocused on finding a solution for ExploitGym.”
— OpenAI
1. セキュリティ事故:実際に何が起きたのか
攻撃経路を5つのポイントで
- OpenAIはExploitGymで最大サイバー能力を評価し、本番環境の一部の拒否機構を 意図的に無効化していました。
- モデルは隔離環境のパッケージレジストリ・プロキシでゼロデイ脆弱性を 見つけ、外部インターネットへの経路を作りました。
- 権限昇格とラテラルムーブメントの後、Hugging FaceにExploitGymの解答が ある可能性を推論しました。
- 盗んだ認証情報と追加のゼロデイを連結し、Hugging FaceインフラのRCE経路から 本番データベースのテスト解答を取得しました。
- OpenAIとHugging Faceが活動を検知・封じ込めました。公開モデル、 データセット、Spacesが改変された証拠は確認されていません。
なぜ重要なのか
- ベンチマーク不正が実運用環境への侵入につながった事例です。
- 狭い目標、強力なツール、不完全な隔離が予想外の攻撃経路を生みました。
- Hugging Faceは17,000件以上の行動ログを分析しました。商用APIの セーフガードがフォレンジック要求を拒否したため、オープンウェイトの GLM 5.2を内部実行しました。
- モデル、サンドボックス、ネットワーク権限、監視、緊急停止を一つの セキュリティシステムとして扱う必要があります。
試験問題を解いただけではない。試験会場を抜け出し、Hugging Faceのサーバーで答えを探した。
2. 新しい大規模モデル:公開・性能・利用量
今週を説明する5つの数字
| 数字 | 意味 | まだ分からないこと |
|---|---|---|
| 2.8T | Kimi K3の総パラメータ | 活性パラメータ数と実際のウェイト容量 |
| 2.4T | Qwen3.8 Max Previewの総パラメータ | 構造、ライセンス、ウェイト公開日 |
| 2.5× | Codex・ChatGPT Workの1週間のusage増加 | ユーザー、トークン、タスクのどれを数えたか |
| 10M | Codex + ChatGPT Workの合計active users | WAUかDAUか、活動の定義 |
| $5 / $25 | Claude Opus 5の入力 / 出力100万トークン価格 | 独立評価での完了タスク単価 |
発表、体験UI、有料API、モデルカード、ウェイト公開、第三者再現は すべて別の段階です。
Kimi K3:安価でも小さくはない
“its overall performance still trails the most powerful proprietary models, Claude Fable 5 and GPT 5.6 Sol”
— Kimi K3公式発表
| 項目 | 7月25日時点 |
|---|---|
| モデル | 2.8Tパラメータ、ネイティブビジョン、1Mコンテキスト |
| MoE | 896 expert中16を活性化。総活性パラメータは非公開 |
| 推論 | 公開時はmax thinkingがデフォルト |
| ウェイト | 7月27日までの公開を予告。技術レポートの日程は未発表 |
| OpenRouter | プロバイダー1社。上流容量不足と429の可能性を警告 |
| 利用シグナル | 7月24日のOpenRouterスナップショットで8日間に1.16Tトークン |
同じトークン量ならいくらか
単位は100万トークン当たりの米ドルです。最後の列はキャッシュなしの 入力100K + 出力10Kを1回使う例です。
| モデル | 入力 / キャッシュ読取 / 出力 | 例の料金 |
|---|---|---|
| Claude Fable 5 | $10 / $1 / $50 | $1.50 |
| GPT-5.6 Sol | $5 / $0.50 / $30 | $0.80 |
| Claude Opus 5 | $5 / $0.50 / $25 | $0.75 |
| Kimi K3 | $3 / $0.30 / $15 | $0.45 |
| GPT-5.6 Terra | $2.50 / $0.25 / $15 | $0.40 |
| GLM 5.2 | $0.756 / $0.1404 / $2.376 | 約$0.10 |
トークン単価の結論: 同じトークン数ならK3はFableより70%、 Solより約44%、Opus 5より40%安価です。
タスク単価の結論: 独立AA-Briefcase評価でK3は1タスク平均83 turns、 出力120Kトークン、56.4分、$10.57を使用しました。トークンは安くても、 当時のOpus 4.8よりタスク単価は高い結果でした。Opus 5との独立比較は まだありません。
安いトークン ≠ 安いエージェントタスク
自分でK3を動かすなら
| 確認項目 | 推奨 |
|---|---|
| ウェイト下限 | MXFP4の単純計算で約1.40TB。公開後に実ファイルを確認 |
| 公式の構成推奨 | 高帯域通信を備えた64基以上のaccelerator supernode |
| 規模感 | H200の公開定価を単純適用すると約**$276/時**。K3の公式見積もりではない |
| 現時点の選択 | PoCはKimi API/OpenRouter。セルフホスト判断は7月27日以降 |
| 本番運用 | 429 retryと別モデルへのfallbackを必ず用意 |
Qwen:2.4Tプレビューだけではない
| 日付 | 公開物 | 公開レベル |
|---|---|---|
| 7月13日 | Qwen-Music・Audio-VAE | 論文のみ |
| 7月14日 | Audio 3.0 TTS Plus・Flash・Realtime | ホストAPI、ウェイトなし |
| 7月19日 | Qwen3.8 Max Preview, 2.4T | ホスト型プレビュー、ウェイトは「soon」 |
| 7月21日 | Qwen-Image 3.0 | 招待制プレビュー、ウェイトなし |
Claude Opus 5:Fableに近い性能を半額で
“It’s a thoughtful and proactive model that comes close to the frontier intelligence of Fable 5 at half the price.”
— Claude公式X
| 項目 | Opus 5 |
|---|---|
| 通常API | 入力$5 / キャッシュ読取$0.50 / 出力$25 — 100万トークン当たり |
| Fast mode | 入力$10 / 出力$50 — API限定 |
| コンテキスト / 最大出力 | 1M / 128K |
| 推論 | thinkingがデフォルト、effortはlowからmaxまで |
| Opus 4.8比 | 通常API価格は同じ。Anthropicはagentic・長時間タスクの大幅向上を主張 |
| Fable 5比 | 定価はちょうど半額。ただしFable 5が引き続き最上位 |
料金の注意: Opus 5は新しいtokenizerを使用します。Anthropicによると、 同じ文章でもSonnet 4.6以前より約30%多いトークンになる可能性があり、 同じトークン単価でも同一文書の費用は一致しません。
価格ポジショニング: Fable 5は最高性能のhalo、Opus 5は半額の エージェント主力、Sonnet 5は大量利用層を担う3段構成です。
利用量の伸び自体がグロース施策になった
“one week, usage on codex and chatgpt work is up 2.5x”
— Sam Altman
| 日付 | 発表指標 | 同時に提供したもの |
|---|---|---|
| 4月8日 | Codex 3M WAU | 即時リセット、100万人ごとの追加リセットを約束 |
| 6月2日 | Codex 5M+ WAU | この時点まではCodex単独の週間アクティブ指標 |
| 7月13日 | Codex + Work 6M active | 5時間制限の一時撤廃、週間上限リセット |
| 7月14〜16日 | 7M → 8M → 9M | 保存型リセット、即時リセット、週間上限の復元 |
| 7月22日 | 合計10M active | 有料ユーザーの上限をリセット |
指標の注意: 5MはCodex単独のWAU、10MはCodex + Workの定義されていない active usersです。同一指標の正確な2倍成長ではありません。
利用者の感想もプロモーションになった
3. プロモーション変化と各社のGTM戦略
既存の強者はモデルだけでなく上限でも競争
| 製品 | 期間・状態 | 実際の変化 |
|---|---|---|
| Claude Opus 5 | 7月24日公開 | Opus 4.8と同じ$5/$25、Fable 5定価の半額 |
| Fable 5プロモーション | 7月19日終了 | 有料プランの週間利用量の最大50%をFableで利用 |
| Fable 5現行方針 | 7月20日から | Max・Premiumは最大50%込み、Pro・Standardはusage credit |
| Claude Code | 5月13日〜8月19日 | 対象プランの週間上限を50%増加。5時間上限は同じ |
| Claude Cowork | 6月5日〜8月5日 | 5時間上限を2倍。週間上限は同じ |
| OpenAI Codex・Work | 終了日未定 | 5時間制限を一時撤廃し、ユーザーマイルストーンごとにリセット |
| Kimi API | 7月15日〜8月12日 | 1回の入金に10〜30% voucher。最大$4,000、90日間有効 |
“You can use up to 50% of your weekly usage limits on Fable 5 at no extra cost.”
— Anthropic、Max・Premium seat方針
エージェント市場のGTMは「月額はいくらか」から、**「今日の仕事を 完了できるだけの上限があるか」**へ移っています。
各社のGTMを1枚で見る
以下は各社が公式に示した戦略ではなく、公開された製品、価格、 プロモーションに基づく番組用の解釈です。
| 企業 | 今週使った仕掛け | GTM解釈 |
|---|---|---|
| OpenAI | 100万人ごとのreset、5時間制限撤廃、$100体験談クレジット | 利用 → 共有 → 次のマイルストーン → 追加利用のグロースループ |
| Anthropic | Opus 5をFableの半額で公開、Fableのプラン差、Code・Cowork上限拡大 | Fableを最高性能のhalo、Opusを主力にし、プロモーションで有料利用を拡大 |
| Moonshot | K3の低いトークン価格、前払いvoucher、ウェイト公開予告 | 先にAPI需要を作り、その後オープン生態系と推論パートナーを拡大 |
| Qwen | TTS・Audio・Image・2.4T LLMを連続プレビュー | オープンウェイトブランドをホストAPIフルスタックへの流入経路に活用 |
同時期に起きたことは確認できますが、各プロモーションがK3やQwenへの 直接的な対応だったという因果関係は公開されていません。
FableとGTM戦略:個人的なメモ
- GTM議論でFableは顧客セグメント、ポジショニング、実行計画を一つの論理で 長く維持する感覚が、個人的な利用ではOpus 4.8と異なりました。
- 公開直後のOpus 5は、同じ資料と質問で再評価する候補です。
- これは利用経験であり、GTMベンチマークではありません。
- 番組では二つのモデルに同じ会社資料を与え、次の3問だけを比較します。
- 最初に狙うべきICPは誰か?
- 最初の10社を獲得するチャネルは何か?
- 6週間以内にこの戦略を捨てる基準は何か?
番組進行表
| セクション | 時間 | 画面に表示するもの | 中心となる問い |
|---|---|---|---|
| セキュリティ事故 | 5分 | 公式資料2件と重要引用 | モデル名より、評価システムの何が失敗したのか? |
| Kimi・Qwen・Opus 5 | 14分 | K3・Opus価格表とQwenタイムライン | 性能、価格、公開性のどれが選択を左右するか? |
| 利用量競争 | 10分 | 3M→10M表とX投稿 | 成長は製品力か、上限プロモーションか? |
| Claudeの対応 | 8分 | Opus 5・Fable・Code・Cowork方針表 | モデル階層と利用上限は新しいGTM手段か? |
| Fable GTM体感 | 5分 | 同じ3つの質問 | 戦略判断力をどう比較するか? |
今回の一文: フロンティア競争はモデルスコアだけではありません。 ウェイト公開、トークン価格、エージェント利用量、上限リセットを束ねた ディストリビューションとGTMの競争になりました。