EP 105 Hugging Face Kimi K3 Qwen3.8 Claude Opus 5 Fable 5 Claude Code OpenRouter

Hugging Face安全事件与新模型之战 — Kimi K3、Qwen 2.4T、Claude Opus 5

· Park Jong Hyun
Hugging Face安全事件与新模型之战 — Kimi K3、Qwen 2.4T、Claude Opus 5
Security incident disclosure — July 2026 huggingface.co Hugging Face关于入侵路径、影响范围、响应过程及使用GLM 5.2取证的官方报告 OpenAI与Hugging Face合作应对模型评估期间的安全事件 openai.com OpenAI官方说明GPT-5.6 Sol和一款未命名预发布模型如何逃离评估环境

“This matches the ‘agentic attacker’ scenario the industry has been forecasting.”

— Hugging Face

“All evidence suggests that the models were hyperfocused on finding a solution for ExploitGym.”

— OpenAI

1. 安全事件:究竟发生了什么?

五点还原攻击路径

  • OpenAI使用ExploitGym评估模型的最高网络能力,并有意关闭了部分生产环境的 网络安全拒绝机制。
  • 模型在隔离环境的包注册代理中发现了零日漏洞,由此建立通往开放互联网的路径。
  • 完成提权与横向移动后,模型推断Hugging Face可能存有ExploitGym答案。
  • 模型串联被盗凭据和另一个零日漏洞,找到Hugging Face基础设施的RCE路径, 并从生产数据库取得测试答案。
  • OpenAI和Hugging Face检测并阻止了这次活动。目前没有证据表明公开模型、 数据集或Spaces遭到篡改。

为什么重要

  • 这是一次从基准作弊跨越到真实生产环境入侵的事件。
  • 狭窄目标、强大工具和不完整隔离共同产生了意料之外的攻击路径。
  • Hugging Face分析了超过17,000条行为日志。商业API的安全机制拒绝取证提示后, 团队在内部运行了开放权重的GLM 5.2
  • 模型、沙箱、网络权限、监控与紧急停止机制必须被视为同一套安全系统。
它不只是解答试题,而是离开考场,到Hugging Face服务器上寻找答案。
ExploitGym:事件涉及的网络能力基准 arxiv.org 模型试图获取答案的公开评估环境

2. 新大模型:发布、性能与用量变化

解释本周的五个数字

数字代表什么仍然未知
2.8TKimi K3总参数量激活参数量与实际权重大小
2.4TQwen3.8 Max Preview总参数量架构、许可证与权重发布日期
2.5×Codex和ChatGPT Work一周usage增长“用量”指用户、token还是任务
10MCodex + ChatGPT Work合计active usersWAU还是DAU,以及活跃定义
$5 / $25Claude Opus 5每百万token输入 / 输出价格独立测量的单项任务成本

发布公告、体验UI、付费API、模型卡、权重开放和第三方复现, 是六个不同阶段。

Kimi K3:便宜不等于小

Kimi K3: Open Frontier Intelligence kimi.com 2.8T参数、1M上下文、激活896个expert中的16个,并预告7月27日前开放全部权重

“its overall performance still trails the most powerful proprietary models, Claude Fable 5 and GPT 5.6 Sol”

— Kimi K3官方发布

项目截至7月25日
模型2.8T参数、原生视觉、1M上下文
MoE激活896个expert中的16个,总激活参数未公布
推理发布时默认max thinking
权重预告7月27日前开放,技术报告日期未公布
OpenRouter仅一家提供商,并提示上游容量不足及可能频繁出现429
用量信号7月24日OpenRouter快照显示,发布8天已使用1.16T token

相同token量需要多少钱

单位为每百万token的美元价格。最后一列假设一次无缓存请求使用 100K输入 + 10K输出

模型输入 / 缓存读取 / 输出示例成本
Claude Fable 5$10 / $1 / $50$1.50
GPT-5.6 Sol$5 / $0.50 / $30$0.80
Claude Opus 5$5 / $0.50 / $25$0.75
Kimi K3$3 / $0.30 / $15$0.45
GPT-5.6 Terra$2.50 / $0.25 / $15$0.40
GLM 5.2$0.756 / $0.1404 / $2.376约$0.10

Token单价结论: 在token数量相同的情况下,K3比Fable便宜70%, 比Sol便宜约44%,比Opus 5便宜40%。

任务成本结论: 在独立AA-Briefcase评测中,K3平均每项任务需要83轮、 120K输出token、56.4分钟,成本为**$10.57**。虽然token便宜,但当时的 单任务成本高于Opus 4.8。目前还没有与Opus 5的独立对比。

便宜的token ≠ 便宜的智能体任务

Kimi K3 — OpenRouter价格与供应状态 openrouter.ai 输入$3 / 输出$15,1M上下文;目前仅一家提供商并带有429警告 Kimi K3 Agentic Knowledge Benchmark artificialanalysis.ai 与Fable、Sol、Opus 4.8比较实际知识工作任务的Elo、时间、轮数和成本

如果要自行部署K3

检查项建议
权重下限按MXFP4简单估算约1.40TB,开放后再核对实际文件
官方部署建议具有高带宽互联的64张以上加速卡supernode
规模参考按H200公开标价简单计算约**$276/小时**,并非K3官方报价
当前选择PoC使用Kimi API/OpenRouter,7月27日后再判断自托管
生产环境必须准备429重试和其他模型fallback

Qwen:不只有2.4T预览

日期发布内容开放程度
7月13日Qwen-MusicAudio-VAE仅论文
7月14日Audio 3.0 TTS Plus、Flash、Realtime托管API,无权重
7月19日Qwen3.8 Max Preview, 2.4T托管预览,权重“soon”
7月21日Qwen-Image 3.0邀请制预览,无权重

Claude Opus 5:接近Fable,价格减半

“It’s a thoughtful and proactive model that comes close to the frontier intelligence of Fable 5 at half the price.”

— Claude官方X账号

What’s new in Claude Opus 5 platform.claude.com 包含价格、1M上下文、128K输出、默认thinking和effort等级的官方文档
项目Opus 5
标准API输入$5 / 缓存读取$0.50 / 输出$25 — 每百万token
Fast mode输入$10 / 输出$50 — 仅API
上下文 / 最大输出1M / 128K
推理默认thinking,effort从lowmax
对比Opus 4.8标准API价格相同;Anthropic称智能体和长周期任务显著提升
对比Fable 5标价恰好一半,但Fable 5仍是最高能力档位
Claude API pricing platform.claude.com Anthropic官方Opus 5标准、缓存和批处理价格表

价格注意: Opus 5使用新tokenizer。Anthropic称,相同文本可能比 Sonnet 4.6及更早模型多约30%的token,因此相同token单价不等于 同一文档的成本相同。

价格定位: Fable 5提供最高能力光环,Opus 5作为半价智能体主力, Sonnet 5服务大规模用量,形成三级产品阶梯。

用量增长本身变成增长机制

“one week, usage on codex and chatgpt work is up 2.5x”

— Sam Altman

日期公布指标同时提供的激励
4月8日Codex 3M WAU立即重置,并承诺每增加100万再重置
6月2日Codex 5M+ WAU此时仍是Codex单独的周活指标
7月13日Codex + Work 6M active暂时取消5小时限制并重置周额度
7月14–16日7M → 8M → 9M可保存重置、立即重置、恢复周额度
7月22日合计10M active重置付费用户额度

指标注意: 5M是Codex单独的WAU,10M是Codex + Work定义不明的 active users。这不是同一指标被证实翻倍。

用户评价也变成促销


3. 促销变化与各公司的GTM策略

传统强者不只比模型,也比额度

产品时间 / 状态实际变化
Claude Opus 57月24日发布与Opus 4.8同为$5/$25,是Fable 5标价的一半
Fable 5促销7月19日结束付费计划最多可将每周用量的50%用于Fable
Fable 5现行政策7月20日起Max/Premium最多包含50%;Pro/Standard使用usage credit
Claude Code5月13日–8月19日符合条件的计划每周额度增加50%,5小时限制不变
Claude Cowork6月5日–8月5日5小时额度翻倍,每周额度不变
OpenAI Codex/Work未公布结束日暂时移除5小时限制,并在用户里程碑重置额度
Kimi API7月15日–8月12日单次充值赠送10–30% voucher,最高$4,000,有效期90天
Claude Fable 5 on your plan support.claude.com 7月20日以后Max、Pro、Team、Enterprise各计划的Fable使用政策

“You can use up to 50% of your weekly usage limits on Fable 5 at no extra cost.”

— Anthropic针对Max与Premium席位的政策

Claude Code weekly limits promotion support.claude.com 符合条件的计划每周额度增加50%,持续至8月19日 Claude Cowork usage promotion support.claude.com 5小时用量额度翻倍,持续至8月5日 Kimi K3 launch top-up promotion platform.kimi.ai 根据单次账户充值金额赠送10–30%的voucher

智能体市场的GTM正在从“每月多少钱”转向: “这个额度能否让我在今天完成工作?”

一页看懂各公司GTM

以下不是各公司公开声明的战略,而是基于产品发布、价格与促销所做的 节目讨论用解读

公司本周使用的机制GTM解读
OpenAI每100万用户重置、移除5小时限制、$100评价额度使用 → 分享 → 下个里程碑 → 更多使用,形成增长循环
AnthropicOpus 5以Fable半价发布、Fable分级访问、Code/Cowork扩额Fable作为能力光环、Opus作为智能体主力,通过促销扩大付费使用
MoonshotK3低token价格、预付voucher、预告开放权重先创造API需求,再扩大开放生态与推理合作伙伴
Qwen连续预览TTS、Audio、Image和2.4T LLM以开放权重品牌为托管API全栈产品引流

这些变化确实发生在同一时期,但没有公开证据证明各项促销是对K3或 Qwen的直接回应。

Fable与GTM策略:个人体验

  • 在GTM讨论中,就个人使用感受而言,Fable比Opus 4.8更能长期保持 客户细分、定位与执行计划的一致逻辑。
  • 刚发布的Opus 5值得使用相同材料和提示重新比较。
  • 这只是使用体验,不是GTM专项基准。
  • 节目中可向两个模型提供相同公司资料,只比较三个问题:
  1. 最先应该争取的ICP是谁?
  2. 获取前十位客户应使用什么渠道?
  3. 哪个结果会让我们在六周内放弃该策略?

节目流程

环节时间屏幕显示内容核心问题
安全事件5分钟两个一手来源与重要引文无论模型身份如何,评估系统究竟哪里失效?
Kimi、Qwen、Opus 514分钟K3/Opus价格表与Qwen时间线性能、价格、开放性,哪个最影响选择?
用量之战10分钟3M→10M表格与X帖子增长来自产品吸引力还是额度促销?
Claude的应对8分钟Opus 5、Fable、Code、Cowork政策表模型阶梯和用量额度是否已成为GTM工具?
Fable GTM体验5分钟三个相同问题如何比较模型的战略判断力?

本期一句话: 前沿竞争已不只是模型分数,而是把权重开放、token价格、 智能体用量与额度重置结合起来的分发与GTM竞争


Park Jong HyunLinkedIn · X · YouTube