7月13日,OpenRouter发布了7月第二周(7月6日-12日)的全球AI大模型调用量数据。
几个数字足以说明一切:全球总调用量54.6万亿Token,其中中国模型贡献了27.58万亿——占比超过50%,连续十一周位居全球第一。
更扎眼的是Top 10榜单:十个席位里,中国模型占了八个,美国只剩Anthropic凭Claude Opus 4.7和4.8守住两席。OpenAI和Google,双双出局。
这不是一周的数据波动,而是一个已经持续了半年的结构性趋势。
一、一张表看懂本周全球AI调用榜
本周关键变化
- 腾讯Hy3 (free)以6.13万亿Token登顶,终结DeepSeek-V4-Flash七连冠
- 英伟达Nemotron 3 Ultra首次上榜
- 阶跃星辰Step 3.7 Flash跌出榜单
- Claude Sonnet 5上线首周进入第19位
- 全球前六名全部为中国模型
中国模型份额增长轨迹
二、Top 10的"8:2"格局意味着什么?
上周OpenRouter调用量Top 10中,中国模型占据了八个席位:
🇨🇳 前六名全部是中国模型
腾讯Hy3 (free)
小米MiMo-V2.5
智谱GLM 5.2
MiniMax M3
🇺🇸 仅存的两席
Claude Opus 4.7
Claude Opus 4.8
OpenAI和Google完全不在Top 10之列。这在一年前是不可想象的——OpenRouter曾是美国模型的主场。
在全球开发者用真金白银投票的"日常干活"市场上,中国模型已经成为默认选项。不是偶尔用用,而是主力生产。
三、Hy3登顶:腾讯的"免费核弹"
本周最大的变化是腾讯混元Hy3(free)以6.13万亿Token的周调用量登顶,一举终结了DeepSeek-V4-Flash的七连冠。
Hy3核心参数
| 项目 | 详情 |
|---|---|
| 发布日期 | 2026年7月6日(正式版) |
| 总参数 | 2950亿(295B) |
| 激活参数 | 每次推理仅210亿(21B) |
| 架构 | MoE混合专家(192路由专家 + 1共享专家,Top-8) |
| 上下文 | 256K Token |
| 开源协议 | Apache 2.0(完全可商用) |
| 免费期 | 至2026年7月21日 |
性能表现
| 基准测试 | Hy3得分 | 说明 |
|---|---|---|
| SWE-bench Verified | 78.0 | 代码能力 |
| SWE-bench Pro | 57.9 | 超越DeepSeek V4 Pro |
| WildClawBench | 前列 | 超过GLM-5.1和DeepSeek V4 Pro |
| 任务成功率(WorkBuddy内测) | 90% | 从预览版72%大幅提升 |
| 幻觉率 | 5.4% | 较预览版减半 |
行业评价:"整体能力第二梯队上沿、低成本模型第一梯队"——不是最强的,但性价比极其突出。
腾讯用"限时免费+开源Apache 2.0"的组合拳,在极短时间内完成了用户获取和生态验证。发布当天腾讯股价上涨4.82%,市场显然买账。
冷静声音:Agent从业者赵江杰指出:Hy3目前在中低难度任务上表现优秀,核心架构设计和敏感操作仍不适合无监督交付。"真正的考验,要等到免费期结束之后。"
四、英伟达入局:Nemotron 3 Ultra首次上榜
另一个值得关注的信号是英伟达Nemotron 3 Ultra首次进入OpenRouter榜单。
这不只是多了一个新模型。英伟达作为全球最大的AI芯片供应商,现在也开始直接参与模型层的竞争。当你的GPU卖给所有人,你自己也下场做模型,这个信号的含义远比一次排名更深远。
结合此前的Nemotron-TwoTower架构探索,英伟达正在从"卖铲子"向"既卖铲子又挖金矿"转型。对于依赖英伟达硬件的整个AI生态来说,这是一个需要长期关注的变量。
五、成本鸿沟:100倍价差背后的底层逻辑
为什么全球开发者在用脚投票?答案很简单:钱。
当前主流模型输出Token定价
| 模型 | 输出价格(每百万Token) | 对比 |
|---|---|---|
| DeepSeek V4 Flash | $0.28 | 最便宜 |
| 千问 Qwen 3.6 Max | $1.20 | — |
| 智谱 GLM-5.2 (MIT) | $4.40 | — |
| Claude Sonnet 5* | $10.00 | (8月31日后涨至$15) |
| GPT-5.5 | $30.00 | 最贵 |
最便宜的中国模型和最贵的美国模型之间,价差接近100倍。
2. 性能追平 — 差距缩小到6-9个月
3. 开源可自托管 — 数据主权可控
布鲁金斯学会的Kyle Chan估计,中国模型目前落后美国顶级模型"6到9个月",但运行成本只是"一小部分"。
在Agent工作负载下,这种成本差距会被进一步放大——一个Agent任务可能调用模型50到200次,每次调用的价差都会累积。Vercel的Harpreet Arora说得很直白:
"当任务不需要最好的模型时,团队开始把它路由给最便宜的够用模型——而最近这波中国模型正在赢得这笔交易。"
六、中美博弈:两端同时收紧
但这个故事不只是"谁更便宜"。地缘政治正在从两端同时收紧。
这意味着什么?你的生产依赖可能被任何一方的政策切断。
Hugging Face的Yacine Jernite指出了一个结构性风险:"用户可能被迫在性能强但昂贵、价格和可达性随时变化的美国闭源模型,和想要控制成本或掌握AI栈时唯一可行的中国模型之间做选择。"
务实策略:按任务分层路由
- 高并发、低敏感度的Agent循环 → 中国模型(成本优势)
- 面向客户输出、涉及合规数据 → 美国模型(合规安全)
- 核心能力 → 自托管开源模型(数据主权)
关键提醒:不要硬绑定任何单一模型。在政策环境仍在变化时,这是最大的基础设施风险。
写在最后
54.6万亿Token,中国占一半。这不是一个短期现象,而是一个从2025年初开始、持续加速了18个月的结构性转变。
从4.5%到50%,中国大模型用了一年时间在OpenRouter上完成了从"边缘"到"主流"的跃迁。驱动力是成本、性能和开源生态的三重叠加;阻力是地缘政治和信任成本。
但开发者是务实的。当你的Agent每天调用模型200次,每次价差100倍,任何政治正确都挡不住账单。




