📌 前言
2026年,开源大模型领域迎来了爆发式增长。从阿里Qwen3.6、Google Gemma 4、Meta Llama 4,到DeepSeek V4 Pro、Z.AI GLM-5.1、Moonshot Kimi K2.6——中国模型更是占据了榜单的半壁江山。今天,我们基于多个权威评测数据集(LMSYS Chatbot Arena、Artificial Analysis Intelligence Index、BenchLM.ai、HuggingFace Open LLM Leaderboard等),对这些顶级开源/开放权重大模型进行全面横评。
评测时间:2026年5月 | 数据来源:BenchLM.ai、Artificial Analysis、Vellum、Onyx、LMSYS Chatbot Arena、HuggingFace Open LLM Leaderboard
🏆 综合排行榜:顶级开源模型一览
| 排名 | 模型 | 开发方 | BenchLM评分 | 参数规模 | 授权方式 |
|---|---|---|---|---|---|
| 1 | DeepSeek-V4-Pro-Max | DeepSeek | 87 | MoE(最大开源) | 开放权重 |
| 2 | Kimi K2.6 | Moonshot AI | 84 | 1.1T MoE | 开放权重 |
| 3 | GLM-5.1 | Z.AI(智谱) | 83 | 744B | 开放权重 |
| 4 | GLM-5-Reasoning | Z.AI | 81 | — | 开放权重 |
| 5 | Qwen3.5-397B-Reasoning | 阿里巴巴 | 79 | 397B | Apache 2.0 |
| 6 | Llama 4 Maverick | Meta | — | 大参数MoE | Llama社区许可 |
| 7 | Gemma 4 31B | Google DeepMind | — | 31B Dense | Apache 2.0 |
| 8 | Qwen3.6-35B-A3B | 阿里巴巴 | — | 480B MoE(35B活跃) | Apache 2.0 |
📊 点击查看详细评测维度分析
从上表可以看出,当前开源/开放权重模型的整体能力已达到87分(BenchLM),而闭源前沿模型(如GPT-5.4、Claude Opus 4.7)得分约93分——差距仅6分,开源模型正在快速缩小与闭源的鸿沟。
🧠 维度一:推理能力对比(GPQA Diamond / MMLU Pro)
推理能力是大模型的核心竞争力之一。我们选取了GPQA Diamond(专家级问答)和MMLU Pro(多维评估)两个关键数据集进行测试:
| 模型 | MMLU Pro | GPQA Diamond | 代码能力 |
|---|---|---|---|
| DeepSeek-V4-Pro-Max | 52.1 | 51.6 | SWE-Bench: 优秀 |
| Kimi K2.6 | 53.8 | — | SWE-Bench Pro: >GPT-5.4 |
| GLM-5.1 | 54.9 | — | Coding: >Claude Opus 4.6 |
| Qwen3.5-397B | — | — | 编程强项 |
| Llama 4 Maverick | — | — | 综合均衡 |
| Gemma 4 31B | — | — | 中等规模优秀 |
亮点:Kimi K2.6成为首个在SWE-Bench Pro上超越GPT-5.4的开源模型;GLM-5.1则在编码基准中超越了Claude Opus 4.6。
💰 维度二:性价比与API定价
对于开发者来说,模型的性价比至关重要。以下是各模型在API服务中的价格对比:
| 模型 | 输入价格($/M) | 输出价格($/M) | 速度 |
|---|---|---|---|
| DeepSeek-V4-Flash | $0.14 | $0.28 | 189 tok/s |
| Kimi K2.6 | — | — | 约V4-Pro的2倍速 |
| GLM-5.1 | $1.40 | $4.40 | 242 tok/s |
| GPT-oss-120B | $0.15 | $0.60 | 260 tok/s |
| GPT-oss-20B | $0.08 | $0.35 | 564 tok/s |
| Qwen3.6-35B-A3B | 本地运行 | 免费(自部署) | 约20tok/s(Mac M4) |
结论:DeepSeek-V4-Flash以$0.14/M的输入价格成为当前最便宜的旗舰级API,性价比极高。而Qwen3.6-35B-A3B在MacBook Pro上本地运行即可获得超越Claude Opus 4.7的SVG生成能力(Simon Willison实测)。
🛠️ 维度三:本地部署可行性
点击展开各模型硬件需求详情
| 模型 | 量化后大小 | 最低RAM/VRAM | 推荐硬件 |
|---|---|---|---|
| Gemma 4 31B (Q4) | ~20 GB | 24 GB GPU / 32 GB Mac | M系列Mac / RTX 3090 |
| Qwen3.6-35B-A3B | ~21 GB | 20.9 GB | MacBook Pro (M4) |
| GLM-5.1 (744B) | 需要8×A100 | 约800GB+ | 多GPU服务器 |
| Kimi K2.6 (1.1T) | 需要8×A100 | 约1TB+ | 高端集群 |
| DeepSeek V4 Pro | MoE稀疏激活 | 按需分配 | 支持vLLM/tensor parallel |
| Llama 4 Scout | 较小MoE | 约512 GB | 多GPU |
结论:对于个人开发者,Gemma 4 31B和Qwen3.6-35B-A3B是最友好的本地部署选择——单张24GB显卡即可运行。而千亿参数级别的模型则需要多卡服务器支持。
🎯 各场景推荐
- 编程开发:Kimi K2.6(SWE-Bench Pro第一)、GLM-5.1、DeepSeek V4-Pro
- 长文本处理:DeepSeek V4 Pro(1M上下文窗口)、Llama 4(10M上下文)
- 本地部署:Qwen3.6-35B-A3B、Gemma 4 31B(Apache 2.0最友好)
- 性价比API:DeepSeek V4-Flash($0.14/M输入)、Step 3.5 Flash($0.10/M,中国模型)
- 多语言/中文能力:Kimi K2.6、GLM-5.1、Qwen3.6(阿里出品,中文优化)
- 开源许可最干净:GLM-5.1、Gemma 4 (Apache 2.0)、Qwen3.x (Apache 2.0)
🇨🇳 中国模型的崛起
本次评测中,中国模型表现尤为亮眼:
- Kimi K2.6(Moonshot AI):综合排名第2,SWE-Bench Pro首超GPT-5.4
- GLM-5.1(智谱AI/Z.AI):排名第3,编码能力超越Claude Opus 4.6
- DeepSeek V4 Pro:排名第1开源模型,最大开源权重744B+
- Qwen3.6(阿里):Apache 2.0授权,本地部署首选
- Step 3.5 Flash(阶跃星辰):最便宜中国旗舰$0.10/M输入
目前Open AI排名前列的前8个模型中,有6个来自中国团队!中国已成为全球开源大模型创新的最重要引擎。