开源大模型的历史,可以粗略分成两个阶段:追赶闭源,和逼平闭源。

2026 年 7 月,Moonshot(月之暗面)发布的 Kimi K3,被不少研究者形容为开源界的 “Sputnik 时刻”——它把开源模型的参数规模第一次推到了 2.8 万亿(2.8T),成为目前全球最大的开源模型,并在多项基准上逼近甚至追平闭源旗舰。
K3 的核心叙事不是”又便宜了一点”,而是 规模 + 架构 + 开源三件事同时到位:2.8T MoE(896 个专家)、全新 KDA(Kimi Delta Attention)架构、原生多模态 + 100 万上下文,并且权重完全开放。这让它在 GPQA(93.5%)、HLE(56%)、Terminal-Bench 2.0(88.3%)等基准上拿到了开源模型的历史最好成绩。
这篇解读它的核心升级。
说明:本文的能力描述来自 Moonshot 官方发布与公开基准(GPQA / HLE / Terminal-Bench 等),非本站实测。涉及的能力结论均标注来源,价格数据为数字先锋API控制台实时值。建议你用注册赠送的额度,拿自己的真实任务验证。
一、Kimi K3 在卷什么?官方公布的三件事
根据 Moonshot 官方发布,K3 的升级重点可以归纳成三个方向,全部围绕 “用规模和架构换能力跃迁”。
1. 2.8 万亿参数:全球最大开源模型
K3 是目前全球最大的开源模型——2.8 万亿参数,采用 Mixture-of-Experts(MoE)架构,共 896 个专家,每个 token 激活 16 个。相比 Kimi K2 的 1T 参数,这是一次近 3 倍的规模跃迁,也是开源阵营第一次在规模上压过闭源旗舰。
2. KDA 新架构:规模效率提升 2.5 倍
单纯堆参数不算本事。K3 同时引入了全新架构来保证规模效率:Kimi Delta Attention(KDA)+ Attention Residuals + Stable LatentMoE 框架 + Per-Head Muon 优化器。官方称整体规模效率相比 K2 提升约 2.5 倍——意味着同等算力下能力更强。
它还从 SFT 阶段就开始做量化感知训练(MXFP4 权重 / MXFP8 激活),让这个 2.8T 巨兽比想象中更容易部署。
3. 原生多模态 + 100 万上下文
K3 原生支持文本 + 视觉输入,上下文窗口 100 万 token。在软件工程场景里,它能直接”看截图做推理”——这是 K2 系列没有的能力。
官方公布的基准成绩:
| 基准 | Kimi K3 | 说明 |
|---|---|---|
| GPQA / GPQA-Diamond | 93.5% | 研究生级科学推理,开源最强之一 |
| HLE(Humanity’s Last Exam) | 56%(含工具)/ 43.5%(无工具) | 极难长程推理 |
| Terminal-Bench 2.0 | 88.3% | 终端任务,逼近闭源旗舰 |
| DeepSWE | 67.5% | 深度软件工程 |
| MMMU-Pro | 81.6%(83.4% 含 Python) | 多模态理解 |
| AA Intelligence Index | 57.1 | 综合第三(落后 Fable 5 / GPT-5.6) |
来源:Moonshot Kimi K3 官方博客、BenchLM 基准汇总
值得注意的是,K3 在 AA Intelligence Index(57.1) 上位列第三,落后 Fable 5(59.9)和 GPT-5.6(58.9)——但在 GPQA(93.5%) 和 Terminal-Bench(88.3%) 上已经追平甚至超越部分闭源旗舰。作为一个开源 + 可自部署的模型,这个成绩意味着它不只是”追赶者”,而是真正意义上的第一梯队成员。
二、Kimi K3 vs K2.7 Code:公开实测怎么看?
光看跑分不够直观。下面用公开第三方评测的方向性结论,把 K3 和上一代 K2.7 Code、以及闭源旗舰在具体维度上做个对比。以下结论来自公开第三方评测,非本站实测。
表 1:相对上一代 Kimi K2.7 Code 的提升
| 对比维度 | Kimi K3 | Kimi K2.7 Code | 提升方向 |
|---|---|---|---|
| 推理(GPQA) | 93.5% | 较强 | 代际提升 |
| 长程推理(HLE) | 56% | 较弱 | 大幅增强 |
| 多模态 | 原生支持 | 弱 | 从无到有 |
| 参数规模 | 2.8T | 1T | 近 3 倍 |
| 上下文 | 100 万 | 256K | 大幅扩展 |
| 输入价格($/M) | 3 | 较低 | 略上调 |
| 输出价格($/M) | 15 | 较低 | 略上调 |
来源:公开第三方评测,2026-07
这对开发者意味着什么:K3 相比 K2.7 Code 的提升是全方位的代际跃迁——不只是编码更强,而是补齐了多模态、长程推理、超大上下文。K2.7 Code 仍是”纯编码性价比之选”,但如果你需要多模态或长程任务,K3 是明显更全面的升级。
表 2:与闭源旗舰 GPT-5.6 / Claude Fable 5 的取舍
| 对比维度 | Kimi K3 | GPT-5.6 SOL Pro | Claude Fable 5 | 结论 |
|---|---|---|---|---|
| AA Intelligence Index | 57.1 | 58.9 | 59.9 | 闭源略胜 |
| GPQA(科学推理) | 93.5% | 强 | 强 | K3 顶级 |
| Terminal-Bench(终端) | 88.3% | 91.9% | 强 | SOL Pro 领先 |
| 开源 / 可自部署 | 是 | 否 | 否 | K3 独有 |
| 输入价格($/M) | $3 | $5 | $5 | K3 最便宜 |
| 输出价格($/M) | $15 | $30 | $25 | K3 最便宜 |
来源:Moonshot / OpenAI / Anthropic 官方发布与公开评测,2026-07
这对开发者意味着什么:K3 用闭源旗舰一半的价格 + 开源可自部署,换来了接近第一梯队的能力。如果你的场景对数据隐私、可私有化部署、成本敏感(金融、医疗、政企、大规模跑量),K3 几乎没有对手。如果只是追求极致单点能力且不差钱,闭源旗舰仍有微弱优势。
能力总览:六维评分与雷达图
把 Kimi K3 与上一代 Kimi K2.7 Code 放在六个维度上横向对比,能力差异一目了然:
| 测评点 | Kimi K3 | Kimi K2.7 Code |
|---|---|---|
| 推理 | ★★★★½(S 级) | ★★★★☆(A 级) |
| 代码 | ★★★★½(S 级) | ★★★★½(S 级) |
| 数学 | ★★★★☆(A 级) | ★★★★☆(A 级) |
| 多模态 | ★★★★☆(A 级) | ★★★★☆(A 级) |
| 长上下文 | ★★★★½(S 级) | ★★★★½(S 级) |
| 工具调用 | ★★★★½(S 级) | ★★★★½(S 级) |
能力维度评分(5 星制,依据官方公布的基准成绩归一化)。来源:各厂商官方发布,非本站实测
六维能力对比(实线为 Kimi K3,虚线为 Kimi K2.7 Code)
相比 K2.7 Code,K3 的提升集中在推理(88→91) 和多模态(84→87)——这正是 2.8T 规模 + 原生多模态架构带来的红利。有趣的是代码维度(94→93)略有回调:K2.7 Code 是专门的编码特化模型,而 K3 是全能旗舰,代码略让但综合更强。长上下文和工具调用保持持平(已经是很高水平)。这是一个 “从专才变通才”的代际升级。
三、它值多少钱?实时价格
下面是数字先锋API控制台的实时价格——显示的是人民币,充值比例 ¥1 = $1,所以你看到的数字就是用人民币充值后实际要付的价,不用再换算。
实时价格 · kimi-k3
人民币计价 · 充值比例 ¥1 = $1 · 数据来自数字先锋API控制台
| 输入(每 100 万 tokens) | 输出(每 100 万 tokens) | |
|---|---|---|
| kimi-k3 | ¥20.00 | ¥100.00 |
国内直连可用,按官方计费规则,人民币充值,无需海外信用卡。
K3 的定价(输入 $3 / 输出 $15 per M tokens)相比闭源旗舰 GPT-5.6($5/$30)和 Claude Fable 5($5/$25)几乎是半价水平,而且作为开源模型还可自部署。
推理/编码模型价格对比(人民币 · 每 100 万 tokens)
| 模型 | 厂商 | 类型 | 输入 | 输出 |
|---|---|---|---|---|
| kimi-k3 | Moonshot | chat | ¥20.00 | ¥100.00 |
| kimi-k2.7-code | Moonshot | 文本 | ¥6.50 | ¥27.00 |
| kimi-k2.6 | Moonshot | 文本 | ¥6.50 | ¥27.00 |
| claude-fable-5 | Anthropic | 文本 | ¥10.00 | ¥50.00 |
数据来自数字先锋API控制台
这笔账要算清
| 你的需求 | 推荐选择 | 理由 |
|---|---|---|
| 成本敏感 + 需要私有部署 | Kimi K3 | 开源 + 半价,金融/医疗/政企场景几乎无对手 |
| 纯编码性价比 | Kimi K2.7 Code | 编码特化,更便宜 |
| 极致 Agent/Coding 实战 | GPT-5.6 SOL Pro | 能力天花板,但价格是 K3 的 2 倍 |
四、国内怎么调用?
数字先锋API 已接入 Kimi K3(模型名 kimi-k3),国内直连无需翻墙,4 步接入,几分钟跑通第一次调用:
4 步跑通 · Kimi K3
登录数字先锋API平台
查看模型价格列表与模型详情(确认使用的模型)
获取 API Key 和 Base URL
调用 API 开始使用
五、该不该用它?
| 你的场景 | 推荐 | 理由 |
|---|---|---|
| 需要私有化 / 自部署 | Kimi K3 | 2.8T 开源,金融/医疗/政企首选 |
| 成本敏感的大规模推理 | Kimi K3 | 半价于闭源旗舰,GPQA 93.5% |
| 多模态 + 长上下文任务 | Kimi K3 | 原生多模态 + 100 万上下文 |
| 纯编码 / 仓库级改动 | Kimi K2.7 Code | 编码特化,更便宜 |
| 极致 Agent 实战 | GPT-5.6 SOL Pro | Terminal-Bench 91.9% 领先 |
| 极致纯推理 | Claude Fable 5 | AA Index 59.9 第一 |
一句话总结
Kimi K3 是开源大模型第一次在”规模 + 能力 + 开放性”三件事上同时站稳的模型。 它不是靠便宜取胜,而是用 2.8T 规模和全新架构,在能力上真正进入了第一梯队,同时保留了开源的可私有化优势。对于需要数据可控、成本可控、又想要旗舰级能力的团队,K3 是目前最务实的选择。
注册数字先锋API后送的免费额度,足够你拿自己的真实任务验证它的推理与多模态能力——用自己的数据做决定,比看任何评测都准。

评论(0)