Kimi K3开源彻底了!权重、技术报告和训练Infra应开尽开
月之暗面开源了Kimi K3模型,包含权重、技术报告和训练基础设施。K3拥有2.8万亿参数,支持原生视觉理解和100万token上下文,在多项评测中表现接近顶尖闭源模型,但成本显著更低。
月之暗面开源了Kimi K3模型,包含权重、技术报告和训练基础设施。K3拥有2.8万亿参数,支持原生视觉理解和100万token上下文,在多项评测中表现接近顶尖闭源模型,但成本显著更低。
SynthePulse Insight · AI 深度解读
版本 2 · 3 个来源
月之暗面开源 2.8 万亿参数模型 Kimi K3,基准测试接近前沿,但独立测试揭示网络与数学能力差距,引发对蒸馏技术的讨论。
2026 年 7 月 27 日,月之暗面(Moonshot AI)正式开源 Kimi K3 模型权重和技术报告,同时开源了高性能注意力内核 FlashKDA、MoE 通信库 MoonEP 和 AI Agent 规模化运行工具 AgentENV。Kimi K3 是一个 2.8 万亿参数的 MoE 模型,采用 KDA 混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术,原生支持视觉理解,上下文窗口达 100 万 token。
月之暗面声称新架构每单位算力智能提升 2.5 倍。训练效率的提升得益于架构改进:注意力机制中 KDA 与 Gated MLA 按 3:1 比例混合,层间使用 Attention Residuals 替代传统残差连接;专家路由采用 Stable LatentMoE 和 Quantile Balancing 以平衡负载。后训练阶段通过 Multi-Teacher On-Policy Distillation 将 9 个专家模型的能力融合进统一模型。
在流行基准测试中,Kimi K3 得分接近 Claude Fable 5 和 GPT-5.6 Sol。在 Artificial Analysis Intelligence Index v4.1 榜单上,K3 从 580 个模型中排名第四,得分 57.1;在 WebDev Arena 上排名第一,Elo 分数 1678,超过 Claude Fable 5 的 1634 分;在 Vals AI 的 GDP 加权行业基准套件上排名第二,得分 74.7%。
成本方面,Kimi K3 在 BrowseComp 上每任务仅花费 2.03 美元,是 GPT-5.6 Sol 价格的一半;在 GDPval-AA v2 测试上,成本比 GPT-5.6 Sol 低 13%,不到 Claude Fable 5 的 40%。月之暗面表示,开放权重模型能降低智能获取门槛,推动创新。
英国网络研究所的独立测试发现,Kimi K3 的网络能力远落后于前沿模型,数学能力同样存在差距。这一结果与基准测试中的优异表现形成对比,暗示模型可能在某些评测中过度优化。
性能差距模式引发了对蒸馏技术的猜测。中国模型常面临此类指控,但美国开源支持者日益视蒸馏为合法技术。目前尚无直接证据证明 Kimi K3 使用了蒸馏,但独立测试的短板为这一推断提供了间接支持。
月之暗面开源的三项关键技术各有侧重:MoonEP 管理专家并行通信,通过冗余专家位置平衡负载;FlashKDA 实现 KDA 注意力高性能算子,在 H20 上 prefill 速度提升 1.72 到 2.22 倍;AgentENV 基于 Firecracker microVM 提供大规模沙箱环境,训练和评估期间共创建 51219741 个沙箱。
这些基础设施的开源有助于降低社区复现和部署门槛,但独立测试的短板表明,仅靠基础设施开源不足以解决模型核心能力的不足。
本文基于月之暗面官方发布信息、第三方基准测试报告及独立测试结果。基准测试数据来自 Artificial Analysis、WebDev Arena 等平台,独立测试由英国网络研究所进行,但具体测试方法和详细数据未在来源中提供。蒸馏推断基于性能差距模式,非直接证据。
Kimi K3 在基准测试和成本上展现出竞争力,但独立测试揭示的网络与数学能力短板,以及可能的蒸馏依赖,凸显了中国大模型在追赶前沿过程中的性能与可信度挑战。
主报道
主报道来源
另有 2 个来源报道