模型规模与架构特性
2026年7月16日,月之暗面正式发布旗舰模型Kimi K3。该模型总参数量达到2.8万亿(2.8T),是全球首个达到此规模并开源的模型。在架构上,Kimi K3采用了混合专家(MoE)稀疏架构,包含896个专家,单次推理仅激活16个专家。
为了优化信息在长序列和深层模型中的流动,Kimi K3引入了Kimi Delta Attention(KDA)混合线性注意力架构和Attention Residuals(AttnRes)残差优化。其中,Kimi Linear架构通过引入线性近似,将注意力计算复杂度从O(n²)降低至O(n)或O(n·√n)。官方数据显示,这些结构性改进使Kimi K3的整体扩展效率相比K2提升了约2.5倍。
核心能力与应用表现
Kimi K3原生支持1,048,576 Token的上下文窗口,并具备文本、图像和视频的输入模态能力。在实际应用中,该模型展现出较强的长程编码能力,能够处理大型代码库并协调使用终端工具。在内核优化竞技场的测试中,Kimi K3在最大思考强度下的表现接近Fable-5,并领先于Opus 4.8、GPT-5.6 Sol和GPT 5.5。
此外,Kimi K3在软件工程与视觉推理结合的任务中表现突出,可利用截图和视觉反馈优化前端、CAD及游戏开发等场景。在实测中,它还能够从零构建类Triton编译器MiniTriton,且在部分工作负载的Roofline基准测试中性能优于Triton。
技术挑战与用户评价
尽管参数规模巨大,但Kimi K3在工程实现上面临显著挑战。由于2.8T参数在FP8量化下仍需约2.8TB显存,推理必须依赖多节点集群的分布式张量并行和流水线并行。同时,896个专家的稀疏性增加了All-to-All通信的复杂程度,且超大规模训练在稳定性方面要求极高。
在用户体验方面,评价呈现分化。一方面,其在编程和3D视觉等任务上表现抢眼,被认为打破了开源模型落后于闭源旗舰的惯性。另一方面,生成速度被指为主要短板,在某些任务中的耗时远超GPT-5.6 Sol。此外,部分用户反馈模型存在幻觉问题,在面对虚构问题时可能会编造答案。
发布计划与后续安排
目前,Kimi K3的推理模式始终开启max深度思考档位。关于开源进度,官方已宣布K3为开放模型,并承诺在2026年7月27日前发布完整权重及技术报告。
评论区
已通过 0 条 · 审核通过后展示