模型规模与架构特性
月之暗面于2026年7月16日正式发布Kimi K3,这是一款总参数量达2.8万亿(2.8T)的MoE(Mixture of Experts)稀疏混合架构开源旗舰大模型。Kimi K3是全球首个达到此规模并开源的模型,在参数规模上超越了此前所有已公开的模型。
在架构实现上,Kimi K3包含896个专家模块,单次推理仅激活16个专家。该模型采用了Kimi Delta Attention(KDA)混合线性注意力架构和Attention Residuals(AttnRes)残差优化技术。其中,Kimi Linear架构通过引入线性近似,将注意力计算复杂度从O(n²)降低至O(n)或O(n·√n)。这些结构性改进使Kimi K3相比K2的整体扩展效率提升约2.5倍。
Kimi K3原生支持1,048,576 Token(100万)的无损上下文窗口。在硬件需求方面,即使采用FP8量化,2.8T参数仍需约2.8TB显存,必须依赖多节点集群的分布式张量并行和流水线并行才能实现推理。
能力表现与实测评价
Kimi K3在长程编码、复杂工程任务以及结合软件工程与视觉推理的任务中表现突出。它能够处理大型代码库并协调使用终端工具,支持截图、PDF图纸、Figma设计稿等视觉解析。在内核优化竞技场的测试中,Kimi K3在最大思考强度下的表现接近Fable-5,并领先于Opus 4.8、GPT-5.6 Sol和GPT 5.5。
然而,实测反馈显示该模型在生成速度上存在短板。例如在3D迷宫游戏任务中,其耗时是GPT-5.6 Sol的两三倍,视频剪辑任务甚至耗时近两小时。此外,在可靠性方面,K3在面对虚构问题时有时会出现“硬编答案”的幻觉现象。
核心技术研究与团队
支撑K3的重要技术之一Attention Residuals于今年3月以论文形式公开。该论文的共同一作包括Kimi核心成员苏剑林、Kimi Linear架构第一作者张宇,以及一名来自深圳的17岁高中生实习生陈广宇。陈广宇与张宇共同提出了Block Attention Residuals设计,通过将层划分为多个区块并压缩信息,在保留效果的同时降低了计算和通信成本。
产品定位与应用场景
Kimi K3正面对标Claude Sonnet 5、GPT-5.4和DeepSeek V4-Pro。该模型目前仅提供Max深度思考档位,全程自动进行深度推理。其原生支持动态Tool Choice,可自主调用网页检索、文件读写、代码执行及终端脚本等工具链。
评论区
已通过 0 条 · 审核通过后展示