Kimi K3模型性能与市场影响
月之暗面正式发布了新一代旗舰大模型Kimi K3。该模型是一款原生多模态MoE智能体模型,总参数量达到2.8万亿。在Arena盲测榜单中,Kimi K3以1679分的成绩位列全球第一,并在七个前端细分领域中获得六个第一。此外,在FrontierSWE编程基准测试中,其得分率为81.2%,前端代码能力位列全球第一。
Kimi K3在技术架构上采用了升级版Stable LatentMoE混合专家架构,内置896个垂直细分专家模块,但单次推理仅激活16个专家,激活比例低于2%。同时,该模型采用了自研的KDA混合线性注意力机制和注意力残差技术,使其能够稳定支撑100万token的上下文窗口。官方数据显示,K3的算力缩放效率较前代提升了2.5倍。
硬件部署与算力表现
在硬件部署方面,Kimi K3由于模型权重超过1.5 TB,对显存需求极高。由于单张NVIDIA B200显存为192 GB,8卡服务器总容量约1.5 TB,难以完整放下模型权重并留出KV Cache空间,因此部署Kimi K3需要使用两台服务器共16张B200 GPU。
相比之下,Wafer AI在配备8张AMD MI355X的单台服务器上完成了Kimi K3的部署,因为单张MI355X拥有288 GB显存,8卡合计约2.3 TB。测试结果显示,在输入1024 Token、输出400 Token的情况下,MI355X的单用户生成速度为118 Token/s,总吞吐量为952 Token/s。而16张B200的双节点部署总吞吐量为498 Token/s,单用户生成速度为90 Token/s。计算显示,MI355X的单节点吞吐量约为B200双节点部署平均单节点吞吐量的3.8倍。
全球竞争与行业应对
面对Kimi K3和DeepSeek V4 Flash等中国新一代模型的竞争,全球主要AI企业采取了降低价格并提升入门级模型能力的策略。
- OpenAI:将基础前沿模型ChatGPT 5.6 Luna的价格降低了80%(按每百万Token计算),中端模型5.6 Terra的价格下调了20%。但其最强大的旗舰模型价格并未降低,且更快版本的价格反而上涨。
- 谷歌:推出了价格更低的Gemini 3.6 Flash和3.5 Flash-Lite模型。
- Anthropic:将价格最低的Opus 4.8模型替换为能力更强的Claude 5.0,并维持原价。
分析认为,美国企业倾向于投入巨额资金推动前沿技术,而中国开发者则依托制造业和工程能力,打造出成本更低、规模更精简且高端能力相近的模型。
评论区
已通过 0 条 · 审核通过后展示