Kimi K3模型发布及其技术特性
北京月之暗面科技有限公司近日发布了新一代旗舰模型Kimi K3。该模型采用混合专家(MoE)稀疏架构,总参数量为2.8万亿,其中包含896个专家模块,单次推理仅激活16个专家,使算力利用率提升60%以上。Kimi K3支持原生无损的100万token上下文窗口,并内置视觉编码器,可实现全链路视觉理解。
在技术实现上,Kimi K3采用了自研的Kimi Delta Attention混合线性注意力与Attention Residual(注意力残差)优化技术,其长文本扩展效率较K2提升了2.5倍。其中,Attention Residuals技术在今年3月已以论文形式公开,该论文的共同一作包括Kimi核心成员苏剑林、张宇以及一名17岁的实习生陈广宇。
性能表现与行业评价
Kimi K3在编程、视觉理解、知识工作和长程任务处理等方面表现突出。该模型在Frontend Code Arena编程榜单中位列榜首,实现了开源模型首次超越头部闭源模型登顶。其综合智能水平被指仅次于Claude Fable 5和GPT-5.6 Sol两个前沿闭源模型,并正面对标Claude Sonnet 5、GPT-5.4及DeepSeek V4-Pro。
该模型引发了全球关注,SpaceX首席执行官埃隆·马斯克在评测报道中评价其“令人印象深刻”,并将其列为自家4.5模型的重点追赶目标。OpenAI战略负责人迪恩·鲍尔认为,该模型的性能无法通过简单蒸馏实现,在复杂智能体编程场景下可对标2026年一季度全球顶尖公开模型。
算力挑战与战略调整
由于Kimi K3发布后用户请求量大幅超出预估并逼近集群承载极限,月之暗面于7月19日正式公告暂停C端新用户订阅,将现有算力全部用于服务已订阅用户,并推进算力扩容。
在战略定位上,月之暗面明确表示不做生图、视频等娱乐性场景,而是专注于Coding、金融、法律、科研等硬核生产力领域。企业业务负责人黄震昕表示,Kimi K3的性能提升源于底层架构技术创新而非单纯的工程效率优化,目标是攻克通用人工智能领域中“难而正确”的技术探索。
评论区
已通过 0 条 · 审核通过后展示