字节跳动训练超大规模AI模型
据英国《金融时报》8月7日援引知情人士报道,字节跳动正在训练一个参数量高达10万亿的AI模型。此前,《晚点LatePost》曾报道该模型规模为“超5万亿”。若达到10万亿参数,该模型规模将超越约有8万亿参数的Mythos 5;即使为5万亿,也将超过目前中国已发布的最大模型Kimi K3,并接近Anthropic的Fable 5。
另有消息称,该模型的规模将是中国已发布最大模型Kimi K3的三倍以上。具体对比数据显示,阿里Qwen 3.8-Max的参数为2.4万亿,Kimi K3为2.8万亿。
项目进展与组织调整
知情人士透露,该模型目前处于早期阶段,正在进行为期3到6个月的预训练。若进展顺利,后续将进行微调并发布,具体的模型尺寸将在后期阶段确定。该项目由Seed Foundation负责人项亮主导,并与大语言模型预训练数据负责人沈科合作。
在组织架构方面,字节跳动此前将飞书团队一分为二,产品团队并入豆包,销售线划归火山引擎。创始人张一鸣在Seed全员会上解释称,整合火山引擎、飞书和豆包的资源是为了构筑算力和数据上的优势。
技术路线与内部观点
在技术路径选择上,张一鸣明确表示反对模型蒸馏。他认为蒸馏虽然能在短期内改善表现,但本质上是在复制已有能力,无法让模型真正学会“思考”。张一鸣主张推动原创研究,而非模仿竞争对手。
此外,字节跳动CEO梁汝波在8月6日的年度全员会上坦承,豆包大模型在AI Coding方面并不突出,并举例了Anthropic的Claude Code。张一鸣对此认可编程的关键地位,但提醒编程仅是眼下热点之一,应着眼于其他领域。
行业背景与外部评价
针对此动向,社交平台X上的网友认为,若该模型能像Kimi K3那样持续进化,将迫使其他竞争者加速追赶。部分网友则指出,10万亿参数的规模在正式推出前就已改写了推理的算账逻辑。
在行业竞争格局中,月之暗面的Kimi K3 Max和阿里的Qwen 3.8 Max等中国模型已占据全球前十近半席位,而字节的Seed 2.1 Pro目前排在第21位。
评论区
已通过 0 条 · 审核通过后展示