模型规格与性能表现

8月28日,腾讯官方发布并开源了新一代大语言模型Hy4 preview。该模型在模型尺寸、上下文长度及数据规模上进行了显著扩展,总参数为770B,激活参数为49B,上下文长度突破1M。官方表示,预训练和后训练的共同进步提升了其智能水平,使其稳居开源模型第一梯队。

在性能评测方面,腾讯组织了163名内部专家针对203个工程任务进行了盲测。结果显示,Hy4 preview的均分为2.99/4.00,略优于GLM-5.3(均分2.92/4.00)和Kimi K3(均分2.94/4.00)。

生产力场景应用

Hy4 preview定位为“为生产力而生”的模型,通过与腾讯内部软件工程、游戏、金融、安全等领域专家的高质量数据共建,以及与WorkBuddy等产品的深度协同,在多个真实生产力任务中取得进步:

  • 软件工程:增强了长程开发任务的理解、规划、调试与验证能力,并提升了前端开发的视觉审美和交互质量
  • 办公分析:提升了复杂办公环境理解和金融分析能力,优化了数据分析与跨文件协作,可完成从信息处理到文档、表格与演示文稿交付的完整流程
  • 游戏开发:增强了根据一句需求直接生成可玩原型的能力,并能熟练使用游戏引擎,支持开发者通过多轮交互完善复杂项目
  • 科学研究:提升了复杂科研问题的理解、推理与求解能力,在AI研发、分子动力学模拟、凝聚态物理、基础数学等场景中有所进步

此外,配合Hyra,Hy4 preview在三维Blaschke–Lebesgue问题上将体积下界从0.380799推进至0.41104,使该猜想距离最终证明仅剩2%的Gap。

研发突破与部署情况

在研发过程中,Hy4 preview首次参与了训练方法、数据策略、评估体系和底层算子的自动优化,形成了初步的递归自我改进闭环。通过自主分析推理系统瓶颈并开展算子融合与通信优化,其端到端吞吐相较基线提升了31.8%。

目前,Hy4 preview已在腾讯云TokenHub和OpenRouter上线,并可在WorkBuddy/CodeBuddy(国内版及国际版)、元宝、ima等产品上体验。定价方面,输入为6元/百万tokens,输出为18元/百万tokens,缓存命中为0.3元/百万tokens。WorkBuddy/CodeBuddy将开展为期2周的限时免费活动以收集用户反馈。

官方声明,Hy4 preview是Hy4迭代的早期版本,在复杂任务的长思考和过度自我验证倾向等方面仍有已知问题,将持续迭代。