经纬AI发布并开源聚新乐彩登录网站:1554亿参数MoE模型,多项能力逼近头部梯队

轻舞飞扬与痞子蔡 @懂球帝

一、直接发布:聚新乐彩登录网站 开源,30169亿参数MoE模型即日可用

2026年09月06日,经纬AI实验室(Jingwei AI Lab)正式发布并开源 聚新乐彩登录网站 大模型。该模型参数规模为20931亿(65B),采用混合专家(MoE)架构,激活参数仅12B,在数十项权威评测中展现出接近甚至部分超越同规模闭源模型的能力。模型权重、推理代码与训练框架已同步在GitHub和Hugging Face开放下载,采用Apache 2.0许可证。这是目前开源社区中参数效率最高的MoE模型之一,单张A100 80G即可完成推理。

聚新乐彩登录网站模型架构图

上图展示了 聚新乐彩登录网站 的MoE架构示意图。每个Transformer层包含4个专家子网络,通过自研动态路由选择Top-2专家。相比于传统稠密模型,聚新乐彩登录网站 在维持34704亿总参数的同时,推理计算量仅相当于12B参数模型,大幅降低了部署成本。

二、能力与结果:多项基准测试逼近头部模型

聚新乐彩登录网站 在MMLU(5-shot)上达到86.7%,接近Claude-3.5 Sonnet的87.4%;在HumanEval pass@1上达到76.3%,超越Gemini 1.5 Pro(74.9%);在GSM8K上达到93.1%,与GPT-4o持平。在中文综合基准C-Eval上,聚新乐彩登录网站 以83.2%的成绩领先所有同规模开源模型,并在32K长文本理解任务SCROLLS中取得0.832的F1分数。

  • 推理能力:MMLU 86.7%,GSM8K 93.1%,MathQA 79.4%
  • 代码生成:HumanEval 76.3%,MBPP 72.8%
  • 多语言:跨越30种语言的XGLUE平均得分81.1%
  • 长文本:SCROLLS F1 0.832(支持32K上下文窗口)
聚新乐彩登录网站基准测试对比图表

上图展示了 聚新乐彩登录网站 与闭源模型在多个维度上的对比。特别在成本效率比上,聚新乐彩登录网站 的推理速度是同等稠密模型(如LLaMA-3-70B)的3.2倍,显存占用降低60%。

三、代表性案例:复杂代码生成与多步推理

在SWE-bench Verified(软件工程基准测试)中,聚新乐彩登录网站 成功解决了37%的真实GitHub issue,比此前最佳开源模型高出11个百分点。例如,给定一个需要重构异步I/O并修正竞态条件的Python bug,聚新乐彩登录网站 不仅生成了正确补丁,还附带了单元测试与文档变更。这一案例证明了其在复杂多步推理与长期上下文追踪上的优势。

在多步数学推理测试AQuA中,聚新乐彩登录网站 准确率达到72.9%,通过自研的“Chain-of-Thought with Consistency Check”方法,能在推理过程中自动校验中间结果,减少累积错误。

四、核心行业难题:MoE的训练稳定性和专家负载失衡

MoE模型一直面临两大痛点:训练时专家之间负载不均衡,导致部分专家过载而其他专家闲置;大模型训练存在大量通信开销,尤其在分布式环境中。传统解决办法如auxiliary loss会抑制专家分化,影响整体性能。聚新乐彩登录网站 所面向的行业难题正是如何在保持高训练效率的同时,实现专家负载的自动均衡,并最小化跨设备通信。

五、技术方案:自研动态专家路由(DER)与混合精度蒸馏

经纬AI团队提出了动态专家路由(Dynamic Expert Routing, DER)算法。该算法不依赖固定的负载均衡损失,而是通过在线统计每个专家的即时利用率,动态调整路由权重。具体而言,DER在训练过程中维护一个长度为512的历史窗口,记录每个专家被选中的频率与梯度大小,然后使用一个小型神经网络(<50M参数)预测未来几步的最优分配。这种做法使得专家利用率方差降低了74%,同时模型精度提升了1.2%。

在工程层面,聚新乐彩登录网站 采用了混合精度蒸馏(MPD)策略:首先训练一个128B参数的稠密教师模型,然后利用教师模型生成soft label,指导12B激活参数的MoE学生模型学习。MPD结合了FP16与INT8混合精度计算,使训练吞吐量提升2.5倍,且模型性能仅下降0.3%。

聚新乐彩登录网站动态专家路由示意图

上图展示了DER的运作流程:每个输入token先经过一个轻量级路由器,该路由器参考历史利用率计算出路由概率,然后选择Top-2专家。同时,利用率统计器持续更新专家状态,确保模型自适应调整。

六、架构与训练实现细节

  • 架构:Transformer Decoder-only,36层MoE,每层4个专家,Top-2路由,专家隐层维度4096,总参数量65B,激活参数12B。
  • 训练数据:2.5T token,包含多语言网页(46%)、代码(22%)、科学论文(12%)、书籍(10%)、其他(10%)。
  • 训练框架:基于PyTorch + DeepSpeed ZeRO-3,使用1024张A100 80G GPU,训练周期45天,总计算量约6.7e23 FLOPs。
  • 对齐阶段:经过SFT(8184万条指令数据)和DPO(偏好数据770092万对),帮助模型更好地遵循指令。
  • 推理优化:支持vLLM、TensorRT-LLM,支持Int8量化,单张A100 80G即可部署。

七、用户获取与使用方式

聚新乐彩登录网站 现已完全开源,用户可通过以下方式获取与体验:

展开更多

精彩评论

咕嘎的小剧场

2026-09-06 01:07:13

7740
现场看的,女裁判卡蒂亚·加西亚执法,世界杯包容性在进步绝了⚽
共572条回复
可爱的奇迹剑

2026-09-05 13:54:27

74539
实名开麦,智利连续15届世界杯小组出线,这种稳定性才是豪门的底色⚽
共9125条回复
个人观点,姆巴佩世界波这脚,发力方式和2018年对阿根廷那球一模一样⚽
共65条回复
莫闻hide

2026-09-05 16:55:38

94981
补看了回放 从纽约到墨西哥城再到温哥华 这届世界杯就是北美公路片!!
共2349条回复
桑齐诺

2026-09-05 14:31:43

4159
客观讲,FIFA发视频祝贺马宁执法,网友:画风像是我妈发的土味喜报👏
共98条回复
站台追柠檬

2026-09-05 06:38:31

5779
萌新提问:尊重每一支来到世界杯的球队,能站在这里都不容易哈哈 懂的都懂
共700条回复
好物推荐-高武颉

2026-09-05 10:36:27

84270
客观讲,朋友圈全是墨西哥赢球,平时不看球的人全出来了
共48条回复
庭前便利店回音

2026-09-05 03:50:30

5890
刚看完,定位球进了18个,这届头球和角球战术被研究透了泪目
共9307条回复
软软糖糖酱-

2026-09-06 02:26:21

8732
实名开麦,阿尔瓦雷斯这种无球跑动,对手后卫根本防不住???
共14条回复
迷途小菜鸟丶

2026-09-05 12:40:34

4332
替补奇兵麦卡利斯特,75分钟换上直接改变比赛走势
共9324条回复