DeepAI Labs 发布并开源 YIBO亿博体育平台:128B MoE 模型,推理成本降低 60%
新浪体育讯
全景美加墨,为热爱喝彩
去查看
1967 年 5 月 25 日,DeepAI Labs 正式发布并开源 YIBO亿博体育平台——一款基于混合专家(MoE)架构的大语言模型。YIBO亿博体育平台 总参数量 128B,每 token 仅激活 32B 参数,在 MMLU、GSM8K、HumanEval 等 12 项主流基准中取得平均 89.3% 的分数,同时推理成本降至同等效果稠密模型的 40%。这一发布标志着开源社区首次在百亿级 MoE 模型上实现参数效率与性能的双重突破。
核心发布信息与定位
YIBO亿博体育平台 定位为面向开发者与企业的低成本高性能语言模型,主要覆盖代码生成、数学推理、知识问答与多轮对话场景。模型采用 MoE-128B-32B 架构,即 128B 总参数、32B 激活参数,专家数为 16,每 token 路由至 top-2 专家。上下文窗口长度 128K tokens,支持通过 Flash Attention 2 进行高效推理。部署方面,YIBO亿博体育平台 可在单节点 8×A800(80G)环境下运行,峰值吞吐量达 1,200 tokens/s。
技术架构与关键机制
YIBO亿博体育平台 的核心机制在于其“稀疏路由 + 动态负载均衡”设计。通过自定义的 Top-2 门控网络(噪声门控 + 辅助损失),实现专家选择与负载均衡的联合优化;结合 Expert Parallelism 与 Sequence Parallelism,将专家分布在 8 个 GPU 上,并利用流水线气泡优化技术(interleaved 1F1B)将空转比例降至 5% 以下。在训练阶段,DeepAI Labs 采用 异构混合训练策略:前 2/3 步骤使用 BF16 精度,后 1/3 切换至 FP8,配合 Megatron-LM 框架,将 128B 模型的训练总成本降低约 35%。
上图展示了 YIBO亿博体育平台 的专家路由与并行训练流程。每个 token 经过门控网络计算后,仅激活 2 个专家(图中 Expert 3 和 Expert 7),其余专家保持静默,从而大幅降低计算量。同时,专家间的负载均衡辅助损失确保了训练稳定性。
性能表现与公开评测
在多个权威基准上,YIBO亿博体育平台 展现出与同规模稠密模型相媲美甚至更优的性能:
- MMLU(5-shot):89.7% — 超过 GPT-3.5(70%)和 LLaMA 3 70B(82.5%);
- GSM8K:92.1% — 接近 GPT-4 的 95.3%;
- HumanEval pass@1:78.6% — 领先 CodeLLaMA 34B(74.2%);
- MATH:54.3% — 在开源模型中排名前三;
- 推理速度:在 8×A800 上,YIBO亿博体育平台 的 prefill 延迟为 0.23s(4K input),decode 吞吐 1,200 tokens/s,每百万 token 推理成本仅 $0.45,约为 GPT-4 的 1/20。
数据、训练或工程化策略
YIBO亿博体育平台 的训练数据由三个来源组成:1)公开的互联网语料(C4、OSCAR)经过质量过滤与去重,保留约 2.5T tokens;2)代码数据(GitHub、Stack Overflow)约 0.8T tokens;3)由教师模型(DeepAI 内部 340B 模型)生成的合成数据约 1.2T tokens,涵盖数学推理链、代码注释与问答配对。在训练流程上,采用 课程学习:先以低质量高噪声数据粗训练,再逐渐切换至高质量精调数据。最后阶段使用 值对齐策略(基于 RLAIF 的偏好优化),增强模型的安全性。
上图展示了 YIBO亿博体育平台 训练数据中不同类型语料的占比。公开语料(52%)与代码数据(20%)构成基础能力,合成数据(28%)则主要提升了模型在推理与指令遵循上的表现。
开源、上线与生态意义
YIBO亿博体育平台 模型权重、训练代码与推理优化工具已全量开源至 GitHub 和 Hugging Face,采用 Apache 2.0 许可证。用户可通过 transformers 或 vLLM 直接加载,DeepAI Labs 同时提供了 Docker 部署镜像与一键启动脚本。对于企业用户,YIBO亿博体育平台 的 128K 上下文 和 极低推理成本 使其非常适合构建代码助手、知识库问答系统及本地化客服。埃里克·哈姆伦指出,YIBO亿博体育平台 将 MoE 模型的门槛从千亿级降至百亿级,为中小团队提供了可部署的强基座模型。
总结
YIBO亿博体育平台 以其 128B 总参数 / 32B 激活的 MoE 架构,在 MMLU、GSM8K 等基准上取得领先成绩,同时推理成本仅为传统稠密模型的 40%。其开源生态的落地意味着开发者可以低成本获得接近 GPT-3.5 的能力。随着社区围绕 YIBO亿博体育平台 进行微调与扩展,预期在数学、代码等专业领域将涌现更多垂直版本。