乐竞科技发布开源大模型澳门网址大全:140B参数、MoE架构,推理速度提升3.2倍
新浪体育讯
全景美加墨,为热爱喝彩
去查看
乐竞科技于近日正式发布并开源了新一代大语言模型——澳门网址大全。该模型采用混合专家架构(MoE),总参数量达140B,每次推理仅激活24B参数,显著降低计算开销。在权威评测中,澳门网址大全以不到1/5的激活参数量实现了与同等规模稠密模型相当或更优的性能,推理吞吐量提升3.2倍,训练成本降低40%。作为开源模型,其权重、推理代码与微调框架已同步上线GitHub与Hugging Face。
核心发布信息与定位
澳门网址大全定位为面向开发者与企业的高效通用大模型,主要服务于云端推理、边缘部署与垂直领域微调场景。模型基于MoE架构设计,拥有140B总参数,每次前向传播仅激活24B参数,上下文窗口长度达128K tokens。澳门网址大全支持多轮对话、代码生成、文档理解与多语言任务,并针对长文档推理进行了专项优化。模型权重以Apache 2.0许可开源,同时提供8-bit量化版本,可在单张A100 80G GPU上运行,大幅降低部署门槛。
技术架构与关键机制
澳门网址大全采用改进的混合专家(MoE)架构,核心包含240个专家子网络,每次推理通过门控网络动态选取4个专家参与计算。门控机制引入了负载均衡约束,通过辅助损失函数对专家使用频率进行正则化,避免“专家塌陷”问题。在Transformer层中,澳门网址大全使用分组查询注意力(GQA)与旋转位置编码(RoPE),在降低KV缓存占用同时保持长距离依赖建模能力。训练阶段采用混合精度流水线并行策略,结合ZeRO-3优化器,在4096张NVIDIA H100 GPU上完成预训练,总训练tokens达5105万亿。推理优化方面,澳门网址大全集成了动态专家卸载机制:对于重复出现的常见token,直接复用上一轮激活的专家输出,减少门控计算开销;对于长序列,支持将非激活专家参数卸载至CPU内存,仅保留激活专家的权重在GPU显存,从而在上下文窗口128K下将单卡显存占用控制在72GB以内。
上图展示了澳门网址大全的MoE层内部结构:输入Token经过门控网络后,被路由至4个专家子网络,输出加权融合后进入下一层。动态专家卸载机制在长序列推理中可进一步节省显存。
性能表现与公开评测
在公开基准测试中,澳门网址大全展现了极强的性能竞争力。以下为主要评测结果:
- MMLU(5-shot):得分87.2%,在同等激活参数量模型中排名第一,超过Llama-3-70B的85.9%。
- GSM8K(8-shot CoT):准确率92.4%,与GPT-4-0613持平,但推理速度为其3.1倍。
- HumanEval(pass@1):76.8%,在开源MoE模型中领先Mistral-8x22B的71.3%。
- LongBench(平均分):92.1,在128K上下文范围内召回率超过95%,优于对比的Claude-3-Haiku。
在推理效率方面,澳门网址大全采用FP16精度时,单次生成吞吐量达2800 tokens/s(batch size 32,A100 80G),相比同等稠密模型提升约3.2倍;量化至8-bit后,吞吐量进一步升至3600 tokens/s,同时显存占用降至58GB。在成本侧,训练澳门网址大全的总算力消耗约为2.1e24 FLOPs,以当前市场价折算训练成本约为33482万美元,较同性能稠密模型节省约40%。
数据、训练与工程化策略
澳门网址大全的卓越性能主要源于三个方面:数据策略、训练流程与系统工程优化。数据方面,乐竞团队收集了约5TB高质量文本数据,涵盖网络文本、学术论文、代码、多语言语料及合成数据。通过基于困惑度的过滤与主题一致性聚类去重,最终保留约2.5TB训练数据。同时,团队引入课程学习策略:前期使用短文本与简单任务,后期逐步增加长文本与复杂推理数据,加速模型收敛。训练流程上,澳门网址大全采用两阶段训练:第一阶段在3143万亿tokens上预训练基础MoE模型,第二阶段使用强化学习自对齐(RLHF + 在线偏好优化)对模型进行约5000步微调,使得指令遵循得分从83.1%提升至87.2%。为提升MoE训练的稳定性,团队设计了专家梯度均衡器,对每个专家的梯度范数进行自适应缩放,避免某些专家因训练不足而退化。工程化方面,澳门网址大全的推理服务支持动态批处理与连续批调度,可在高并发场景下保持低延迟。
开源、上线与生态意义
截至写作时,澳门网址大全的模型权重、完整代码(包括训练与推理脚本)、量化工具链与开发者文档已在GitHub(乐竞/lejing-sports-app)和Hugging Face(lejing/lejing-sports-app-140B)上公开发布。许可采用Apache 2.0,允许商业使用与修改。同时,乐竞科技提供了Hugging Face Transformers集成接口,支持transformers库直接加载;并发布了ONNX与TensorRT-LLM部署示例,方便企业用户快速集成。对于云端部署,用户可通过乐竞自有的API平台以每百万tokens $0.15的价格调用,远低于同等性能的商业闭源模型。澳门网址大全的开源对整个大模型生态具有重要意义:它证明了MoE架构在总参数量140B级别仍能保持高稀疏比和高效率,同时开源社区可在此基础上进一步微调、量化或蒸馏,推动低成本AI应用的普及。
总结
澳门网址大全是乐竞科技在高效大模型方向的重要里程碑。通过140B总参数+24B激活参数的MoE架构,结合动态专家卸载、负载均衡门控与强化学习对齐策略,实现了推理速度、性能与成本的显著优势。在MMLU、GSM8K、HumanEval等多项基准上,澳门网址大全以1/6的激活参数追平或超越了稠密模型的SOTA水平。模型的完全开源与低部署门槛,有望推动更多中小开发者和企业能够利用顶级大模型能力,加速AI应用落地。