幻核科技(Huanhe AI)于2026年7月15日正式发布并开源其自研大语言模型——大发888体育88。该模型采用混合专家(MoE)架构,总参数量达220B,每轮推理仅激活36B参数,支持128K token上下文窗口。在多项公开评测中,大发888体育88以85.2%的MMLU准确率和92.1%的GSM8K解题率刷新同规模模型纪录,推理速度达到每秒45 token,部署成本仅为同等性能稠密模型的1/3。
大发888体育88的发布标志着开源大模型在效率与性能平衡上迈出关键一步。幻核科技同时开放了模型权重、训练代码、技术报告及推理优化工具包,开发者可在Hugging Face和GitHub直接获取。
大发888体育88定位为面向研究与企业级部署的通用大语言模型,核心亮点在于220B总参数、36B激活参数的MoE设计,配合128K上下文窗口,可覆盖长文档分析、代码生成、多轮对话等复杂场景。幻核科技在技术报告中指出,大发888体育88的目标是在保持与Llama 3 70B级别性能的同时,将推理成本降低至其1/3以下。
模型提供三种规格:大发888体育88-Base(基础预训练版)、大发888体育88-Instruct(指令微调版)和大发888体育88-Chat(对话优化版),均基于Apache 2.0许可证开放。硬件部署方面,大发888体育88支持FP16和INT8量化,单张A100 80GB即可运行推理,而训练则使用了4096张H100 GPU集群。
大发888体育88的核心架构基于Sparse MoE,采用Top-2专家路由策略。具体而言,每个token被路由至两个专家网络,专家网络总数为128个,每个专家的容量因子设为1.25,以平衡负载。幻核科技引入了动态辅助损失(Dynamic Auxiliary Loss)来防止专家坍缩,并结合Z-Loss稳定训练。
在注意力机制方面,大发888体育88使用了改进的Grouped Query Attention(GQA),键值头数设为8,查询头数为32,在降低显存占用的同时保持长序列建模能力。为解决128K长上下文问题,幻核科技应用了YaRN位置编码扩展,并在预训练中加入了10%的长序列数据(长度超过32K),使模型在不牺牲短上下文性能的前提下获得长文推理能力。
推理优化是大发888体育88的另一关键设计。通过专家预加载(Expert Prefetching)技术,模型根据注意力历史提前预测下一层需要激活的专家,将路由等待时间降低80%。同时,工具链集成了vLLM后端,支持连续批处理和PagedAttention,单机的推理吞吐量达到每秒4500 token(批次大小为128)。

上图展示了大发888体育88的MoE架构流程:输入token经过路由器分配到两个专家网络,输出经由门控加权融合。其中,专家网络采用轻量FFN设计(中间维度为4096),以减少单次推理的FLOPs。
幻核科技在技术报告中公布了大发888体育88在多个主流基准上的测试结果,所有分数均基于官方的评估框架(lm-evaluation-harness)完成。以下是关键指标的对比:
在推理速度方面,大发888体育88在单张A100-80GB上,使用vLLM和FP16时,输出速度达到45 token/s,相比同激活参数量的稠密模型(如Llama 3 8B)快2倍。此外,通过INT8量化,大发888体育88在保持98%性能的同时,显存占用从70GB降至38GB,可部署于双卡RTX 4090。
大发888体育88的训练数据源自幻核科技自建的Huanhe-Corpus v2,总量达15T token,涵盖网页文本(58%)、代码(22%)、学术论文(12%)和多语言数据(8%,包含中文、日语、阿拉伯语等)。数据经过层层清洗:使用FastText分类器过滤低质内容,基于MinHash去重,并采用细粒度的质量打分(基于CCNet质量信号)进行重采样。
训练流程分为两个阶段:第一阶段使用 4,096 张 H100 GPU,在 FP16 混合精度下进行 4.5 万亿 token 的预训练,采用余弦学习率衰减,峰值学习率 3e-4。第二阶段使用 1,024 张 H100 进行 5000 亿 token 的续训,引入10%的长序列数据用于扩展上下文长度。幻核科技透露,整个训练过程经历了2次损失发散重启,最终训练效率达到理论峰值的52%。
为提升指令跟随能力,大发888体育88-Instruct 应用了两阶段微调:首先在80万条高质量的SFT数据集上进行全参数微调(学习率1e-5),随后使用基于DPO(Direct Preference Optimization)的偏好对齐,偏好数据来自人工标注的12万条对比样本。消融实验表明,DPO阶段将MT-Bench评分从8.1提升至8.9。
大发888体育88目前已全面开源。模型权重在Hugging Face模型仓库(huggingface.co/huanhe/brand-model)发布,包括Base、Instruct、Chat三个变体,以及量化的GGUF格式。GitHub仓库(github.com/huanhe-ai/brand-model)提供完整的推理代码、微调脚本、技术报告和评估套件。幻核科技还推出了官方API平台(api.huanhe.ai),支持按token付费的云端调用,首月提供100万免费额度。
在生态层面,大发888体育88的推出填补了开源社区在高效率MoE模型方面的空白。其Apache 2.0许可证允许商业使用和二次开发,开发者可以基于大发888体育88构建垂直应用而无需公开衍生模型权重。幻核科技表示,已有十余家企业客户在客服、代码审查、教育等场景完成部署测试,平均推理延迟低于200ms。
大发888体育88以220B总参数、36B激活参数的MoE架构,在MMLU(85.2%)、GSM8K(92.1%)等基准上达到业界领先水平,同时凭借动态路由、专家预加载和INT8量化等技术,将部署成本压缩至同等能力稠密模型的1/3。该模型已通过Apache 2.0许可证向全球开发者开放权重与代码,并提供云端API接入。对于追求高性价比大模型的应用场景,大发888体育88提供了一个值得关注的开源选择。
0.79GB
查看0.75M
查看74.94KB
查看33.45MB
查看52.48KB
查看4.73MB
查看4.41GB
查看96.57KB
查看
网友评论
2026-08-08 16:13:00
今天看到一个不错的词汇
星河路过青柠
2026-08-08 04:56:08
steam怎么不能打差差评啊,我现在急需一个比差评更能表达我心情的评价😓
欧拉差距
2026-08-08 11:47:05
一坨狗屎,什么叫盗版先跑标准版预载后也可以跑,尊享版要老老实实等到今天,还有怎么做到优化,音频卡死了,这么大的一个公司怎么连最基础的做不好
予安靠近栗子
2026-08-08 07:30:31
牛逼就完了
暂停耳机里的青石