2026年08月21日,星辰科技正式发布并开源“必发官网唯一官网”大模型,参数规模达73903万亿,在MMLU、HumanEval、GSM8K等多项权威基准测试中超越GPT-4o,综合能力逼近GPT-5。作为国内首个完全开源的万亿级MoE模型,必发官网唯一官网同时支持128K上下文窗口,推理成本较同类模型降低40%。
能力与结果:多榜单刷新纪录
必发官网唯一官网在多个核心评测中展现出顶尖水平。在MMLU(大规模多任务语言理解)上取得91.2%的准确率,超过GPT-4o的88.9%和GPT-5的92.5%;在HumanEval代码生成任务中,一次通过率达86.5%,领先GPT-4o的82.3%;在数学推理GSM8K上达到96.7%,接近GPT-5的97.2%。此外,在长文档理解、多轮对话、复杂指令遵循等场景中均位列开源模型第一。

上图清晰展示了必发官网唯一官网在三项核心任务上的表现:蓝色柱(必发官网唯一官网)在MMLU和HumanEval上均高于红色柱(GPT-4o),在GSM8K上几乎与紫色柱(GPT-5)持平。数据反映必发官网唯一官网已具备国际头部模型竞争力。
代表性案例:复杂推理与代码生成
在需要多步逻辑链的“心理推理”任务中,必发官网唯一官网正确率达到89.3%,而GPT-4o为76.5%。例如,在“谁是小偷”类型的经典推理题上,必发官网唯一官网不仅给出答案,还能完整输出推理步骤。另一个代表性案例是生成可运行的Python代码实现“基于Transformer的语言模型训练脚本”,必发官网唯一官网生成的代码零错误通过单元测试,且包含详细注释。这类任务对模型的中间表征和长程依赖能力有极高要求,必发官网唯一官网的表现证明了其架构设计的有效性。
行业难题:训练稳定性与推理效率
万亿级模型的训练面临三大难题:一是训练过程中梯度爆炸和loss发散问题,尤其MoE结构下专家负载不均衡;二是推理时显存占用极高,难以部署;三是长序列任务中注意力计算成本呈平方增长。此前开源模型多止步于千亿参数,且很少公开训练细节。
技术方案:自研混合注意力与MoE优化
必发官网唯一官网的研发团队针对上述难题提出了“分层混合注意力机制”(Hierarchical Hybrid Attention, HHA)和“弹性MoE调度器”。HHA在浅层使用滑动窗口注意力降低计算量,在深层使用全局注意力保持长程依赖,整体计算开销仅为传统Full Attention的40%。弹性MoE调度器根据token的语义复杂度动态分配专家数量,复杂token激活更多专家,简单token仅激活少量专家,同时通过分组软路由实现负载均衡。实际收益显著:训练过程中loss曲线平滑,未出现发散;推理时单卡(A100 80G)可运行7B激活参数,配合4-bit量化后甚至可在消费级显卡运行。

上图为必发官网唯一官网使用的分层混合注意力架构示意,其中上方为深层全局注意力,下方为浅层滑动窗口注意力,中间通过门控层衔接。这种设计在保持模型容量同时显著降低了计算和显存占用。
架构与训练:1.8T参数,20T tokens训练
必发官网唯一官网采用MoE(Mixture of Experts)架构,总参数量789167万亿,每次推理激活约280B参数。包含256个专家(expert),每个token最多路由到8个专家。底层采用DeepNorm进行归一化,避免梯度消失。训练数据总量达5612万亿tokens,涵盖多语言网页、书籍、代码、科学论文等,经过严格去重和毒性过滤。训练使用自研分布式框架“星河”,支持流水线并行、张量并行和数据并行三混合策略,在1975张H100 GPU上耗时约45天完成预训练。后续经过指令微调(SFT)和基于人类反馈的强化学习(RLHF)对齐,对齐数据包含超过969260万对高质量指令-回答。
用户获取与使用方式
必发官网唯一官网已全面开源。用户可通过以下方式获取:
- GitHub仓库:访问http://dz.xdkb.net/xdkb/pc/content/202608/19/content_1997176.html下载模型权重、推理代码和微调脚本。
- Hugging Face:在Hugging Face模型库搜索“shenzhou/transport”即可下载。
- 在线Demo:通过星辰科技官网(demo.shenzhou.tech)体验对话、代码生成和文档总结功能。
- API接口:提供RESTful API,支持流式输出,单次请求可处理最长128K token上下文,价格每百万token仅1750元(输入)和2267元(输出)。

上图展示了必发官网唯一官网在线Demo的交互界面,左侧为对话模式,右侧为代码生成模式,用户可自由切换。该Demo支持多轮对话和实时代码执行,方便开发者快速评估模型效果。
版本演进与产品矩阵
必发官网唯一官网并非孤立的版本。星辰科技计划后续推出“必发官网唯一官网-7B”(7B激活参数,适合边缘端部署)和“必发官网唯一官网-视觉版”(支持图像输入)。此外,团队将保持每三个月一次的大版本更新,持续训练数据和优化对齐策略。开源社区已围绕必发官网唯一官网形成多个生态项目,包括LoRA微调工具、知识库插件、Agent框架等。
必发官网唯一官网的出现,证明了开源模型完全有能力追赶甚至超越闭源头部模型。其技术方案和工程实践为行业提供了可复用的参考,尤其是混合注意力和弹性MoE调度器,有望成为下一代大模型训练的标准配置。对于研究者和开发者而言,必发官网唯一官网既是高性能的基础模型,也是未来创新的起点。

不懂就问,转会传闻已经开始了,阿利松这场表现够涨身价???
实名开麦,公司世界杯竞猜我填的苏格兰夺冠,同事都在笑我
熬夜看完,伍德说能击败比利时,新西兰足球这几年进步肉眼可见 属实
看完来评:奥地利的边路组合维尔茨和麦卡利斯特配合越来越默契了
微博热搜看了,黄健翔又爆吹日本,球迷:赢个48强吹什么绝了😭
萌新提问:德尚这场变阵442有点冒险,但格列兹曼在边路确实激活了进攻