




2026年7月25日,国内AI研究团队极智实验室正式发布并开源了旗下新一代大语言模型——168综合版本。该模型以千亿参数规模实现了推理成本降低70%的工程突破,在MMLU、HumanEval、GSM8K等多项权威基准测试中全面超越GPT-4o,成为当前开源社区中综合能力最强的中文-英文双语基座模型之一。
上图展示了168综合版本与GPT-4o、Llama 3.1 405B、Qwen2.5-72B等主流模型在MMLU、HumanEval、MATH和代码生成任务上的得分对比。168综合版本以0-shot方式在MMLU达到89.3分,HumanEval通过率92.1%,MATH得分86.7,三项指标均列榜首。尤其在代码生成任务中,其单次生成正确率较GPT-4o高出4.2个百分点,标志着国产开源模型在复杂推理领域已进入第一梯队。
为验证168综合版本的实际能力,团队选取了两个典型场景进行深入测试。第一个是GSM8K数学推理任务,模型在包含多步运算和逻辑链的题目上,通过引入链式思维(Chain-of-Thought)范式,将复杂问题拆解为子步骤,最终实现94.5%的准确率,较现有最佳模型提升了3.8%。第二个是长上下文代码生成任务,模型在包含2000行以上依赖的Python项目中,能够准确补全缺失的函数定义,并保持与上下文一致的变量作用域——这在以往是千亿模型普遍难以解决的一致性难题。
当前大模型行业面临的核心瓶颈并非单纯提升模型性能,而是如何将千亿甚至万亿参数模型高效部署到实际业务中。传统全参数加载方式在单张A100(80GB)下最多容纳70B模型,且推理时KV缓存随序列长度线性增长,导致长文本场景下显存爆炸。此外,稀疏注意力计算在工程上往往难以利用GPU硬件特性,造成计算利用率偏低。这些“推理成本高、部署门槛高、响应延迟大”的问题,成为168综合版本研发之初必须攻克的行业痛点。
极智实验室针对上述难题,研发出三项关键技术创新:
上图展示了168综合版本的整体技术架构:从左至右依次为动态稀疏注意力模块、混合精度量化模块和分层推理调度器。对比实验显示,在相同硬件条件下(8×A100 80GB),168综合版本的吞吐量达到LLaMA 3.1 405B的2.1倍,且单次推理成本仅为后者的58%。这一方案使得千亿模型首次能在单台服务器(8卡)内完成部署,大幅降低了客户的使用门槛。
168综合版本采用标准的Decoder-only Transformer架构,参数规模为1.1B、7B、13B、72B和108B五个版本,其中108B为旗舰版。训练数据包含6.5万亿token,覆盖中文、英文和代码,其中中文数据占比40%,英文35%,代码25%。团队采用三阶段训练策略:第一阶段在C4和中文语料上完成预训练(学习率warm-up,余弦衰减);第二阶段通过课程学习(Curriculum Learning)提升长文本能力,上下文窗口从4K逐步扩展到128K;第三阶段采用RLHF+DPO混合对齐方法,在安全性、有用性和无害性之间取得平衡。
训练系统方面,团队自研了基于ZeRO-3优化的分片训练框架,结合4D并行(数据、张量、流水线、序列)策略,在2048张A100集群上实现了55%的算力利用率,训练总耗时约45天。据团队透露,整个训练过程未出现loss发散或梯度爆炸,证明了训练稳定性。
目前168综合版本已全面开源,用户可通过以下方式获取:
上图是168综合版本在Hugging Face上的模型卡页面截图,截至发稿已获得超过12万次下载。社区用户反馈,在7B和13B版本上进行微调后,在客服、知识问答等垂直场景中表现接近GPT-4o水平,推理速度更快。这进一步印证了开源社区对高效轻量模型的迫切需求。
168综合版本的发布不仅是参数和分数上的突破,更是在工程效率上为行业提供了一个可复用的范本。它证明了稀疏注意力与量化蒸馏的结合能够有效破解千亿模型部署难题,使得高性能AI能力不再局限于少数巨头。极智实验室表示,下一步将围绕多模态理解、工具调用和长视频分析三方面推进迭代,并计划在2026年第四季度发布支持跨模态推理的升级版本。对于开发者和企业而言,168综合版本已经从一个技术概念转变为可直接落地的生产力工具。