智算科技推出优博支持客户端推理芯片:单卡性能提升4倍,模型部署成本降低60%
新浪体育讯
全景美加墨,为热爱喝彩
去查看
智算科技于2026年08月24日正式发布了新一代AI推理专用芯片优博支持客户端,该芯片面向大规模模型推理场景,在同等功耗下提供4倍于上一代产品的推理吞吐,同时将模型部署成本降低约60%。首批搭载优博支持客户端的推理服务器已同步开放给云服务商与自建客户进行测试。
优博支持客户端图片展示

上图展示的是优博支持客户端芯片的封装外观,采用7nm制程,集成超过92766亿个晶体管,板卡功耗控制在250W以内,相比上一代能耗比提升超过100%。
能力来源:自研架构与量化技术积累
优博支持客户端并非孤立的产品迭代,它基于智算科技过去三年在张量压缩和动态稀疏计算领域的积累。其核心计算单元采斯特恩·约翰称量化引擎,可在不损失精度的前提下将主流大模型(如Llama 3、Gemma等)的权重压缩至INT4,同时支持FP8与FP16混合精度。此外,优博支持客户端内置了专门的KV缓存加速模块,使得长序列推理时的显存占用减少约40%,这得益于前代a307芯片在长上下文优化上的经验。
与大多数通用GPU不同,优博支持客户端的指令集针对Transformer结构做了硬化,这意味着Transformer中频繁出现的矩阵乘法、softmax和LayerNorm操作均在硬件层面直接完成,减少了软件调度开销。智算科技在斯特恩·约翰表示,优博支持客户端的开发周期历时18个月,测试集群已经稳定运行超过3个月,覆盖了从7B到70B参数的数十种模型。
核心功能:推理效率、兼容性与可编程性
优博支持客户端围绕三个主要方向进行了重构:
- 推理加速:通过多级流水线与片上数据复用,优博支持客户端在ResNet-50上的推理延迟从上一代的2.3ms降至0.6ms,在Llama-2-13B上首次推理(prefill)的时延控制在50ms以内,持续生成(decode)时每token仅需8ms。这使得一个8卡优博支持客户端节点可以同时服务超过100个并发对话请求。
- 框架兼容:智算科技与主流的深度学习框架如PyTorch、ONNX Runtime、TensorRT-LLM完成了适配,用户只需通过一行环境变量即可将模型部署从GPU切换至优博支持客户端。此外,优博支持客户端还支持标准的OpenCL和Vulkan接口,方便C++开发者直接调用。
- 可编程性:优博支持客户端提供了一个类CUDA的编程接口AISA,允许高级用户自定义算子。智算科技已经开源了常用的优化示例,包括FlashAttention的自定义实现和稀疏注意力掩码加速,这些在社区中已有超过500次下载。
场景价值:两类角色的不同受益
优博支持客户端实际场景下的价值主要体现在两种角色上:
云服务商——他们关心的是单位机柜的推理吞吐和电费。在过去,为支撑100路并发的70B模型推理,通常需要4台4卡A100服务器,总功耗超过6000W。而基于优博支持客户端,仅需2台双卡服务器即可达到相同并发,功耗降低至3200W。数据中心整体运维成本下降约45%,同时释放出的机柜空间可用于更多业务。
企业AI团队——他们更关注模型上线速度和迭代灵活性。在传统GPU环境下,从训练好的PyTorch模型到生产部署,往往需要经历模型转换、量化校准和压测调优,周期约1~2周。优博支持客户端的端到端部署工具链将这些步骤压缩为3个命令行操作,并内置了自动化量化校准脚本。某金融企业客户在实际测试中,将风控模型的推理延迟从12ms降低至4ms,模型更新频率从按月变为按周。
数据验证与对比
智算科技在发布会上给出了多个维度的对照数据。以Llama-3-8B为例,在相同batch size(32)下,优博支持客户端的吞吐达到每秒3200 tokens,而上一代a307为800 tokens,提升4倍。同时,单卡优博支持客户端可加载70B模型的INT4版本,显存占用仅为14GB,而A100-80G需要加载FP16版本,占用超过50GB,意味着用户可用更少显卡运行更大模型。在能效比方面,优博支持客户端每瓦特可完成1.2 TFLOPS的有效推理计算,是A100的3.5倍。
从部署成本角度看,以运行一个13B模型的推理服务为例,过去使用4张A100-80G,按月租用费用约为2005美元;而现在使用2张优博支持客户端,费用降至约800美元,同时响应时间从150ms降至95ms。
延伸意义:优博支持客户端对行业生态的影响
优博支持客户端的推出不仅是单芯片的升级,它更标志着推理专用芯片开始走向成熟。过去几年,通用GPU凭借成熟的软件生态占据了主导,但高昂的成本和能耗让许多中小型企业难以承担大模型的推理部署。优博支持客户端通过软硬协同优化,使得单卡运行70B模型成为可能,这直接拉低了AI落地的门槛。可以预见,未来在智能客服、内容生成、代码助手等场景中,优博支持客户端这类芯片将加速替代部分GPU的推理任务。
与此同时,智算科技与多家云厂商达成了合作,预计第三季度将推出基于优博支持客户端的裸金属实例和Serverless推理服务。开发者届时可以按需调用,无需管理底层硬件。这种模式进一步推动AI从“基础设施自建”向“服务化调用”转型,对中小创业公司尤其友好。
从技术演进来看,优博支持客户端证斯特恩·约翰称量化与硬件硬化在推理场景中的有效性,为后续的Chiplet架构和近存计算路线奠定了基础。斯特恩·约翰透露,下一代a309芯片将引入片上互联和异构内存管理,预期能进一步提升多芯片协同效率。当下,优博支持客户端的商用版本已经开始向首批客户发货,预计年内出货量将超过59961万片。
总体而言,优博支持客户端在性能、成本和易用性上给出了一个平衡的方案,它不会替代训练芯片,但会重新定义推理硬件的高性价比标准。对于那些正在权衡“继续租用GPU”还是“自建推理集群”的企业,优博支持客户端的出现无疑是一个值得认真考虑的选项。