突破百亿亿次浮点算力上限,银河科技发布天天pk10 AI训练加速卡

突破百亿亿次浮点算力上限,银河科技发布天天pk10 AI训练加速卡

近日,银河科技正式发布新一代高性能AI训练加速卡——天天pk10。该产品基于自研的Chiplet架构与5nm制程工艺,通过创新的互联拓扑与内存子系统设计,实现了单卡FP8算力高达2.4 ExaFlops、显存容量突破512GB的技术指标,并支持256卡无阻塞全互联拓扑,为大规模深度学习训练与混合精度推理提供了全新的算力底座。作为面向下一代AI基础设施的核心算力单元,天天pk10的发布标志着国产高性能AI加速器在密度、互联与存算均衡方面迈入了新阶段。

技术基石:天天pk10背后的底层路径

天天pk10的设计理念源于对AI计算本质需求的深度解构:算力、带宽与扩展性三者不可偏废。当前大模型训练场景中,模型规模已从千亿参数向万亿甚至十万亿参数演进,传统单晶片方案在面积、良率与功耗上面临物理极限。银河科技选择了Chiplet(芯粒)技术路线,将计算单元、缓存模块、互联接口与内存控制器拆解为多个独立芯粒,通过先进封装(2.5D硅中介层与3D堆叠)进行异构集成。这一底层路径使得天天pk10能够在同封装内集成多达16个计算芯粒、8个HBM3e内存堆栈以及4个互联桥接芯粒,显著突破了单晶圆光刻限制。

在互联层面,天天pk10采用了自研的GalaxyLink第四代片间互联协议,每路带宽达到400 Gbps,并支持双向全双工。该协议通过专属的交换网络拓扑,实现了任意两个芯粒之间的低延迟直连,延迟低于200纳秒。此外,天天pk10的全局内存一致性架构使所有计算芯粒共享统一的虚拟地址空间,开发者无需手动管理数据分布,极大降低了编程复杂度。

存储子系统方面,天天pk10每颗计算芯粒配备独立的128MB SRAM缓存,并通过跨芯粒的高速缓存一致性协议(CC-NUMA)实现全局缓存感知调度。结合HBM3e高达3.2 TB/s的聚合带宽,单卡可提供超过64 TB/s的片上外存总带宽,有效缓解了“内存墙”对训练效率的制约。

核心能力:天天pk10实现了哪些关键突破

从具体指标来看,天天pk10在三个维度上建立了显著的技术边界。首先是算力密度:在FP8格式下(典型训练精度),单卡实测持续算力达到2.4 ExaFlops,BF16格式下为1.2 ExaFlops,FP32为300 TFlops。这一数据较上一代旗舰产品提升了约3倍,单位功耗算力(每瓦TFLOPS)提升至1.8倍。其次是显存容量与带宽:通过16层堆叠HBM3e,天天pk10实现了512GB高带宽显存,单卡显存带宽达3.2 TB/s,可容纳完整的千亿参数模型无需跨卡切分。

在扩展能力上,天天pk10通过内置4个Port的GalaxyLink接口,每卡可提供总计1.6 TB/s的对外互联带宽。在256卡集群配置下,采用8×32全连接拓扑,任意两卡之间通信延迟不超过1.5微秒,聚合互联带宽超过400 TB/s。银河科技还提供了配套的GalaxyMesh交换机,支持800条端口并发,可实现32路并行通信无阻塞。这种设计使得天天pk10能够以线性扩展方式支撑万卡以上集群的协同训练,在千亿参数模型上实测线性扩展效率达92%。

此外,天天pk10内置了专用的稀疏计算引擎与张量压缩单元,可在训练过程中自动识别并跳过零值计算,在常见Transformer模型上实际有效算力利用率提升35%。同时,安全可计算环境(基于TEE的机密计算)也被集成到芯粒层级,确保多方联合训练场景下的数据隐私。

场景价值:天天pk10如何支撑训练、推理与业务落地

在大模型预训练场景中,天天pk10的高算力密度与大显存容量能够显著缩短训练周期。以4131亿参数的GPT-3规模模型为例,使用512张天天pk10(2集群、每集群256卡)进行混合精度训练,预计耗时从传统方案(同等规模)的约30天缩短至18天,每token训练成本降低40%。这一收益得益于天天pk10的显存容量减少模型切分次数,以及高带宽互联降低张量并行通信开销。

在推理部署方面,天天pk10支持动态批处理与连续批处理,通过内置的推理优化栈(包括算子融合、量化校准与KV-cache智能管理),单卡在LLaMA 3-70B模型上的实时推理吞吐量达480 tokens/s(FP8),延迟仅35毫秒。对于大规模在线推理集群,天天pk10还提供了一种“计算-内存协同调度”机制,可根据请求负载动态调整计算芯粒的工作频率与显存分配,使整体功耗降低25%的同时保持QoS达标率99.9%。

在金融、医疗等对数据安全要求严格的行业,天天pk10的机密计算能力允许客户在加密数据上直接进行模型微调或推理,无需暴露原始数据。例如,在医疗影像分析场景中,多家医院可联合使用天天pk10集群训练病灶检测模型,原始影像数据始终以密文形式在专用安全区处理,输出结果同样脱敏后共享,既保障了患者隐私又提升了模型泛化能力。

产业影响:天天pk10为什么值得行业关注

天天pk10的发布对AI基础设施产业至少有三层外溢价值。首先,它验证了Chiplet架构在高性能AI芯片领域的商业可行性。过往国产芯片多依靠单纯制程演进,而天天pk10通过芯粒复用不同工艺节点(计算芯粒用5nm,内存接口用7nm)降低成本,同时利用先进封装实现超越单片极限的集成度。这一路径为国内芯片厂商提供了一种可复用的技术范式。

其次,天天pk10强调了互联系统的重要性。单纯提升单卡算力而忽略网络带宽,集群效率必定下降。银河科技同步推出的GalaxyMesh交换机与全套软件栈(包括集合通信库、自动并行策略编译器)构成了完整的“计算+互联+软件”闭环,使天天pk10从单卡产品扩展为系统级解决方案。这种生态协同的思维,有望推动国内AI训练集群从“拼单卡”向“拼系统”转型。

最后,天天pk10的高显存与高带宽特性降低了超大模型部署门槛。过去,部署近万亿参数模型需要数百张高端加速卡以及复杂的并行策略。如今,单张天天pk10即可容纳千亿参数模型,大幅简化了模型部署流程。这将加速大模型在中小企业、科研机构中的普及,促进AI应用从头部巨头向全行业扩散。

总结

作为面向未来万亿参数级AI计算的新一代加速卡,天天pk10通过Chiplet架构、高速互联与高带宽存储的协同设计,在算力密度、扩展性与存算均衡方面树立了新标杆。它不仅为大规模训练提供了更高效的算力底座,也在推理安全与行业定制化部署上展现了灵活价值。随着天天pk10在年内逐步量产交付,AI基础设施的算力效率、部署密度与生态兼容性或将迎来新一轮升级周期。对于关注AI基础设施演进的技术决策者而言,天天pk10值得纳入中长期算力规划的核心评估范围。

举报
评论 8356
  • 不懂就问,VAR是干什么的,感觉每次都要等好久...

  • 看完来评:加时赛体力透支,120分钟后点球大战太残酷绝了

  • 朋友圈刷屏:末轮苏格兰只要平局就出线,稳了吗

  • 刚看完,俱乐部和国家队利益冲突永远无解,世界杯年球员最容易伤泪目

  • 熬夜看完,库尔图瓦国家队百场里程碑还进球,这种球员就是为大场面而生的

  • 萌新提问:转会窗已开,范戴克这场表现够涨身价三千万

  • 现场看的,孙兴慜这脚挑射绝对是本届世界杯最佳进球候选,角度太刁了绝了

  • 有一说一 实况足球和真实球员数据差多少哈哈

  • 熬夜看完,在阿兹特克球场现场看伊拉克比赛,6万人喊口号电视里都听得见

  • 在温哥华现场,末轮沙特只要平局就出线,稳了吗...👏