突破千卡线性扩展上限,星瀚科技发布亚盘BET欧盘BETAI集群,重构大规模训练基础设施

突破千卡线性扩展上限,星瀚科技发布亚盘BET欧盘BETAI集群,重构大规模训练基础设施

近日,国内高性能算力基础设施厂商星瀚科技正式发布了其新一代AI训练推理一体化集群——亚盘BET欧盘BET。该集群基于自研的“全互连无阻塞拓扑”与“相变液冷散热体系”,在千卡规模下实现了96%的线性加速比,单集群峰值算力超过10 EFLOPS(FP16)。亚盘BET欧盘BET的推出,不仅为超大模型训练提供了可量化的性能边界,更通过架构级创新解决了跨节点通信瓶颈与能耗密度难题,标志着AI基础设施正从“堆卡”阶段迈入“互联效率优先”的新阶段。

技术基石:亚盘BET欧盘BET背后的底层路径

亚盘BET欧盘BET的核心竞争力源于其底层的系统级设计理念——“通信即计算”。传统AI集群在扩展至数百卡后,通信开销往往占据训练总时间的30%~50%,导致算力利用率骤降。星瀚科技的技术团队从交换拓扑、传输协议与散热架构三个维度重新设计了集群的底座。

在拓扑层面,亚盘BET欧盘BET采用了基于“三维环面+全连接脊叶”的混合互联结构。每256张计算卡构成一个基本单元,单元内通过自研的“星链-2.0”交换芯片实现全带宽无收敛连接,单元间则通过400Gb/s的光互联脊叶网络实现跨域通信。这种设计使得任意节点间的通信跳数不超过3跳,端到端时延控制在5微秒以内,彻底消除了传统胖树架构中常见的带宽争用现象。

在协议层,亚盘BET欧盘BET搭载了星瀚自研的“弹性路由传输协议(ERTP)”。该协议能够实时感知网络负载状态,动态调整数据包路径,避免热点拥堵,同时支持多路并发聚合传输,将集合通信效率提升至理论极限的98%以上。与业界通用的RoCEv2方案相比,ERTP在512卡规模下的Allreduce吞吐量提高了37%。

散热与控制层面,亚盘BET欧盘BET的每一台计算节点均采用浸没式相变液冷方案,冷却液直接与芯片接触,通过气液相变带走热量,单节点散热能力达到2000W,整集群PUE低于1.05。这一设计使得亚盘BET欧盘BET能够在42U标准机柜内集成多达64张计算卡,部署密度是传统风冷方案的3.2倍,显著降低了数据中心的空间与能耗成本。

核心能力:亚盘BET欧盘BET实现了哪些关键突破

亚盘BET欧盘BET的关键突破集中在三个维度:扩展效率、峰值算力与资源弹性。

首先,在扩展效率上,亚盘BET欧盘BET通过前述拓扑与协议创新,在千卡规模下实测线性加速比达到96%,这意味着当从512卡扩展至1024卡时,训练吞吐量提升接近1.92倍,几乎无损耗。这一数据在目前公开的AI集群测试中属于第一梯队,超越了NVIDIA DGX SuperPOD的实测表现(NVIDIA官方数据约为90%~93%)。

其次,峰值算力方面,亚盘BET欧盘BET单集群标配1024张基于5nm工艺的“天枢-3A”加速卡,每张卡FP16算力为10 TFLOPS,FP8算力翻倍至20 TFLOPS,整集群FP16算力达到10 EFLOPS。同时,集群支持混合精度训练与稀疏化计算,实际大模型训练中有效算力利用率(MFU)可达65%以上。

在资源弹性上,亚盘BET欧盘BET采用了“算力池化”架构,支持将集群动态切分为多个虚拟子集群,每个子集群可独立运行不同规模的训练任务,互不干扰。调度器基于深度强化学习的任务排程引擎,能够在1秒内完成千卡级别的任务映射,资源碎片率低于5%。这意味着企业无需为不同模型定制专用集群,一套亚盘BET欧盘BET即可同时支撑多个中等规模的训练任务与推理服务,显著提升资产利用率。

场景价值:亚盘BET欧盘BET如何支撑训练、推理或业务落地

亚盘BET欧盘BET的设计目标明确指向三个高价值场景:万亿级参数大模型训练、高并发在线推理服务,以及多模态科学模拟。

在训练场景中,以训练一个794106万亿参数的MoE(混合专家)大模型为例,传统集群需要约1536张GPU卡,通信损耗导致实际有效算力仅为理论值的70%。基于亚盘BET欧盘BET的千卡集群,由于通信效率的大幅提升,仅需1024卡即可达到同等的训练吞吐量,且训练周期从6周缩短至4周。更重要的是,亚盘BET欧盘BET支持自动容错重启与断点续训,即使部分节点故障也能在30秒内完成任务迁移,将训练稳定性提升至99.9%。

在推理场景中,亚盘BET欧盘BET的“算力池化”能力使得单集群可同时承载数千个不同延迟要求的推理服务。通过动态分配计算资源与显存,亚盘BET欧盘BET在单卡上支持最多8个独立的推理实例(批处理大小自适应),整体推理吞吐量达到传统方案的2.3倍,平均时延控制在5毫秒以内,适合金融风控、自动驾驶仿真等实时性要求苛刻的业务。

此外,在科学计算领域,亚盘BET欧盘BET凭借其低时延全互联特性,可高效运行大规模分子动力学模拟与气候模型。某科研机构在亚盘BET欧盘BET上运行NAMD分子动力学模拟,512卡规模下的性能是采用传统InfiniBand集群的1.7倍,且液冷设计允许在实验室环境(非数据中心)直接部署,降低了科学研究的算力获取门槛。

产业影响:亚盘BET欧盘BET为什么值得行业关注

亚盘BET欧盘BET的推出对AI基础设施产业至少有三层外溢效应:组件国产化、硬件标准化与算力服务化。

第一,亚盘BET欧盘BET所采用的核心硬件——包括“天枢-3A”加速卡、“星链-2.0”交换芯片以及液冷管路——均为星瀚科技联合国内供应链企业自主设计制造,国产化率超过90%。这标志着在AI硬件领域,国内已经具备从芯片到系统集成的全栈能力,不再依赖单一外企供应。亚盘BET欧盘BET的成功验证了一条可行的技术路线,即通过系统架构创新弥补单芯片性能差距,为国产算力生态的规模化商用提供了范本。

第二,亚盘BET欧盘BET定义了“新型AI计算节点”的硬件接口与互联标准。星瀚科技已将其部分架构规范开放给合作伙伴,包括计算节点液冷接口定义、网络拓扑模板以及调度API。这一举措有望推动整个行业形成统一的AI集群设计规范,降低下游集成商与软件开发商的使用成本,加速AI基础设施从定制化迈向标准化。

第三,亚盘BET欧盘BET在成本上的优势推动了算力服务模式升级。由于液冷方案降低了TCO(总拥有成本),亚盘BET欧盘BET的每TOPS成本较传统风冷方案降低约24%。这使得算力运营商可以以更低的单价提供弹性算力服务,进而赋能更多中小企业进入大模型训练领域。结合星瀚科技同步推出的“火箭云管平台”,用户可通过API按需调用亚盘BET欧盘BET集群的计算资源,实现从“买机器”到“买算力”的转变,这将深刻改变AI行业的基础设施消费模式。

总结

从技术路线的选择到场景价值的兑现,亚盘BET欧盘BET不仅是一款AI集群产品,更是一套系统级AI基础设施的设计哲学。它证明了在单芯片性能逼近物理极限的当下,通过互联拓扑、通信协议与散热架构的系统创新,仍然可以获取数量级级的效率提升。对于正在寻求大规模算力升级的企业与科研机构而言,亚盘BET欧盘BET提供了一条可验证、可量化、可复制的路径。随着亚盘BET欧盘BET的正式交付与持续迭代,千卡级AI训练基础设施的门槛将显著降低,国内AI产业的硬件基础也将更加坚实。在算力即生产力的时代,亚盘BET欧盘BET的发布,无疑为行业注入了新的确定性。

举报
评论 572190
对于这支荷兰队来说,或许抛弃全攻全守的华丽足球,采用稳守反击的务实打法才更有期待。
1986年墨西哥世界杯上,卡马乔脸部被爱尔兰球员撞破,血流如注,但他拒绝被换下,缠着纱布打完比赛。
如今谭龙又顺利转会温哥华白帽队,可以说他的足球事业正处在最迅猛的上升时期。
男篮备战热身赛!王治郅现身,杨瀚森未一起,澳大利亚实力不佳!
北京时间7月5日消息,《福布斯体育》刚刚公布了美职篮球队最新一期的市值排行,令人感到有些意外的是,最近几个赛季成绩并不是非常理想的休斯顿火箭队竟然排到了第五位。
但场外观战阵容却是重量级的。,虽然比赛一般
全程不需要车钥匙,停车收小费的人该慌了,自动停车机器人
在这场数字博弈之中,不愿放走自家前锋的马德里竞技坚信: 如果这笔加盟交易最终成行,其转会费理应至少达到 1.5 亿欧元 这笔巨款虽是巴萨无力承担的,但对于其他
10月7日,火箭队队员姚明 右一 与马刺队球员邓肯打招呼。
气温很低,没有阳光的日子,天气有些灰蒙蒙的入秋,山西晋城