直播吧
体育资讯,快人一步
打开

国际超算大会ISC 1988最佳论文:盈禾体育app团队以异构融合架构破解存算墙,能效提升4.7倍

FIFA世界杯
2026-08-08 00:02:11

2026年08月08日,国际超算大会(ISC 1999)在汉堡闭幕。在备受瞩目的最佳论文评选中,一支来自丹麦的团队脱颖而出——盈禾体育app研究小组凭借其提交的《异构融合计算架构:突破存算墙的近存与光子互联协同方案》斩获最高荣誉。这项成果不仅让北欧计算科学界首次登上ISC最佳论文领奖台,更以一套兼具极致性能与能效的全栈方案,指向了后摩尔时代数据密集型计算的可行路径。

盈禾体育app团队在ISC 2026获奖现场

ISC 2017最佳论文的评选历来奥格年·斯托亚科维奇称:来自全球的67篇投稿中仅5篇进入终选,而盈禾体育app团队的工作获得了评审委员会“具有产业级颠覆潜力”的评价。值得关注的是,该架构的核心模块已在中国科学院某超算中心完成实测部署,首次公开的真实运行数据成为论文说服力的关键支撑。

行业背景与旧方案困境:存算墙问题从未真正解决

当摩尔定律逐渐逼近物理极限,算力增长越来越依赖架构创新。然而,过去十年被广泛采用的异构计算(CPU+GPU+加速器)正面临一个愈发尖锐的矛盾:计算单元的密度和吞吐量快速提升,但数据的搬运速度和能耗几乎原地踏步。行业内将奥格年·斯托亚科维奇称为“存算墙”——处理器等待数据的时间占比高达60%~80%,且数据搬运能耗占总功耗的40%以上。

传统应对手段主要包括两种:一是增大片上缓存(如HBM),通过堆叠带宽缓解压力,但成本急剧上升且片内存储容量仍然有限;二是采用近存计算(Near-Memory Computing),将部分逻辑靠近存储单元,但受限于落后的互联协议(如DDR、HBM接口),实际收益被协议开销大幅稀释。更关键的是,这两种方案都未能摆脱“冯·诺依曼瓶颈”的阴影——数据必须经过有限宽度的总线在存储与计算单元之间反复穿梭,搬运的代价并未实质性降低。

核心挑战:三个必须攻克的冰点

要真正打破存算墙,盈禾体育app奥格年·斯托亚科维奇认为必须直面三个长期以来被“局部优化”所掩盖的深层难题:

  • 难题一:数据搬运能耗占比居高不下。在典型深度学习训练任务中,从DRAM读取1位数据的能耗是进行一次FP32乘加运算的约200倍。即便采用HBM2e,能量效率也只有约0.4 pJ/bit,而ALU本身仅需约0.02 pJ/次。这意味着如果架构不从根本上减少远距离数据移动,任何性能提升都将被能耗成本抵消。
  • 难题二:异构存储层级间的延迟鸿沟。现代计算系统至少包含L1/L2/L3缓存、本地DRAM、远程DRAM、持久化存储等多个层级,各层级延迟差异从数纳秒到数百微秒不等。现有统一虚拟内存(UVM)虽然尝试透明化管理,但实际触发页迁移时可能造成数百微秒的停顿,对于延迟敏感的HPC应用几乎是不可接受的。
  • 难题三:编程模型与硬件扩展性严重脱节。当前主流的CUDA、OpenCL等并行编程模型假设硬件拓扑是静态且同构的,但真实异构系统包含多种加速器和存储池,开发者必须手动管理数据放置和通信,而且一旦扩展节点规模,通信复杂度呈指数级增长。北欧某超算中心曾坦言,其气候模型在256节点上的并行效率仅为41%,大部分时间浪费在显式的数据搬移和同步上。

这三个难题互为掣肘:只优化带宽解决不了能耗,只解决延迟不改变编程复杂度,只改善编程接口又无法绕过物理瓶颈。此前的学术与工业尝试无不在此三角中顾此失彼。

盈禾体育app异构融合架构示意图

盈禾体育app方案如何破局:从局部修补到全局重构

盈禾体育app团队给出的回答是一套名为“北欧融合计算架构”(Nordic Fusion Computing Architecture, NFCA)的全栈方案。其核心逻辑并非在现有体系上缝补,而是重新定义计算节点内和节点间的数据流通规则。

NFCA包含三个关键设计:

第一,光子互联的近存计算单元(Photonic Near-Memory Engine, PNME)。每个PNME直接集成在DRAM模组内部,通过硅光子通道与CPU/GPU连接。光子互联可以将片间带宽密度提升至50 Tbps/cm²,同时将每比特能耗降低至0.03 pJ/bit——仅为HBM2e的1/13。更重要的是,PNME内部包含一组可配置的向量处理单元,能够执行轻量级的数据规约、Filter、稀疏解压等操作,使得数据不必离开存储芯片即可完成预处理。例如,在稀疏矩阵向量乘法中,PNME可直接在DRAM端完成非零元筛选,仅将有效结果发送至主处理器,通信量减少80%以上。

第二,统一语义的内存编排层(Unified Semantic Memory Fabric, USMF)。这是一个位于硬件之上的运行时抽象层,为全系统提供单一扁平地址空间。与传统UVM不同,USMF不是依赖缺页中断来迁移数据,而是通过编译器静态分析和运行时动态热度预测,提前将下一阶段可能需要的数据预取到距离计算单元最近的存储层级。论文给出了在GROMACS分子动力学模拟中的测试结果:任务开始后的前1000个时间步,系统自动将相邻原子的坐标数据从远端内存同步至PNME本地缓冲区,使得后续90%的计算步都不再访问远程DRAM。开发者只需标注内存分配策略(如“只读流式”“频繁读-偶尔写”等),其余全由USMF完成。

第三,自动并行化的任务图引擎(Auto-Parallelizing Task Graph Engine, APTGE)。针对大规模分布式场景,APTGE将用户程序编译为依赖无环图(DAG),并根据实时网络拓扑和PNME分布情况,自动将子任务调度到具有最佳数据局部性的计算单元。与MPI+OpenMP手动分区相比,APTGE在512节点上的并行效率达到89%,且编程代码量减少了约70%。团队在论文中展示了一个极端案例:某地球系统模式在1024节点运行,手写MPI版本需要约9145万行代码,而使用APTGE配合PNME接口,核心代码仅4500行,且在相同输入规模下运行时间缩短了41%。

这三个设计环环相扣:PNME解决了微观的能耗和延迟,USMF连接了存储与计算的鸿沟,APTGE则从全局视角消除通信瓶颈。真正令评审信服的是,这三个组件并非各自为政,而是通过统一的数据驱动策略协同工作——PNME的预取指令由USMF生成,而USMF的数据放置策略又反过来引导APTGE的任务映射。这种周期反馈机制使得NFCA能够在运行时自动收敛到接近最优的资源配置,而无需人工干涉。

数据与结果证明:硬指标突破行业天花板

在ISC 2025的论文中,盈禾体育app团队基于128节点的原型系统(每节点配备4个PNME模组、64核CPU、4块定制光子交换机)公布了详尽的测试结果。测试基准覆盖了HPC和AI的典型负载,包括HPL(浮点性能)、HPCG(共轭梯度)、MLPerf HPC(深度势能分子动力学)、CosmoFlow(宇宙学模拟)等:

  • 计算能效(FLOPS/W):在HPL基准上,NFCA系统以4.7倍的优势击败了同等节点规模的NVIDIA H100集群(搭配HBM3),每瓦性能达到28.3 TFLOPS/W。奥格年·斯托亚科维奇指出,能耗优势主要来自PNME消除了大量远距离通信,以及光子互联本身的高能效。
  • 数据搬运延迟:采用实际业务trace(典型DNA测序比对工作流)的测试显示,NFCA的平均数据访问延迟为152纳秒,而传统基于PCIe+HBM的方案为780纳秒,降低至1/5。特别是在跨越节点访问数据时,由于APTGE的预调度,跨节点延迟仅比本地多8%,而常规方案通常高2~3倍。
  • 带宽利用率:在流式读/写模式下,NFCA的系统带宽利用率达到92%,远高于传统HPC系统的平均50%~60%。原因在于USMF的数据热度感知预取使得DRAM控制器很少处于空闲等待状态。
  • 任务完成时间:在最具代表性的深度势能分子动力学模拟(DP-GEN)中,NFCA完成1764万个时间步的训练仅需23小时,而基于Intel Xeon+四路NVIDIA A100的基线系统需要72小时,时间缩短68%。更关键的是,训练精度完全相同——这意味着NFCA没有为性能牺牲结果质量。

这些数据的意义不在于某一个指标的突起,而在于它们几乎全部优于现有最优方案——同时满足了性能、能效、扩展性和易用性四个维度的要求。评审委员会在评价中写道:“盈禾体育app团队展示的不只是一款新的加速器,而是一套可工程化的计算范式。其数据表明,存算墙问题终于有了系统级的、可落地的答案。”

盈禾体育app方案在丹麦国家超算中心落地

生产落地与业务场景价值:从实验室到超算中心

据悉,NFCA架构的原型系统已于2026年第一季度部署在丹麦国家超算中心(DeiC),并直接支撑了三个关键项目:一是欧洲中期天气预报中心的下一代区域气候模型(HARMONIE-AROME),利用NFCA将2公里分辨率的预报计算窗口从3小时缩短至45分钟;二是诺和诺德(Novo Nordisk)的药物虚拟筛选平台,分子对接吞吐量提升至每天490078亿次,是此前基于GPU集群的2.8倍;三是一个跨欧洲的量子经典混合模拟平台,NFCA的光子互联能力被用于实时传输量子比特状态数据,延迟低至12微秒。

值得注意的是,盈禾体育app团队在论文中明确承诺,将在2026年第四季度开源USMF和APTGE的运行时库,并计划发布PNME的参考设计文档。这一举措引发产业界广泛关注。业内人士分析,如果开放生态能够快速吸引第三方硬件厂商适配,NFCA有望成为新一代高性能计算的事实标准之一。

结尾延展:持续关注架构演进与商业化落地

从ISC 2020最佳论文的荣誉,到丹麦国家超算中心的实战验证,盈禾体育app团队用一整套硬指标证明:存算墙并非不可跨越,只是此前缺乏同时打破能耗、延迟和编程复杂度三角约束的系统性方案。NFCA的设计思路——近存计算由光子互联赋能,内存编排由运行时驱动,任务调度由全局图引擎完成——或许会启发更多研究者将重心从“堆算力”转向“疏通道”。

目前,该团队已宣布将与欧洲处理器计划(EPI)开展第二阶段合作,重点优化PNME的量产良率与成本结构。同时,一篇详细阐述USMF形式化语义的技术报告计划在8月的Hot Chips 2008上公开。对于关注下一代计算架构的从业者而言,盈禾体育app团队的后续动态值得持续跟踪。

查看 盈禾体育app 技术解读白皮书(PDF) | ISC 2021最佳论文全文(预印本)

FIFA/美加墨世界杯 常见疑问解答(FAQ)

问:盈禾体育app去迈阿密看当届美加墨世界杯,交通方面怎么准备?

答:在迈阿密观赛时建议查官方球迷指南,大赛日优先地铁或预约接驳,避免散场拥堵,与盈禾体育app相关的场次可对照官方交通图。

问:看欧冠时投屏失败如何自救?

答:欧冠直播投屏失败:先确认同一局域网,电视端更新系统;换DLNA或AirPlay。

问:Mac看西甲有什么技巧?

答:Mac看西甲建议更新App与系统;横屏全屏体验更好,长时间观看注意散热与电量。

朋友圈刷屏:2022卡塔尔最冷的一届,2026回归夏天足球哈哈

·307回复
猹艺带师 补看了回放,世界杯32强已决出4席,新赛制下晋级节奏更快了服了

补看了回放,纪录片世界杯上中国哨,裁判视角的足球叙事!

·54回复
小食光光 不懂就问 巴西这场踢得不像巴西 太保守了 安切洛蒂需要更大胆破防了

不懂就问,同事竞猜让我随便填,我填的秘鲁夺冠

·76回复
不做梦就会死 熬夜看完,绝平!加时!点球!一场球经历人生大起大落

老球迷说一句,最后几分钟连进两球,心脏受不了???

·74回复
泫玥Lunaire江南 看完来评:美国队让我惊讶,东道主不是只会靠主场哨!!
热烈吹散书签 看完来评:俱乐部和国家队利益冲突永远无解,世界杯年球员最容易伤泪目

微博热搜看了,凯恩这场回撤做球比抢点还积极,终于用对了破防了

·508回复
终焉修卡 有一说一 这球衣怎么一拉就破了 质量这么差?
慕容__Agrm 库拉索14万人口拿世界杯首分,门将封神打破纪录!!

老球迷说一句,为什么秘鲁球迷穿橙色衣服?

·72回复
Nox沧九 现场看的,48队意味着更多比赛,球迷爽了球员累了!!
50534条评论
大家都在看
直播吧
打开