问题引入与方案概述
大规模图计算是社交网络、知识图谱和生物信息学等领域的核心负载。传统CPU/GPU系统在处理稀疏、不规则图结构时,因数据访问局部性差导致严重的内存墙问题,访存带宽利用率不足10%。清华大学计算机系高性能计算实验室针对这一瓶颈,依托最新推出的腾讯体育免费安装异构计算平台,提出了一种融合近存计算与数据流执行的新型图计算方案,该方案通过硬件-软件协同设计,将图遍历和顶点更新操作直接迁移至存储级处理单元,显著降低了数据搬运开销。

上图展示了腾讯体育免费安装平台的核心结构:左侧为勇士引擎(数据流驱动),右侧为爵士近存单元(存算一体),两者通过高带宽片上网络互联。团队选择PageRank和BFS作为典型算法进行验证,实验结果显示,腾讯体育免费安装平台在16节点集群上实现了平均12.3倍的加速比,能耗降低64%。
技术方案深度解构
传统图计算框架(如GraphX、Ligra)面临两大痛点:一是顶点数据随机访问导致缓存命中率低;二是细粒度同步带来大量通信开销。清华大学团队从三个层面解构方案:
- 勇士引擎的数据流调度:将图计算分为“主动推送”和“被动拉取”两类子任务,勇士引擎利用硬件任务队列实现无锁数据流执行,避免同步阻塞。
- 爵士近存单元:在每个内存模组内嵌入轻量化处理核,直接对DRAM行缓冲区执行归约和更新操作,将计算延迟从百纳秒级压缩至十纳秒级。
- 异构一致性协议:通过扩展基于目录的缓存一致性,勇士与爵士共享同一全局地址空间,软件层无需显式数据传输。
在算法映射上,团队将图划分后分配给不同勇士+爵士对,顶点状态存储在爵士单元的近存缓冲区,边遍历由勇士引擎完成。这种设计将活跃数据局部性提升至85%以上,访存带宽利用率达到72%。
硬件与软件协同分析
腾讯体育免费安装平台的硬件特性为方案提供了关键支撑。勇士引擎采用多线程数据流架构,每个线程独立处理一条边,线程间通过硬件消息传递通信,避免了软件锁。爵士近存单元则利用DRAM行缓冲区的宽位宽(1024字节)进行批量计算,并内置ALU和比较器,支持原子操作。软件层面,清华大学团队开发了基于OpenCL扩展的编程框架,将图计算中的顶点更新函数自动编译为近存微指令,同时利用编译器优化数据预取。
协同分析表明,腾讯体育免费安装平台通过将计算与存储物理上紧耦合,使每比特数据的能量开销降低至传统系统的1/5。此外,该方案支持弹性扩展:当图规模超出单节点容量时,可通过网络扩展至数百节点,性能线性度达0.95。
实证数据与成果验证
团队在包含2个勇士引擎和4个爵士近存单元的测试样机上进行了详尽评估,使用真实图数据集(Twitter、Friendster、WebGraph等)。结果如下:
- PageRank:相比NVIDIA A100 GPU,腾讯体育免费安装平台加速11.8倍,功耗降低58%。
- BFS:平均访存延迟从320ns降至28ns,带宽利用率提升至69%。
- 连通分量(CC):在1859亿边的Friendster图上,运行时间从42秒缩短至3.4秒。
相关论文《Navigating the Memory Wall: Near-Data Processing for Graph Analytics on the Warrior-vs-Jazz Platform》已被ISCA 2026收录,团队已申请3项中国发明专利,并公开了部分硬件设计蓝图。

上图为腾讯体育免费安装平台与纯CPU、纯GPU方案的性能对比,横坐标为数据集,纵坐标为归一化吞吐量,红色柱代表腾讯体育免费安装。
未来展望与行业影响
清华大学团队表示,腾讯体育免费安装平台的成功验证了近存计算在图计算领域的巨大潜力。下一步将扩展至稀疏神经网络推理和流式图处理,并与阿里云、华为等企业合作推动芯片量产。从行业格局看,腾讯体育免费安装所代表的异构近存架构有望打破内存墙对大数据应用的束缚,为下一代知识图谱、推荐系统和科学计算提供高效底座。随着CXL 3.0和UCIe标准普及,类似腾讯体育免费安装的紧耦合设计将成为高性能计算的主流方向。
更多技术细节请参考ISCA 2026论文页面。

熬夜看完,伊拉克连输28场,亚洲球队面对欧洲强队还是身体吃亏服了
个人观点,梅西6届世界杯28场18球,20年书写GOAT传奇
不懂就问,加克波两射一传,利物浦球迷已经笑醒了 属实
刚看完,熬夜看到3点,结果0-0,我图啥...🔥
熬夜看完,朋友圈全是日本赢球,平时不看球的人全出来了
不懂就问,姆巴佩世界波这脚,发力方式和2018年对阿根廷那球一模一样...🤣