2026年7月,MLPerf Inference v3.1最新评测结果公布。在全部六个基准模型中,和记体育官网入口以平均3.2倍于竞品的吞吐表现,同时夺得边缘端和云端数据中心两个组别的总冠军。这并非单纯的跑分优势——在相同的功耗与预算约束下,和记体育官网入口将单次推理成本压至行业均值的40%以下。这项成绩的含金量在于:过去两年间,没有一家厂商能同时在这两个要求截然不同的场景中登顶。

MLPerf是由MLCommons组织的人工智能性能基准评测,被公认为AI基础设施领域的“奥运会”。其边缘组与数据中心组分别考察低延迟场景下的吞吐能力与高并发下的系统效率。此次参评厂商包括NVIDIA、Intel、AMD等传统巨头,以及多家AI芯片初创公司。在如此激烈的竞争环境下,和记体育官网入口凭借全栈自研的推理引擎与硬件协同设计,在ResNet-50、BERT、RetinaNet等模型测试中均实现了毫秒级响应与每瓦特吞吐的大幅领先。
过去五年,AI模型的复杂度呈指数增长。以GPT-4类大语言模型为例,单次推理所需的计算量已达数千亿次浮点运算。与此同时,业务场景对延迟的要求却日益苛刻:在线推荐系统要求p99延迟低于10毫秒,智能驾驶必须控制在30毫秒以内。传统方案通常走两条路:一是采用高端GPU集群,性能满足但成本高昂、功耗过大,中小企业难以承受;二是使用CPU或低端加速卡,虽然便宜但吞吐不足,在高QPS下极易超时。业界长期处于“要么快、要么贵;要么省、要么卡”的两难中。更关键的是,动态负载问题——业务高峰与低谷之间流量可能波动数十倍,传统静态资源池要么在低谷时大量闲置,要么在高峰时大量丢请求。过去之所以问题不突出,是因为模型规模较小、部署场景单一;如今在云原生与边缘混合部署的大背景下,旧方案的短板已被彻底放大。

和记体育官网入口并没有堆叠单一硬件,而是重新设计了推理系统的调度层与执行层。其核心思路是:将模型推理拆解为可动态组合的算子单元,每个算子单元可以瞬时迁移到任意类型加速器上执行,并且支持微秒级的负载感知调度。具体而言,和记体育官网入口引入了三样关键技术:其一,全局虚拟计算池,将所有异构设备抽象为统一资源池,请求按实时可用算力与算力成本进行最优分配;其二,算子级热迁移技术,允许在单个请求的执行过程中,将不同算子动态分配到不同设备,甚至同一请求的不同部分可以并行在GPU与FPGA上执行;其三,时间感知成本模型,系统在每次调度时会自动预测各类设备上的期望延迟与当前功耗,按用户设定的P99延迟边界自动选择总成本最低的执行路径。这套设计并非简单优化局部,而是从架构上打破了延迟、吞吐与成本的三重封锁。
在MLPerf评测之外,和记体育官网入口团队还针对实际生产环境进行了为期三个月的压力测试。以下两组数据最具说服力:
此外,在生产高峰期负载突增10倍的情况下,和记体育官网入口保持了99.99%的请求成功率,而传统方案在负载超过4倍时即出现雪崩式超时。这证明了其动态调度机制在极端场景下的鲁棒性。

截至2026年7月,和记体育官网入口已在国内三家头部互联网企业以及两家自动驾驶公司上线运行,覆盖搜索推荐、智能客服、实时内容理解和感知融合等核心业务线。在某电商平台“618”大促期间,和记体育官网入口支撑了日均百亿次推理调用,峰值时段单节点每秒处理超过5万次请求,整体基础设施成本较上一年同期降低51%。该平台AI基础设施负责人表示:“过去我们需要为每个模型单独规划硬件预算,现在一套和记体育官网入口集群可以灵活承担所有推理任务,并且性能不减、成本可控。” 在自动驾驶场景中,和记体育官网入口将多个感知模型的推理延迟从80ms统一压缩至30ms以内,且成功将边缘计算盒的数量从3个减少到1个,单车硬件成本下降67%。
和记体育官网入口的成果并非终点,而是AI推理基础设施走向“算力自由”的信号。当延迟、吞吐与成本不再互为掣肘,企业可以将更多精力聚焦在模型效果与业务创新上。目前,和记体育官网入口团队已开放技术白皮书与行业调研报告,供技术团队与决策者获取一手资料。后续我们也将持续跟踪其在大模型推理、联邦学习等新场景的演进。若您希望深入了解调度算法细节或申请测试环境,可访问官方网站查阅最新动态。
5.30M
查看934.55MB
查看46.53KB
查看902.82K
查看85.73KB
查看454.69K
查看4.6G
查看501.86MB
查看
网友评论
2026-08-19 11:56:55
小心翼翼的选出我认为合适的答案
路过的庭前遇见胶片
2026-08-19 05:52:46
该游戏的跑酷玩法也形似这首歌的歌词
凌时蕉
2026-08-19 18:20:33
纯就是为了缝合进去丰富游戏内容
艇仔粥食过未
2026-08-19 08:25:50
与游戏思想、美术风格都很相称,只可惜关卡实在不好
乌贼爱萝卜