国产异构系统上HPL的优化与分析
随着异构系统成为建造超级计算机的重要选择,如何让CPU与加速器协调工作以充分发挥异构系统的计算性能具有重要意义.HPL是高性能计算领域最重要的基准测试程序,传统面向纯CPU系统的HPL算法通过加速器加速矩阵乘法的做法已经无法取得很好的性能.针对这一问题,提出了基于国产处理器-国产加速器异构系统的HPL性能模型和多线程细粒度流水HPL算法.完成了一个轻量级跨平台异构加速框架HPCX,以实现跨平台的HPL算法.该性能模型能够准确地预测类似异构系统的HPL性能.该HPL算法在NVIDIA GPU平台上性能超过了NVIDIA官方闭源nvhpl程序9%.在国产处理器-国产加速器平台512个节点的规模上,优化的HPL算法实现了2.3 PFLOPS实测峰值性能和71.1%的浮点效率.
HPL;异构系统;跨平台;性能建模;E级计算
32
TP303(计算技术、计算机技术)
国家重点研发计划;中国科学院战略性先导科技专项C类;国家自然科学基金;中国科学院前沿科学重点研究计划
2021-08-31(万方平台首次上网日期,不代表论文的发表时间)
共10页
2319-2328