面向超大规模计算系统的监控、调度及网络优化实践

来源 :数据与计算发展前沿 | 被引量 : 0次 | 上传用户:ty20011
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
[目的]为应对超大规模计算系统所带来的监控数据风暴、作业调度稳定性及灵活性、网络复杂度及高效性等实际挑战,本文分享了近期真实实践的经验和解决办法.[应用背景]当计算系统从P级逐渐向E级过渡,节点数量可超过10000个.在计算系统设计之初就需要确定网络拓扑的选型,而在系统的具体使用中更是离不开高效的调度和及时的监控.[方法]本文采用了基于动态负载均衡的分布式监控架构设计,基于高速缓存的分布式告警架构设计,基于SLURM的源码和配置优化,以及nd-Torus网络拓扑仿真对比等相关技术手段,基本满足了实际业务使用需求.[结果]数据表明,对于~10000节点的计算系统,实时告警数据库表的数据量大小基本可以控制在100万条以内.优化后的SLURM调度系统,可满足系统的业务级调度需求.网络方面,6D-Torus网络由于网络直径低、平均通信距离短,性能和网卡线缆用量较Fat-Tree网络和3D-Torus有一定提升,饱和吞吐率超过40%.[结论]分布式监控架构和告警架构可以有效解决监控数据风暴问题.SLURM在优化后可以实现对超大规模计算系统的作业调度功能.就线缆和交换机使用数量而言,6D-Torus相对于传统Fat-Tree网络更加经济,且性能优于3D-Torus,更适合超大规模计算系统.
其他文献
用中子衍射应力分析谱仪测量无应力样品表面时,衍射峰因装置因素会发生一定的偏移(赝偏移).使用射线追踪程序SIMRES对减轻赝偏移的方法进行系统研究,使得测量的应力值更为准
应用高效液相色谱-电喷雾串联质谱(HPLC-MS/MS)测定[18F]FDG示踪剂中残留的Kryptofix 2.2.2浓度,并进行方法学确证.以乙腈40 mmol/L NH4Ac水溶液(50:50,V/V)为流动相,采用ult
[背景]理论分析、实验观察与计算模拟是科学研究的三大手段.高性能计算作为一个国家综合国力的主要标志之一,具有重要的战略意义.[方法]本文从我国高性能计算机的研制、高性
厚屏频率选择表面(FSS)能克服双层或多层溥屏FSS级联引起的结构复杂和中心频率透过率容易降低的不利影响,并且在拓展FSS带宽方面具有优势,这使其在曲面隐身雷达天线罩应用方
端粒DNA与细胞的衰老、死亡、癌变密切相关,人体端粒DNA富含G和C单链可分别形成G-四链体(G-quadruplex)和I-motif四链体结构.它们与端粒酶活性、着丝粒DNA、RNA夹层结构等有
[目的]本文根据2019年11月发布的中国高性能计算机TOP100排行榜的数据,对国内高性能计算机的发展现状从总体性能、制造商、行业领域等方面进行了深入分析.[结果]中国TOP100的
[目的]本文介绍了中国科学院地球系统模式CAS-ESM的发展、构成及性能优化,着重介绍了在并行计算优化方面的工作.[方法]基于CAS-ESM1.0,在大气和海洋模式上,就并行剖分、跳点
[目的]随着云计算、物联网以及人工智能等新型高通量应用的迅速兴起,高性能计算的主要应用从传统的科学与工程计算为主逐步演变为以新兴数据处理为核心,这给传统处理器带来了
[目的]本文主要分析人工智能和大数据应用随着迅速增大的数据规模,给计算机系统带来的主要挑战,并针对计算机系统的发展趋势给出了一些面向人工智能和大数据亟待解决的高效能
[目的]高超声速湍流直接数值模拟(DNS)对空间及时间分辨率要求高,计算量非常大.过大的计算量及过长的计算时间是导致DNS难以在工程中被大范围应用的重要原因.为加快计算速度,