Skip to content

基于国产异构加速卡的 GPUMD/NEP 机器学习势训练、分子动力学模拟与精度验证全流程

神经演化势(Neuroevolution Potential, NEP)是近年来发展迅速的机器学习势之一,其核心特点是将「描述符 + 神经网络 + 演化优化 + GPU 分子动力学」四个环节收敛到一个自洽、极简、几乎零依赖的代码库 GPUMD 中:训练用 nep,MD 模拟用 gpumd,两个可执行文件、两个纯文本输入即可完成全流程,单卡吞吐可达 10⁵–10⁶ atom·step/s 量级。
本期最佳实践,以全无机钙钛矿 CsPbBr₃(含 γ/β/α 三相、Br 空位缺陷与 CsPb₂Br₅ 次生相)的相稳定性与热输运研究为例,完整记录在超算互联网平台的国产异构加速卡上,打通 NEP 训练 → 精度四级验收 → GPUMD 生产分子动力学的全过程:包含异构加速卡环境的真实构建与验证、DFT 标注作业的多卡绑核编排、数据集构建与体检、nep.in 每一个关键字的物理含义与调参经验、run.in的系综选择、10 万代训练的真实收敛曲线、12.2 万原子受力的 parity 与误差分位分析、300 ps 生产 MD 的守恒性诊断,以及 8 个真实报错案例的根因与修复。
最终模型力 RMSE = 31.9 meV/Å、能量主体 RMSE = 9.2 meV/atom、位力 RMSE = 11.2 meV/atom,满足卤化物钙钛矿长时程 MD 的精度要求。相比同类基于DeePMD-kit的实践,本期最佳实践重点解决了精度验证、错误排查与计算资源扩展三个常被简化的环节,并将所有操作步骤细化至可直接复现的颗粒度。

目录
一、背景与目标
二、方法学:NEP 势为什么这样设计
三、软硬件环境与选型
四、异构加速卡环境配置与五步冒烟测试
五、体系设计与训练数据准备(十步)
六、NEP 训练配置详解(nep.in 逐参数)
七、异构加速卡上的训练执行、监控与收敛判读
八、精度验收体系:四级验证(本报告重点)
九、GPUMD 生产分子动力学
十、性能、多卡扩展与「万卡」级批量调度
十一、报错了怎么办:真实案例与三步定位法
十二、一页纸可复现清单
十三、结论与展望
附录 A 全部脚本与文件清单
附录 B nep.in / run.in 参数速查表
参考来源

划重点:完整使用教程文档,大家可点击查看:基于国产异构加速卡的 GPUMD/NEP 机器学习势训练、分子动力学模拟与精度验证全流程

1.png

使用教程文档:https://www.scnet.cn/ui/aihub/knowledge/openaimodels/vyBGQnVMmr0j?create=true