摘要:
在OpenMPI中,使用mpirun、mpiexec命令在不同节点拉起MPI进程,并传入各种设置参数。为保证程序正常运行,需要传入正确的参数。这里记录常用方法。 阅读全文
posted @ 2026-08-23 10:14
LO_StacNet
阅读(3)
评论(0)
推荐(0)
摘要:
统一内存(CUDA Unified Memory)让数据在GPU和CPU之间的搬运对用户透明,在编写程序时无需频繁的手动搬移,简化了程序编写。但是,有些情况我们需要对数据进行大规模IO并且已知操作设备,此时如果操作到内存页再进行自动搬移会在计算过程中插入很多内存搬移,导致性能下降。为了防止这种情况,可以通过`cudaMemPrefetchAsync`预取函数,在操作前将内存显式迁移。 阅读全文
posted @ 2026-08-23 10:13
LO_StacNet
阅读(1)
评论(0)
推荐(0)
摘要:
本文记录在windows10-WSL2-Ubuntu22.04.3 RTX3060 环境下安装CUDA,并使用Clion-Cmake创建CUDA工程,同时在Jetson Orin Nano上进行开发的过程。 阅读全文
posted @ 2026-08-23 10:12
LO_StacNet
阅读(2)
评论(0)
推荐(0)

浙公网安备 33010602011771号