CUDA学习之二:shared_memory使用,矩阵相乘
摘要:CUDA中使用shared_memory可以加速运算,在矩阵乘法中是一个体现。矩阵C = A * B,正常运算时我们运用 C[i,j] = A[i,:] * B[:,j] 可以计算出结果。但是在CPU上完成这个运算我们需要大量的时间,设A[m,n],B[n,k],那么C矩阵为m*k,总体,我们需要做...
阅读全文
posted @ 2015-03-20 21:48
浙公网安备 33010602011771号