摘要:
CUDA中使用shared_memory可以加速运算,在矩阵乘法中是一个体现。矩阵C = A * B,正常运算时我们运用 C[i,j] = A[i,:] * B[:,j] 可以计算出结果。但是在CPU上完成这个运算我们需要大量的时间,设A[m,n],B[n,k],那么C矩阵为m*k,总体,我们需要做... 阅读全文
posted @ 2015-03-20 21:48
冷豆东
阅读(6070)
评论(0)
推荐(0)

浙公网安备 33010602011771号