Вызов функции cublas cublasSgemv
Спасибо за @ hubs, при вызове cublasSgemv следует заметить, что CUBLAS_OP_T также является вектором транспонирования. /*Я изучаю cuda и cublas в течение месяца, и я хочу проверить производительность cublas для дальнейшего использования. Но в моем матрично-векторном умножении с использованием cublasSgemv ответ неверен. Я инициализировать матрицу A и вектор X по строкам. Я отправил их на устройство, используя cudaMemcpy, и вызвал функцию cublasSgemv, потому что A-это строка-мажор, я транспонирую ее с помощью параметра CUBLAS_OP_T.* /
//the row is 50,and col is 10, A[i]=i;x[i]=1; And A matrix is row major.
//the answer I get is 45,545,.....4545,0,0,0,0,0,0,0,0,........0
int main(){
int row=50;
int col=10;
int N=row*col;
float*A=new float[N];
float* y_gpu=new float[50];
for (int i=0;i<N;i++)
{
A[i]=(float)i;
}
float* x=new float[10];
for (int i=0;i<10;i++)
{
x[i]=1;
}
GpuVec(A,x,y_gpu,row,col); //call the function
for(int i=0;i<50;i++){
cout<<" "<<y_gpu[i]<<endl; //
}
return 0;
}
int GpuVec(const float* A,const float* x, float* y,const int row,const int col){
cudaError_t cudastat;
cublasStatus_t stat;
int size=row*col;
cublasHandle_t handle;
float* d_A; //device matrix
float* d_x; //device vector
float* d_y; //device result
cudastat=cudaMalloc((void**)&d_A,size*sizeof(float));
cudastat=cudaMalloc((void**)&d_x,col*sizeof(float));
cudastat=cudaMalloc((void**)&d_y,row*sizeof(float));// when I copy y to d_y ,can I cout d_y?
cudaMemcpy(d_A,A,sizeof(float)*size,cudaMemcpyHostToDevice); //copy A to device d_A
cudaMemcpy(d_x,x,sizeof(float)*col,cudaMemcpyHostToDevice); //copy x to device d_x
float alf=1.0;
float beta=0;
stat=cublasCreate(&handle);
stat=cublasSgemv(handle,CUBLAS_OP_T,col,row,&alf,d_A,col,d_x,1,&beta,d_y,1);//swap col and row
cudaMemcpy(y,d_y,sizeof(float)*row,cudaMemcpyDeviceToHost); // copy device result to host
cudaFree(d_A);
cudaFree(d_x);
cudaFree(d_y);
cublasDestroy(handle);
return 0;
}
1 ответ:
Чтобы использовать двумерные массивы, хранящиеся в строках-мажорном порядке в cublas (что работает с колонками-мажорном порядке), вы можете вызвать
gemv
таким образом.stat = cublasSgemv(handle, CUBLAS_OP_T, col, row, &alf, d_A, col, d_x, 1, &beta, d_y, 1);
Вы должны поменять местами m (строки) и n (столбцы) в вызове, чтобы выполнить
y = A * x
, но это позволяет использовать вызов cublas без транспонирования исходного массива.