CUDA学习ing..

0.引言

本文记载了CUDA的学习过程~刚开始接触GPU相关的东西，包括图形、计算、并行处理模式等，先从概念性的东西入手，然后结合实践开始学习。CUDA感觉没有一种权威性的书籍，开发工具变动也比较快，所以总感觉心里不是很踏实。所以本文就是从初学者的角度，从无知开始探索的过程。当然在学习过程中避免不了出现概念性的理解错误，出现描述模糊不确切的地方还望指出，共勉共勉~

1.CUDA的概念

2.CUDA的模型

CUDA的运行模型，让host中的每个kernel按照线程网格的方式（Grid）在显卡硬件（GPU）上执行。每一个线程网格又包含多个线程块（block），每一个线程块又包含多个线程（Thread）。

Thread是UCDA模型中最基本的运行单元，执行最基本的程序指令。每一组协作的Thread被归于一个Block。在Block内部允许共享存储，可以容纳Thread的上限是512个。Grid是一组Block,共享全局存储空间。每一个Grid对应着一个Kernel任务（GPU上执行的核心任务）。

Warp:GPU执行程序时（Multi-processor）调度单位，目前CUDA的Warp的大小为32，同在一个Warp线程，在相同的指令下执行不同的数据。由于Multi-processor的数量不同，所以一个Block内的所有Thread不一定全部同时运行，但是每个Warp内的所有Thread一定同时运行。因此，我们定义BlockSize的时候应该是Warp Size的整数倍，也就是BlockSize应该为32 的整数倍。理论上来说，Thread的数量越多，就越能弥补单个Thread读取数据的 latency，但是当Tread越多，每个Thread可用的寄存器数量也就越少，严重的时候甚至能造成Kernel无法启动。因此每个Block至少应该包含64个Thread，一般数目为128或者256，具体的数量依据Multi-processor的数目而定。一个Multi-processor最多可以同时运行768个Thread，但是每个Multi-processor最多包含8个Block，因此要保持100%利用率，Block与Size就应该保持下列设定：

2 blocks x 384 threads

3 blocks x 256 threads

4 blocks x 192 threads

6 blocks x 128 threads

8 blocks x 96 threads

CUDA学习ing..的更多相关文章

CUDA学习，第一个kernel函数及代码讲解
前一篇CUDA学习,我们已经完成了编程环境的配置,现在我们继续深入去了解CUDA编程.本博文分为三个部分,第一部分给出一个代码示例,第二部分对代码进行讲解,第三部分根据这个例子介绍如何部署和发起一个k ...
CUDA学习之二：shared_memory使用，矩阵相乘
CUDA中使用shared_memory可以加速运算,在矩阵乘法中是一个体现. 矩阵C = A * B,正常运算时我们运用 C[i,j] = A[i,:] * B[:,j] 可以计算出结果.但是在CP ...
CUDA学习之一：二维矩阵加法
今天忙活了3个小时,竟然被一个苦恼的CUDA小例程给困住了,本来是参照Rachal zhang大神的CUDA学习笔记来一个模仿,结果却自己给自己糊里糊涂,最后还是弄明白了一些. RZ大神对CUDA关于 ...
CUDA学习笔记（三）——CUDA内存
转自:http://blog.sina.com.cn/s/blog_48b9e1f90100fm5f.html 结合lec07_intro_cuda.pptx学习内存类型 CGMA: Compute ...
CUDA学习笔记（二）【转】
来源:http://luofl1992.is-programmer.com/posts/38847.html 编程语言的特点是要实践,实践多了才有经验.很多东西书本上讲得不慎清楚,不妨自己用代码实现一 ...
cuda学习2-block与thread数量的选取
由上一节可知,在main函数中,cuda程序的并行能力是在add<<<N,1>>>( dev_a, dev_b, dev_c )函数中体现的,这里面设置的是由N个b ...
cuda学习3-共享内存和同步
为什么要使用共享内存呢,因为共享内存的访问速度快.这是首先要明确的,下面详细研究. cuda程序中的内存使用分为主机内存(host memory) 和设备内存(device memory),我们在这 ...
CUDA学习之从CPU架构说起
最近要学习GPU编程,就去英伟达官网下载CUDA, 遇到的第一个问题就是架构的选择所以我学习的CUDA的第一步是从学习认识CPU架构开始的,x86-64简称x64,是64位版的x86指令集,向前兼容 ...
CUDA学习笔记1
最近要做三维重建就学习一下cuda的一些使用. CUDA并行变成的基本四路是把一个很大的任务划分成N个简单重复的操作,创建N个线程分别执行. CPU和GPU,有各自的存储空间: Host, CPU a ...

随机推荐

Asp.net MVC4.0（net4.5）部署到window server 2003上的解决方案
Asp.net MVC4.0(net4.5) 部署到window server 2003上的解决方案最近做了一个Web项目,也没多想就用了Asp.net MVC4.0 ,MVC4.0默认的目标fra ...
MVC应用程序显示上传的图片
MVC应用程序显示上传的图片前两篇<MVC应用程序实现上传文件>http://www.cnblogs.com/insus/p/3590907.html和<MVC应用程序实现上传文件 ...
c# 数据类型占用的字节数
最近一直在使用C#中的关于各种数据类型转化为字节或者字节转化为各种数据类型进行数据解析.但是在此之前必须知道各种数据类型在字节中占的字节数. 所以在此归总. bool -> System.Boo ...
String类重写
#include <iostream> #include<string.h> using namespace std; class String { int length; i ...
Web.Config Transformation配置灵活的配置文件
使用Web.Config Transformation配置灵活的配置文件发布Asp.net程序的时候,开发环境和发布环境的Web.Config往往不同,比如connectionstring等.如果常 ...
[转]Top 10 DTrace scripts for Mac OS X
org link: http://dtrace.org/blogs/brendan/2011/10/10/top-10-dtrace-scripts-for-mac-os-x/ Top 10 DTra ...
企业架构与建模之ArchiMate的由来和详述（上）
终于完成了关于企业架构框架理论的总结,谢谢各位看官的支持,能挺过之前过于理论化的叙述而坚持到现在着实不易,笔者也自愧没有实践经验可以分享,希望日后有兴趣的看官能够不吝赐教.在本系列后面的也是最后一个大 ...
Linux网络编程(三)
Linux网络编程(三) wait()还是waitpid() Linux网络编程(二)存在客户端断开连接后,服务器端存在大量僵尸进程.这是由于服务器子进程终止后,发送SIGCHLD信号给父进程,而父进 ...
开发者所需要知道的iOS7 SDK新特性
iOS 7 春风又绿加州岸,物是人非又一年.WWDC 2013 keynote落下帷幕,新的iOS开发旅程也由此开启.在iOS7界面重大变革的背后,开发者们需要知道的又有哪些呢.同去年一样,我会先简单 ...
HTML5 前端框架和开发工具【下篇】
HTML5 前端框架和开发工具[下篇] 快速,安全,响应式,互动和美丽,这些优点吸引更多的 Web 开发人员使用 HTML5.HTML5 有许多新的特性功能,允许开发人员和设计师创建应用程序和网站,带 ...

CUDA学习ing..

CUDA学习ing..的更多相关文章

随机推荐

热门专题