并行程序设计---cuda memory

CUDA存储器模型：

GPU片内：register，shared memory；

host 内存： host memory, pinned memory.

板载显存：local memory,constant memory, texture memory, texture memory,global memory;

基本单元：register file （32bit/each）

计算能力1.0/1.1版本号硬件：8192/SM。

计算能力1.2/1.3版本号硬件： 16384/SM;

每一个线程占有的register有限。编程时不要为其分配过多私有变量。

shared memory：訪问速度与寄存器相似。

实现线程间通信的延迟最小。

保存公用的计数器或者block的公用结果。

硬件1.0~1.3中。16KByte/SM,被组织为16个bank。

声明keyword _shared_ int sdata_static[16];

host内存：分为pageable memory 和 pinned memory

pageable memory：通过操作系统API（malloc（）。new（））分配的存储器空间；、

pinned memory：始终存在于物理内存中，不会被分配到低速的虚拟内存中，可以通过DMA加速与设备端进行通信。

cudaHostAlloc(), cudaFreeHost()来分配和释放pinned memory。使用pinned memory长处：主机端-设备端的传输数据带宽高；某些设备上能够通过zero-copy功能映射到设备地址空间。从GPU直接訪问，省掉主存与显存间进行数据拷贝的工作; pinned memory 不能够分配过多：导致操作系统用于分页的物理内存变。导致系统总体性能下降。通常由哪个cpu线程分配，就仅仅有这个线程才有訪问权限；

cuda2.3版本号中，pinned memory功能扩充：

portable memory：让控制不同GPU的主机端线程操作同一块portable memory，实现cpu线程间通信；使用cudaHostAlloc（）分配页锁定内存时。加上cudaHostAllocPortable标志。

write-combined Memory：提高从cpu向GPU单向数据传输的速度；不使用cpu的L1，L2 cache对一块pinned memory中的数据进行缓冲。将cache资源留给其它程序使用。在pci-e总线传输期间不会被来自cpu的监视打断。在调用cudaHostAlloc（）时加上cudaHostAllocWriteCombined标志。cpu从这样的存储器上读取的速度非常低。

mapped memory：两个地址：主机端地址（内存地址），设备端地址（显存地址）。能够在kernnel程序中直接訪问mapped memory中的数据。不必在内存和显存之间进行数据拷贝，即zero-copy功能；在主机端能够由cudaHostAlloc（）函数获得。在设备端指针能够通过cudaHostGetDevicePointer（）获得；通过cudaGetDeviceProperties（）函数返回的canMapHostMemory属性知道设备是否支持mapped
memory；在调用cudaHostAlloc（）时加上cudaHostMapped标志，将pinned memory映射到设备地址空间。必须使用同步来保证cpu和GPu对同一块存储器操作的顺序一致性；显存中的一部分能够既是portable memory又是mapped memory。在运行CUDA操作前，先调用cudaSetDeviceFlags（）（加cudaDeviceMapHost标志）进行页锁定内存映射。

constant memory：仅仅读地址空间；位于显存，有缓存加速；64Kb。用于存储须要频繁訪问的仅仅读參数。仅仅读；使用_constant_ keyword。定义在全部函数之外。两种常数存储器的用法：直接在定义时初始化常数存储器。定义一个constant数组。然后使用函数进行赋值；

texture memory：仅仅读。不是一块专门的存储器，而是牵涉到显存、两级纹理缓存、纹理拾取单元的纹理流水线；数据常以一维、二维或者三维数组的形式存储在显存中；缓存加速；能够声明大小比常数存储器大得多；适合实现图像树立和查找表。对大量数据的随机訪问或非对齐訪问有良好的加速效果；在kernel中訪问纹理存储器的操作成为纹理拾取（texture fetching）。纹理拾取使用的坐标与数据在显存中的位置能够不同，通过纹理參照系约定二者的映射方式。将显存中的数据与纹理參照系关联的操作，称为将数据与纹理绑定（texture
binding）。显存中能够绑定到纹理的数据有：普通线性存储器和cuda数组；存在缓存机制；能够设定滤波模式，寻址模式等；

local memory：寄存器被使用完成，数据将被存储在局部存储器中；

大型结构体或者数组。

无法确定大小的数组；

线程的输入和中间变量；

定义线程私有数组的同一时候进行初始化的数组被分配在寄存器中。

global memory:存在于显存中。也称为线性内存（显存能够被定义为线性存储器或者CUDA数组）。

cudaMalloc（）函数分配，cudaFree（）函数释放，cudaMemcpy（）进行主机端与设备端的传输数据。

初始化共享存储器须要调用cudaMemset（）；

二维三维数组：cudaMallocPitch（）和cudaMalloc3D（）分配线性存储空间，能够确保分配满足对齐要求；

cudaMemcpy2D（）。cudaMemcpy3D（）与设备端存储器进行拷贝；

并行程序设计---cuda memory的更多相关文章

【CUDA并行程序设计系列（1）】GPU技术简介
http://www.cnblogs.com/5long/p/cuda-parallel-programming-1.html 本系列目录: [CUDA并行程序设计系列(1)]GPU技术简介 [CUD ...
《CUDA并行程序设计：GPU编程指南》
<CUDA并行程序设计:GPU编程指南> 基本信息原书名:CUDA Programming:A Developer’s Guide to Parallel Computing with ...
OpenMP并行程序设计
1.fork/join并行执行模式的概念 2.OpenMP指令和库函数介绍 3.parallel 指令的用法 4.for指令的使用方法 5 sections和section指令的用法 1.fork/j ...
《并行程序设计导论》——MPI（Microsoft MPI）（1）：Hello
=================================版权声明================================= 版权声明:原创文章禁止转载请通过右侧公告中的“联系邮 ...
OpenMP并行程序设计——for循环并行化详解
在C/C++中使用OpenMP优化代码方便又简单,代码中需要并行处理的往往是一些比较耗时的for循环,所以重点介绍一下OpenMP中for循环的应用.个人感觉只要掌握了文中讲的这些就足够了,如果想要学 ...
CUDA ---- Memory Model
Memory kernel性能高低是不能单纯的从warp的执行上来解释的.比如之前博文涉及到的,将block的维度设置为warp大小的一半会导致load efficiency降低,这个问题无法用war ...
openMP编程(上篇)之并行程序设计
openMP简介 openMP是一个编译器指令和库函数的集合,主要是为共享式存储计算机上的并行程序设计使用的. 当计算机升级到多核时,程序中创建的线程数量需要随CPU核数变化,如在CPU核数超过线程数 ...
OpenMP 并行程序设计入门
OpenMP 是一个编译器指令和库函数的集合,主要是为共享式存储计算机上的并行程序设计使用的. 0. 一段使用 OpenMP 的并行程序 #include <stdio.h> #inclu ...
CUDA并行程序设计开发环境搭建与远程调试
课题需要用到GPU加速.目前使用的台式电脑只有核心显卡,而实验室有一台服务器装有NVIDIA GTX980独显.因此,想搭建一个CUDA的开发环境,来实现在台式机上面开发cuda程序,程序在服务器而不 ...

随机推荐

python面试题解析(前端、框架和其他)
答: HTTP是一个属于应用层的面向对象的协议,由于其简捷.快速的方式,适用于分布式超媒体信息系统.它于1990年提出,经过几年的使用与发展,得到不断地完善和扩展.目前在WWW中使用的是HTTP/1. ...
基于JQuery的WEB套打设计器jatoolsPrinter1.0
开发web套打应用时,如快递单打印,一般要经过以下步骤:1. 扫描快递单据,保存成一个图片文件2. 将底图作成<img>3. 在<img>上放置打印项,试着打印到打印机,观察有 ...
使用spyder3调试python程序
Ctrl+F5 以Debug模式运行文件在debug之前记得用%reset 指令清空一下ipython工作空间中的变量,以免影响debug中变量值的查看无论你是否打断点,都会在第一行语句执行之前中 ...
Python学习-day7 类部分socket
这周还是继续关于类的学习,在面向对象的学习过程中又学习了网络编程,并且提交了编写FTP的作业. 复习一下类的相关概念和定义类属性实例变量:内存中 ...
install cinnamon on ubuntu 14.04
emotion: I feel not comfortable with ubuntu 14.04 default desktop unity,i still look for a alternati ...
PHP协程是通过生成器实现的，这里测试了PHP生成器的一些特性
学习PHP的生成器,测试了一些特性.代码如下: function gen() { $name = (yield 'hello'); $nickname = (yield 'world'); yield ...
九度oj 题目1475：IP数据包解析
题目描述: 我们都学习过计算机网络,知道网络层IP协议数据包的头部格式如下: 其中IHL表示IP头的长度,单位是4字节:总长表示整个数据包的长度,单位是1字节. 传输层的TCP协议数据段的头部格式如下 ...
前面板插口耳机无声音？无Realtek控制器？
今天碰到一个很恶心的问题,电脑又没有声音了, 因为新装的系统,怀疑没有驱动,就装了驱动,还是没有有声音, 网上搜了半天都是让在控制面板找Realtek控制器,可以我的控制面板没有. 最后找到一篇百度经 ...
设计模式（二 & 三）工厂模式：2-工厂方法模式
模拟场景: 沿用设计模式(二)工厂模式:1-简单工厂模式中关于运算器 Operation 的例子. 思想: 针对在 Easy Factory 中提出的,破坏“开-闭原则”的问题,Factory M ...
[luoguP2754] 星际转移问题（最大流）
传送门不同的时间每个飞船所在的地点不同,给我们启示按照时间构建分层图. 同一个地点 x <x, dayi - 1> -> <x, dayi> 连一条容量为 INF 的边 ...

并行程序设计---cuda memory

并行程序设计---cuda memory的更多相关文章

随机推荐

热门专题