肿瘤大数据挖掘中经常需要处理上百亿行的文本文件,这些文件往往高达数百GB,假如文件结构简单统一,那么用sed和awk 处理是非常方便和快速的。但有时候会遇到逻辑较为复杂的处理流程,这样我一般会用JAVA来处理。但由于JAVA是单线程的,因此对于实验室多核服务器来说,能充分有效的利用起每个核会方便不少,那么这个时候就推荐用多线程来并发(并行)处理任务,从而达到运算速度倍速的提升。

  这里举一个并行计算的例子。例子比较简单,主要是对三个数进行累加,最后输出结果。我们分别用单线程和多线程来执行,其中单线程是顺序执行而多线程则同时启动三个线程来并行(服务器CPU数大于三,所以这里是并行而不是并发)执行。

  首先是单线程的运行结果:

public class Nothreading
{
public static void main(String[] args)
{
long startTime = System.currentTimeMillis();
int sum_i = 0;
int sum_j = 0;
int sum_k = 0;
for(int i = 0; i < 10000; i++)
{
sum_i += 1;
       /* 增加程序运行时间, 后面同理 */
for(int a = 0 ; a < 100000 ; a ++)
{
String s = "To cost some time";
String[] ss = s.split(" ");
}
}
for(int j = 0; j < 10000; j++)
{
sum_j += 2;
for(int a = 0 ; a < 100000 ; a ++)
{
String s = "To cost some time";
String[] ss = s.split(" ");
}
}
for(int k = 0; k < 10000; k++)
{
sum_k += 3;
for(int a = 0 ; a < 100000 ; a ++)
{
String s = "To cost some time";
String[] ss = s.split(" ");
}
}
long endTime = System.currentTimeMillis();
System.out.println(sum_i + "\t" + sum_j + "\t" + sum_k);
System.out.println("run time:"+(endTime-startTime)+"ms");
}
}

  运行结果:

run time:663587ms

  图片是该程序运行时的CPU资源利用状态: 可以看到仅有一个CPU的利用率达到100%.

  下面是多线程:

class Count_i
{
public int sum_i = 0;
public synchronized void count()
{
for(int i = 0 ; i < 10000; i++)
{
sum_i += 1;
/* 增加运行时间 后面同理*/
for(int a = 0 ; a < 100000; a ++)
{
String s = "To cost some time";
String[] ss = s.split(" ");
}
}
}
} class Count_j
{
public int sum_j = 0;
public synchronized void count()
{
for(int j = 0 ; j < 10000; j++)
{
sum_j += 2;
for(int a = 0 ; a < 100000; a ++)
{
String s = "To cost some time";
String[] ss = s.split(" ");
}
}
}
} class Count_k
{
public int sum_k = 0;
public synchronized void count()
{
for(int k = 0 ; k < 10000; k++)
{
sum_k += 3;
for(int a = 0 ; a < 100000; a ++)
{
String s = "To cost some time";
String[] ss = s.split(" ");
}
}
}
} class Mul_thread_i extends Thread
{
public Count_i c_i;
public Mul_thread_i(Count_i acc)
{
this.c_i = acc;
}
public void run()
{
c_i.count();
}
} class Mul_thread_j extends Thread
{
public Count_j c_j;
public Mul_thread_j(Count_j acc)
{
this.c_j = acc;
}
public void run()
{
c_j.count();
}
} class Mul_thread_k extends Thread
{
public Count_k c_k;
public Mul_thread_k(Count_k acc)
{
this.c_k = acc;
}
public void run()
{
c_k.count();
}
} public class Threethreading_save
{
public static void main(String[] args) throws InterruptedException
{
long startTime = System.currentTimeMillis();
Count_i ci = new Count_i();
Count_j cj = new Count_j();
Count_k ck = new Count_k();
Mul_thread_i aa = new Mul_thread_i(ci);
Mul_thread_j bb = new Mul_thread_j(cj);
Mul_thread_k cc = new Mul_thread_k(ck); aa.start();
bb.start();
cc.start();
aa.join();
bb.join();
cc.join(); System.out.println(ci.sum_i);
System.out.println(cj.sum_j);
System.out.println(ck.sum_k);
long endTime = System.currentTimeMillis();
System.out.println("run time:"+(endTime-startTime)+"ms");
}
}

  下面是运行结果:

10000
20000
30000
run time:221227ms

  CPU状态:可以看到有三个CPU的利用率达到100%.

空闲时的状态:

  总结一些,当我们处理的任务量很大的时候,如果计算机有多个CPU,可以将待处理的任务合理的分为几个部分,然后开几个线程同时进行运算,等这些子任务都完成以后再交给主线程后续的处理,可以看到效率成倍的提升。当然线程安全是一个需要注意的问题,由于时间关系后面将详细介绍。

利用JAVA多线程来提高数据处理效率的更多相关文章

  1. GitHub Java项目推荐|功能丰富的 Java 工具包|提高开发效率

    GitHub Java项目推荐|功能丰富的 Java 工具包|提高开发效率 功能丰富的 Java 工具包.它帮助我们实现了常用的工具方法,从而减少代码的体积,提高开发效率.该项目最初是作者工作项目中的 ...

  2. 如何优化JAVA代码及提高执行效率

    可供程序利用的资源(内存.CPU时间.网络带宽等)是有限的,优化的目的就是让程序用尽可能少的资源完成预定的任务.优化通常包含两方面的内容:减小代码的体积,提高代码的运行效率.本文讨论的主要是如何提高代 ...

  3. (原创)JAVA多线程一传统多线程

    一,多线程 多线程是提高程序效率,避免资源浪费的很好的解决方案,下面来慢慢的介绍多线程的一些基本知识,而这些是晋级高级不可或缺的一部分 1,Thread类 类实现多线程需要实现Runnable接口,我 ...

  4. java 多线程 22 :生产者/消费者模式 进阶 利用await()/signal()实现

    java多线程15 :wait()和notify() 的生产者/消费者模式 在这一章已经实现了  wait/notify 生产消费模型 利用await()/signal()实现生产者和消费者模型 一样 ...

  5. 在一个千万级的数据库查寻中,如何提高查询效率?分别说出在数据库设计、SQL语句、java等层面的解决方案。

    在一个千万级的数据库查寻中,如何提高查询效率?分别说出在数据库设计.SQL语句.java等层面的解决方案. 解答: 1)数据库设计方面: a. 对查询进行优化,应尽量避免全表扫描,首先应考虑在 whe ...

  6. 如何利用 Visual Studio 自带工具提高开发效率

    Visual Stuido 是一款强大的Windows 平台集成开发工具,你是否好好地利用了它呢? 显示行号 有些时候(比如错误定位)的时候,显示行号将有利于我们进行快速定位. 如何显示 1. 工具 ...

  7. tomcat免重启随意更改java代码 提高开发效率

    转载:http://developer.51cto.com/art/201012/241243.htm 做为了一个java开发人员,总是为因为要增加一个类,或是增加删除一个方法,甚至修改一个小处代码而 ...

  8. 【Java】能提高日常工作效率的一些Java函数

    自编工具总是临时抱佛脚来得顺溜,宜常备手边以提高工作效率: package com.hy; import java.io.File; /** * 日常工作常用的一些工具方法 * @author 逆火 ...

  9. JAVA多线程提高十四: 面试题

    前面针对多线程相关知识点进行了学习,那么我们来来看看常见的面试题: 1. 空中网面试题1 package com.kongzhongwang.interview; import java.util.c ...

随机推荐

  1. java.lang.IllegalAccessError: tried to access method org.apache.poi.util.POILogger.log from class org.apache.poi.openxml4j.opc.ZipPackage

    代码说简单也简单,说复杂那还真是寸步难行. 之前好好的excel导出功能,本地启动调试的时候突然就不行了,一直报上面的错. 一直在本地折腾了半天,去测试环境上看,又是好的,可以正常导出excel. 搜 ...

  2. 【vuejs深入一】深入学习vue指令,自定义指令解决开发痛点

    写在前面  一个好的架构需要经过血与火的历练,一个好的工程师需要经过无数项目的摧残. 最近博主我沉淀了几个月,或者说懒了几个月.然而大佬的指点总是一针见血,能够让人看到方向.所以我现在有觉得,一个好的 ...

  3. jacascript 函数声明、函数表达式与声明提升(hoisting机制)

    前言:这是笔者学习之后自己的理解与整理.如果有错误或者疑问的地方,请大家指正,我会持续更新! 声明.定义.初始化 声明的意思是宣称一个变量名的存在,定义则为这个变量分配存储空间,初始化则是给该变量名的 ...

  4. 解决:My97DatePicker 日期插件引用在PHP文件中maxDate和minDate控制失效问题

    开发环境: 语言:PHP 框架:ThinkPHP 问题:在引用插件My97DatePicker时,想实现:开始日期不能大于结束日期,结束时间不能小于开始时间 步骤一.查看文档官方文档http://ww ...

  5. 深入浅出理解 TCP/IP 协议 (一)

    文章转自:https://www.cnblogs.com/onepixel/p/7092302.html TCP/IP 协议栈是一系列网络协议的总和,是构成网络通信的核心骨架,它定义了电子设备如何连入 ...

  6. [LeetCode] Sentence Similarity II 句子相似度之二

    Given two sentences words1, words2 (each represented as an array of strings), and a list of similar ...

  7. [HNOI2012]排队

    题目描述 某中学有 n 名男同学,m 名女同学和两名老师要排队参加体检.他们排成一条直线,并且任意两名女同学不能相邻,两名老师也不能相邻,那么一共有多少种排法呢?(注意:任意两个人都是不同的) 输入输 ...

  8. [ZJOI2016]小星星

    题目描述 小Y是一个心灵手巧的女孩子,她喜欢手工制作一些小饰品.她有n颗小星星,用m条彩色的细线串了起来,每条细线连着两颗小星星. 有一天她发现,她的饰品被破坏了,很多细线都被拆掉了.这个饰品只剩下了 ...

  9. ●洛谷P3348 [ZJOI2016]大森林

    题链: https://www.luogu.org/problemnew/show/P3348 题解: LCT,神题 首先有这么一个结论: 每次的1操作(改变生长点操作),一定只会会对连续的一段区间产 ...

  10. ●POJ 3378 Crazy Thairs

    题链: http://poj.org/problem?id=3378 题解: 树状数组维护,高精度. 依次考虑以每个位置结尾可以造成的贡献. 假设当前位置为i,为了达到5个元素的要求,我们需要求出,在 ...