java处理大文本2G以上

面试中经常碰到类似问题，问题的关键我觉得是用设置一个缓冲区

还有一个思路是通过Linux split 命令将文件直接切割成小文件，再进行处理再汇总。

或者jdk7提供的 forkjoin 框架，利用forkjoinpool管理的线程池，处理此种问题，未尝试过。

以下内容转自： http://blog.csdn.net/sysmedia/article/details/78030113

如下的程序，将一个行数为fileLines的文本文件平均分为splitNum个小文本文件，其中换行符'r'是linux上的，windows的java换行符是'\r\n'：

package kddcup2012.task2.FileSystem;  

import java.io.BufferedInputStream;

import java.io.BufferedReader;

import java.io.File;

import java.io.FileInputStream;

import java.io.FileWriter;

import java.io.IOException;

import java.io.InputStreamReader;  

public class FileSplit

{

    public static void main(String[] args) throws IOException

    {

        long timer = System.currentTimeMillis();

        int bufferSize = 20 * 1024 * 1024;//设读取文件的缓存为20MB   

        //建立缓冲文本输入流

        File file = new File("/media/Data/毕业设计/kdd cup/数据/userid_profile.txt");

        FileInputStream fileInputStream = new FileInputStream(file);

        BufferedInputStream bufferedInputStream = new BufferedInputStream(fileInputStream);

        InputStreamReader inputStreamReader = new InputStreamReader(bufferedInputStream);

        BufferedReader input = new BufferedReader(inputStreamReader, bufferSize);  

        int splitNum = 112-1;//要分割的块数减一

        int fileLines = 23669283;//输入文件的行数

        long perSplitLines = fileLines / splitNum;//每个块的行数

        for (int i = 0; i <= splitNum; ++i)

        {

            //分割

            //每个块建立一个输出

            FileWriter output = new FileWriter("/home/haoqiong/part" + i + ".txt");

            String line = null;

            //逐行读取，逐行输出

            for (long lineCounter = 0; lineCounter < perSplitLines && (line = input.readLine()) != null; ++lineCounter)

            {

                output.append(line + "\r");

            }

            output.flush();

            output.close();

            output = null;

        }

        input.close();

        timer = System.currentTimeMillis() - timer;

        System.out.println("处理时间：" + timer);

    }

}

以上程序处理大文本文件只需要30MB左右的内存空间（这和所设的读取缓冲大小有关），但是速度不是很快，在磁盘没有其他程序占用的情况下，将200MB文件分割为112份需要20秒（机器配置：Centrino2 P7450 CPU，2GB DDR3内存，Ubuntu 11.10系统，硬盘最大读写速度大约60MB/S）。

另外，对于几百兆到2GB大小的文件，使用内存映射文件的话，速度会块一些，但是内存映射由于映射的文件长度不能超过java中int类型的最大值，所以只能处理2GB以下的文件。

java 读取一个巨大的文本文件既能保证内存不溢出又能保证性能

package helloword.helloword;

import java.io.BufferedReader;

import java.io.File;

import java.io.FileReader;

import java.io.RandomAccessFile;

import java.nio.ByteBuffer;

import java.nio.MappedByteBuffer;

import java.nio.channels.FileChannel;

public class ReadBig {

    public static String fff = "C:\\mq\\read\\from.xml";

    public static void main1(String[] args) throws Exception {

        final int BUFFER_SIZE = 0x300000;// 缓冲区大小为3M

        File f = new File(fff);

        MappedByteBuffer inputBuffer = new RandomAccessFile(f, "r").getChannel().map(FileChannel.MapMode.READ_ONLY,

                f.length() / 2, f.length() / 2);

        byte[] dst = new byte[BUFFER_SIZE];// 每次读出3M的内容

        long start = System.currentTimeMillis();

        for (int offset = 0; offset < inputBuffer.capacity(); offset += BUFFER_SIZE) {

            if (inputBuffer.capacity() - offset >= BUFFER_SIZE) {

                for (int i = 0; i < BUFFER_SIZE; i++)

                    dst[i] = inputBuffer.get(offset + i);

            } else {

                for (int i = 0; i < inputBuffer.capacity() - offset; i++)

                    dst[i] = inputBuffer.get(offset + i);

            }

            int length = (inputBuffer.capacity() % BUFFER_SIZE == 0) ? BUFFER_SIZE

                    : inputBuffer.capacity() % BUFFER_SIZE;

            System.out.println(new String(dst, 0, length));// new

            // String(dst,0,length)这样可以取出缓存保存的字符串，可以对其进行操作

        }

        long end = System.currentTimeMillis();

        System.out.println("读取文件文件一半内容花费：" + (end - start) + "毫秒");

    }

    public static void main2(String[] args) throws Exception {

        int bufSize = 1024;

        byte[] bs = new byte[bufSize];

        ByteBuffer byteBuf = ByteBuffer.allocate(1024);

        FileChannel channel = new RandomAccessFile(fff, "r").getChannel();

        while (channel.read(byteBuf) != -1) {

            int size = byteBuf.position();

            byteBuf.rewind();

            byteBuf.get(bs); // 把文件当字符串处理，直接打印做为一个例子。

            System.out.print(new String(bs, 0, size));

            byteBuf.clear();

        }

    }

    public static void main3(String[] args) throws Exception {

        BufferedReader br = new BufferedReader(new FileReader(fff));

        String line = null;

        while ((line = br.readLine()) != null) {

            System.out.println(line);

        }

    }

    public static void main(String[] args) throws Exception {

        int bufSize = 1024;

        byte[] bs = new byte[bufSize];

        ByteBuffer byteBuf = ByteBuffer.allocate(1024);

        FileChannel channel = new RandomAccessFile("d:\\filename", "r").getChannel();

        while (channel.read(byteBuf) != -1) {

            int size = byteBuf.position();

            byteBuf.rewind();

            byteBuf.get(bs);

            // 把文件当字符串处理，直接打印做为一个例子。

            System.out.print(new String(bs, 0, size));

            byteBuf.clear();

        }

    }

}

java 读取大容量文件，内存溢出？怎么按几行读取，读取多次。最佳答案

package helloword.helloword;

import java.io.BufferedInputStream;

import java.io.BufferedReader;

import java.io.File;

import java.io.FileInputStream;

import java.io.FileNotFoundException;

import java.io.FileReader;

import java.io.FileWriter;

import java.io.IOException;

import java.io.InputStreamReader;

import java.io.RandomAccessFile;

import java.util.Scanner;

public class TestPrint {

    public static void main(String[] args) throws IOException {

        String path = "你要读的文件的路径";

        RandomAccessFile br = new RandomAccessFile(path, "rw");// 这里rw看你了。要是之都就只写r

        String str = null, app = null;

        int i = 0;

        while ((str = br.readLine()) != null) {

            i++;

            app = app + str;

            if (i >= 100) {// 假设读取100行

                i = 0;

                // 这里你先对这100行操作，然后继续读

                app = null;

            }

        }

        br.close();

    }

    // 当逐行读写大于2G的文本文件时推荐使用以下代码

    void largeFileIO(String inputFile, String outputFile) {

        try {

            BufferedInputStream bis = new BufferedInputStream(new FileInputStream(new File(inputFile)));

            BufferedReader in = new BufferedReader(new InputStreamReader(bis, "utf-8"), 10 * 1024 * 1024);// 10M缓存

            FileWriter fw = new FileWriter(outputFile);

            while (in.ready()) {

                String line = in.readLine();

                fw.append(line + " ");

            }

            in.close();

            fw.flush();

            fw.close();

        } catch (IOException ex) {

            ex.printStackTrace();

        }

    }

}

jdk本身就支持超大文件的读写。

网上的文章基本分为两大类:

一类是使用BufferedReader类读写超大文件；

另一类是使用RandomAccessFile类读取，经过比较，最后使用了前一种方式进行超大文件的读取，下面是相关代码，其实很简单

-------------------------------------------------------------------

File file = new File(filepath);

BufferedInputStream fis = new BufferedInputStream(new FileInputStream(file));

BufferedReader reader = new BufferedReader(new InputStreamReader(fis,"utf-8"),5*1024*1024);// 用5M的缓冲读取文本文件  

String line = "";

while((line = reader.readLine()) != null){

   //TODO: write your business

}

java处理大文本2G以上的更多相关文章

Java查询大文本
但JAVA本身缺少相应的类库,需要硬编码才能实现结构化文件计算,代码复杂且可读性差,难以实现高效的并行处理. 使用免费的集算器可以弥补这一不足.集算器封装了丰富的结构化文件读写和游标计算函数,书写简单 ...
【Java】大文本字符串滤重的简单方案~
本文章也同步至本人的CSDN博客中: http://blog.csdn.net/u012881584/article/details/70477832 今天来说一个Java中处理大文本字符串虑重的两个 ...
java处理大文本方案
转载自:http://langgufu.iteye.com/blog/2107023 java处理大文件,一般用BufferedReader,BufferedInputStream这类带缓冲的Io类, ...
Java调用SqlLoader将大文本导入数据库
Java调用SqlLoader将大文本导入数据库业务场景:将一千万条数据,大约500M的文本文档的数据导入到数据库分析:通过Java的IO流解析txt文本文档,拼接动态sql实现insert入库, ...
java filechannel大文件的读写
java读取大文件超大文件的几种方法转自:http://wgslucky.blog.163.com/blog/static/97562532201332324639689/ java 读取一个 ...
Android自定义ScrollView分段加载大文本数据到TextView
以下内容为原创,转载时请注明链接地址:http://www.cnblogs.com/tiantianbyconan/p/3311658.html 这是我现在碰到的一个问题,如果需要在TextView中 ...
jdbc基础 (三) 大文本、二进制数据处理
LOB (Large Objects) 分为:CLOB和BLOB,即大文本和大二进制数据 CLOB:用于存储大文本 BLOB:用于存储二进制数据,例如图像.声音.二进制文件在mysql中,只有B ...
利用JDBC处理mysql大数据--大文本和二进制文件等
转载自http://www.cnblogs.com/xdp-gacl/p/3982581.html 一.基本概念大数据也称之为LOB(Large Objects),LOB又分为:clob和blob, ...
sql 批处理、获取自增长、事务、大文本处理
批处理需要批量执行sql语句! 需求:批量保存信息! 设计: AdminDao Public void save(List<Admin list){ // 目前用这种方式 // 循环 // 保 ...

随机推荐

01.centos7环境准备
博客为日常工作学习积累总结: 1.环境准备: 系统版本:CentOS-7-x86_64-Minimal-1810.iso 运行环境:虚拟机windows上的VM 15 系统安装:参照老男孩运维要求 2 ...
对类Vue的MVVM前端库的实现
关于实现MVVM,网上实在是太多了,本文为个人总结,结合源码以及一些别人的实现关于双向绑定 vue 数据劫持 + 订阅 - 发布 ng 脏值检查 backbone.js 订阅-发布(这个没有使用过, ...
cookie，session，token
发展史 1.很久很久以前,Web 基本上就是文档的浏览而已, 既然是浏览,作为服务器, 不需要记录谁在某一段时间里都浏览了什么文档,每次请求都是一个新的HTTP协议, 就是请求加响应, 尤其是我不用 ...
浏览器窗口输入网址后发生的一段事情（http完整请求）
1.DNS查询得到IP 输入的是域名,需要进行dns解析成IP,大致流程: 如果浏览器有缓存,直接使用浏览器缓存,否则使用本机缓存,再没有的话就是用host 如果本地没有,就向dns域名服务器查询(当 ...
python paramiko模块和多线程讲解
1.paramiko 实现ssh 登录 import paramiko # 实现ssh登录 ssh_client = paramiko.SSHClient() ssh_client.set_missi ...
先进先出算法（FIFO）——页面置换
原创最近操作系统实习,写了先进先出算法(FIFO)的代码来实现页面置换. 题目阐述如下: 设计四:页面置换设计目的: 加深对请求页式存储管理实现原理的理解,掌握页面置换算法. 设计内容: 设计一个 ...
Xilinx与modelsim的仿真联调
关于Xilinx与modelsim的仿真联调,尤其是仿真环境的搭建,网上的信息都比较零散,我当初在联调的时候遇到比较多的问题,也是折腾了两天才弄好,下面的步骤我总结得非常详细,可以帮助大家少走弯路. ...
dart 自己写一个简单的文件编码器
// import 'dart:convert'; import 'dart:io'; main() async { var src = File('./lib/convert/source.txt' ...
自己写的一些Excel及WordVBA函数[原创]
1.将Excel当前工作表另存至桌面 Excel中有时一个工作簿中工作表特别多,需要快速单独存取其中一个,可用以下代码快速存至桌面 Sub 另存工作表到桌面() Dim sh As Worksheet ...
Hibernate学习笔记四
1 整合log4j(了解) l slf4j 核心jar : slf4j-api-1.6.1.jar .slf4j是日志框架,将其他优秀的日志第三方进行整合. l 整合导入jar包 log4j 核心包 ...

java处理大文本2G以上

java处理大文本2G以上的更多相关文章

随机推荐

热门专题