给定a、b两个文件，各存放50亿个url，每个url各占64字节，内存限制是4G，让你找出a、b文件共同的url?

package com.hadoop.hdfs;

import org.apache.hadoop.yarn.webapp.hamlet.Hamlet;

import org.junit.Test;

import java.io.*;

import java.util.HashMap;

import java.util.HashSet;

public class Suanfa1 {

    @Test

    public void a1() throws IOException {

        BufferedReader bufferedReader = new BufferedReader(new FileReader("D:/aa.txt"));

//        BufferedWriter bufferedWriter = new BufferedWriter(new FileWriter("D://"))

        String str1 = "";

        while ((str1 = bufferedReader.readLine())!=null){

            int i = (int) (hashCode(str1)%1000);

            BufferedWriter bufferedWriter = new BufferedWriter(new FileWriter("D://aa"+String.valueOf(i)+".txt"));

            bufferedWriter.write(str1);

            bufferedWriter.close();

            System.out.println(i);

        }

        bufferedReader.close();

    }

    public void a2() throws IOException {

        BufferedReader bufferedReader = new BufferedReader(new FileReader("D:/bb.txt"));

//        BufferedWriter bufferedWriter = new BufferedWriter(new FileWriter("D://"))

        String str1 = "";

        while ((str1 = bufferedReader.readLine())!=null){

            int i = (int) (hashCode(str1)%1000);

            BufferedWriter bufferedWriter = new BufferedWriter(new FileWriter("D://bb"+String.valueOf(i)+".txt"));

            bufferedWriter.write(str1);

            bufferedWriter.close();

        }

        bufferedReader.close();

    }

    public long hashCode(String str) {

        long h = 0;

        if (h == 0) {

            int off = 0;

            char val[] = str.toCharArray();

            long len = str.length();

            for (long i = 0; i < len; i++) {

                h = 31 * h + val[off++];

            }

        }

        return h;

    }

    @Test

    public void a3() throws IOException {

        a1();

        a2();

        for (int i = 0; i < 1000; i++) {

            BufferedReader bufferedReader1 = new BufferedReader(new FileReader("D://aa"+String.valueOf(i)+".txt"));

            BufferedReader bufferedReader2 = new BufferedReader(new FileReader("D://bb"+String.valueOf(i)+".txt"));

            HashSet set = new HashSet();

            String input1 = "";

            while ((input1 = bufferedReader1.readLine())!=null){

                set.add(hashCode(bufferedReader1.readLine()));

            }

            String input2 = "";

            while ((input2 = bufferedReader2.readLine())!=null){

                if (set.contains(hashCode(input2))){

                    System.out.println(input2);

                }

            }

        }

    }

}

给定a、b两个文件，各存放50亿个url，每个url各占64字节，内存限制是4G，让你找出a、b文件共同的url?的更多相关文章

给定a、b两个文件，各存放50亿个url，每个url各占用64字节，内存限制是4G，如何找出a、b文件共同的url？
给定a.b两个文件,各存放50亿个url,每个url各占用64字节,内存限制是4G,如何找出a.b文件共同的url? 可以估计每个文件的大小为5G*64=300G,远大于4G.所以不可能将其完全加载到 ...
面试- 阿里-. 大数据题目- 给定a、b两个文件，各存放50亿个url，每个url各占64字节，内存限制是4G，让你找出a、b文件共同的url?
假如每个url大小为10bytes,那么可以估计每个文件的大小为50G×64=320G,远远大于内存限制的4G,所以不可能将其完全加载到内存中处理,可以采用分治的思想来解决. Step1:遍历文件a, ...
海量数据处理面试题(1) 找出两文件种包含的相同的url
问题:给定a.b两个文件,各存放50亿个url,每个url各占64字节,内存限制是4G,让你找出a.b文件共同的url? 分析:50亿个url,每个url64字节,就是320G,显然是无法一次读入内存 ...
查找mysql数据库文件的存放位置
在mysql数据库中,有时候并不是很容易找出mysql数据库文件data的存放位置吗,这时就可以使用mysql自带的命令行工具进行查询. 具体命令如下:show variables like '%da ...
BD面试题1-两个大文件中找出公共记录[转载]
转自:https://blog.csdn.net/tiankong_/article/details/77234726#commentBox 1.题目给定a.b两个文件,各存放50亿个url,每个u ...
【Linux】找出文件之间的差异
使用命令comm可以找出2个文件之间的差异现在有文件如下: Linux:/qinys # cat A.txt apple lemon onion orange pear Linux:/qinys # ...
如何在 Linux 中找出最近或今天被修改的文件
1. 使用 ls 命令,只列出你的 home 文件夹中今天的文件. ls -al --time-style=+%D | grep `date +%D` 其中: -a- 列出所有文件,包括隐藏文件 -l ...
9.11排序与查找（三）——给定一个排序后的数组，包括n个整数，但这个数组已被旋转过多次，找出数组中的某个元素
/** * 功能:给定一个排序后的数组.包括n个整数.但这个数组已被旋转过多次,次数不详.找出数组中的某个元素. * 能够假定数组元素原先是按从小到大的顺序排列的. */ /** * 思路:数组 ...
ORACLE中如何找出大表分布在哪些数据文件中？
ORACLE中如何找出大表分布在哪些数据文件中? 在ORACLE数据中,我们能否找出一个大表的段对象分布在哪些数据文件中呢? 答案是可以,我们可以用下面脚本来找出对应表的区.段分别位于哪些数据文件 ...

随机推荐

vue后台_纯前端实现excel导出/csv导出
之前的文件下载功能一般是由前后端配合实现,由于项目需要,纯前端实现了一把excel的导出功能: 一.excel导出 1.安装依赖库 xlsx:这是一个功能强大的excel处理库,但是上手难度也很大,还 ...
Python中单引号和双引号的作用
一.单引号和双引号在Python中我们都知道单引号和双引号都可以用来表示一个字符串,比如 str1 = 'python' str2 = "python" str1和str2是没有 ...
C字符贪吃蛇
算法参照Perl字符贪吃蛇,源码: #include <stdio.h> #include <windows.h> #define WIDTH 12 // 宽 #define ...
ArcGIS Python人门到精通目录基于ArcGIS10.2，100以上案例15章42个视频806分钟，51GIS网站上线
ArcGIS Python人门到精通目录闫老师 QQ:276529800 微信13108507190 1. ArcGIS Python基础 1.1 ArcGIS为什么学习Python 1.2 A ...
[电脑]拆解DELL 2007FPb液晶显示器
最近修了不少三星214T显示器,拆卸很方便,多数更换电容就OK了.但有一台出现了花屏,怀疑是数码板出问题了.单位有台显示屏破碎的DELL2007FPb,拆了看看能否借用数码板. 图片:IMG_2063 ...
bower 安装依赖提示 EINVRES Request to https://bower.herokuapp.com/packages/xxx failed with 502
出错提示EINVRES Request to https://bower.herokuapp.com/packages/chai failed with 502 访问 https://bower.he ...
python接入微博第三方API之2接入用户登录和微博发布
python接入微博第三方API之2接入用户登录和微博发布 # coding=utf-8 import requests import json import MySQLdb from datetim ...
008-SpringBoot发布WAR启动报错：Error assembling WAR: webxml attribute is required
一.Spring Boot发布war包流程: 1.修改web model的pom.xml <packaging>war</packaging> SpringBoot默认发布的都 ...
Python高级笔记（七）魔法属性
1. 私有属性名字重整 print(Test.__dict__) {'__weakref__': <attribute '__weakref__' of 'Test' objects>, ...
android webview带cookie访问url
问题描述在原生和h5混合开发的时候会遇到这么一个问题,用webview加载某个url时,你只是app登录了账号,但是网页却没有,所有会禁止访问此url,webview就会显示白屏.所以要访问此url, ...

给定a、b两个文件，各存放50亿个url，每个url各占64字节，内存限制是4G，让你找出a、b文件共同的url?

给定a、b两个文件，各存放50亿个url，每个url各占64字节，内存限制是4G，让你找出a、b文件共同的url?的更多相关文章

随机推荐

热门专题