作业要求

构建一个关系模式和课本中的关系movies(title,year,length,movietype,studioname,producerC)一样的关系，名称自定，在这个关系中插入1000万条记录。

注：关系movies的主键为(title,year)。

要求如下：

在尽可能短的时间内完成；
只允许使用原生的SQL，不允许将SQL作为嵌入语言，也不允许使用其他语言如C#、Python等来完成；
提交你的详细解决方案和结果。

分析

查资料得知

可以将多条insert语句合并为一句，即一条insert语句插入多个元组
可以通过事务，减少每条insert语句都建立新事务带来的时空消耗
可以通过load data infile将文件中的数据导入mysql，似乎很快的样子

虽然第三种似乎很快，但在此我采用了前两种方法，通过合并+事务实现。

我通过python模拟生成（只改变主键中的year，以生成不同元组）1千万条记录，将其组织为$10\times100\times10000$条记录添加进movies，分成10个事务，每个事务里有100条insert语句，每条insert语句插入10000个元组。

实现

实现思路如下：

复制原数据库moviedb至newmoviedb
设置max_allowed_packet，以保证一条insert语句可以插入足够多的元组
用python生成一条一次插入10000个元组的insert语句
用python生成一个包含100条insert语句的事务，保存至sql文件
用navicat运行该sql文件

至此就可以实现一百万条记录的插入了（我的电脑耗时327s？好像很慢！？）

之后再套一层循环就可以继续完成1千万条记录的插入了。

下面给出可能用到的步骤（如未说明，代码默认为控制行或者mysql环境下的命令）：

复制数据库

创建新数据库newmoviedb

登录并创建数据库：

mysql -u root -p

CREATE DATABASE `newmoviedb` DEFAULT CHARACTER SET UTF8 COLLATE UTF8_GENERAL_CI;

复制moviedb至newmoviedb

复制数据库

mysqldump moviedb -u root -pchouxianyu --add-drop-table | mysql newmoviedb -u root -pchouxianyu

上面chouxianyu是我的mysql密码

进入newmoviedb

use newmoviedb;

设置max_allowed_packet

设置max_allowed_packet为100M

set global max_allowed_packet = 100*1024*1024;

删除movies中所有元素（调试用）

delete from movies;

生成一条insert语句

下边是insert.py

insertStr = "INSERT INTO movies(title,year,length,movietype,studioname,producerC) VALUES"

value1_str = "('mymovietitle',"

# j

value2_str = ",120,'sciFic','MGM',100)"

# ,;

num_value = 10000

f = open(r'C:\Users\Cxy\Documents\Navicat\MySQL\Servers\MySQL\newmoviedb\insertRow.sql', 'w')  # 清空文件内容再写

f.write(insertStr)

for j in range(1, num_value):

    f.write(value1_str)

    f.write(str(j))

    f.write(value2_str)

    f.write(',')

f.write(value1_str)

f.write(str(num_value))

f.write(value2_str)

f.write(';')

f.close()

生成一个事务

以下是transaction.py

transaction_begin_str = "START TRANSACTION;\n"

transaction_end_str = "COMMIT;\n"

insertStr = "INSERT INTO movies(title,year,length,movietype,studioname,producerC) VALUES"

value1_str = "('mymovietitle',"

# j

value2_str = ",120,'sciFic','MGM',100)"

# ,;

num_value = 10000

num_sql = 100

# 打开文件

f = open(r'C:\Users\Cxy\Documents\Navicat\MySQL\Servers\MySQL\newmoviedb\transaction.sql', 'w')  # 清空文件内容再写

# 将SQL语句写入文件

f.write(transaction_begin_str)

for i in range(1, num_sql+1):

    f.write(insertStr)

    for j in range(1, num_value):

        f.write(value1_str)

        f.write(str(i*num_value*10+j))

        f.write(value2_str)

        f.write(',')

    f.write(value1_str)

    f.write(str(i*num_value*10+num_value))

    f.write(value2_str)

    f.write(';\n')

f.write(transaction_end_str)

# 关闭文件

f.close()

参考链接

https://www.cnblogs.com/freefei/p/7679991.html

https://blog.csdn.net/qq_22855325/article/details/76087138

https://blog.csdn.net/weixin_44595372/article/details/88723191

https://zhidao.baidu.com/question/185665472.html

https://www.cnblogs.com/zhangjpn/p/6231662.html

https://www.cnblogs.com/wangcp-2014/p/8038683.html

https://blog.csdn.net/gb4215287/article/details/82669785

作者：@臭咸鱼

转载请注明出处：https://www.cnblogs.com/chouxianyu/

欢迎讨论和交流!

python+mysql:实现一千万条数据插入数据库的更多相关文章

[MyBatis]五分钟向MySql数据库插入一千万条数据批量插入用时5分左右
本例代码下载:https://files.cnblogs.com/files/xiandedanteng/InsertMillionComparison20191012.rar 我的数据库环境是mys ...
LOAD DATA INFILE读取CSV中一千万条数据至mysql
作业要求构建一个关系模式和课本中的关系movies(title,year,length,movietype,studioname,producerC)一样的关系,名称自定,在这个关系中插入1000万 ...
mysql自定义函数并在存储过程中调用，生成一千万条数据
mysql 自定义函数,生成 n 个字符长度的随机字符串 -- sql function delimiter $$ create function rand_str(n int) returns VA ...
java之5分钟插入千万条数据
虽说不一定5分钟就插入完毕,因为取决去所插入的字段,如果字段过多会稍微慢点,但不至于太慢.10分钟内基本能看到结果. 之前我尝试用多线程来实现数据插入(百万条数据),半个多小时才二十多万条数据. 线程 ...
orcle 如何快速插入百万千万条数据
有时候做实验测试数据用到大量数据时可以用以下方法插入: 方法一:使用xmltable create table bqh8 as select rownum as id from xmltable('1 ...
MySQL制作具有千万条测试数据的测试库
有时候需要制造一些测试的数据,以mysql官方给的测试库为基础,插入十万,百万或者千万条数据.利用一些函数和存储过程来完成. 官方给的测试库地址:https://github.com/datachar ...
复杂业务下向Mysql导入30万条数据代码优化的踩坑记录
从毕业到现在第一次接触到超过30万条数据导入MySQL的场景(有点low),就是在顺丰公司接入我司EMM产品时需要将AD中的员工数据导入MySQL中,因此楼主负责的模块connector就派上了用场. ...
mysql查询随机几条数据(速度快)
MySql查询随机几条数据想到了 Max RAND 这几个函数用以下2种办法都可以实现查询. 速度还行. 几十万数据左右, 没有什么问题. SELECT * FROM `news` WHERE i ...
腾讯面试题,js处理1千万条数据排序并且页面不卡顿
<!DOCTYPE html> <html lang="en"> <head> <meta charset="UTF-8&quo ...

随机推荐

第一次打开PyCharm的基本操作(附图)
第一次打开PyCharm可能需要修改一些个性化和了解一些基本操作,有助于接下来的学习过程.(后续可能会更新) 我的版本是64位的1.3 1.换界面皮肤默认黑色的,不喜欢黑色皮肤可以换成白色的 Fil ...
最新二六三网络通信java校招面经（含整理过的面试题大全）
从6月到10月,经过4个月努力和坚持,自己有幸拿到了网易雷火.京东.去哪儿. 二六三网络通信等10家互联网公司的校招Offer,因为某些自身原因最终选择了二六三网络通信.6.7月主要是做系统复习.项 ...
kubespray部署k8s
0.把外网的/usr/local/bin/*拷过来覆盖 1.把部署好的集群的 calicoctl cni-plugins-linux-amd64-v0.8.1.tgz kubeadm-v1.16.3- ...
ERNIE 2.0 理解与使用
更新中更新时间:2019-12-06 17:43:27 实验需要,在自己学习的过程中做如下笔记,欢迎指正,欢迎交流. 1. ERNIE简述 ERNIE和BERT一样,也是基于transformer来 ...
hadoop在eclipse当中如何添加源码？
[学习笔记] /*org.apache.hadoop.mapreduce.Mapper.Context,java.lang.InterruptedException,想看map的源代码,按contro ...
todo---ezmorph
todo---ezmorph
（三）Servlet 知识点总结（来自那些年的笔记）
(史上最全知识汇总)转载请贴上原文链接! 作者:淮左白衣写于 2018年4月15日20:14:55 如果,碰巧你打开了本篇博客,相信我,你想要的servlet知识,这里应该都能找到!! 目录 (史上 ...
剑指offer15：反转链表后，输出新链表的表头。
1 题目描述输入一个链表,反转链表后,输出新链表的表头. 2 思路和方法 (1)利用栈作为中间存储,进行链表的反转,将压入的数据按先进后出的顺序弹出依次赋给链表再输出表头pHead. (2)将当前节 ...
PAT(B) 1012 数字分类（Java）
题目链接:1012 数字分类代码 /** * Score 20 * Run Time 142ms * @author wowpH * @version 1.1 */ import java.util ...
Struts2连接Mysql的Crud使用
今天分享的是struts2框架中增删改查的用法: 一:利用Struts2框架 1.1在pom.xml中导入相关依赖 <project xmlns="http://maven.apach ...

python+mysql:实现一千万条数据插入数据库

作业要求

分析

实现

复制数据库

创建新数据库newmoviedb

复制moviedb至newmoviedb

进入newmoviedb

设置max_allowed_packet

删除movies中所有元素（调试用）

生成一条insert语句

生成一个事务

参考链接

python+mysql:实现一千万条数据插入数据库的更多相关文章

随机推荐

热门专题