针对格式文件，Python读取一定大小的文件内容

由数据库导出的数据是格式化数据，如下所示，每两个<REC>之间的数据是一个记录的所有字段数据，如<TITLE>、<ABSTRACT>、<SUBJECT_CODE>。但是每条记录中可能某些字段信息为空，

在导出的文本文件中，就会缺失这个字段，如记录3，缺失<ABSTRACT>这个字段，记录4，缺失<SUBJECT_CODE>这个字段。

<REC>(记录1)

<TITLE>=Regulation of the protein disulfide proteome by mitochondria in mammalian cells.

<ABSTRACT>=The majority of protein disulfides in cells is considered an important inert structural, rather than a dynamic regulatory, determinant of protein function.

<SUBJECT_CODE>=A006_8;D050_42;A006_62

<REC>(记录2)

<TITLE>=Selective control of cortical axonal spikes by a slowly inactivating K+ current.

<ABSTRACT>=Neurons are flexible electrophysiological entities in which the distribution and properties of ionic channels control their behaviors.

<SUBJECT_CODE>=E057_6;E062_318;I135_46

<REC>(记录3)

<TITLE>=Coupling of hydrogenic tunneling to active-site motion in the hydrogen radical transfer catalyzed by a coenzyme B12-dependent mutase.

<SUBJECT_CODE>=B016_11;B014_32;B014_54

<REC>(记录4)

<TITLE>=Hyaluronic acid hydrogel for controlled self-renewal and differentiation of human embryonic stem cells.

<ABSTRACT>=Control of self-renewal and differentiation of human ES cells (hESCs) remains a challenge.

<REC>(记录5)

<TITLE>=Biologically inspired crack trapping for enhanced adhesion.

<ABSTRACT>=We present a synthetic adaptation of the fibrillar adhesion surfaces found in nature.

<SUBJECT_CODE>=A004_57;B022_73;C034_22

<REC>(记录6)

<TITLE>=Identification of a retroviral receptor used by an envelope protein derived by peptide library screening.

<ABSTRACT>=This study demonstrates the power of a genetic selection to identify a variant virus that uses a new retroviral receptor protein.

<SUBJECT_CODE>=A006_8;E059_A;E059_5

1、从数据库中导出数据时，一些表格的导出文件（txt文本文件），占用空间会在3-4G个左右，无法直接读入内存；

2、通过python的linecache模块的getlines函数读取600M以上的文本文件时，有时会因为PC当时的运行情况，内存不足等原因，读取得到的内容为空；

备注：linecache模块的getlines()函数最终是调用file.readlines()函数来一次读取数据的，如果文件过大，getlines函数会返回一个空链表作为结果。

3、逐行读取文本内容，一是不方便后续的处理流程，后续流程需要对每条记录的数据进行处理，而非对每行数据进行处理；二是逐行读取文本内容，速度较慢；

因此，有必要针对这类格式文件，设计一种可以读取一定大小，并且这段文本中的记录都是完整的，不会出现最后一个记录只有部分字段数据；

实现代码如下：

#!/usr/bin/env python

# -*- coding: utf-8 -*-

# -*- coding: GBK -*-

import os

import sys

from time import time

REC_STR = '<REC>'

def read_text_in_buffer_multi_line(fd,length,label):

    BUFFER = []

    fd.seek(label,0)#根据新的label设置文件位置

    flag = 0

    line = ''

    BUFFER = fd.readlines(length)#读取一定大小的文本，并存放在BUFFER中

    line = fd.readline()#读取下一行，用于判断文件是否结束

    if not line:

        flag = 1

    label = fd.tell()#获取当前的文件位置

    if flag == 0:#如果文件没有结束，则将BUFFER中最后一个<REC>之后的数据丢弃；否则则直接返回BUFFER

        BUFFER_POST = []

        while True:

            temp = BUFFER.pop()#丢弃数据

            if temp.startswith(REC_STR) == False:#判断是否为<REC>

                BUFFER_POST.append(temp)

            else:#是<REC>，结束循环

                BUFFER_POST.append(temp)

                break

        len_buf_post = len(''.join(BUFFER_POST))#获取到丢弃的数据的字节数目

        label = label - len_buf_post - len(line)#当前位置减去丢弃的字节数目，再减去多读取的一行的数据的字节数目

    return BUFFER,label

if __name__ == "__main__":

    filename = "Data\\SJWD_U.txt"

    fd = open(filename,'rb')

    label = 0

    readlen = 100000*210#待读取的字节数目

    fout = open("out.txt",'w')

    begin = time()

    while True:

        buffer_list,label = read_text_in_buffer_multi_line(fd,readlen,label)

        if buffer_list == []:

            break

        else:

            fout.writelines(buffer_list)

    end = time()

    print "time:",(end - begin)

    fd.close()

    fout.close()

针对格式文件，Python读取一定大小的文件内容的更多相关文章

python读取txt批量创建文件
python读取txt批量创建文件 pythonbatchfile 前几天有个小问题, 需要批量建立很多文件夹,, 所以手动写了个小的脚本, 后续可以直接使用读取目录文件, 然后直接创建相应的文件 ...
编写Java程序，在硬盘中选取一个 txt 文件，读取该文档的内容后，追加一段文字“[ 来自新华社 ]”，保存到一个新的 txt 文件内
查看本章节查看作业目录需求说明: 在硬盘中选取一个 txt 文件,读取该文档的内容后,追加一段文字"[ 来自新华社 ]",保存到一个新的 txt 文件内实现思路: 创建 Sa ...
python读取和写入csv文件
读取csv文件: def readCsv(): rows=[] with file(r'E:\py\py01\Data\system.csv','rb') as f: reads=csv.reader ...
python读取并写入mat文件
用matlab生成一个示例mat文件: clear;clc matrix1 = magic(5); matrix2 = magic(6); save matData.mat 用python3读取并写入 ...
python 读取mysql存储的文件路径下载文件，内容解析，上传七牛云，内容入es
#!/usr/bin/env python # -*- coding: utf-8 -*- import ConfigParser import json import os import re fr ...
python 读取csv中的文件，从sftp下载文件
需要从sftp上下载一些图片文件,文件名存放在一个csv文件中.代码如下: # -*- coding:utf-8 -*- import paramiko import csv import os de ...
python读取、写入txt文本内容
转载:https://blog.csdn.net/qq_37828488/article/details/100024924 python常用的读取文件函数有三种read().readline().r ...
linux shell 脚本历史文件清理脚本，按天，按月，清理前N天的历史文件，删除指定大小历史文件，历史文件归档清理
不知道大家那有没有要清理的这个事情.需要清理目录历史文件.可能后续也会有很多其他地方需要清理历史文件,可能会用到. 我这两天空闲写了个脚本,清理比较方便,有要进行清理的大量历史文件的话可以用. 脚本用 ...
Linux下删除空文件，删除指定大小的文件
Linux下批量删除空文件(大小等于0的文件)的方法: find . -name "*" -type f -size 0c | xargs -n 1 rm -f 用这个还可以删除指 ...

随机推荐

XDocument获取指定节点
string xmlFile = @"D:\Documents\Visual Studio 2013\Projects\Jesee.Web.Test\ConsoleApplication1\ ...
ts 协议解析
pes : http://wenku.baidu.com/link?url=KjcA0qXqZ1bWVQTa8i1YOmygofldSQL7Pjj-zGRw1e_6_LFmVLo5DIWF0SNwVn ...
一键保存Feedly里的文章到有道笔记
写在之前:今天升级了有道笔记3.5,发现有道笔记支持发邮件保存笔记了,所以就分享一下怎么通过IFTTT保存到有道笔记.因为IFTTT是外国货,所以一直没有有道笔记的频道,不过有了发邮件保存笔记的功能, ...
Webform Session、Cookies传值，跳转页面方式
Session:每个独立的浏览器都会创建一个独立的Session,不是一台电脑一个Session 存放位置:服务器上作用:只要里面有内容,那么这个网站中所有的C#端都能访问到这个变量优点:安全,速 ...
Python之路第一课Day5--随堂笔记（模块）
本节课程大纲: 1.模块介绍 2.time &datetime模块 3.random 4.os 5.sys 6.shutil 7.json & picle 8.shelve 9.xml ...
F.I.S初探（前端工程化）
云笔记:http://note.youdao.com/share/?id=7c4a2dcf118f0ad7bb52a36aaee46a7a&type=note 一.初识FIS 在做项目中遇 ...
[译]MVC网站教程（三）：动态布局和站点管理
目录 1. 介绍 2. 软件环境 3. 在运行示例代码之前(源代码 + 示例登陆帐号) 4. 自定义操作结果和控制器扩展 1) OpenFileResult 2) ImageR ...
Expert 诊断优化系列------------------透过等待看系统
上一篇我们简单的介绍了,语句优化的三板斧,大部分语句三板斧过后,就算不成为法拉利也能是个宝马了.为了方便阅读给出系列文章的导读链接: SQL SERVER全面优化-------Expert for S ...
关于printf错用格式化字符串导致double和long double输出错误的小随笔
[题外话] 以前用HUSTOJ给学校搭建Online Judge,所有的评测都是在Linux下进行的.后来为了好往学校服务器上部署,所以大家重新做了一套Online Judge,Web和Judge都是 ...
sublime text2 安装less2css插件
之前一直用PhpStorm,功能十分强大,各种插件也有,不过比较占内存,有时候,左边的项目列表都刷不出来,今天又出现了这个问题,于是果断换sublime了. 由于项目中要用less编译,所以得装个le ...

针对格式文件，Python读取一定大小的文件内容

针对格式文件，Python读取一定大小的文件内容的更多相关文章

随机推荐

热门专题