用Python提取XML里的内容，存到Excel中

最近做一个项目是解析XML文件，提取其中的chatid和lt、timestamp等信息，存到excel里。

1.解析xml，提取数据

使用python自带的xml.dom中的minidom（也可以用lxml）

xml文件如下：

minidom.parse()#解析文件，返回DOM对象

_get_documentElement()DOM是树形结构，获得了树形结构的根节点

getElementsByTagName()根据name查找根目录下的子节点

getAttribute()获取DOM节点的属性的值

提取的代码如下：

class get_xml():
    #加载获取xml的文档对象
    def __init__(self,address):
        #解析address文件，返回DOM对象，address为文件地址
        self.doc = minidom.parse(address)
        #DOM是树形结构，_get_documentElement()获得了树形结构的根节点
        self.root = self.doc._get_documentElement()
        #.getElementsByTagName()，根据name查找根目录下的子节点
        self.httpSample_nodes = self.root.getElementsByTagName('httpSample')

    def getxmldata(self):

        data_list=[]
        j = -1
        responseData_node = self.root.getElementsByTagName("responseData")
        for i in self.httpSample_nodes:
            j = j+1
            #getAttribute()，获取DOM节点的属性的值
            if i.getAttribute("lb") == "发送信息":
                a = 'chatId":"(.*?)"'
            elif i.getAttribute("lb") == "接收信息":
                # a = "chatId%3A%22(.*?)%22"
                a = "info%3A%22(.*?)%22"
            if (i.getAttribute("lb") == "发送信息" or i.getAttribute("lb") == "接收信息") and i.getAttribute("rc") == "200":
                try:
                    #使用re包里面的方法，通过正则表达式提取数据
                    b = re.search(a, responseData_node[j].firstChild.data)
                    if b is not None:
                        d = b.group(1)
                        print("d:",d)
                        data_list.append((d, i.getAttribute("ts"), i.getAttribute("lt"),i.getAttribute("lb")))
                except:
                    pass
        return data_list

2.存储为Excel，导出数据到Excel

用到的包openpyxl，openpyxl.workbook下的Workbook()用来在内存里创建文件，最后写进磁盘的

wb = load_workbook(filename = XXXX.xlsx)：读取Excel文件，文件地址为XXXX.xlsx

wb = Workbook()：创建一个Workbook对象

ew = ExcelWriter(workbook = wb)：新建一个excelWriter，最后用来保存

wb.create_sheet(0, 'XXX')：新建一个sheet，位置是0，sheet名字是XXX

ws = wb.worksheets[0]：打开一个sheet，sheet位置是0，即第1个sheet

ws.cell(row=1,column=1).value = XXX：在1行1列的位置加入数据XXX

ew.save(filename = XXXX.xlsx)：将数据导出到本地，本地文件地址为XXXX.xlsx

一个导出Excel的例子如下：

import openpyxl
from openpyxl import writer,load_workbook
# Workbook用来在内存里创建文件最后写进磁盘的
from openpyxl.workbook import workbook, Workbook
from openpyxl.writer.excel import ExcelWriter

from openpyxl.cell import get_column_letter
# if __name__ == "__main__":
def importexcel(match,dest_filename):
    if(os.path.exists(dest_filename)):
        wb = load_workbook(filename=dest_filename)
    else:
        wb = Workbook()
    ew = ExcelWriter(workbook = wb)
    #创建一个新sheet
    wb.create_sheet(0, '聊聊发送接收请求')
    # 打开已存在的第一个sheet，也可以用get_sheet_names获得所有的sheet的名字
    ws = wb.worksheets[0]
    ws.title = "聊聊发送接收请求"
    ws.cell('A1').value = "chartid"
    ws.cell('B1').value = "接收时间戳"
    ws.cell('C1').value = "发送时间戳"
    ws.cell('D1').value = "时间戳差"
    ws.cell('E1').value = "接收lt"
    ws.cell('F1').value = "发送到接收的响应时间"

    l = 2
    for i in match:
        ws.cell(row=l,column=1).value = i['chatId']
        ws.cell(row=l,column=2).value = i['accept_timestamp']
        ws.cell(row=l,column=3).value = i['send_timestamp']
        ws.cell(row=l,column=4).value = i['timestamp_gap']
        ws.cell(row=l,column=5).value = i['accept_lt']
        ws.cell(row=l,column=6).value = i['response_time']
        print(i,l)
        l = l+1
    ew.save(filename = dest_filename)

用Python提取XML里的内容，存到Excel中的更多相关文章

table内容保存到Excel中
@{ Layout = null; } <html> <head> <title></title> </head> <body> ...
VBA读取word中的内容到Excel中
原文:VBA读取word中的内容到Excel中 Public Sub Duqu() Dim myFile As String Dim docApp As Word.Applicati ...
用python提取xml里面的链接源码
因群里朋友需要提取xml地图里面的链接,就写了这个程序. 代码: #coding=utf-8 import urllib import urllib.request import re url='ht ...
python爬取数据保存到Excel中
# -*- conding:utf-8 -*- # 1.两页的内容 # 2.抓取每页title和URL # 3.根据title创建文件,发送URL请求,提取数据 import requests fro ...
用python实现批量获取Linux主机简要信息并保存到Excel中 unstable 1.1
#!/usr/bin/env python3 # -*- coding: utf-8 -*- #filename get_linux_info.py #获取Linux主机的信息 # titles=[' ...
「拉勾网」薪资调查的小爬虫，并将抓取结果保存到excel中
学习Python也有一段时间了,各种理论知识大体上也算略知一二了,今天就进入实战演练:通过Python来编写一个拉勾网薪资调查的小爬虫. 第一步:分析网站的请求过程我们在查看拉勾网上的招聘信息的时候 ...
python提取xml属性导入Mysql
xml文档来自ganglia-gmond端telnet localhost 8649产生出来的文档,由于ganglia每隔一段时间就更新数据,为了永久保存数据到MySQL中,就用python写了最开始 ...
python从XML里取数，遍历等
#coding=utf-8 #通过minidom解析xml文件 import xml.dom.minidom as xmldom import os ''' XML文件读取 <?xml vers ...
tomcat -web.xml里的内容
<?xml version="1.0" encoding="UTF-8"?> <Server port="8005" sh ...

随机推荐

Eclipse整合Tomcat开发Dynamic Web Project环境总结
一.引子习惯了MyEclipse的你是否曾想过基于Eclipse进行Dynamic Web Project项目开发呢?网上资料颇多,但是实践起来却发现总有这样那样的问题,设计Lucene搜索引擎项目 ...
bzoj2262: 平行宇宙与虫洞
Description 量子力学指出,宇宙并非只有一种形态. 根据量子理论,一件事件发生之后可以产生不同的后果,而所有可能的后果都会形成自己的宇宙. 我们可以把一个宇宙看成一个时间轴,虫洞可以看成不同 ...
java操作Excel之POI（1）
一.新建工作簿.sheet.单元格 public static void main(String[] args) throws Exception { Workbook wb = new HSSFWo ...
poj 3046 Ant Counting（多重集组合数）
Ant Counting Time Limit : 2000/1000ms (Java/Other) Memory Limit : 131072/65536K (Java/Other) Total ...
杂项：CDN
ylbtech-杂项:CDN CDN的全称是Content Delivery Network,即内容分发网络.其基本思路是尽可能避开互联网上有可能影响数据传输速度和稳定性的瓶颈和环节,使内容传输的更快 ...
jshint在bat批处理中闪退，代码中无法调用的问题
先说解决办法:加个call eg: call jshint --version Pause 具体原因有空再更
jq上下级元素查找方法
1.parent([expr]) 获取指定元素的所有父级元素 2.next([expr]) 获取指定元素的下一个同级元素 3.nextAll([expr]) 获取指定元素后面的所有同级元素 4.and ...
selenium+python自动化91-unittest多线程生成报告（BeautifulReport）
前言 selenium多线程跑用例,这个前面一篇已经解决了,如何生成一个测试报告这个是难点,刚好在github上有个大神分享了BeautifulReport,完美的结合起来,就能生成报告了. 环境必备 ...
外星人完事了，开始python的matplotlib玩转
外星人完事了,开始python的matplotlib玩转看书上的例子,在win下安装比较麻烦今天用pip尝试了一下 pip install matplotlib 然后等待即可安装完毕后在pyt ...
IOUtils总结
参考:https://www.cnblogs.com/xing901022/p/5978989.html 常用的静态变量在IOUtils中还是有很多常用的一些变量的,比如换行符等等 public s ...

用Python提取XML里的内容，存到Excel中

用Python提取XML里的内容，存到Excel中的更多相关文章

随机推荐

热门专题