在上一篇博客中,我们介绍了什么是 XML ,http://www.cnblogs.com/ysocean/p/6901008.html,那么这一篇博客我们介绍如何来解析 XML 。

  部分文档引用:http://www.cnblogs.com/lanxuezaipiao/archive/2013/05/17/3082949.html

  解析 XML 文件一般来说有两种底层形式,一种是基于树的结构来解析的称为DOM;另一种是基于事件流的形式称为Sax。而在这两种解析方式的基础上,基于底层api的更高级封装解析器也应用而生,比如面向Java的 JDom和 Dom4J。

1、DOM(Document Object Model)

  DOM 是用与平台和语言无关的方式表示 XML 文档的官方 W3C 标准。DOM 是以层次结构组织的节点或信息片断的集合。这个层次结构允许开发人员在树中寻找特定信息。分析该结构通常需要加载整个文档和构造层次结构,然后才能做任何工作。由于它是基于信息层次的,因而 DOM 被认为是基于树或基于对象的。

  优点:

    ①、整个 Dom 树都加载到内存中了,所以允许随机读取访问数据。

    ②、允许随机的对文档结构进行增删。

  缺点:

    ①、整个 XML 文档必须一次性解析完,耗时。

    ②、整个 Dom 树都要加载到内存中,占内存。

  适用于:文档较小,且需要修改文档内容

2、Sax(Simple API for XML)

  

  SAX处理的特点是基于事件流的。分析能够立即开始,而不是等待所有的数据被处理。而且,由于应用程序只是在读取数据时检查数据,因此不需要将数据存储在内存中。这对于大型文档来说是个巨大的优点。事实上,应用程序甚至不必解析整个文档;它可以在某个条件得到满足时停止解析。sax分析器在对xml文档进行分析时,触发一系列的事件,应用程序通过事件处理函数实现对xml文档的访问,因为事件触发是有时序性的,所以sax分析器提供的是一种对xml文档的顺序访问机制,对于已经分析过的部分,不能再重新倒回去处理.此外,它也不能同时访问处理2个tag,sax分析器在实现时,只是顺序地检查xml文档中的字节流,判断当前字节是xml语法中的哪一部分,检查是否符合xml语法并且触发相应的事件.对于事件处理函数的本身,要由应用程序自己来实现. SAX解析器采用了基于事件的模型,它在解析XML文档的时候可以触发一系列的事件,当发现给定的tag的时候,它可以激活一个回调方法,告诉该方法制定的标签已经找到。

  优点:

    ①、访问能够立即进行,不需要等待所有数据被加载。

    ②、只在读取数据时检查数据,不需要保存在内存中

    ③、不需要将整个数据都加载到内存中,占用内存少

    ④、允许注册多个Handler,可以用来解析文档内容,DTD约束等等。

  缺点:

    ①、需要应用程序自己负责TAG的处理逻辑(例如维护父/子关系等),文档越复杂程序就越复杂。

    ②、单向导航,无法定位文档层次,很难同时访问同一文档的不同部分数据,不支持XPath。

    ③、不能随机访问 xml 文档,不支持原地修改xml。

  适用于:文档较大,只需要读取文档数据。

3、JDOM(Java-based Document Object Model)

  JDOM是处理xml的纯java api.使用具体类而不是接口。JDOM具有树的遍历,又有SAX的java规则。

  JDOM与DOM主要有两方面不同。首先,JDOM仅使用具体类而不使用接口。这在某些方面简化了API,但是也限制了灵活性。第二,API大量使用了Collections类,简化了那些已经熟悉这些类的Java开发者的使用。

  JDOM自身不包含解析器。它通常使用SAX2解析器来解析和验证输入XML文档(尽管它还可以将以前构造的DOM表示作为输入)。它包含一些转换器以将JDOM表示输出成SAX2事件流、DOM模型或XML文本文档。JDOM是在Apache许可证变体下发布的开放源码。

  优点:

    ①、使用具体类而不是接口,简化了DOM的API。

    ②、大量使用了Java集合类,方便了Java开发人员。

  缺点:

    ①、不能处理大于内存的文档.

    ②、API 简单,没有较好的灵活性

4、DOM4J(Document Object Model for Java)

  虽然DOM4J代表了完全独立的开发结果,但最初,它是JDOM的一种智能分支。它合并了许多超出基本XML文档表示的功能,包括集成的XPath,支持XML Schema支持以及用于大文档或流化文档的基于事件的处理。它还提供了构建文档表示的选项,它通过DOM4J API和标准DOM接口具有并行访问功能。从2000下半年开始,它就一直处于开发之中。

为支持所有这些功能,DOM4J使用接口和抽象基本类方法。DOM4J大量使用了API中的Collections类,但是在许多情况下,它还提供一些替代方法以允许更好的性能或更直接的编码方法。直接好处是,虽然DOM4J付出了更复杂的API的代价,但是它提供了比JDOM大得多的灵活性。

在添加灵活性、XPath集成和对大文档处理的目标时,DOM4J的目标与JDOM是一样的:针对Java开发者的易用性和直观操作。它还致力于成为比JDOM更完整的解决方案,实现在本质上处理所有Java/XML问题的目标。在完成该目标时,它比JDOM更少强调防止不正确的应用程序行为。

DOM4J是一个非常非常优秀的Java XML API,具有性能优异、功能强大和极端易用使用的特点,同时它也是一个开放源代码的软件。如今你可以看到越来越多Java软件都在使用DOM4J来读写XML,特别值得一提的是连Sun的JAXM也在用DOM4J。

  优点:

    ①、大量使用了Java集合类,方便Java开发人员,同时提供一些提高性能的替代方法。

    ②、支持XPath。查找节点特别快

    ③、灵活性高。

  缺点:

    ①、大量的使用了接口,API复杂,理解难。

    ②、移植性差。

注:XPath是一门在 XML 文档中查找信息的语言。

比较:

  1、 DOM4J性能最好,连Sun的JAXM也在用DOM4J。目前许多开源项目中大量采用DOM4J,例如大名鼎鼎的Hibernate也用DOM4J来读取XML配置文件。如果不考虑可移植性,那就采用DOM4J。

  2、JDOM和DOM在性能测试时表现不佳,在测试10M文档时内存溢出,但可移植。在小文档情况下还值得考虑使用DOM和JDOM.虽然JDOM的开发者已经说明他们期望在正式发行版前专注性能问题,但是从性能观点来看,它确实没有值得推荐之处。另外,DOM仍是一个非常好的选择。DOM实现广泛应用于多种编程语言。它还是许多其它与XML相关的标准的基础,因为它正式获得W3C推荐(与基于非标准的Java模型相对),所以在某些类型的项目中可能也需要它(如在JavaScript中使用DOM)。

  3、SAX表现较好,这要依赖于它特定的解析方式-事件驱动。一个SAX检测即将到来的XML流,但并没有载入到内存(当然当XML流被读入时,会有部分文档暂时隐藏在内存中)。

  综上所述:如果XML文档较大且不考虑移植性问题建议采用DOM4J;如果XML文档较小则建议采用JDOM;如果需要及时处理而不需要保存数据则考虑SAX。

实例:

  第一步:建立一个 student.xml 文件,我们以这个文件通过上面的四种解析方式来对比分析。

<?xml version="1.0" encoding="UTF-8"?>
<students>
<student>
<name>Tom</name>
<age>11</age>
</student>
<student>
<name>Bob</name>
<age>22</age>
</student>
<student>
<name>Marry</name>
<age>23</age>
</student>
</students>

  一、DOM 解析(JDK已经自带jar包,不需要额外导入!)

package com.ys.xml;

import java.io.FileOutputStream;

import javax.xml.parsers.DocumentBuilder;
import javax.xml.parsers.DocumentBuilderFactory;
import javax.xml.transform.Transformer;
import javax.xml.transform.TransformerFactory;
import javax.xml.transform.dom.DOMSource;
import javax.xml.transform.stream.StreamResult; import org.w3c.dom.Document;
import org.w3c.dom.Element;
import org.w3c.dom.Node;
import org.w3c.dom.NodeList; public class DomParser{ /**
* 解析器读入整个文档,然后构建一个驻留内存的树结构,
* 该方法返回 Document 对象,然后我们可以通过 这个对象来操作文档
*/
public Document getDocument(String fileName) throws Exception{
//1.创建解析工厂
DocumentBuilderFactory dbFactory = DocumentBuilderFactory.newInstance();
//2.得到解析器
DocumentBuilder dBuilder = dbFactory.newDocumentBuilder();
//3.得到文档对象
Document document = dBuilder.parse(fileName); return document;
} //读取xml文档中的数据
public void read(String fileName) throws Exception{
//获取 Document 对象
Document document = new DomParser().getDocument(fileName); //获取<name></name>的节点
NodeList nameNode = document.getElementsByTagName("name");
//获取<name sex="xxx"></name>节点的sex属性
Element element = (Element) document.getElementsByTagName("name").item(0);
System.out.println(element.getAttribute("sex"));//xxx for(int i = 0 ; i < nameNode.getLength() ;i++){
System.out.println(nameNode.item(i).getTextContent());
}
/**结果为
* Tom
* Bob
* Marry
*/ //获取文档的根元素对象
Element rootElementName = document.getDocumentElement();
System.out.println(rootElementName.getNodeName()); //students //得到根节点
Node root = document.getElementsByTagName(rootElementName.getNodeName()).item(0);
list(root); } //打印所有标签
private void list(Node root) {
if(root instanceof Element){
System.out.println(root.getNodeName());
}
NodeList list = root.getChildNodes();
for(int i = 0 ; i < list.getLength() ; i++){
Node child = list.item(i);
list(child);
}
} //向 xml 文件中增加节点和属性
public void add(String fileName) throws Exception{
//获取 Document 对象
Document document = new DomParser().getDocument(fileName); //创建节点
Element sex = document.createElement("sex");
sex.setTextContent("男"); //把创建的节点添加到第一个<student></student>标签上
Element student = (Element) document.getElementsByTagName("student").item(0);
student.appendChild(sex); //在<name></name>中增加属性 <name address="xxx"></name>
Element name = (Element) document.getElementsByTagName("name").item(0);
name.setAttribute("address", "xxx"); //把更新后的内存写入xml文档中
TransformerFactory tfFactory = TransformerFactory.newInstance();
Transformer tFormer = tfFactory.newTransformer();
tFormer.transform(new DOMSource(document),
new StreamResult(new FileOutputStream("src/student.xml")));
} //向 xml 文件中删除节点和属性
public void delete(String fileName) throws Exception{
//获取 Document 对象
Document document = new DomParser().getDocument(fileName); //得到要删除的第一个<name></name>节点
Element name = (Element) document.getElementsByTagName("name").item(0);
//得到要删除的第一个<name></name>节点的父节点
//Element student = (Element) document.getElementsByTagName("student").item(0);
//student.removeChild(name);
//上面两步可以简写为
name.getParentNode().removeChild(name); //在<name></name>中删除属性 <name address="xxx"></name>
name.removeAttribute("address"); //把更新后的内存写入xml文档中
TransformerFactory tfFactory = TransformerFactory.newInstance();
Transformer tFormer = tfFactory.newTransformer();
tFormer.transform(new DOMSource(document),
new StreamResult(new FileOutputStream("src/student.xml")));
} //向 xml 文件中更新节点和属性
public void update(String fileName) throws Exception{
//获取 Document 对象
Document document = new DomParser().getDocument(fileName); //得到要删除的第一个<name></name>节点
Element name = (Element) document.getElementsByTagName("name").item(0);
//在<name></name>中更新属性 <name address="xxx"></name>为<name address="yyy"></name>
name.setAttribute("address", "yyy");
//更新name节点的文字为VAE,即<name>vae</name>
name.setTextContent("vae"); //把更新后的内存写入xml文档中
TransformerFactory tfFactory = TransformerFactory.newInstance();
Transformer tFormer = tfFactory.newTransformer();
tFormer.transform(new DOMSource(document),
new StreamResult(new FileOutputStream("src/student.xml")));
}
}

  

  

  二、SAX 解析(JDK已经自带jar包,不需要额外导入!)

package com.ys.xml;

import javax.xml.parsers.ParserConfigurationException;
import javax.xml.parsers.SAXParser;
import javax.xml.parsers.SAXParserFactory; import org.xml.sax.Attributes;
import org.xml.sax.ContentHandler;
import org.xml.sax.Locator;
import org.xml.sax.SAXException;
import org.xml.sax.XMLReader;
import org.xml.sax.helpers.DefaultHandler; public class SaxParser{ public static void main(String[] args) throws Exception {
//1.创建解析工厂
SAXParserFactory spFactory = SAXParserFactory.newInstance();
//2.得到解析器
SAXParser sParser = spFactory.newSAXParser();
//3.得到读取器
XMLReader xmlReader = sParser.getXMLReader(); //4.设置内容处理器
xmlReader.setContentHandler(new TagDefaultHandler()); //5.读取 XML 文档内容
xmlReader.parse("src/student.xml");
}
} //第一种方法:继承接口ContentHandler 得到 XML 文档所有内容
class ListHandler implements ContentHandler{ @Override
public void startElement(String uri, String localName, String qName,
Attributes atts) throws SAXException {
System.out.println("<"+qName+">");
} @Override
public void characters(char[] ch, int start, int length)
throws SAXException {
System.out.println(new String(ch,start,length));
} @Override
public void endElement(String uri, String localName, String qName)
throws SAXException {
System.out.println("</"+qName+">");
} @Override
public void setDocumentLocator(Locator locator) {
} @Override
public void startDocument() throws SAXException {
} @Override
public void endDocument() throws SAXException {
} @Override
public void startPrefixMapping(String prefix, String uri)
throws SAXException {
} @Override
public void endPrefixMapping(String prefix) throws SAXException {
} @Override
public void ignorableWhitespace(char[] ch, int start, int length)
throws SAXException {
} @Override
public void processingInstruction(String target, String data)
throws SAXException {
} @Override
public void skippedEntity(String name) throws SAXException {
} } //使用继承类 DefaultHandler 更好
class TagDefaultHandler extends DefaultHandler{
//当前解析的是什么标签
private String currentTag;
//想获得第几个标签的值
private int tagNumber=0;
//当前解析的是第几个标签
private int currentNumber=0;
@Override
public void startElement(String uri, String localName, String qName,
Attributes attributes) throws SAXException {
currentTag = qName;
//当前解析的name 标签是第几个
if("name".equals(currentTag)){
currentNumber++;
System.out.println(currentNumber);
}
} @Override
public void characters(char[] ch, int start, int length)
throws SAXException {
//打印所有name标签的值
if("name".equals(currentTag)){
System.out.println(new String(ch,start,length));
}
//想获得 第二个name标签的值
tagNumber = 2;
if("name".equals(currentTag)&&currentNumber==tagNumber){
System.out.println(new String(ch,start,length));
}
} @Override
public void endElement(String uri, String localName, String qName)
throws SAXException {
currentTag = null;
}
}

  

  三、DOM4J 解析

  JAR包下载链接:http://pan.baidu.com/s/1b5L9AA 密码:wg2l

package com.ys.xml;

import java.io.File;
import java.io.FileOutputStream;
import org.dom4j.Document;
import org.dom4j.Element;
import org.dom4j.io.OutputFormat;
import org.dom4j.io.SAXReader;
import org.dom4j.io.XMLWriter;
import org.junit.Test; public class DOM4JParser { //读取第二个<name><name>
@Test
public void read() throws Exception{
SAXReader reader = new SAXReader();
Document document = reader.read(new File("src/student.xml")); //得到根节点
Element root = document.getRootElement();
//得到第二个<student><student>节点
Element student = (Element)root.elements("student").get(1);
//获取<name><name>中间的值
String value = student.element("name").getText();
System.out.println(value);//Bob
//获取<name sex="xxx"><name>中间的sex值
String sexValue = student.element("name").attributeValue("sex");
System.out.println(sexValue);//xxx
} //增加节点
@Test
public void add() throws Exception{
SAXReader reader = new SAXReader();
Document document = reader.read(new File("src/student.xml")); Element student = document.getRootElement().element("student");
student.addElement("schoolName").setText("湖北"); OutputFormat format = OutputFormat.createPrettyPrint();
format.setEncoding("utf-8"); XMLWriter writer = new XMLWriter(new FileOutputStream("src/student.xml"),format);
writer.write(document);
writer.close(); } //删除节点
@Test
public void delete() throws Exception{
SAXReader reader = new SAXReader();
Document document = reader.read(new File("src/student.xml")); Element student = (Element)document.getRootElement().elements("student").get(1);
student.element("schoolName").setText("湖南"); OutputFormat format = OutputFormat.createPrettyPrint();
format.setEncoding("utf-8"); XMLWriter writer = new XMLWriter(new FileOutputStream("src/student.xml"),format);
writer.write(document);
writer.close(); } //修改节点
@Test
public void update() throws Exception{
SAXReader reader = new SAXReader();
Document document = reader.read(new File("src/student.xml")); Element student = document.getRootElement().element("student");
Element schoolName = student.element("schoolName");
schoolName.getParent().remove(schoolName); OutputFormat format = OutputFormat.createPrettyPrint();
format.setEncoding("utf-8"); XMLWriter writer = new XMLWriter(new FileOutputStream("src/student.xml"),format);
writer.write(document);
writer.close(); } }

  

XPath 简介:

   由于 DOM4J 是支持 XPath,那么 XPath 是什么呢?

  XPath 是一门在 XML 文档中查找信息的语言。使用路径表达式来选取 XML 文档中的节点或者节点集。这些路径表达式和我们在常规的电脑文件系统中看到的表达式非常相似。

  

  

我们以一个例子看一下用法:

package com.ys.xml;

import java.io.File;
import java.util.List; import org.dom4j.Document;
import org.dom4j.Node;
import org.dom4j.io.SAXReader; public class XPathParser { public static void main(String[] args) throws Exception {
SAXReader reader = new SAXReader();
Document document = reader.read(new File("src/student.xml")); //得到第一个 name 节点的值
String nameValue = document.selectSingleNode("//name").getText();
System.out.println(nameValue); //Tom //得到所有 name 节点的值
List<Node> nameValues = document.selectNodes("//name");
for(Node obj : nameValues){
System.out.println(obj.getText());//Tom Bob Marry
} } }

  

基于底层的 XML 的解析方式详解的更多相关文章

  1. JavaEE实战——XML文档DOM、SAX、STAX解析方式详解

    原 JavaEE实战--XML文档DOM.SAX.STAX解析方式详解 2016年06月22日 23:10:35 李春春_ 阅读数:3445 标签: DOMSAXSTAXJAXPXML Pull 更多 ...

  2. JAVA中的四种JSON解析方式详解

    JAVA中的四种JSON解析方式详解 我们在日常开发中少不了和JSON数据打交道,那么我们来看看JAVA中常用的JSON解析方式. 1.JSON官方 脱离框架使用 2.GSON 3.FastJSON ...

  3. XML的解析方式(DOM、SAX、StAX)

    (新)  XML的解析方式(DOM.SAX.StAX) 博客分类: XML   一般来说,解析XML文件存在着两种方式,一种是event-based API,比如说象SAX,XNI. 第二种是tree ...

  4. Android:XML简介 & 解析方式对比(DOM、SAX、PULL)

    目录   示意图 1. 定义 XML,即 extensible Markup Language ,是一种数据标记语言 & 传输格式 2. 作用 对数据进行标记(结构化数据).存储 & ...

  5. nrf52——DFU升级USB/UART升级方式详解(基于SDK开发例程)

    摘要:在前面的nrf52--DFU升级OTA升级方式详解(基于SDK开发例程)一文中我测试了基于蓝牙的OTA,本文将开始基于UART和USB(USB_CDC_)进行升级测试. 整体升级流程: 整个过程 ...

  6. Drawable实战解析:Android XML shape 标签使用详解(apk瘦身,减少内存好帮手)

    Android XML shape 标签使用详解   一个android开发者肯定懂得使用 xml 定义一个 Drawable,比如定义一个 rect 或者 circle 作为一个 View 的背景. ...

  7. xml的解析方式的简介

    xml的解析的简介(写到java代码) *xml是一个标记型文档 *js使用dom解析标记型文档? -根据html的层级结构,在内存中分配一个树形结构,把html的标签,属性和文本都封装成对象 -do ...

  8. Dubbo配置方式详解

    Dubbo 是一个分布式服务框架,致力于提供高性能和透明化的 RPC 远程服务调用方案,是阿里巴巴 SOA 服务化治理方案的核心框架,每天为 2,000+ 个服务提供 3,000,000,000+ 次 ...

  9. Solr系列五:solr搜索详解(solr搜索流程介绍、查询语法及解析器详解)

    一.solr搜索流程介绍 1. 前面我们已经学习过Lucene搜索的流程,让我们再来回顾一下 流程说明: 首先获取用户输入的查询串,使用查询解析器QueryParser解析查询串生成查询对象Query ...

随机推荐

  1. Python可视化学习(2):Matplotlib快速绘图基础

    Matplotlib将大部分的绘图对象都封装成为对象,故理论上所有的图表元素(如Line2D, Text,Label等)都是对象,都可以将其在图表中提取出来并配置实例的属性.同时,Matplotlib ...

  2. android-studio-bundle-141.2178183首次执行Hello World的时候出现ADB not responding. If you'd like to retry, then please manually kill "adb.e的错误

    这是由于有其他程序在占用adb.exe要使用的端口5037,打开命令提示符cmd,输入指令netstat -aon|findstr 5037查看在使用此端口的程序,如 8036即为占用该端口号的PID ...

  3. C字符串处理函数

    部分参考百科. C常用字符串函数:字符串输入函数,字符串输出函数,字符串处理函数,标准输入输出流 字符串处理函数: 1.字符串长度:strlen(str),返回字符串实际长度,不包括'\0',返回值类 ...

  4. Unity粒子系统

    最近比较清闲,就重新看了一遍例子系统,感觉能把效果做的炫酷对于初学者来说并不是一件容易的事,但是回头想想,最重要的原因可能还是没有把Particle Systems组件研究透吧,温故而知新,一起复习一 ...

  5. 商城项目实战 | 1.1 Android 仿京东商城底部布局的选择效果 —— Selector 选择器的实现

    前言 本文为菜鸟窝作者刘婷的连载."商城项目实战"系列来聊聊仿"京东淘宝的购物商城"如何实现. 京东商城的底部布局的选择效果看上去很复杂,其实很简单,这主要是要 ...

  6. PMD教程

    1.单词 violations outline:错误大纲2.错误级别 红色 很高的错误 橙色 错误 黄色 很高的警告 绿色 警告 蓝色 输出信息3.提示 Avoid excessively long ...

  7. 修改linux系统时间和同步

    date 查看当前时间 date -s 15:14:13 修改时间 cp /usr/share/zoneinfo/Asia/Shanghai /etc/localtime 修改时区 yes cront ...

  8. JS模式---命令模式

    var opendoor = { execute: function () { console.log("开门"); } }; var closedoor = { execute: ...

  9. [进程管理] Linux中Load average的理解

    Load average的定义 系统平均负载被定义为在特定时间间隔内运行队列中的平均进程树.如果一个进程满足以下条件则其就会位于运行队列中: - 它没有在等待I/O操作的结果 - 它没有主动进入等待状 ...

  10. jquery实现网页倒计时

    在毕设作品考试模块要做个倒计时,当时间到时自动结束答题.于是在jQuery插件社区找到一个简洁明了的倒计时.先上效果图. 感谢作者hacker(这是黑客的意思么),贴上地址:http://www.jq ...