一、基本介绍
XPath 是一门在 XML 文档中查找信息的语言, 可用来在 XML 文档中对元素和属性进行遍历。XPath 是 W3C XSLT 标准的主要元素,并且 XQuery 和 XPointer 同时被构建于 XPath 表达之上。因此,对 XPath 的理解是很多高级 XML 应用的基础。XPath非常类似对数据库操作的SQL语言,或者说JQuery,它可以方便开发者抓起文档中需要的东西。(dom4j也支持xpath)
二、节点类型
所谓节点(node),就是XML文件的最小构成单位,一共分成7种。
三、 常用路径表达式- element(元素节点)
- attribute(属性节点)
- text (文本节点)
- namespace (名称空间节点)
- processing-instruction (处理命令节点)
- comment (注释节点)
- root (根节点)
表达式 | 描述 |
节点名称(nodename) | 选取此节点的所有子节点 |
/ | 从根节点选取 |
// | 从匹配选择的当前节点选择文档中的节点,而不考虑它们的位置 |
. | 选取当前节点 |
.. | 选取当前节点的父节点 |
@ | 选取属性 |
通配符
描述 | |
* | 匹配任何元素节点 |
@* | 匹配任何属性节点 |
node() | 匹配任何类型的节点 |
| | 选取若干路径 |
四、示例
demo.xml
<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0">
<channel>
<title>Java Tutorials and Examples 2</title>
<language>en-us</language>
<item>
<title><![CDATA[Java Tutorials 2]]></title>
<link>http://www.javacodegeeks.com/</link>
</item>
<item>
<title><![CDATA[Java Examples 2]]></title>
<link>http://examples.javacodegeeks.com/</link>
</item>
</channel>
<college name="c1">
<class name="class1">
<student name="stu1" sex='male' age="21" />
<student name="stu2" sex='female' age="20" />
<student name="stu3" sex='female' age="20" />
</class>
</college>
<bookstore>
<book>
<title lang="eng">Harry Potter</title>
<price>29.99</price>
</book>
<book>
<title lang="eng">Learning XML</title>
<price>39.95</price>
</book>
</bookstore>
</rss>
[例1] bookstore :选取 bookstore 元素的所有子节点。
[例2] /bookstore :选取根节点bookstore,这是绝对路径写法。
[例3] bookstore/book :选取所有属于 bookstore 的子元素的 book元素,这是相对路径写法。
[例4] //book :选择所有 book 子元素,而不管它们在文档中的位置。
[例5] bookstore//book :选择所有属于 bookstore 元素的后代的 book 元素,而不管它们位于 bookstore 之下的什么位置。
[例6] //@lang :选取所有名为 lang 的属性。
带条件的过滤:所有的条件,都写在方括号"[]"中,表示对节点进行进一步的筛选。
[例7] /bookstore/book[1] :表示选择bookstore的第一个book子元素。
[例8] /bookstore/book[last()] :表示选择bookstore的最后一个book子元素。
[例9] /bookstore/book[last()-1] :表示选择bookstore的倒数第二个book子元素。
[例10] /bookstore/book[position()<3] :表示选择bookstore的前两个book子元素。
[例11] //title[@lang] :表示选择所有具有lang属性的title节点。
[例12] //title[@lang='eng'] :表示选择所有lang属性的值等于"eng"的title节点。
[例13] /bookstore/book[price] :表示选择bookstore的book子元素,且被选中的book元素必须带有price子元素。
[例14] /bookstore/book[price>35.00] :表示选择bookstore的book子元素,且被选中的book元素的price子元素值必须大于35。
[例15] /bookstore/book[price>35.00]/title :表示在例14结果集中,选择title子元素。
[例16] /bookstore/book/price[.>35.00] :表示选择值大于35的"/bookstore/book"的price子元素。
[例17] //* :选择文档中的所有元素节点。[例18] /*/* :表示选择所有第二层的元素节点。
[例19] /bookstore/* :表示选择bookstore的所有元素子节点。
[例20] //title[@*] :表示选择所有带有属性的title元素。
[例21] //book/title | //book/price :表示同时选择book元素的title子元素和price子元素。
五、java中实现xpath过滤的代码:
import java.io.File;
import java.io.FileInputStream;
import javax.xml.parsers.DocumentBuilder;
import javax.xml.parsers.DocumentBuilderFactory;
import javax.xml.xpath.XPath;
import javax.xml.xpath.XPathConstants;
import javax.xml.xpath.XPathExpressionException;
import javax.xml.xpath.XPathFactory;
import org.w3c.dom.Document;
import org.w3c.dom.Node;
import org.w3c.dom.NodeList;
public class XPathDemo {
private static Document doc;
private static XPath xpath;
public static void main(String[] args) throws Exception {
init();
getRootEle();
getChildEles();
getPartEles();
haveChildsEles();
getLevelEles();
getAttrEles();
//打印根节点下的所有元素节点
System.out.println(doc.getDocumentElement().getChildNodes().getLength());
NodeList nodeList = doc.getDocumentElement().getChildNodes();
for (int i = 0; i < nodeList.getLength(); i++) {
if (nodeList.item(i).getNodeType() == Node.ELEMENT_NODE) {
System.out.print(nodeList.item(i).getNodeName() + " ");
}
}
}
// 初始化Document、XPath对象
public static void init() throws Exception {
// 创建Document对象
DocumentBuilderFactory dbf = DocumentBuilderFactory.newInstance();
dbf.setValidating(false);
DocumentBuilder db = dbf.newDocumentBuilder();
doc = db.parse(new FileInputStream(new File("demo.xml")));
// 创建XPath对象
XPathFactory factory = XPathFactory.newInstance();
xpath = factory.newXPath();
}
// 获取根元素
// 表达式可以更换为/*,/rss
public static void getRootEle() throws XPathExpressionException {
Node node = (Node) xpath.evaluate("/rss", doc, XPathConstants.NODE);
System.out.println(node.getNodeName() + "--------"
+ node.getNodeValue());
}
// 获取子元素并打印
public static void getChildEles() throws XPathExpressionException {
NodeList nodeList = (NodeList) xpath.evaluate("/rss/channel/*", doc,
XPathConstants.NODESET);
for (int i = 0; i < nodeList.getLength(); i++) {
System.out.print(nodeList.item(i).getNodeName() + " ");
}
System.out.println();
}
// 获取部分元素
// 只获取元素名称为title的元素
public static void getPartEles() throws XPathExpressionException {
NodeList nodeList = (NodeList) xpath.evaluate("//*[name() = 'title']",
doc, XPathConstants.NODESET);
for (int i = 0; i < nodeList.getLength(); i++) {
System.out.print(nodeList.item(i).getNodeName() + "-->"
+ nodeList.item(i).getTextContent());
}
System.out.println();
}
// 获取包含子节点的元素
public static void haveChildsEles() throws XPathExpressionException {
NodeList nodeList = (NodeList) xpath.evaluate("//*[*]", doc,
XPathConstants.NODESET);
for (int i = 0; i < nodeList.getLength(); i++) {
System.out.print(nodeList.item(i).getNodeName() + " ");
}
System.out.println();
}
// 获取指定层级的元素
public static void getLevelEles() throws XPathExpressionException {
NodeList nodeList = (NodeList) xpath.evaluate("/*/*/*/*", doc,
XPathConstants.NODESET);
for (int i = 0; i < nodeList.getLength(); i++) {
System.out.print(nodeList.item(i).getNodeName() + "-->"
+ nodeList.item(i).getTextContent() + " ");
}
System.out.println("-----------------------------");
}
// 获取指定属性的元素
// 获取所有大于指定价格的书箱
public static void getAttrEles() throws XPathExpressionException {
NodeList nodeList = (NodeList) xpath.evaluate("//bookstore/book[price>35.00]/title", doc,
XPathConstants.NODESET);
for (int i = 0; i < nodeList.getLength(); i++) {
System.out.print(nodeList.item(i).getNodeName() + "-->"
+ nodeList.item(i).getTextContent() + " ");
}
System.out.println();
}
}
参考文档:
https://my.oschina.net/cloudcoder/blog/223359
http://www.ruanyifeng.com/blog/2009/07/xpath_path_expressions.html