xml的解析

最新推荐文章于 2022-07-20 21:04:30 发布

MBH1816

最新推荐文章于 2022-07-20 21:04:30 发布

阅读量188

点赞数 1

1.概念：

XML 指可扩展标记语言，被设计用来传输和存储数据。

2.xml的特性

XML 是不作为的。

XML 被设计用来结构化、存储以及传输信息。

通过 XML 您可以发明自己的标签

上例中的标签没有在任何 XML 标准中定义过（比如 <to> 和 <from>）。这些标签是由文档的创作者发明的。

这是因为 XML 没有预定义的标签。

在 HTML 中使用的标签（以及 HTML 的结构）是预定义的。HTML 文档只使用在 HTML 标准中定义过的标签（比如 <p> 、<h1> 等等）。

XML 允许创作者定义自己的标签和自己的文档结构。

XML 不是对 HTML 的替代

XML 是对 HTML 的补充。

XML 不会替代 HTML，理解这一点很重要。在大多数 web 应用程序中，XML 用于传输数据，而 HTML 用于格式化并显示数据。

对 XML 最好的描述是：

XML 是独立于软件和硬件的信息传输工具。

3.xml功能

把数据从 HTML 分离、简化数据共享、简化数据传输等

Python中对xml的解析有三种方法：

一、elementtree解析

代码如下：

用eklementtree方法解析xml
import xml.etree.ElementTree as et#导入elementree模块起个别名
tree=et.parse('country.xml')#加载xml文档
root=tree.getroot()#获取根节点
#获取根节点的标签、属性及文本。
print('root-tag:',root.tag,'root-attrib:',root.attrib,'root-text:',root.text)
#遍历根节点里的节点
for child in root:
    print('节点:',child.tag,'属性:',child.attrib,'文本:',child.text)
    #遍历节点的子节点
    for sub in child:
        print('节点:',sub.tag,'属性:',sub.attrib,'文本:',sub.text)

二、使用SAX API解析XML

SAX是事件驱动的XML解析的标准接口。使用SAX解析XML通常需要通过子类化xml.sax.ContentHandler来创建自己的ContentHandler。
ContentHandler处理XML样式/风格的特定标签和属性。 ContentHandler对象提供了处理各种解析事件的方法。它拥有的解析器在解析XML文件时调用ContentHandler方法。
在XML文件的开头和结尾分别调用：startDocument和endDocument方法。 characters(text)方法通过参数text传递XML文件的字符数据。

ContentHandler在每个元素的开头和结尾被调用。如果解析器不在命名空间模式下，则调用startElement(tag，attributes)和endElement(tag)方法; 否则，调用相应的方法startElementNS和endElementNS方法。这里，tag是元素标签，属性是Attributes对象。

例如：XML文件

<collection shelf = "New Arrivals">
<movie title = "Enemy Behind">
   <type>War, Thriller</type>
   <format>DVD</format>
   <year>2013</year>
   <rating>PG</rating>
   <stars>10</stars>
   <description>Talk about a US-Japan war</description>
</movie>
<movie title = "Transformers">
   <type>Anime, Science Fiction</type>
   <format>DVD</format>
   <year>1989</year>
   <rating>R</rating>
   <stars>8</stars>
   <description>A schientific fiction</description>
</movie>
   <movie title = "Trigun">
   <type>Anime, Action</type>
   <format>DVD</format>
   <episodes>4</episodes>
   <rating>PG</rating>
   <stars>10</stars>
   <description>Vash the Stampede!</description>
</movie>
<movie title = "Ishtar">
   <type>Comedy</type>
   <format>VHS</format>
   <rating>PG</rating>
   <stars>2</stars>
   <description>Viewable boredom</description>
</movie>
</collection>

xml的解析代码：


#!/usr/bin/python3

import xml.sax

class MovieHandler( xml.sax.ContentHandler ):
   def __init__(self):
      self.CurrentData = ""
      self.type = ""
      self.format = ""
      self.year = ""
      self.rating = ""
      self.stars = ""
      self.description = ""

   # Call when an element starts
   def startElement(self, tag, attributes):
      self.CurrentData = tag
      if tag == "movie":
         print ("*****Movie*****")
         title = attributes["title"]
         print ("Title:", title)

   # Call when an elements ends
   def endElement(self, tag):
      if self.CurrentData == "type":
         print ("Type:", self.type)
      elif self.CurrentData == "format":
         print ("Format:", self.format)
      elif self.CurrentData == "year":
         print ("Year:", self.year)
      elif self.CurrentData == "rating":
         print ("Rating:", self.rating)
      elif self.CurrentData == "stars":
         print ("Stars:", self.stars)
      elif self.CurrentData == "description":
         print ("Description:", self.description)
      self.CurrentData = ""

   # Call when a character is read
   def characters(self, content):
      if self.CurrentData == "type":
         self.type = content
      elif self.CurrentData == "format":
         self.format = content
      elif self.CurrentData == "year":
         self.year = content
      elif self.CurrentData == "rating":
         self.rating = content
      elif self.CurrentData == "stars":
         self.stars = content
      elif self.CurrentData == "description":
         self.description = content

if ( __name__ == "__main__"):

   # create an XMLReader
   parser = xml.sax.make_parser()
   # turn off namepsaces
   parser.setFeature(xml.sax.handler.feature_namespaces, 0)

   # override the default ContextHandler
   Handler = MovieHandler()
   parser.setContentHandler( Handler )

   parser.parse("movies.xml")

三、使用DOM API解析XML

文档对象模型(“DOM”)是来自万维网联盟(W3C)的跨语言API，用于访问和修改XML文档。

DOM对于随机访问应用非常有用。SAX只允许您一次查看文档的一部分。如果想要查看一个SAX元素，则无法访问另一个。

以下是快速加载XML文档并使用xml.dom模块创建minidom对象的最简单方法。 minidom对象提供了一个简单的解析器方法，可以从XML文件快速创建一个DOM树。

示例调用minidom对象的parse(file [，parser])函数来解析由文件指定为DOM树对象的XML文件。

#!/usr/bin/python3

from xml.dom.minidom import parse
import xml.dom.minidom

# Open XML document using minidom parser
DOMTree = xml.dom.minidom.parse("movies.xml")
collection = DOMTree.documentElement
if collection.hasAttribute("shelf"):
   print ("Root element : %s" % collection.getAttribute("shelf"))

# Get all the movies in the collection
movies = collection.getElementsByTagName("movie")

# Print detail of each movie.
for movie in movies:
   print ("*****Movie*****")
   if movie.hasAttribute("title"):
      print ("Title: %s" % movie.getAttribute("title"))

   type = movie.getElementsByTagName('type')[0]
   print ("Type: %s" % type.childNodes[0].data)
   format = movie.getElementsByTagName('format')[0]
   print ("Format: %s" % format.childNodes[0].data)
   rating = movie.getElementsByTagName('rating')[0]
   print ("Rating: %s" % rating.childNodes[0].data)
   description = movie.getElementsByTagName('description')[0]
   print ("Description: %s" % description.childNodes[0].data)

MBH1816

关注

1
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
xml的解析

1.概念：XML 指可扩展标记语言，被设计用来传输和存储数据。2.xml的特性XML 是不作为的。XML 被设计用来结构化、存储以及传输信息。通过 XML 您可以发明自己的标签上例中的标签没有在任何 XML 标准中定义过（比如 &lt;to&gt; 和 &lt;from&gt;）。这些标签是由文档的创作者发明的。这是因为 XML 没有预定义的标签。在 HTML 中使用的标签（以及 HTML 的结构...
复制链接

扫一扫