xml中的空格之完全解说

原创 2003年08月20日 10:56:00

提示:我提取了《xslt从入门到精通》中关于空格解释的核心部分,借以抛砖引玉,希望大家踊跃参与讨论。谈谈你对空格的理解。

只适合对xml文件结构有一定了解的学者,不适合初学者。请按从上至下的顺序阅读。


对html文件而言,空格不重要;然而,对xml而言,默认立场就是要保留空格结点(空格结点的解释见下文)。


根据xml规范的规定,所谓空格是四种字符的任意组合序列:
-----------------------
空格字符(space),对应字符值为 #x20
返回字符(Carriage Return),对应字符值为 #xD
新行字符(Newline),对应字符值为 #xA
跳格字符(Tab),对应字符值为 #x9。


xml文件的空格也会形成结点,也就是空格结点。空格结点属于文字结点类型。


对xml和xslt而言,空格结点会牵涉到两个议题:
-----------------------
1。在xml输入文件中决定哪些空格是重要的,xslt处理器要看见这些空格结点。而决定的密钥就是xml:space属性。
2。在xsl模板文件中决定哪些空格是重要的,xslt处理器应将它复制到结果树中,而决定的密钥就是xsl:strip-space
和xsl:preserve-space这两个命令。


“重要和不重要的空格结点”
-----------------------
若某组件的内容只能放组件,则该组件中的空格结点就是不重要的(Insignificant);
如果某组件的内容是#PCDATA的类型,则其内的空格结点应视为重要的(Signficant)。
至于组件内容混杂了文字内容和组件的情况则无从评判,应视组件及其内容之语意而定。


xslt处理器接触到xml输入文件之前,会先由xml分析器进行分析
-----------------------
(1)xml:space属性可以改变后续接手的xml应用程序处理空格结点的模式,例如,xslt处理器就会受xml:space属性影响。
(2)xml文件中任何一列标记或内容尾端的结尾的结尾符号全部会换成单一新行字符(#xA)。
(3)属性值交给xml应用程序之前,xml分析器也应该先对属性值做规范化的操作。这是因为不同的操作系统每一行文字列
     的结尾字符有不同的组合,例如,windows系统会由返回字符呵新行字符组成结尾符号,而Unix系统则仅由新行字符组
     成结尾符号。xml分析器在读取xml文件之后,便先行将所有结尾符号换成单一新行字符,不仅统一了不同系统间不同
     结尾符号设计的差异性,同时也简化了后续xml应用程序的的操作难度。这样一个处理过程称为“规范化(Normalization)”。
 a,每一文字列的结尾符号都要规范化成单一的新行字符(#xA)。
 b,任何一个空格符(#x20、#xD、#xA、#x9)都应换成一个空格字符(#x20)。
 c,属性值中若含有字参码,则应替换成该参考字符,例如,
会换成新行字符(#xA)。
 d,属性值若含有实体参考,则应以其替换文字替换。
 e,除此之外,任何字符都应直接放入规范化属性值中。
 f,最后,如果属性类型不是CDATA,则xml分析器应该再进一步把属性值前后的空格字符序列删除,而且属性值中间
    若有空格序列,也应该替换成单一空格字符。
   
   
xslt处理器把xml输入文件和xsl模板文件的结构树建好之后,会现把组件中相邻的文字结点合并成单一的文字结点,然后再把
一些文字结点抽掉。然而,如果文字结点符合下列条件之一,就会被保留下来:
-----------------------
(1)文字结点的父组件是空格保留组件名称集(Set Of Whitespace-preserving Element Names)中的一员。
(2)文字结点中至少有一个非空格符。
(3)文字结点的某个祖先组件中有xml:space属性,其值为preserve,而且较近的祖先组件中没有其他xml:space属性值为default。
除此之外的文字结点逗会被抽掉。


对xsl模板而言,所谓的空格保留组件名称集只有一个xsl:text组件可用。xsl模板文件的空格结点都会被删除,但是,如果空格结
点出现在xsl:text组件中就会被保留下来。

 

我的网站:http://www.17xml.com/article_show.asp?article_id=47

读XML文件时出现空格字符情况 .

public static byte[] StreamToByte(InputStream inStream) throws Exception { byte casebyte[]=new b...
  • mycup163
  • mycup163
  • 2012年07月01日 12:16
  • 1226

XML转String拼htmlText的时候莫名多出来的空格

在做一个XML内容拼接成String供htmlText使用的时候发现总是会在每行后面多一个空格,并且自动换行。后来发现原来XML有一个静态方法prettyPrinting : Boolean[静态] ...
  • topfire7
  • topfire7
  • 2010年07月05日 16:43
  • 599

操作XML

操作XML   千呼万唤始出来,BB了这么多东西,咱们终于可以写点东西了,前方内容很多,楼主正在考虑是否可以分开写.   因为啥东西多呢?前面说了那么多关于XML的...
  • shanyongxu
  • shanyongxu
  • 2016年04月23日 21:23
  • 3887

dom4j 创建缩进换行格式的xml,并输出xml到字符串中

public void createXML() {                   // 创建XML文档树           Document document = DocumentHelper...
  • pingguowang
  • pingguowang
  • 2015年03月20日 14:24
  • 3762

xml中空格换行缩进

常用的XML转义字符记录如下: 空格: string name="out_bound_submit">出  库string> 其中的 就代表空格 连续的空格会被合并为一个空格 换行: s...
  • lqianq86
  • lqianq86
  • 2016年05月13日 17:44
  • 455

Android中xml文件中空格转义符

空格:  
  • zhanzkw
  • zhanzkw
  • 2014年03月26日 09:28
  • 1464

XML就是这么简单

什么是XML? XML:extensiable markup language 被称作可扩展标记语言 XML简单的历史介绍: gml->sgml->html-&am...
  • Java_3y
  • Java_3y
  • 2018年02月10日 19:05
  • 33

xml

XML---可扩展标记语言 第一部分:XML语言介绍 什么是 XML? ·  XML 指可扩展标记语言(EXtensible Markup Language) ·  XML 是一种标记语言...
  • xiaoliang_1991
  • xiaoliang_1991
  • 2012年08月01日 07:03
  • 3978

翻译《Ruby Hacking Guide》

导读:   周末,我在校验《Ruby Hacking Guide》(简称RHG)。   RHG是一本剖析Ruby源码的书。其实,这是日文书,原名是《Ruby源码完全解说》,作者是青木峰郎。很早就听说过...
  • wozhilei
  • wozhilei
  • 2008年03月04日 18:38
  • 585

云台控制协议

PELCO-D与PELCO-P协议 PELCO-D: 数据格式:1位起始位、8位数据、1位停止位,无校验位。波特率:2400B/S 命令格式: 字节1 字节2 ...
  • evsqiezi
  • evsqiezi
  • 2013年12月23日 16:30
  • 1716
内容举报
返回顶部
收藏助手
不良信息举报
您举报文章:xml中的空格之完全解说
举报原因:
原因补充:

(最多只允许输入30个字)