xml文件处理经验总结

 1.xml文件存储效率不高,存在很大的冗余信息量

excel文件与xml文件的转化是一个指数级的函数关系,如下表所示。

excel文件大小(KB)转化之后的xml文件大小(KB)
278 557
296 937
124722282
4287236361
10111747658

      经过winzip的压缩,一个236361kb的xml文件可以被压缩为659kb,压缩比为359:1,这说明了xml的冗余信息量是很巨大的。

     打开excel转换过来的xml文件,就可以看到每描述一个cell的内容,xml都要用60个字符的附加信息。如下所示。<Cell ss:StyleID="s29"><ss:Data ss:Type="String"
      xmlns="http://www.w3.org/TR/REC-html40">aa</ss:Data></Cell> 

    因此,xml的文件的存储或者是上传,一定要做压缩处理,否则其效率是很低的。或者如果可以找到其他替代的存储或者编码格式,例如json,最好可以先考虑。在对效率不敏感的时候,xml才是一个好的选择。

(2)xml处理效率不高,对于大xml文件,无论是dom处理或者是sax处理都不是理想处理方式。

http://developer.51cto.com/art/200604/25541.htm 这篇文章对这个问题有很详细的描述。

http://cavingdeep.cnblogs.com/archive/2006/03/15/350456.html <<新兴XML处理方法VTD-XML介绍>>这篇文章有很好的分析。

基本上的xml的处理是一个很好内存的操作,现在也出现一种新的处理方式vtd-xml.如下所述。

  1. VTD-XML的解析速度是SAX(with NULL content handler)的1.5x~2.0x。With NULL content handler的意思就是说SAX解析中没有插入任何额外的处理逻辑,也就是SAX的最高速度。
  2. VTD-XML的内存占用是原XML的1.3x~1.5x(其中1.0x的部分是原XML,0.3x~0.5x是VTD-XML占用的部分),而DOM的内存占用则是原XML的5x~10x。举一个例子,如果一个XML的大小是50MB,那么用VTD-XML读取进来内存占用会在 65MB~75MB之间,而DOM的内存占用则会在250M~500MB之间。基于这个数据用DOM处理大的XML文件几乎是不可能的选择。

因此,在做xml处理的时候,必须要考虑到内存方面的限制。

(3)xml的编码问题

xml作为一种描述语言,本身会用到特殊符号来作为元描述语言,因此对于这些特殊符号要做另外的处理,否则很容易出错。一般来说,如果是真实的数据内容,都是推荐使用CDATA部件,因为只有在CDATA部件之内的文本会被解析器忽略。但是要注意处理,数据内容的字符"]]>" 或者"<![CDATA[" 。

http://dev.csdn.net/article/68/68417.shtm<<XML指南——XML CDATAXML指南——XML CDATA>>这篇文章就对这个问题作了很好的说明。

 

 

 



   

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值