编码出错的问题

最新推荐文章于 2024-10-07 13:47:55 发布

weixin_33758863

最新推荐文章于 2024-10-07 13:47:55 发布

阅读量144

点赞数

文章标签： awk 操作系统

原文链接：http://www.cnblogs.com/code-style/p/3469362.html

版权

#!/bin/sh


rm bbb
touch bbb
cat aaa | while read line
do
  echo $line | iconv -f utf8 -t gb2312 >> bbb
done

linux下关于编码有两个相关命令，一个是file，用于检测文件编码格式。一个是iconv命令用于将文件在两种编码格式之间转换。但是，经常会出现一个问题，就是不管怎么转，有的时候就是会报告转换失败，我一直在想这是怎么回事？一种可以说通的解释是文件的一部分已经损坏掉，所以无法进行整体转换，那么我产生一个想法，既然是部分损坏，那么我可以部分读出，部分转换，失败掉的地方就失败掉好了，我可以把大多数完整的行给转换出来。

之后发现上面脚本的一个BUG：我期望的是当脚本转换编码错误时，出错的一行被整个放弃，但是脚本还是将出错那一行能够编码的字符串写入文件，这样的数据会破坏文件

#!/bin/sh


rm bbb
touch bbb
cat aaa | while read line
do
        aline=`echo $line | iconv -f utf8 -t gb2312 2>/dev/null`
        echo $aline | awk '{if(substr($0,length($0),1)==";")print $0 >> "'bbb'"}'
done