windows下的中文文件名共享在linux下显示乱码的问题

最新推荐文章于 2024-07-26 14:53:47 发布

piperzero

最新推荐文章于 2024-07-26 14:53:47 发布

阅读量2.2k

点赞数

文章标签：操作系统 ruby 运维

1.现象描述

在windos环境下有一个含有中文的文件名，比如dataset_省调.scd。

在linux（虚拟机）下通过挂载系统将该文件挂载在/mnt/hgfs目录下，显示为乱码。但是通过ftp将文件上传到linux相应目录下中文显示正常。

2.原因分析

windows下的文件名编码方式为GBK。linux（虚拟机）系统下通过挂载方式共享该文件时，文件名的中文自动自动转换为了UTF-8编码方式，在linux系统下中文编码设置为GBK编码方式，所以显示为乱码。

3.验证

使用编码转换工具，将查看“省调”两个字的GBK编码为CA A1 B5 F7，UTF8编码为E7 9C 81 E8 B0 83，显示为”鐪佽皟“。该汉字在linux系 1.现象描述

在windos环境下有一个含有中文的文件名，比如dataset_省调.scd。

在linux（虚拟机）下通过挂载系统将该文件挂载在/mnt/hgfs目录下，显示为乱码。但是通过ftp将文件上传到linux相应目录下中文显示正常。

2.原因分析

3.验证

使用编码转换工具，将查看“省调”两个字的GBK编码为CA A1 B5 F7，UTF8编码为E7 9C 81 E8 B0 83，显示为”鐪佽皟“。该汉字在linux系统下显示正好为上述编码的三个乱码汉字。

4.问题解决

可以通过FTP或其它一些同步工具将该文件上传到linux系统下。

5.知识拓展

字符(Character)是文字与符号的总称，包括文字、图形符号、数学符号等。一组抽象字符的集合就是字符集(Charset)。

计算机要处理各种字符，就需要将字符和二进制内码对应起来，这种对应关系就是字符编码(Encoding)。

制定编码首先要确定字符集，并将字符集内的字符排序，然后和二进制数字对应起来。根据字符集内字符的多少，会确定用几个字节来编码。
每种编码都限定了一个明确的字符集合，叫做被编码过的字符集(Coded Character Set)，这是字符集的另外一个含义。通常所说的字符集大多是这个含义。

常用的字符集有： ASCII、 ISO 8859-1、 UCS、 Unicode、 UTF、汉字编码、 ANSI

下面是转的各种编码方式的详细介绍：

ASCII:
American Standard Code for Information Interchange，美国信息交换标准码。
目前计算机中用得最广泛的字符集及其编码，由美国国家标准局(ANSI)制定。
它已被国际标准化组织(ISO)定为国际标准，称为ISO 646标准。
ASCII字符集由控制字符和图形字符组成。
在计算机的存储单元中，一个ASCII码值占一个字节(8个二进制位)，其最高位(b7)用作奇偶校验位。
所谓奇偶校验，是指在代码传送过程中用来检验是否出现错误的一种方法，一般分奇校验和偶校验两种。
奇校验规定:正确的代码一个字节中1的个数必须是奇数，若非奇数，则在最高位b7添1。
偶校验规定:正确的代码一个字节中1的个数必须是偶数，若非偶数，则在最高位b7添1。

ISO 8859-1:
ISO 8859，全称ISO/IEC 8859，是国际标准化组织(ISO)及国际电工委员会(IEC)联合制定的一系列8位字符集的标准，现时定义了15个字符集。
ASCII收录了空格及94个“可印刷字符”，足以给英语使用。
但是，其他使用拉丁字母的语言(主要是欧洲国家的语言)，都有一定数量的变音字母，故可以使用ASCII及控制字符以外的区域来储存及表示。
除了使用拉丁字母的语言外，使用西里尔字母的东欧语言、希腊语、泰语、现代阿拉伯语、希伯来语等，都可以使用这个形式来储存及表示。
* ISO 8859-1 (Latin-1) - 西欧语言
* ISO 8859-2 (Latin-2) - 中欧语言
* ISO 8859-3 (Latin-3) - 南欧语言。世界语也可用此字符集显示。
* ISO 8859-4 (Latin-4) - 北欧语言
* ISO 8859-5 (Cyrillic) - 斯拉夫语言
* ISO 8859-6 (Arabic) - 阿拉伯语
* ISO 8859-7 (Greek) - 希腊语
* ISO 8859-8 (Hebrew) - 希伯来语(视觉顺序)
* ISO 8859-8-I - 希伯来语(逻辑顺序)
* ISO 8859-9 (Latin-5 或 Turkish) - 它把Latin-1的冰岛语字母换走，加入土耳其语字母。
* ISO 8859-10 (Latin-6 或 Nordic) - 北日耳曼语支，用来代替Latin-4。
* ISO 8859-11 (Thai) - 泰语，从泰国的 TIS620 标准字集演化而来。
* ISO 8859-13 (Latin-7 或 Baltic Rim) - 波罗的语族
* ISO 8859-14 (Latin-8 或 Celtic) - 凯尔特语族
* ISO 8859-15 (Latin-9) - 西欧语言，加入Latin-1欠缺的法语及芬兰语重音字母，以及欧元符号。
* ISO 8859-16 (Latin-10) - 东南欧语言。主要供罗马尼亚语使用，并加入欧元符号。
很明显，iso8859-1编码表示的字符范围很窄，无法表示中文字符。
但是，由于是单字节编码，和计算机最基础的表示单位一致，所以很多时候，仍旧使用iso8859-1编码来表示。
而且在很多协议上，默认使用该编码。

UCS:
通用字符集(Universal Character Set，UCS)是由ISO制定的ISO 10646(或称ISO/IEC 10646)标准所定义的字符编码方式，采用4字节编码。
UCS包含了已知语言的所有字符。
除了拉丁语、希腊语、斯拉夫语、希伯来语、阿拉伯语、亚美尼亚语、格鲁吉亚语，还包括中文、日文、韩文这样的象形文字，UCS还包括大量的图形、印刷、数学、科学符号。
* UCS-2: 与unicode的2byte编码基本一样。
* UCS-4: 4byte编码, 目前是在UCS-2前加上2个全零的byte。

Unicode:
Unicode(统一码、万国码、单一码)是一种在计算机上使用的字符编码。
它是http://www.unicode.org制定的编码机制，要将全世界常用文字都函括进去。
它为每种语言中的每个字符设定了统一并且唯一的二进制编码，以满足跨语言、跨平台进行文本转换、处理的要求。
1990年开始研发，1994年正式公布。随着计算机工作能力的增强，Unicode也在面世以来的十多年里得到普及。
但自从unicode2.0开始，unicode采用了与ISO 10646-1相同的字库和字码，ISO也承诺ISO10646将不会给超出0x10FFFF的UCS-4编码赋值，使得两者保持一致。
Unicode的编码方式与ISO 10646的通用字符集(Universal Character Set，UCS)概念相对应，目前的用于实用的Unicode版本对应于UCS-2，使用16位的编码空间。
也就是每个字符占用2个字节，基本满足各种语言的使用。实际上目前版本的Unicode尚未填充满这16位编码，保留了大量空间作为特殊使用或将来扩展。

UTF:
Unicode 的实现方式不同于编码方式。
一个字符的Unicode编码是确定的，但是在实际传输过程中，由于不同系统平台的设计不一定一致，以及出于节省空间的目的，对Unicode编码的实现方式有所不同。
Unicode的实现方式称为Unicode转换格式(Unicode Translation Format，简称为 UTF)。
* UTF-8: 8bit变长编码，对于大多数常用字符集(ASCII中0~127字符)它只使用单字节，而对其它常用字符(特别是朝鲜和汉语会意文字)，它使用3字节。
* UTF-16: 16bit编码，是变长码，大致相当于20位编码，值在0到0x10FFFF之间，基本上就是unicode编码的实现，与CPU字序有关。

汉字编码:
* GB2312字集是简体字集，全称为GB2312(80)字集，共包括国标简体汉字6763个。
* BIG5字集是台湾繁体字集，共包括国标繁体汉字13053个。
* GBK字集是简繁字集，包括了GB字集、BIG5字集和一些符号，共包括21003个字符。
* GB18030是国家制定的一个强制性大字集标准，全称为GB18030-2000，它的推出使汉字集有了一个“大一统”的标准。

ANSI和Unicode big endia:
我们在Windows系统中保存文本文件时通常可以选择编码为ANSI、Unicode、Unicode big endian和UTF-8，这里的ANSI和Unicode big endia是什么编码呢?
ANSI:
使用2个字节来代表一个字符的各种汉字延伸编码方式，称为ANSI编码。
在简体中文系统下，ANSI编码代表GB2312编码，在日文操作系统下，ANSI编码代表JIS编码。
Unicode big endia:
UTF-8以字节为编码单元，没有字节序的问题。UTF-16以两个字节为编码单元，在解释一个UTF-16文本前，首先要弄清楚每个编码单元的字节序。
Unicode规范中推荐的标记字节顺序的方法是BOM(即Byte Order Mark)。
在UCS编码中有一个叫做"ZERO WIDTH NO-BREAK SPACE"的字符，它的编码是FEFF。而FFFE在UCS中是不存在的字符，所以不应该出现在实际传输中。
UCS规范建议我们在传输字节流前，先传输字符"ZERO WIDTH NO-BREAK SPACE"。
这样如果接收者收到FEFF，就表明这个字节流是Big-Endian的；如果收到FFFE，就表明这个字节流是Little-Endian的。
因此字符"ZERO WIDTH NO-BREAK SPACE"又被称作BOM。
Windows就是使用BOM来标记文本文件的编码方式的。

编程语言与编码

C、C++、Python2内部字符串都是使用当前系统默认编码
Python3、Java内部字符串用Unicode保存
Ruby有一个内部变量$KCODE用来表示可识别的多字节字符串的编码，变量值为"EUC" "SJIS" "UTF8" "NONE"之一。
$KCODE的值为"EUC"时，将假定字符串或正则表达式的编码为EUC-JP。
同样地，若为"SJIS"时则认定为Shift JIS。若为"UTF8"时则认定为UTF-8。
若为"NONE"时，将不会识别多字节字符串。
在向该变量赋值时，只有第1个字节起作用，且不区分大小写字母。
"e" "E" 代表 "EUC"，"s" "S" 代表 "SJIS"，"u" "U" 代表 "UTF8"，而"n" "N" 则代表 "NONE"。
默认值为"NONE"。
即默认情况下Ruby把字符串当成单字节序列来处理。

为什么会乱码?

乱码是个老问题，从上面我们知道，字符在保存时的编码格式如果和要显示的编码格式不一样的话，就会出现乱码问题。
我们的Web系统，从底层数据库编码、Web应用程序编码到HTML页面编码，如果有一项不一致的话，就会出现乱码。
所以，解决乱码问题说难也难说简单也简单，关键是让交互系统之间编码一致。

有没有万金油?

在如此多种编码和字符集弄的我们眼花缭乱的情况下，我们只需选择一种兼容性最好的编码方式和字符集，让它成为我们程序子系统之间
交互的编码契约，那么从此恼人的乱码问题即将远离我们而去 -- 这种兼容性最好的编码就是UTF-8!
毕竟GBK/GB2312是国内的标准，当我们大量使用国外的开源软件时，UTF-8才是编码界最通用的语言。

下面还有一篇关于编码的文章，转自 http://kb.cnblogs.com/a/1540382/

这是一篇程序员写给程序员的趣味读物。所谓趣味是指可以比较轻松地了解一些原来不清楚的概念，

增进知识，类似于打RPG游戏的升级。整理这篇文章的动机是两个问题：

问题一：

使用Windows记事本的“另存为”，可以在GBK、Unicode、Unicode big endian和UTF-8这几种

编码方式间相互转换。同样是txt文件，Windows是怎样识别编码方式的呢？

我很早前就发现Unicode、Unicode bigendian和UTF-8编码的txt文件的开头会多出几个字节，

分别是FF、FE（Unicode）,FE、FF（Unicode bigendian）,EF、BB、BF（UTF-8）。但这些

标记是基于什么标准呢？

问题二：

最近在网上看到一个ConvertUTF.c，实现了UTF-32、UTF-16和UTF-8这三种编码方式的相互转换。

对于Unicode(UCS2)、GBK、UTF-8这些编码方式，我原来就了解。但这个程序让我有些糊涂，想不

起来UTF-16和UCS2有什么关系。查了查相关资料，总算将这些问题弄清楚了，顺带也了解了一些

Unicode的细节。写成一篇文章，送给有过类似疑问的朋友。本文在写作时尽量做到通俗易懂，但要

求读者知道什么是字节，什么是十六进制。

0、big endian和little endian

bigendian和littleendian是CPU处理多字节数的不同方式。例如“汉”字的Unicode编码是6C49。

那么写到文件里时，究竟是将6C写在前面，还是将49写在前面？如果将6C写在前面，就是big endian。

如果将49写在前面，就是little endian。

“endian”这个词出自《格列佛游记》。小人国的内战就源于吃鸡蛋时是究竟从大头(Big-Endian)

敲开还是从小头(Little-Endian)敲开，由此曾发生过六次叛乱，一个皇帝送了命，另一个丢了王位。

我们一般将endian翻译成“字节序”，将big endian和little endian称作“大尾”和“小尾”。

1、字符编码、内码，顺带介绍汉字编码

字符必须编码后才能被计算机处理。计算机使用的缺省编码方式就是计算机的内码。早期的计算机使用

7位的ASCII编码，为了处理汉字，程序员设计了用于简体中文的GB2312和用于繁体中文的big5。

GB2312(1980年)一共收录了7445个字符，包括6763个汉字和682个其它符号。汉字区的内码范围高

字节从B0-F7，低字节从A1-FE，占用的码位是72*94=6768。其中有5个空位是D7FA-D7FE。

GB2312支持的汉字太少。1995年的汉字扩展规范GBK1.0收录了21886个符号，它分为汉字区和图形符

最低0.47元/天解锁文章

piperzero

关注

0
点赞
踩
2

收藏

觉得还不错? 一键收藏
0
评论
windows下的中文文件名共享在linux下显示乱码的问题

1.现象描述在windos环境下有一个含有中文的文件名，比如dataset_省调.scd。在linux（虚拟机）下通过挂载系统将该文件挂载在/mnt/hgfs目录下，显示为乱码。但是通过ftp将文件上传到linux相应目录下中文显示正常。2.原因分析windows下的文件名编码方式为GBK。linux（虚拟机）系统下通过挂载方式共享该文件时，文件名的中文自动自动转换为了UTF-...
复制链接

扫一扫