无法通过json传递字符串在sqlite3中进行汉字字符插入和查询

最新推荐文章于 2024-05-17 11:35:15 发布

chinaclock

最新推荐文章于 2024-05-17 11:35:15 发布

阅读量1.4k

点赞数

分类专栏：开源组件学习数据库文章标签： json sqlite3 unicode utf-8

本文链接：https://blog.csdn.net/chinaclock/article/details/48969441

版权

开源组件学习同时被 2 个专栏收录

6 篇文章 0 订阅

订阅专栏

数据库

2 篇文章 0 订阅

订阅专栏

碰到一个“无法通过json传递字符串在sqlite3中进行汉字字符插入和查询”的问题，验证后，确实会出现乱码。

怀疑是sqlite3库本身就不支持汉字，但是查询后发现默认sqlite3就是utf-8的，其内部也是用utf-8，就是本来就支持汉字。

一、首先用sqlite3的命令行工具尝试，发现时可以直接插入和查询的，那么怀疑是不是输入的的字符集有问题。

二、但是sqlite3本身是可以调整字符集的，那么上层传下来是不是就有问题。

使用代码验证，发现json上的接口传入是汉字，到执行sqlite_exec时就已经变成了乱码。

三、调整发现json只支持unicode，而且没有调整编码集的接口参数。

那么推论下原因，是不是由于传入的参数并不是json支持的unicode。由于json本身是没法设置unicode的，所以只能将源码文件设置成unicode的utf-8.

然后编译，链接，运行，发现ok了。

又尝试了下其他的使用utf-8 with BOM或者ANSI，都可以正常编译，然而会出现乱码的情况。所以在使用汉字时，必须要严格指定文件的编码格式为utf-8，保证编译和链接及插入使用都统一的是utf-8.

查看文件的编码格式有两种方法：

1.使用file命令，可以直接显示编码

2.用vim打开后，: set fileencoding 命令会显示当前文件的编码格式

那么Unicode和UTF-8到底是什么关系呢？

有一篇相关博文如下(摘自http://alexiter.iteye.com/blog/1533109)：

UTF-8是Unicode的实现方式之一，它规定了字符如何在计算机中存储、传输等。

UTF-8最大的一个特点，就是它是一种变长的编码方式。它可以使用1~4个字节表示一个符号，根据不同的符号而变化字节长度。

UTF-8的编码规则很简单，只有二条：

1）对于单字节的符号，字节的第一位设为0，后面7位为这个符号的unicode码。因此对于英语字母，UTF-8编码和ASCII码是相同的。

2）对于n字节的符号（n>1），第一个字节的前n位都设为1，第n+1位设为0，后面字节的前两位一律设为10。剩下的没有提及的二进制位，全部为这个符号的unicode码。

下表总结了编码规则，字母x表示可用编码的位。

Unicode符号范围 | UTF-8编码方式
(十六进制) | （二进制）
-------------------------------+---------------------------------------------
0000 0000-0000 007F | 0xxxxxxx
0000 0080-0000 07FF | 110xxxxx 10xxxxxx
0000 0800-0000 FFFF | 1110xxxx 10xxxxxx 10xxxxxx
0001 0000-0010 FFFF | 11110xxx 10xxxxxx 10xxxxxx 10xxxxxx

下面，还是以汉字“严”为例，演示如何实现UTF-8编码。

已知“严”的unicode是4E25（100111000100101），根据上表，可以发现4E25处在第三行的范围内（0000 0800-0000 FFFF），因此“严”的UTF-8编码需要三个字节，即格式是“1110xxxx 10xxxxxx 10xxxxxx”。然后，从“严”的最后一个二进制位开始，依次从后向前填入格式中的x，多出的位补0。这样就得到了，“严”的UTF-8编码是“11100100 10111000 10100101”，这是保存在计算机中的实际数据，转换成十六进制就是E4B8A5，转成十六进制的目的为了便于阅读。

其他相关的：

1）ANSI是默认的编码方式。对于英文文件是ASCII编码，对于简体中文文件是GB2312编码（只针对Windows简体中文版，如果是繁体中文版会采用Big5码）。

2）Unicode编码指的是UCS-2编码方式，即直接用两个字节存入字符的Unicode码。这个选项用的little endian格式。

3）Unicode big endian编码与上一个选项相对应。我在下一节会解释little endian和big endian的涵义。

4）UTF-8编码，也就是上一节谈到的编码方法。

选择完”编码方式“后，点击”保存“按钮，文件的编码方式就立刻转换好了。

7. Little endian和Big endian

上一节已经提到，Unicode码可以采用UCS-2格式直接存储。以汉字”严“为例，Unicode码是4E25，需要用两个字节存储，一个字节是4E，另一个字节是25。存储的时候，4E在前，25在后，就是Big endian方式；25在前，4E在后，就是Little endian方式。

那么很自然的，就会出现一个问题：计算机怎么知道某一个文件到底采用哪一种方式编码？

Unicode规范中定义，每一个文件的最前面分别加入一个表示编码顺序的字符，这个字符的名字叫做”零宽度非换行空格“（ZERO WIDTH NO-BREAK SPACE），用FEFF表示。这正好是两个字节，而且FF比FE大1。

如果一个文本文件的头两个字节是FE FF，就表示该文件采用大头方式；如果头两个字节是FF FE，就表示该文件采用小头方式。

chinaclock

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
无法通过json传递字符串在sqlite3中进行汉字字符插入和查询

碰到一个“无法通过json传递字符串在sqlite3中进行汉字字符插入和查询”的问题，验证后，确实会出现乱码。怀疑是sqlite3库本身就不支持汉字，但是查询后发现默认sqlite3就是utf-8的，其内部也是用utf-8，就是本来就支持汉字。一、首先用sqlite3的命令行工具尝试，发现时可以直接插入和查询的，那么怀疑是不是输入的的字符集有问题。二、但是sqlite3本身是可以调整字
复制链接

扫一扫

专栏目录