oracle utf8 varchar,oracle的varchar2选择byte作单位的时候,utf8情况下,一个汉字到底占3个or4个字节?...

utf-8 中的一个汉字占几个字节

占 2 个字节的:〇

占 3 个字节的:基本等同于 GBK,含 21000 多个汉字

占 4 个字节的:中日韩超大字符集里面的汉字,有 5 万多个

1 个 utf8 数字占 1 个字节

1 个 utf8 英文字母占 1 个字节

在查找 UTF-8 编码资料时发现,很多的帖子说的 UTF-8 编码里,一个汉字占用3个字节,

有的还做了个证明,大概是这样的,创建一个没有 BOM 的 UTF-8 编码的文本文件,

里面保存了几个汉字,然后查看文件的大小。我觉得这样的证明没有一点说服力,

因为 UTF-8 是变长的,1-6 个字节,少量的汉字检测不能说明所有的汉字都是的。

后来我又查看了字符映射表-汉语,找到了正确的答案:

少数是汉字每个占用 3 个字节,多数占用 4 个字节。

占用 3 个字节的范围

U+2E80 - U+2EF3 : 0xE2 0xBA 0x80 - 0xE2 0xBB 0xB3 共 115 个

U+2F00 - U+2FD5 : 0xE2 0xBC 0x80 - 0xE2 0xBF 0x95 共 213 个

U+3005 - U+3029 : 0xE3 0x80 0x85 - 0xE3 0x80 0xA9 共 36 个

U+3038 - U+4DB5 : 0xE3 0x80 0xB8 - 0xE4 0xB6 0xB5 共 7549 个

U+4E00 - U+FA6A : 0xE4 0xB8 0x80 - 0xEF 0xA9 0xAA 共 44138 个

U+FA70 - U+FAD9 : 0xEF 0xA9 0xB0 - 0xEF 0xAB 0x99 共 105 个

合计: 52156 个

占用 4 个字节的范围

U+20000 - U+2FA1D : 0xF0 0xA0 0x80 0x80 - 0xF0 0xAF 0xA8 0x9D 共 64029 个

合计: 64029 个

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
`VARCHAR2`是一种数据库列数据类型,用于存储变长字符串,并允许预先指定其最大长度。在Oracle数据库系统中,`VARCHAR2`类型的默认最大长度通常是4000字节。 然而,具体的最大长度取决于以下几个因素: 1. **数据库版本**:不同版本的Oracle数据库支持的最大`VARCHAR2`长度可能会有所不同。例如,在一些较旧的版本中,最大长度可能是256字符。随着版本的更新,这个值通常会增加。 2. **实例配置**:某些数据库配置选项也可能影响`VARCHAR2`的最大长度。例如,通过设置`NLS_LENGTH_SEMANTICS`等环境变量或参数,可以更改数据库对长度的理解方式和计算方式。 3. **特定表空间属性**:如果在一个特定的数据块大小的表空间上创建表,则可能受到该表空间最大块大小的限制,进而影响`VARCHAR2`的最长长度。一般情况下,现代Oracle数据库的表空间块大小为8KB、16KB或更大,理论上允许的`VARCHAR2`最大长度由块大小决定,但实际实现中受上述其他因素影响。 为了查询当前数据库环境中`VARCHAR2`最大长度的具体值,可以在SQL提示符下运行以下查询: ```sql SELECT value FROM v$parameter WHERE name = 'varchar2_max'; ``` 此查询将返回当前数据库配置的`VARCHAR2_MAX`参数值,显示了允许的最大`VARCHAR2`长度。 关于您的问题,如果您是在考虑在Oracle数据库中使用`VARCHAR2`类型并且需要确定其确切的最大长度,建议直接查询如上所示的系统视图,获取到最准确的信息。此外,对于其他数据库管理系统(如MySQL、PostgreSQL等),它们也提供类似的功能或数据类型来处理字符串,但它们的具体名称和参数设定可能有所不同。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值