vba判断文件编码格式_如何用vba判断一个记事本文本文件是什么编码?

本文介绍了如何使用VBA来判断文本文件的编码格式,通过读取文件头的字节来识别是ANSI、Unicode Big Endian、Unicode Little Endian还是UTF-8编码,并提供了一段示例代码。
摘要由CSDN通过智能技术生成

在了解如何用vba判断一个文本文件是以什么编码形式保存之前,我们先来了解下字节序的概念。

比如一个中文字符“保”的unicode编码为4FDD,在存入到计算机时,需要用2个字节,如果第一个字节存4F,第二个字节存DD,那么它的字节序就是Big Endian。如果第一个字节存DD,第二个字节存4F,那么它的字节序就是 Little Endian。

由于一个文本文件可以保存为ANSI编码、Unicode Little Endian 编码、Unicode Big Endian 编码、UTF-8编码,为了便于识别具体是用哪种编码哪种字节序存储的文本文件,Windows 引入了BOM(Byte Order Mark,字节序标记)来表征文本文件的编码方式。

在unicode编码中有一个叫做”ZERO WIDTH NO-BREAK SPACE”的字符,它的编码是FEFF。而FFFE在unicode编码中是不存在的字符,所以不应该出现在实际传输中。UCS规范建议我们在传输字节流前,先传输字符”ZERO WIDTH NO-BREAK SPACE”。这样如果接收者收到FEFF,就表明这个字节流是Big-Endian的;如果收到FFFE,就表明这个字节流是Little-Endian的。因此字符”ZERO WIDTH NO-BREAK SPACE”又被称作BOM。

UTF-8不需要BOM来表明字节顺序,但可以用BOM来表明编码方式。字符”ZERO WIDTH NO-BREAK SPACE”的UTF-8编码是EF BB BF。所以如果接收者收到以EF BB BF开头的字节流,就知道这是UTF-8编码了。

Windows就是使用BOM来标记文本文件的编码方式的。

当用编程的方式判断一个文本文件的编码方式时,如果以二进制形式读取文件头的前两个字节,如果是FEFF,则表示Unicode Big Endian 编码。如果是FFFE,则表示Unicode Little Endian 编码。如果前三个字节是EFBBBF则表示UTF-8编码。如果都不是,则表示是ANSI编码。

有了以上的知识,可以使用以下的代码判断一个文本文件的编码方式:

Visual Basic

Sub QQ1722187970()

Dim sPath As String

sPath = "c:\test.txt"

iFN = VBA.FreeFile

Open sPath For Binary Access Read As iFN

Dim iLenB

'获取打开文本文件的字节数

iLenB = VBA.LOF(iFN)

If iLenB > 0 Then

Dim sResult() As Byte

ReDim sResult(iLenB - 1)

Get iFN, , sResult

Select Case UBound(sResult)

Case 0

MsgBox "ANSI编码"

Case 1

sBom = VBA.Hex(sResult(0)) & VBA.Hex(sResult(1))

If sBom = "FEFF" Then

MsgBox "Unicode Big Endian 编码"

ElseIf sBom = "FFFE" Then

MsgBox "Unicode Little Endian 编码"

Else

MsgBox "ANSI编码"

End If

Case Is > 1

sBom = VBA.Hex(sResult(0)) & VBA.Hex(sResult(1)) & VBA.Hex(sResult(2))

If Left(sBom, 4) = "FEFF" Then

MsgBox "Unicode Big Endian 编码"

ElseIf Left(sBom, 4) = "FFFE" Then

MsgBox "Unicode Little Endian 编码"

ElseIf Left(sBom, 6) = "EFBBBF" Then

MsgBox "UTF-8编码"

Else

MsgBox "ANSI编码"

End If

End Select

End If

'关闭打开的文件

Close iFN

End Sub

1

2

3

4

5

6

7

8

9

10

11

12

13

14

15

16

17

18

19

20

21

22

23

24

25

26

27

28

29

30

31

32

33

34

35

36

37

38

39

40

SubQQ1722187970()

DimsPathAsString

sPath="c:\test.txt"

iFN=VBA.FreeFile

OpensPathForBinaryAccessReadAsiFN

DimiLenB

'获取打开文本文件的字节数

iLenB=VBA.LOF(iFN)

IfiLenB>0Then

DimsResult()AsByte

ReDimsResult(iLenB-1)

GetiFN,,sResult

SelectCaseUBound(sResult)

Case0

MsgBox"ANSI编码"

Case1

sBom=VBA.Hex(sResult(0))&VBA.Hex(sResult(1))

IfsBom="FEFF"Then

MsgBox"Unicode Big Endian 编码"

ElseIfsBom="FFFE"Then

MsgBox"Unicode Little Endian 编码"

Else

MsgBox"ANSI编码"

EndIf

CaseIs>1

sBom=VBA.Hex(sResult(0))&VBA.Hex(sResult(1))&VBA.Hex(sResult(2))

IfLeft(sBom,4)="FEFF"Then

MsgBox"Unicode Big Endian 编码"

ElseIfLeft(sBom,4)="FFFE"Then

MsgBox"Unicode Little Endian 编码"

ElseIfLeft(sBom,6)="EFBBBF"Then

MsgBox"UTF-8编码"

Else

MsgBox"ANSI编码"

EndIf

EndSelect

EndIf

'关闭打开的文件

CloseiFN

EndSub

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值