我们所编写的每一行代码,要在机器上运行最终都需要编译成二进制的机器码 CPU 才能识别。但是由于虚拟机的存在,屏蔽了操作系统与 CPU 指令集的差异性,类似于 Java 这种建立在虚拟机之上的编程语言通常会编译成一种中间格式的文件Class文件来进行存储。
一、跨平台性
Java 虚拟机的设计者在设计之初就考虑并实现了其它语言在 Java 虚拟机上运行的可能性,所以并不是只有 Java 语言能够跑在 Java 虚拟机上,时至今日诸如 Kotlin、Groovy、Jython、JRuby 等一大批 JVM 语言都能够在 Java 虚拟机上运行,它们和 Java 语言一样都会被编译器编译成字节码文件,然后由虚拟机来执行,所以说类文件(字节码文件)具有语言无关性。
二、Class类结构
Class 文件是一组以 8 位字节为基础单位的二进制流,各个数据严格按照顺序紧凑的排列在 Class 文件中,中间无任何分隔符,这使得整个 Class 文件中存储的内容几乎全部都是程序运行的必要数据,没有空隙存在。当遇到需要占用 8 位字节以上空间的数据项时,会按照高位在前的方式分割成若干个 8 位字节进行存储。
Java 虚拟机规范规定 Class 文件格式采用一种类似与 C 语言结构体的微结构体来存储数据,这种伪结构体中只有两种数据类型:无符号数和表。
-
无符号数属于基本的数据类型,以 u1、u2、u4、u8来分别代表 1 个字节、2 个字节、4 个字节和8个字节的无符号数,无符号数可以用来描述数字、索引引用、数量值或者按照 UTF-8编码结构构成的字符串值。
-
表是由多个无符号数或者其他表作为数据项构成的复合数据类型,所有表都习惯性地以「_info」结尾。表用于描述有层次关系的复合结构的数据,整个Class 文件就是一张表,它由下表中所示的数据项构成。
Class 文件中存储的字节严格按照上表中的顺序紧凑的排列在一起。哪个字节代表什么含义,长度是多少,先后顺序如何都是被严格限制的,不允许有任何改变。
Test类作为Class文件解读参考
public class Test {
private int m;
public int inc(){
return m + 1;
}
}
查看二进制信息:对Test.java使用javac编译后,使用vim查看Test.class文件,此时显示文件为乱码信息,输入:%!xxd
即可显示二进制信息
0000000: cafe babe 0000 0034 0013 0a00 0400 0f09 .......4........
0000010: 0003 0010 0700 1107 0012 0100 016d 0100 .............m..
0000020: 0149 0100 063c 696e 6974 3e01 0003 2829 .I...<init>...()
0000030: 5601 0004 436f 6465 0100 0f4c 696e 654e V...Code...LineN
0000040: 756d 6265 7254 6162 6c65 0100 0369 6e63 umberTable...inc
0000050: 0100 0328 2949 0100 0a53 6f75 7263 6546 ...()I...SourceF
0000060: 696c 6501 000e 5465 7374 436c 6173 732e ile...TestClass.
0000070: 6a61 7661 0c00 0700 080c 0005 0006 0100 java............
0000080: 0954 6573 7443 6c61 7373 0100 106a 6176 .TestClass...jav
0000090: 612f 6c61 6e67 2f4f 626a 6563 7400 2100 a/lang/Object.!.
00000a0: 0300 0400 0000 0100 0200 0500 0600 0000 ................
00000b0: 0200 0100 0700 0800 0100 0900 0000 1d00 ................
00000c0: 0100 0100 0000 052a b700 01b1 0000 0001 .......*........
00000d0: 000a 0000 0006 0001 0000 0001 0001 000b ................
00000e0: 000c 0001 0009 0000 001f 0002 0001 0000 ................
00000f0: 0007 2ab4 0002 0460 ac00 0000 0100 0a00 ..*....`........
0000100: 0000 0600 0100 0000 0600 0100 0d00 0000 ................
0000110: 0200 0e0a
查看字节码信息:使用javap -verbose
工具可以参看当前Class文件的字节码信息
D:\>javap -verbose Test.class
Classfile /D:/Test.class
Last modified 2020-8-26; size 265 bytes
MD5 checksum 0d5efc4b65ae7eb6d64f84136ce58ff9
Compiled from "Test.java"
public class Test
minor version: 0
major version: 52
flags: ACC_PUBLIC, ACC_SUPER
Constant pool:
#1 = Methodref #4.#15 // java/lang/Object."<init>":()V
#2 = Fieldref #3.#16 // Test.m:I
#3 = Class #17 // Test
#4 = Class #18 // java/lang/Object
#5 = Utf8 m
#6 = Utf8 I
#7 = Utf8 <init>
#8 = Utf8 ()V
#9 = Utf8 Code
#10 = Utf8 LineNumberTable
#11 = Utf8 inc
#12 = Utf8 ()I
#13 = Utf8 SourceFile
#14 = Utf8 Test.java
#15 = NameAndType #7:#8 // "<init>":()V
#16 = NameAndType #5:#6 // m:I
#17 = Utf8 Test
#18 = Utf8 java/lang/Object
{
public Test();
descriptor: ()V
flags: ACC_PUBLIC
Code:
stack=1, locals=1, args_size=1
0: aload_0
1: invokespecial #1 // Method java/lang/Object."<init>":()V
4: return
LineNumberTable:
line 1: 0
public int inc();
descriptor: ()I
flags: ACC_PUBLIC
Code:
stack=2, locals=1, args_size=1
0: aload_0
1: getfield #2 // Field m:I
4: iconst_1
5: iadd
6: ireturn
LineNumberTable:
line 6: 0
}
SourceFile: "Test.java"
1、魔数与 Class 文件版本
每个 Class 文件的头 4 个字节称为魔数(Magic Number),它的唯一作用是确定这个文件是否为一个能被虚拟机接收的 Calss 文件。之所以使用魔数而不是文件后缀名来进行识别主要是基于安全性的考虑,因为文件后缀名是可以随意更改的。Class 文件的魔数值为「0xCAFEBABE」。之所以是CAFEBABE是因为有一位开发者喜欢著名咖啡品牌 Peet`s Coffee,此后出现的Java商标也是一杯咖啡……
紧接着魔数的 4 个字节存储的是 Class 文件的版本号:第 5 和第 6 两个字节是次版本号(Minor Version),第 7 和第 8 个字节是主版本号(Major Version)。高版本的 JDK 能够向下兼容低版本的 Class 文件,虚拟机会拒绝执行超过其版本号的 Class 文件。
# 魔数 次版本号 主版本号
0000000: cafe babe 0000 0034 0013 0a00 0400 0f09 ...4....
根据以上信息可以获得主版本号信息 0x0034 的十进制52,52对应的JDK版本是JDK8,可以向下兼容45-51的JDK版本。JDK版本是从45开始的,JDK1.0-1.1 使用了45.0-45.3的版本号。
次版本号在JDK12之前都没有使用过,全为0。
> 字节码文件内容
public class Test
minor version: 0
major version: 52
2、常量池
主版本号之后是常量池入口,常量池可以理解为 Class 文件之中的资源仓库,它是 Class 文件结构中与其他项目关联最多的数据类型,也是占用 Class 文件空间最大的数据项目之一,同是它还是 Class 文件中第一个出现的表类型数据项目。
因为常量池中常量的数量是不固定的,所以在常量池入口需要放置一个 u2 类型的数据来表示常量池的容量「constant_pool_count」,和计算机科学中计数的方法不一样,这个容量是从 1 开始而不是从 0 开始计数。之所以将第 0 项常量空出来是为了满足后面某些指向常量池的索引值的数据在特定情况下需要表达「不引用任何一个常量池项目」的含义,这种情况可以把索引值置为 0 来表示。
Class 文件结构中只有常量池的容量计数是从 1 开始的,其它集合类型,包括接口索引集合、字段表集合、方法表集合等容量计数都是从 0 开始。
常量池中主要存放两大类常量:字面量和符号引用。
- 字面量比较接近 Java 语言层面的常量概念,如字符串、声明为 final 的常量值等。
- 符号引用属于编译原理方面的概念,包括了以下三类常量:
- 类和接口的全限定名
- 字段的名称和描述符
- 方法的名称和描述符
经过javac编译后的Class文件不会保存方法、字段最终在内存中的布局信息,而是保存其具体地址的符号引用。当虚拟机做类加载时,将会从常量池获得对应的符号引用,再在类创建时或运行时解析翻译到具体的内存地址中。
# 常量池大小
0000000: cafe babe 0000 0034 0013 0a 00 0400 0f09 .......4........
根据以上信息可以得出,常量池容量是十六进制0x0013,十进制为19,因此常量池中有18项常量,索引范围在1-18。