【Java虚拟机】一篇文章理解jvm所有内存区域

光年行者

于 2024-08-24 14:44:00 发布

阅读量826

点赞数 26

文章标签： java jvm 开发语言

本文链接：https://blog.csdn.net/weixin_40892351/article/details/141186800

版权

本篇文章会详细介绍Java虚拟机运行时数据区域以及一些相关的基础技术细节，希望能让Java刚入门的同学也能看懂。部分内容引用了周志明老师的《深入理解Java虚拟机：JVM高级特性与最佳实践》里的内容，强烈推荐大家去看这本书！

一、概述

Java虚拟机在执行Java程序的过程中会把它所管理的内存划分为若干个不同的数据区域。这些区域有各自的用途，以及创建和销毁的时间，有的区域随着虚拟机进程的启动而一直存在，有些区域则是依赖用户线程的启动和结束而建立和销毁。

如下图，这些数据区域分为这几个区：

下面的表格整理了各个区域的生命周期、存放内容、常见的异常，大家可以读完后面的文章之后再回过头来看这个表格：

二、程序计数器

程序计数器是CPU的一个重要组件，它用于存储当前将要执行的指令的内存地址。这是一个计算机体系结构中的一个通用概念。

那么问题来了，在jvm里，这个指令是什么指令呢？是Java代码吗？还是更底层的机器码？答案是字节码，准确的说是Java字节码。所以我们可以这么说，在jvm里，程序计数器是当前线程所执行的字节码的行号指示器。字节码解释器工作时就是通过改变这个计数器的值来选取下一条需要执行的字节码指令，它是程序控制流的指示器，分支、循环、跳转、异常处理、线程恢复等基础功能都需要依赖这个计数器来完成。

那么问题又来了：

什么是字节码，它是什么时候生成的？
什么是字节码解释器？它是什么时候工作的？

接下来我们在花点时间了解一下Java里面字节码和字节码解释器的概念：

字节码是一种低级的、平台无关的指令集，通常由编译器将高级语言编写的源代码转换成字节码，然后再由特定的虚拟机（如Java虚拟机）进一步转换成特定平台的机器码执行。字节码是编译过程的一个中间产物，它允许跨平台运行，因为同样的字节码可以在不同的操作系统和硬件上运行，只要这些平台上有相应的虚拟机。
在Java语言中，字节码的生成时间是源代码编译阶段，源代码被编译成大家都知道的.class文件，.class文件就包含了Java字节码。
字节码解释器是JVM的一个组件，负责逐条读取和执行字节码指令。当JVM加载.class文件到内存后，解释器会按照程序计数器（PC寄存器）的指示，一条一条地解释执行字节码。这个过程是直接按照字节码的指令进行的，没有将字节码转换成机器码。
接下来就是到了即时编译（JIT）阶段。JIT编译是JVM中的一个高级优化过程，它在程序运行时将热点代码（即频繁执行的代码段）从字节码转换为机器码。这个过程通常发生在程序的执行过程中，当JVM的JIT编译器检测到某些代码段被频繁调用时，它会将这些代码段编译成本地机器码以提高性能。

下面的流程图按个人理解总结了Java从编译到运行的阶段，供大家参考：

由于Java虚拟机的多线程是通过线程轮流切换、分配处理器执行时间的方式来实现的，在任何一个确定的时刻，一个处理器（对于多核处理器来说是一个内核）都只会执行一条线程中的指令。因此，为了线程切换后能恢复到正确的执行位置，每条线程都需要有一个独立的程序计数器，各条线程之间计数器互不影响，独立存储，我们称这类内存区域为“线程私有”的内存。

如果线程正在执行的是一个Java方法，这个计数器记录的是正在执行的虚拟机字节码指令的地址；如果正在执行的是本地(Native)方法，这个计数器值则应为空(Undefined)。此内存区域是唯一一个在《Java虚拟机规范》中没有规定任何OutOfMemoryError情况的区域。

三、虚拟机栈

相信很多人应该听说过堆内存(Heap)和栈内存(Stack)。这种划分方式比较粗糙，实际的内存区域划分要比这更复杂。不过这种划分方式的流行也间接说明了程序员最关注的、与对象内存分配关系最密切的区域是“堆”和“栈”两块。其中，“堆”在稍后会专门讲述，而“栈”通常就是指这里讲的虚拟机栈，或者更多的情况下只是指虚拟机栈中局部变量表部分。

与程序计数器一样，Java虚拟机栈(Java Virtual Machine Stack)也是线程私有的，它的生命周期与线程相同。每个方法被执行的时候，Java虚拟机都会同步创建一个栈帧(Stack Frame)用于存储局部变量表、操作数栈、动态连接、方法出口等信息。每一个方法被调用直至执行完毕的过程，就对应着一个栈帧在虚拟机栈中从入栈到出栈的过程。

我们主要看一下局部变量表里存放的内容。局部变量表用于存储方法调用过程中的局部变量，这些局部变量包括方法参数、方法内部定义的变量等。局部变量表所需的内存空间在编译期间完成分配，当进入一个方法时，这个方法需要在栈帧中分配多大的局部变量空间是完全确定的，在方法运行期间不会改变局部变量表的大小。

那么问题来了，为什么在编译期间，这个方法需要在栈帧里分配多大的局部变量空间就可以确定了呢？

要回答这个问题，我们先了解一下局部变量里会存放哪些变量类型，以及这些变量类型的存储方式是什么样的：

局部变量表存放了编译期可知的各种Java虚拟机基本数据类型(boolean、byte、char、short、int、float、long、double)、对象引用（reference类型，它并不等同于对象本身，可能是一个指向对象起始地址的引用指针，也可能是指向一个代表对象的句柄或者其他与此对象相关的位置）和returnAddress类型（指向了一条字节码指令的地址）。也就是说，对于基本数据类型的局部变量，栈帧里存放了变量实际的值。而对于引用类型的变量，栈帧里值存了对象引用的地址，而不是实际的值。

那么为什么我会问上面这个问题呢？主要是针对以下两种情况：

如果方法里有个局部变量是一个集合类型，比如List，Set等等，这种类型的变量，实际大小在编译阶段肯定是没法确定的，因为实际的长度和具体的业务有关。
如果方法里有个循环代码块，循环代码块里会创建基本数据类型的局部变量。循环的次数是不确定的，那这种情况又怎么在编译阶段确定栈帧需要多大的存储空间呢？

相信很多同学应该已经猜到原因了：第一种情况，list、set这种类型的变量，属于引用类型，不会在栈帧里存储实际的值，所以需要的空间不受实际大小的影响。第二种情况，循环代码块里的局部变量的作用域仅限于当前循环迭代，出了这次迭代，局部变量就会被销毁，等进入下次迭代重新创建一个局部变量。所以对于循环里的局部变量只需要分配一份空间即可。

在《Java虚拟机规范》中，对这个内存区域规定了两类异常状况：如果线程请求的栈深度大于虚拟机所允许的深度，将抛出StackOverflowError异常；如果Java虚拟机栈容量可以动态扩展，当栈扩展时无法申请到足够的内存会抛出OutOfMemoryError异常。

四、本地方法栈

本地方法栈(Native Method Stacks)与虚拟机栈所发挥的作用是非常相似的，其区别只是虚拟机栈为虚拟机执行Java方法（也就是字节码）服务，而本地方法栈则是为虚拟机使用到的本地(Native)方法服务。

《Java虚拟机规范》对本地方法栈中方法使用的语言、使用方式与数据结构并没有任何强制规定，因此具体的虚拟机可以根据需要自由实现它，甚至有的Java虚拟机（譬如Hot-Spot虚拟机）直接就把本地方法栈和虚拟机栈合二为一。与虚拟机栈一样，本地方法栈也会在栈深度溢出或者栈扩展失败时分别抛出StackOverflowError和OutOfMemoryError异常。

五、Java堆

对于Java应用程序来说，Java堆(Java Heap)是虚拟机所管理的内存中最大的一块。Java堆是被所有线程共享的一块内存区域，在虚拟机启动时创建。此内存区域的唯一目的就是存放对象实例，Java世界里“几乎”所有的对象实例都在这里分配内存。在《Java虚拟机规范》中对Java堆的描述是：“所有的对象实例以及数组都应当在堆上分配”，而前面写的“几乎”是指从实现角度来看，随着Java语言的发展，现在已经能看到些许迹象表明日后可能出现值类型的支持，即使只考虑现在，由于即时编译技术的进步，尤其是逃逸分析技术的日渐强大，栈上分配、标量替换优化手段已经导致一些微妙的变化悄然发生，所以说Java对象实例都分配在堆上也渐渐变得不是那么绝对了。

Java堆是垃圾收集器管理的内存区域，因此一些资料中它也被称作“GC堆”（Garbage Collected Heap，幸好国内没翻译成“垃圾堆”）。从回收内存的角度看，由于现代垃圾收集器大部分都是基于分代收集理论设计的，所以Java堆中经常会出现“新生代”“老年代”“永久代”“Eden空间”“From Survivor空间”“To Survivor空间”等名词，本篇文章不详细展开介绍了。

如果从分配内存的角度看，所有线程共享的Java堆中可以划分出多个线程私有的分配缓冲区(Thread Local Allocation Buffer，TLAB)，以提升对象分配时的效率。不过无论从什么角度，无论如何划分，都不会改变Java堆中存储内容的共性，无论是哪个区域，存储的都只能是对象的实例，将Java堆细分的目的只是为了更好地回收内存，或者更快地分配内存。

根据《Java虚拟机规范》的规定，Java堆可以处于物理上不连续的内存空间中，但在逻辑上它应该被视为连续的，这点就像我们用磁盘空间去存储文件一样，并不要求每个文件都连续存放。但对于大对象（典型的如数组对象），多数虚拟机实现出于实现简单、存储高效的考虑，很可能会要求连续的内存空间。

Java堆既可以被实现成固定大小的，也可以是可扩展的，不过当前主流的Java虚拟机都是按照可扩展来实现的（通过参数-Xmx和-Xms设定）。如果在Java堆中没有内存完成实例分配，并且堆也无法再扩展时，Java虚拟机将会抛出OutOfMemoryError异常。

六、方法区

方法区(Method Area)与Java堆一样，是各个线程共享的内存区域，它用于存储已被虚拟机加载的类型信息、常量、静态变量、即时编译器编译后的代码缓存等数据。虽然《Java虚拟机规范》中把方法区描述为堆的一个逻辑部分，但是它却有一个别名叫作“非堆”(Non-Heap)，目的是与Java堆区分开来。

根据《Java虚拟机规范》的规定，如果方法区无法满足新的内存分配需求时，将抛出OutOfMemoryError异常。

运行时常量池

运行时常量池(Runtime Constant Pool)是方法区的一部分。Class文件中除了有类的版本、字段、方法、接口等描述信息外，还有一项信息是常量池表(Constant Pool Table)，用于存放编译期生成的各种字面量与符号引用，这部分内容将在类加载后存放到方法区的运行时常量池中。

Java虚拟机对于Class文件每一部分（自然也包括常量池）的格式都有严格规定，如每一个字节用于存储哪种数据都必须符合规范上的要求才会被虚拟机认可、加载和执行，但对于运行时常量池，《Java虚拟机规范》并没有做任何细节的要求，不同提供商实现的虚拟机可以按照自己的需要来实现这个内存区域，不过一般来说，除了保存Class文件中描述的符号引用外，还会把由符号引用翻译出来的直接引用也存储在运行时常量池中。

运行时常量池相对于Class文件常量池的另外一个重要特征是具备动态性，Java语言并不要求常量一定只有编译期才能产生，也就是说，并非预置入Class文件中常量池的内容才能进入方法区运行时常量池，运行期间也可以将新的常量放入池中，这种特性被开发人员利用得比较多的便是String类的intern()方法。

既然运行时常量池是方法区的一部分，自然受到方法区内存的限制，当常量池无法再申请到内存时会抛出OutOfMemoryError异常。

关于Java虚拟机运行时数据区域的介绍就到这里了，理解Java虚拟机运行时数据区域的基本概念是学习jvm只是的基础。有助于我们更好地定位和解决内存泄漏、栈溢出等运行时问题，有利于更好的进行性能调优，例如通过调整堆大小和栈大小来优化程序的执行效率。感谢大家的阅读！