垃圾回收算法
- 分代收集理论
根据对象存活周期的不同将内存分为几块。java堆分为新生代和老年代,根据各个代的特点选择合适的垃圾收集算法
新生代中,每次收集都会有大量对象(近99%)死去,所以选择复制算法,只需要付出少量对象的复制成本就可以完成垃圾收集。
而老年代的对象存活几率比较高,而且没有额外的空间对它进行分配担保,所以必须选择“标记-清除”或“标记-整理”算法进行垃圾收集。“标记-清除”或“标记-整理”算法会比复制算法慢10倍以上。
- 标记-复制
将内存分为大小相同的两块,每次使用其中的一块。当这一块的内存使用完后,就将还存活的对象复制到另一块去,然后再把使用的空间一次清理掉。每次的内存回收都是对内存区间的一半进行回收
- 标记-清除
算法分为“标记”和“清除”阶段:标记存活的对象, 统一回收所有未被标记的对象;也可以反过来,标记出所有需要回收的对象,在标记完成后统一回收所有被标记的对象
问题:
- 如果需要标记的对象太多,效率不高
- 标记清除后会产生大量不连续的碎片
- 标记-整理
根据老年代的特点特适配的一种标记算法,标记过程仍然与“标记-清除”算法一样,但后续不是直接对可回收对象回收,而是让所有存活的对象向一端移动,然后直接清理掉端边界以外的内存。
垃圾收集器
1)Serial收集器(-XX:+UseSerialGC -XX:+UseSerialOldGC)
单线程,只使用一条垃圾收集线程去完成垃圾收集工作,在进行垃圾收集工作的时候必须暂停其他所有的工作线程( "Stop The World"),简单高效
Serial Old收集器是Serial收集器的老年代版本,也是一个单线程收集器。
在JDK1.5以及以前的版本中与Parallel Scavenge收集器搭配使用
作为CMS收集器的后备方案。
2)Parallel Scavenge收集器(-XX:+UseParallelGC(年轻代),-XX:+UseParallelOldGC(老年代)
Parallel收集器其实就是Serial收集器的多线程版本
默认的收集线程数跟cpu核数相同,可以用参数(-XX:ParallelGCThreads)指定收集线程数
Parallel Old收集器是Parallel Scavenge收集器的老年代版本。使用多线程和“标记-整理”算法。
3)ParNew收集器(-XX:+UseParNewGC)
ParNew收集器其实跟Parallel收集器很类似,区别主要在于它可以和CMS收集器配合使用。
4)CMS收集器(-XX:+UseConcMarkSweepGC(old))
CMS(Concurrent Mark Sweep)收集器是一种以获取最短回收停顿时间为目标的收集器
垃圾收集线程与用户线程同时工作
采用“标记-清除”算法
- 初始标记: STW,记录gc roots直接能引用的对象,速度很快。
- 并发标记: 从GC Roots直接关联对象开始遍历整个对象图的过程, 耗时较长但是不需要停顿用户线程, 可以与垃圾收集线程一起并发运行。因为用户程序继续运行,可能会有导致已经标记过的对象状态发生改变。
- 重新标记: 为了修正并发标记期间因为用户程序继续运行而导致标记产生变动的那一部分对象的标记记录(主要是处理漏标问题),这个阶段的停顿时间一般会比初始标记阶段的时间稍长,远远比并发标记阶段时间短。主要用到三色标记里的增量更新算法做重新标记。
- 并发清理: 开启用户线程,同时GC线程开始对未标记的区域做清扫。这个阶段如果有新增对象会被标记为黑色不做任何处理。
- 并发重置:重置本次GC过程中的标记数据。
5)Parallel Scavenge和CMS比较
Parallel Scavenge收集器关注点是吞吐量(运行用户代码的时间与CPU总消耗时间的比值)
CMS垃圾收集器的关注点是用户线程的停顿时间,并发收集、低停顿。
6)CMS的缺点
- 对CPU资源敏感(会和服务抢资源);
- 无法处理浮动垃圾(在并发标记和并发清理阶段又产生垃圾,这种浮动垃圾只能等到下一次gc再清理)
- “标记-清除”算法会导致收集结束时产生大量空间碎片,可以通过参数-XX:+UseCMSCompactAtFullCollection让jvm在执行完标记清除后再做整理
- 会存在上一次垃圾回收还没执行完,然后垃圾回收又被触发的情况,特别是在并发标记和并发清理阶段会出现,一边回收,系统一边运行,也许没回收完就再次触发full gc,也就是"concurrent mode failure",此时会进入stop the world,用serial old垃圾收集器来回收
垃圾收集底层算法实现
- 三色标记
把Gc roots可达性分析遍历对象过程中遇到的对象, 按照“是否访问过”标记成以下三种颜色:
1)黑色: 表示对象已经被垃圾收集器访问过, 且这个对象的所有引用都已经扫描过。黑色对象不可能直接(不经过灰色对象) 指向某个白色对象。
2)灰色: 表示对象已经被垃圾收集器访问过, 但对象上的引用还没有扫描完成。
3)白色: 表示对象尚未被垃圾收集器访问过。 可达性分析刚刚开始的阶段, 所有的对象都是白色的, 若在分析结束的阶段, 仍然是白色的对象, 即代表不可达。
- 多标-浮动垃圾
在并发标记过程中,如果由于方法运行结束导致部分局部变量被销毁,这个gcroot引用的对象之前又被扫描过(被标记为非垃圾对象),那么本轮GC不会回收这部分内存。这部分本应该回收但是没有回收到的内存,被称之为“浮动垃圾”。浮动垃圾并不会影响垃圾回收的正确性,只是需要等到下一轮垃圾回收中才被清除。
针对并发标记(还有并发清理)开始后产生的新对象,直接标记成黑色,本轮不会进行清除。这部分对象期间可能也会变为垃圾,这也是浮动垃圾的一部分。
- 漏标
漏标会导致被引用的对象被当成垃圾误删除,这是严重bug,有两种解决方案: 增量更新(Incremental Update) 和原始快照(Snapshot At The Beginning,SATB) 。
1)增量更新:对增量引用的根对象会做深度扫描,没有SATB效率高
当黑色对象插入新的指向白色对象的引用关系时, 就将这个新插入的引用记录下来, 等并发扫描结束之后, 再将这些记录过的引用关系中的黑色对象为根, 重新扫描一次( 黑色对象一旦新插入了指向白色对象的引用之后, 它就变回灰色对象了)
2) 原始快照:只做简单标记,不需要在重新标记阶段再次深度扫描被删除引用对象,可能造成更多的浮动垃圾
当灰色对象要删除指向白色对象的引用关系时, 就将这个要删除的引用记录下来, 在并发扫描结束之后, 再将这些记录过的引用关系中的灰色对象为根, 重新扫描一次,这样就能扫描到白色的对象,将白色对象直接标记为黑色(目的就是让这种对象在本轮gc清理中能存活下来,待下一轮gc的时候重新扫描,这个对象也有可能是浮动垃圾)
3)各种垃圾收集器处理方案如下:
CMS:写屏障 + 增量更新
G1:写屏障 + SATB
ZGC:读屏障
G1很多对象都位于不同的region,重新深度扫描对象代价会比较高,所以G1选择SATB不深度扫描对象,只是简单标记,等到下一轮GC再深度扫描
CMS就一块老年代区域,对增量引用的根对象会做深度扫描,解决浮动垃圾问题
- 读写屏障
1)写屏障
虚拟机对引用关系记录的插入或删除, 都是通过写屏障实现的,就是在赋值操作前后,加入一些处理(类似AOP),可以用于记录跨代/区引用的变化
SATB:引用消失比如a.b=null,可以利用写屏障,将a成员变量的引用对象b记录下来
增量更新:新增引用a.d = d,可以利用写屏障,将A新的成员变量引用对象D记录下来
2)读屏障
可以用于支持移动对象的并发执行
当读取成员变量时,一律记录下来:D d = a.d
- 记忆集和卡表
1)记忆集
在新生代做GCRoots可达性扫描过程中可能会碰到跨代引用的对象,如果又去老年代扫描效率太低了。
在新生代可以引入记录集(Remember Set)的数据结构(记录从非收集区到收集区的指针集合),避免把整个老年代加入GCRoots扫描范围。 所有涉及部分区域收集(Partial GC) 行为的垃圾收集器, 如G1、 ZGC和Shenandoah收集器, 都会面临相同的问题。
垃圾收集场景中,收集器只需通过记忆集判断出某一块非收集区域是否存在指向收集区域的指针即可,无需了解跨代引用指针的全部细节。
2)卡表
“卡表”(Cardtable)是记忆集的实现
卡表是使用一个字节数组实现:CARD_TABLE[ ],每个元素对应着其标识的内存区域一块特定大小的内存块,称为“卡页”。卡页是2^9大小,即512字节
一个卡页中可包含多个对象,只要有一个对象的字段存在跨代指针,其对应的卡表的元素标识就变成1,表示该元素变脏,否则为0.
GC时,只要筛选本收集区的卡表中变脏的元素加入GCRoots里。
卡表的维护:使用写屏障维护卡表状态。