JVM-GC

  • 垃圾收集算法
  • 垃圾收集器
  • CMS 调优
  • 三色标记
  • 记忆集与卡表

垃圾收集算法

  • 分代收集理论:将java堆分为新生代和老年代,这样我们就可以根据各个年代的特点选择合适的垃圾收集算法

    • 在新生代中,每次收集都会有大量对象(近99%)死去,所以可以选择复制算法,只需要付出少量对象的复制成本就可以完成每次垃圾收集
    • 老年代的对象存活几率是比较高的,而且没有额外的空间对它进行分配担保,所以我们必须选择“标记-清除”或“标记-整理”算法进行垃圾收集。注意,“标记-清除”或“标记-整理”算法会比复制算法慢10倍以上
  • 标记-复制算法:将内存分为大小相同的两块,每次使用其中的一块。当这一块的内存使用完后,就将还存活的对象复制到另一块去,然后再把使用的空间一次清理掉。这样就使每次的内存回收都是对内存区间的一半进行回收

  • 标记-清除算法:算法分为“标记”和“清除”阶段:标记存活的对象, 统一回收所有未被标记的对象(一般选择这种);也可以反过来,标记出所有需要回收的对象,在标记完成后统一回收所有被标记的对象 。它是最基础的收集算法,比较简单,但是会带来两个明显的问题

    • 效率问题 (如果需要标记的对象太多,效率不高)
    • 空间问题(标记清除后会产生大量不连续的碎片)
  • 标记-整理算法:根据老年代的特点特出的一种标记算法,标记过程仍然与“标记-清除”算法一样,但后续步骤不是直接对可回收对象回收,而是让所有存活的对象向一端移动,然后直接清理掉端边界以外的内存


垃圾收集器

  • Serial 收集器 (-XX:+UseSerialGC -XX:+UseSerialOldGC)

    • 新生代采用复制算法,老年代采用标记-整理算法

    • 单线程:在进行垃圾收集工作的时候必须暂停其他所有的工作线程( “Stop The World” ),直到它收集结束

    • Serial Old 收集器是 Serial 收集器的老年代版本

      • 还可以与 Parallel Scavenge 收集器搭配使用
      • 作为 CMS 收集器的后备方案
  • Parallel Scavenge 收集器 (-XX:+UseParallelGC(年轻代), -XX:+UseParallelOldGC(老年代)):JDK8 默认

    • 新生代采用复制算法,老年代采用标记-整理算法

    • Serial 收集器的多线程版本(默认的收集线程数跟cpu核数相同 -XX:ParallelGCThreads

    • Parallel Scavenge 收集器关注点是吞吐量(高效率的利用 CPU),所谓吞吐量就是CPU中用于运行用户代码的时间与CPU总消耗时间的比值

      • CMS 等垃圾收集器的关注点更多的是用户线程的停顿时间(提高用户体验)
    • Parallel Old 收集器是 Parallel Scavenge 收集器的老年代版本

      • 使用多线程和“标记-整理”算法。在注重吞吐量以及CPU资源的场合,都可以优先考虑 Parallel Scavenge收集器和Parallel Old收集器
  • ParNew 收集器 (-XX:+UseParNewGC)

    • 新生代采用复制算法,老年代采用标记-整理算法
    • 跟Parallel收集器很类似,区别主要在于它可以和CMS收集器配合使用
    • 它是许多运行在Server模式下的虚拟机的首要选择,除了Serial收集器外,只有它能与CMS收集器配合工作
  • CMS收集器 (-XX:+UseConcMarkSweepGC(old))

    • “标记-清除” 算法,也可以通过JVM参数调节内存整理的时机
    • CMS(Concurrent Mark Sweep)收集器是一种以获取最短回收停顿时间为目标的收集器。它非常符合在注重用户体验的应用上使用,它是HotSpot虚拟机第一款真正意义上的并发收集器,它第一次实现了让垃圾收集线程与用户线程(基本上)同时工作
    • 运作过程
      • 初始标记: 暂停所有的其他线程(STW),并记录下gc roots直接能引用的对象,速度很快

      • 并发标记: 并发标记阶段就是从GC Roots的直接关联对象开始遍历整个对象图的过程, 这个过程耗时较长但是不需要停顿用户线程, 可以与垃圾收集线程一起并发运行。因为用户程序继续运行,可能会有导致已经标记过的对象状态发生改变

      • 重新标记: 重新标记阶段就是为了修正并发标记期间因为用户程序继续运行而导致标记产生变动的那一部分对象的标记记录,这个阶段的停顿时间一般会比初始标记阶段的时间稍长,远远比并发标记阶段时间短。主要用到三色标记里的增量更新算法做重新标记

      • 并发清理: 开启用户线程,同时GC线程开始对未标记的区域做清扫。这个阶段如果有新增对象会被标记为黑色不做任何处理

      • 并发重置:重置本次GC过程中的标记数据

    • 主要优点:并发收集、低停顿
    • 缺点
      • 对CPU资源敏感(会和服务抢资源)
      • 无法处理浮动垃圾(在并发标记和并发清理阶段又产生垃圾,这种浮动垃圾只能等到下一次gc再清理了)
      • 它使用的回收算法-“标记-清除”算法会导致收集结束时会有大量空间碎片产生,当然通过参数-XX:+UseCMSCompactAtFullCollection可以让jvm在执行完标记清除后再做整理
      • 执行过程中的不确定性,会存在上一次垃圾回收还没执行完,然后垃圾回收又被触发的情况,特别是在并发标记和并发清理阶段会出现,一边回收,系统一边运行,也许没回收完就再次触发full gc,也就是"concurrent mode failure",此时会进入stop the world,用 serial old 垃圾收集器来回收
    • 核心参数
      • -XX:+UseConcMarkSweepGC:启用cms
      • -XX:ConcGCThreads:并发的GC线程数
      • -XX:+UseCMSCompactAtFullCollection:FullGC之后做压缩整理(减少碎片)
      • -XX:CMSFullGCsBeforeCompaction:多少次FullGC之后压缩一次,默认是0,代表每次FullGC后都会压缩一次
      • -XX:CMSInitiatingOccupancyFraction: 当老年代使用达到该比例时会触发FullGC(默认是92,这是百分比)
      • -XX:+UseCMSInitiatingOccupancyOnly:只使用设定的回收阈值(-XX:CMSInitiatingOccupancyFraction设定的值),如果不指定,JVM仅在第一次使用设定值,后续则会自动调整
      • -XX:+CMSScavengeBeforeRemark:在CMS GC前启动一次minor gc,目的在于减少老年代对年轻代的引用,降低CMS GC的标记阶段时的开销,一般CMS的GC耗时 80%都在标记阶段
      • -XX:+CMSParallellnitialMarkEnabled:表示在初始标记的时候多线程执行,缩短STW
      • -XX:+CMSParallelRemarkEnabled:在重新标记的时候多线程执行,缩短STW

CMS 调优

  • 由于动态对象年龄判断原则(业务高峰期)导致频繁 full gc
    • 扩大新生代
    • 将默认的15岁改小一点,比如改为5,避免一直占用survivor区空间
    • 1M 的大对象直接进入老年代
    • CMS 碎片整理
  • 很多优化无非就是让短期存活的对象尽量都留在survivor里,不要进入老年代,这样在minor gc的时候这些对象都会被回收,不会进到老年代从而导致 full gc

三色标记

  • 在并发标记的过程中,因为标记期间应用线程还在继续跑,对象间的引用可能发生变化,多标和漏标的情况就有可能发生

  • 把GC roots可达性分析遍历对象过程中遇到的对象, 按照“是否访问过”这个条件标记成以下三种颜色

    • 黑色: 表示对象已经被垃圾收集器访问过, 且这个对象的所有引用都已经扫描过。 黑色的对象代表已经扫描过, 它是安全存活的, 如果有其他对象引用指向了黑色对象, 无须重新扫描一遍。 黑色对象不可能直接(不经过灰色对象) 指向某个白色对象
    • 灰色: 表示对象已经被垃圾收集器访问过, 但这个对象上至少存在一个引用还没有被扫描过
    • 白色: 表示对象尚未被垃圾收集器访问过。 显然在可达性分析刚刚开始的阶段, 所有的对象都是白色的, 若在分析结束的阶段, 仍然是白色的对象, 即代表不可达
  • 多标-浮动垃圾

    • 在并发标记过程中,如果由于方法运行结束导致部分局部变量(gc root)被销毁,这个gc root引用的对象之前又被扫描过(被标记为非垃圾对象),那么本轮GC不会回收这部分内存。这部分本应该回收但是没有回收到的内存,被称之为“浮动垃圾”
    • 浮动垃圾并不会影响垃圾回收的正确性,只是需要等到下一轮垃圾回收中才被清除
    • 针对并发标记(还有并发清理)开始后产生的新对象,通常的做法是直接全部当成黑色,本轮不会进行清除。这部分对象期间可能也会变为垃圾,这也算是浮动垃圾的一部分
  • 漏标-读写屏障

    • 漏标会导致被引用的对象被当成垃圾误删除,这是严重bug,必须解决
      • 增量更新(Incremental Update): 黑色对象一旦新插入了指向白色对象的引用之后, 它就变回灰色对象了
        • 当黑色对象插入新的指向白色对象的引用关系时, 就将这个新插入的引用记录下来, 等并发扫描结束之后, 再将这些记录过的引用关系中的黑色对象为根, 重新扫描一次
      • 原始快照(Snapshot At The Beginning,SATB):在本轮gc清理中能存活下来,待下一轮gc的时候重新扫描,这个对象也有可能是浮动垃圾
        • 当灰色对象要删除指向白色对象的引用关系时, 就将这个要删除的引用记录下来, 在并发扫描结束之后, 再将这些记录过的引用关系中的灰色对象为根, 重新扫描一次,这样就能扫描到白色的对象,将白色对象直接标记为黑色
    • 无论是对引用关系记录的插入还是删除, 虚拟机的记录操作都是通过写屏障实现的
  • 读写屏障

    • 写屏障:就是指在赋值操作前后,加入一些处理
      • 写屏障实现增量更新:当对象A的成员变量的引用发生变化时,比如新增引用(a.d = d),我们可以利用写屏障,将A新的成员变量引用对象D记录下来
      • 写屏障实现SATB:当对象B的成员变量的引用发生变化时,比如引用消失(a.b.d = null),我们可以利用写屏障,将B原来成员变量的引用对象D记录下来
    • 读屏障:当读取成员变量时,一律记录下来
    • 并发标记时对漏标的处理方案如下
      • CMS:写屏障 + 增量更新
      • G1,Shenandoah:写屏障 + SATB
      • ZGC:读屏障
    • 读写屏障还有其他功能
      • 写屏障可以用于记录跨代/区引用的变化
      • 读屏障可以用于支持移动对象的并发执行
  • 为什么G1用SATB?CMS用增量更新?

    • SATB相对增量更新效率会高(当然SATB可能造成更多的浮动垃圾),因为不需要在重新标记阶段再次深度扫描被删除引用对象
    • CMS对增量引用的根对象会做深度扫描,G1因为很多对象都位于不同的region,CMS就一块老年代区域,重新深度扫描对象的话G1的代价会比CMS高,所以G1选择SATB不深度扫描对象,只是简单标记,等到下一轮GC再深度扫描

记忆集与卡表

  • 在新生代做GCRoots可达性扫描过程中可能会碰到跨代引用的对象,这种如果又去对老年代再去扫描效率太低了
  • 为此,在新生代可以引入记录集(Remember Set)的数据结构(记录从非收集区到收集区的指针集合),避免把整个老年代加入GCRoots扫描范围
    • 并不只是新生代、 老年代之间才有跨代引用的问题, 所有涉及部分区域收集(Partial GC) 行为的垃圾收集器, 典型的如G1、 ZGC和Shenandoah收集器, 都会面临相同的问题
  • 垃圾收集场景中,收集器只需通过记忆集判断出某一块非收集区域是否存在指向收集区域的指针即可,无需了解跨代引用指针的全部细节
  • hotspot使用一种叫做“卡表”(cardtable)的方式实现记忆集,也是目前最常用的一种方式
  • 卡表是使用一个字节数组实现:CARD_TABLE[],每个元素对应着其标识的内存区域一块特定大小的内存块,称为“卡页”,hotSpot使用的卡页是2^9大小,即512字节
    • 一个卡页中可包含多个对象,只要有一个对象的字段存在跨代指针,其对应的卡表的元素标识就变成1,表示该元素变脏,否则为0

  • GC时,只要筛选本收集区的卡表中变脏的元素加入GCRoots里
  • 使用写屏障维护卡表状态
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值