HashMap 在高并发下引起的死循环

最新推荐文章于 2023-02-24 15:23:58 发布

Touch&

最新推荐文章于 2023-02-24 15:23:58 发布

阅读量383

点赞数

分类专栏：并发编程剖析文章标签： HashMap 高并发下死循环

本文链接：https://blog.csdn.net/BThinker/article/details/104513956

版权

并发编程剖析专栏收录该内容

8 篇文章 0 订阅

订阅专栏

HashMap 在高并发下引起的死循环

HashMap 基本实现（JDK 8 之前）

采用数组+链表存储数据，对于一个元素的插入，首先要考虑它在数组中的位置。常用散列函数存放其位置。

常用的散列函数的设计，以下几种：

1、直接赋值法（是多少就放数组中那个位置如100就放数组中第100个位置。）

2、数据分析法（根据一个数据进行分析如：身份证430521199810143314 直接取后四位3314 存放数组位置3314 ）

3、平方取中法（一个数据进行平方进行存放）

4、取余法（ 28%3 >>4，所以存放数组第四个位置。）

HashMap中也采用的是取余法。

HashMap 通常会用一个指针数组（假设为 table[]）来做分散所有的 key，当一个 key 被加入时，会通过 Hash 算法通过 key 算出这个数组的下标 i，然后就把这个 <key, value> 插到 table[i] 中，如果有两个不同的 key 被算在了同一个 i，那么就叫冲突，又叫碰撞，这样会在 table[i] 上形成一个链表。

如果 table[] 的尺寸很小，比如只有 2 个，如果要放进 10 个 keys 的话，那么碰撞非常频繁，于是一个 O(1) 的查找算法，就变成了链表遍历，性能变成了 O(n)，这是 Hash 表的缺陷。

所以，Hash 表的尺寸和容量非常的重要。一般来说，Hash 表这个容器当有数据要插入时，都会检查容量有没有超过设定的 threshold，如果超过，需要增大 Hash 表的尺寸，但是这样一来，整个 Hash 表里的元素都需要被重算一遍。这叫 rehash，这个成本相当的大。

/**
 * 默认的初始容量 16
 */
 static final int DEFAULT_INITIAL_CAPACITY = 1 << 4; // aka 16
/**
 * 默认的负载因子
 */
static final float DEFAULT_LOAD_FACTOR = 0.75f;

HashMap 的 rehash 源代码

Put 一个 Key, Value 对到 Hash 表中：

public V put(K key, V value) {
    if (table == EMPTY_TABLE) {
        inflateTable(threshold);
    }
    if (key == null)
        return putForNullKey(value);
    // 计算 Hash 值
    int hash = hash(key);
    int i = indexFor(hash, table.length);
    // 如果该 key 已被插入，则替换掉旧的 value（链接操作）
    for (Entry<K,V> e = table[i]; e != null; e = e.next) {
        Object k;
        if (e.hash == hash && ((k = e.key) == key || key.equals(k))) {
            V oldValue = e.value;
            e.value = value;
            e.recordAccess(this);
            return oldValue;
        }
    }
    modCount++;
    // 该 key 不存在，需要增加一个结点
    addEntry(hash, key, value, i);
    return null;
}

检查容量是否超标

void addEntry(int hash, K key, V value, int bucketIndex) {
    //查看当前的 size 是否超过了设定的阈值 threshold，如果超过，需要 resize
    if ((size >= threshold) && (null != table[bucketIndex])) {
        resize(2 * table.length);
        hash = (null != key) ? hash(key) : 0;
        bucketIndex = indexFor(hash, table.length);
    }
    createEntry(hash, key, value, bucketIndex);
}

新增table[i]

void createEntry(int hash, K key, V value, int bucketIndex) {
    Entry<K,V> e = table[bucketIndex];
    table[bucketIndex] = new Entry<>(hash, key, value, e);
    size++;
}

新建一个更大尺寸的 hash 表，然后把数据从老的 Hash 表中迁移到新的 Hash 表中

void resize(int newCapacity) {
    Entry[] oldTable = table;
    int oldCapacity = oldTable.length;
    if (oldCapacity == MAXIMUM_CAPACITY) {
        threshold = Integer.MAX_VALUE;
        return;
    }
     // 创建一个新的 Hash Table
    Entry[] newTable = new Entry[newCapacity];
    // 将 Old Hash Table 上的数据迁移到 New Hash Table 上
    transfer(newTable, initHashSeedAsNeeded(newCapacity));
    table = newTable;
    threshold = (int)Math.min(newCapacity * loadFactor, MAXIMUM_CAPACITY + 1);
}

迁移的源代码

void transfer(Entry[] newTable) {
    Entry[] src = table;
    int newCapacity = newTable.length;
    //下面这段代码的意思是：
    //  从OldTable里摘一个元素出来，然后放到NewTable中
    for (int j = 0; j < src.length; j++) {
        Entry<K,V> e = src[j];
        if (e != null) {
            src[j] = null;
            do {
                Entry<K,V> next = e.next;
                int i = indexFor(e.hash, newCapacity);
                e.next = newTable[i];
                newTable[i] = e;
                e = next;
            } while (e != null);
        }
    }
}

该方法实现的机制就是将每个链表转化到新链表，并且链表中的位置发生反转，而这在多线程情况下是很容易造成链表回路，从而发生 get() 死循环。所以只要保证建新链时还是按照原来的顺序的话就不会产生循环（JDK 8 的改进）。

正常的 ReHash 的过程(注意：采用头插法)

假设我们的 hash 算法就是简单的用 key mod 一下表的大小（也就是数组的长度）
最上面的是 old hash 表，其中的 Hash 表的 size = 2，所以 key = 3, 7, 5，在 mod 2 以后都冲突在 table[1] 这里了
接下来的三个步骤是 Hash 表 resize 成 4，然后所有的 <key, value> 重新 rehash 的过程

并发下的 Rehash

a.假设有两个线程

do {
    Entry<K,V> next = e.next; //  假设线程一执行到这里就被调度挂起了
    int i = indexFor(e.hash, newCapacity);
    e.next = newTable[i];
    newTable[i] = e;
    e = next;
} while (e != null);

而线程二执行完成了。于是有下面的这个样子

注意：因为 Thread1 的 e 指向了 key(3)，而 next 指向了 key(7)，其在线程二 rehash 后，指向了线程二重组后的链表。可以看到链表的顺序被反转

b.线程一被调度回来执行

先是执行 newTalbe[i] = e;
然后是 e = next，导致了 e 指向了 key(7)
而下一次循环的 next = e.next 导致了 next 指向了 key(3)

c.线程一接着工作。把 key(7) 摘下来，放到 newTable[i] 的第一个，然后把 e 和 next 往下移

d.环形链接出现
e.next = newTable[i] 导致 key(3).next 指向了 key(7)
此时的 key(7).next 已经指向了 key(3)，环形链表就这样出现了

JDK 8 的改进

JDK 8 中采用的是位桶 + 链表/红黑树的方式，当某个位桶的链表的长度超过 8 的时候，这个链表就将转换成红黑树。

原因总结

HashMap 之所以在并发下的扩容造成死循环，是因为，多个线程并发进行时，因为一个线程先期完成了扩容，将原 Map 的链表重新散列到自己的表中，并且链表变成了倒序，后一个线程再扩容时，又进行自己的散列，再次将倒序链表变为正序链表。于是形成了一个环形链表，当 get 表中不存在的元素时，造成死循环。

Touch&

关注

0
点赞
踩
2

收藏

觉得还不错? 一键收藏
0
评论
HashMap 在高并发下引起的死循环

HashMap 在高并发下引起的死循环HashMap 基本实现（JDK 8 之前）HashMap 通常会用一个指针数组（假设为 table[]）来做分散所有的 key，当一个 key 被加入时，会通过 Hash 算法通过 key 算出这个数组的下标 i，然后就把这个 <key, value> 插到...
复制链接

扫一扫

专栏目录