HashMap源码解析

本文主要基于JDK 1.8版本进行HashMap的源码解析.

1. 简介

HashMap继承自Map接口, 内部使用数组 + 链表 + 红黑树的结构. 在JDK 1.8之前都是数组 + 链表的结构, 因为链表的查询操作是O(N)的时间复杂度, 而且hashMap中查询操作也是占了很大比例的, 如果当节点数量多, 转换为红黑树结构, 那么将会提高很大的效率, 因为红黑树结构中, 增删改查都是O(log N).

HashMap结构

2. 源码解释

2.1 属性

public class HashMap<K,V> extends AbstractMap<K,V> implements Map<K,V>, Cloneable, Serializable {

    // 默认容量, 1向左移位4个, 00000001变成00010000, 也就是2的4次方为16, 使用移位是因为移位是计算机基础运算, 效率比加减乘除快. 
    static final int DEFAULT_INITIAL_CAPACITY = 1 << 4; // aka 16
    // 最大容量, 2的30次方
    static final int MAXIMUM_CAPACITY = 1 << 30;
    // 负债因子, 当数量达到容量 * 负债因子时, 进行扩容为当前的两倍
    static final float DEFAULT_LOAD_FACTOR = 0.75f;
    // 当某个桶节点数量大于8时, 会转换为红黑树. 
    static final int TREEIFY_THRESHOLD = 8;
    // 当某个桶节点数量小于6时, 会转换为链表, 前提是它当前是红黑树结构
    static final int UNTREEIFY_THRESHOLD = 6;
    // 当整个hashMap中元素数量大于64时, 也会进行转为红黑树结构
    static final int MIN_TREEIFY_CAPACITY = 64;
    // 存储元素的数组, transient关键字表示该属性不能被序列化
    transient Node<K,V>[] table;
    // 将数据转换成set的另一种存储形式, 这个变量主要用于迭代功能
    transient Set<Map.Entry<K,V>> entrySet;
    // 当前Map中的元素数量
    transient int size;
    // 临界值, 也就是元素数量达到临界值时, 会进行扩容
    int threshold;
    // 统计该map修改的次数
    transient int modCount;
    // 负载因子, 只不过这个是变量
    final float loadFactor;

}

2.2 内部类

// 红黑树结构
static final class TreeNode<K,V> extends LinkedHashMap.Entry<K,V> {
    TreeNode<K,V> parent;  // red-black tree links
    TreeNode<K,V> left;
    TreeNode<K,V> right;
    TreeNode<K,V> prev;    // needed to unlink next upon deletion
    boolean red;
    TreeNode(int hash, K key, V val, Node<K,V> next) {
        super(hash, key, val, next);
    }
}
// 链表结构
static class Node<K,V> implements Map.Entry<K,V> {
    final int hash;
    final K key;
    V value;
    Node<K,V> next;

    Node(int hash, K key, V value, Node<K,V> next) {
        this.hash = hash;
        this.key = key;
        this.value = value;
        this.next = next;
    }
}

以上两个内部类加上HashMap中的Node<K,V>[] table属性组成了HashMap的结构.

2.3 构造方法

public class HashMap<K,V> extends AbstractMap<K,V> implements Map<K,V>, Cloneable, Serializable {

    public HashMap() {
        this.loadFactor = DEFAULT_LOAD_FACTOR; // all other fields defaulted
    }

    public HashMap(int initialCapacity) {
        this(initialCapacity, DEFAULT_LOAD_FACTOR);
    }

    public HashMap(int initialCapacity, float loadFactor) {
        if (initialCapacity < 0)
            throw new IllegalArgumentException("Illegal initial capacity: " + initialCapacity);
        if (initialCapacity > MAXIMUM_CAPACITY)
            initialCapacity = MAXIMUM_CAPACITY;
        if (loadFactor <= 0 || Float.isNaN(loadFactor))
            throw new IllegalArgumentException("Illegal load factor: " + loadFactor);
        this.loadFactor = loadFactor;
        this.threshold = tableSizeFor(initialCapacity);
    }
}

这三个构造函数比较简单, 其中需要注意的是tableSizeFor(initialCapacity)方法.

public class HashMap<K,V> extends AbstractMap<K,V> implements Map<K,V>, Cloneable, Serializable {
    static final int tableSizeFor(int cap) { // 假设输入为10, 二进制位 00001010
        // 让cap - 1在赋值的目的是让找到的目标值大于或者等于原值, 如果输入项为8, 不进行 - 1处理, 最后得到的结果将会是16. 
        int n = cap - 1; // 00001001
        n |= n >>> 1; // 右移一位 => 00000100, 在位或 => 00001101
        n |= n >>> 2; // 右移两位 => 00000011, 在位或 => 00001111
        n |= n >>> 4; // 右移四位 => 00000000, 在位或 => 00001111
        n |= n >>> 8; // 右移八位 => 00000000, 在位或 => 00001111
        n |= n >>> 16; // 右移十六位 => 00000000, 在位或 => 00001111
        return (n < 0) ? 1 : (n >= MAXIMUM_CAPACITY) ? MAXIMUM_CAPACITY : n + 1;
    }
}

该方法返回大于输入参数且最接近2的整数次幂的数, 比如参数输入10, 则返回16. 这么做的原因是, 当value的hash值小于n - 1, 索引的位置就是hash, 当value的hash值大于n - 1时, 索引的位置就是hash值取模后的值.

public class HashMap<K,V> extends AbstractMap<K,V> implements Map<K,V>, Cloneable, Serializable {
    public HashMap(Map<? extends K, ? extends V> m) {
        this.loadFactor = DEFAULT_LOAD_FACTOR;
        putMapEntries(m, false);
    }

    final void putMapEntries(Map<? extends K, ? extends V> m, boolean evict) {
        int s = m.size(); // 获取参数中map的实际长度
        if (s > 0) { 
            if (table == null) {
                // 求出需要的容量, 实际使用的长度 = 容量 * 0.75, 相除获得的结果在后面需要强制转换为int, 多余的小数会被丢掉, 所以进行+1处理. 
                // 例如map实际长度22, 22 / 0.75 = 29.3, 所需容量肯定为30, 如果刚刚好为整数, 容量大小多1也没什么影响
                float ft = ((float)s / loadFactor) + 1.0F;
                int t = ((ft < (float)MAXIMUM_CAPACITY) ? (int)ft : MAXIMUM_CAPACITY);
                if (t > threshold)
                    threshold = tableSizeFor(t);
            } else if (s > threshold) {
                resize(); // 如果已经初始化, 进行扩容操作.
            }
            // 循环遍历将参数内的数据放入当前Map中
            for (Map.Entry<? extends K, ? extends V> e : m.entrySet()) {
                K key = e.getKey();
                V value = e.getValue();
                putVal(hash(key), key, value, false, evict);
            }
        }
    }
}

2.4 扰动函数

public class HashMap<K,V> extends AbstractMap<K,V> implements Map<K,V>, Cloneable, Serializable {
    // 该方法的实现称之为扰动函数, 该方法可以有效的减少hash碰撞的出现
    static final int hash(Object key) {
        int h;
        return (key == null) ? 0 : (h = key.hashCode()) ^ (h >>> 16);
    }
}

理论上hash是一个int类型数据, 如果直接拿来当做下标值的话, 只要哈希函数映射的比较均匀松散, 一般很难出现碰撞的. 但问题是, 内存中存不下40亿长度的数组, 所以hash值还需要进行取模运算之后得到的余数才能作为下标使用. 这种情况下, 即使hash函数返回的hash值再怎么松散, 依旧很容易出现碰撞的情况. 更何况还有hash函数本身做的不好的情况.

这种时候, 扰动函数的价值就体现出来了. 右位移16位, 正好是32bit的一半, 自己的高半区和低半区做异或, 就是为了混合原始哈希码的高位和低位, 以此来加大低位的随机性. 而且混合后的低位掺杂了高位的部分特征, 这样高位的信息也被变相保留下来. 之后再根据(n - 1) & hash进行下标值计算.
扰动函数

2.5 扩容

public class HashMap<K,V> extends AbstractMap<K,V> implements Map<K,V>, Cloneable, Serializable {
    final Node<K,V>[] resize() {
        Node<K,V>[] oldTab = table;
        int oldCap = (oldTab == null) ? 0 : oldTab.length; // 原数组的长度
        int oldThr = threshold; // 临界值, 2的整数次幂
        int newCap, newThr = 0;
        if (oldCap > 0) { 
            if (oldCap >= MAXIMUM_CAPACITY) { 
                // 当前容量已经到达最大值MAXIMUM_CAPACITY(2的30次幂), 如果在进行扩容将超过int的最大值. 
                // 此处不进行扩容并不代表该Map不能在插入新值.
                threshold = Integer.MAX_VALUE;
                return oldTab;
            } else if ((newCap = oldCap << 1) < MAXIMUM_CAPACITY && oldCap >= DEFAULT_INITIAL_CAPACITY) {
                // 如果当前容量大于等于DEFAULT_INITIAL_CAPACITY(16), 并且扩容一倍(oldCap << 1)
                // 之后小于MAXIMUM_CAPACITY(2的30次幂), 扩容一倍得到新的容量大小. 
                // 假设初始化时设定的大小小于16, 在第二次进行resize时, 将直接扩容到16
                newThr = oldThr << 1; // double threshold
            }
        } else if (oldThr > 0) {
            // 表示原数组中没有任何元素
            newCap = oldThr;
        } else {
            // 赋值newCap为默认的容量(16)以及默认的扩容阈值(16 * 0.75).
            newCap = DEFAULT_INITIAL_CAPACITY;
            newThr = (int)(DEFAULT_LOAD_FACTOR * DEFAULT_INITIAL_CAPACITY);
        }
        if (newThr == 0) { // 当数组中没有元素时, 使用initialCapacity参数的构造函数不会进入该分支
            // 经过上述步骤之后, 根据当前的容量和负载因子计算扩容阈值(threshold).
            float ft = (float)newCap * loadFactor;
            newThr = (newCap < MAXIMUM_CAPACITY && ft < (float)MAXIMUM_CAPACITY ? (int)ft : Integer.MAX_VALUE);
        }
        threshold = newThr;
        // 构建一个容量为newCap的数组, 并将之前的数据存入其中
        Node<K,V>[] newTab = (Node<K,V>[])new Node[newCap];
        table = newTab;
        if (oldTab != null) {
            for (int j = 0; j < oldCap; ++j) {
                Node<K,V> e;
                if ((e = oldTab[j]) != null) {
                    oldTab[j] = null;
                    if (e.next == null) { 
                        // hash没有冲突的情况下, 直接计算下标进行赋值
                        newTab[e.hash & (newCap - 1)] = e;
                    } else if (e instanceof TreeNode) {
                        // 如果该节点是颗红黑树, 分裂成2个树或者2个链表(根据其大小决定), 具体代码可自行查阅
                        ((TreeNode<K,V>)e).split(this, newTab, j, oldCap);
                    } else { // 链表的情况下, 分裂成2个链表添加到数组中
                        Node<K,V> loHead = null, loTail = null;
                        Node<K,V> hiHead = null, hiTail = null;
                        Node<K,V> next;
                        do {
                            next = e.next;
                            if ((e.hash & oldCap) == 0) {
                                if (loTail == null) {
                                    loHead = e;
                                } else {
                                    loTail.next = e;
                                }
                                loTail = e;
                            } else {
                                if (hiTail == null) {
                                    hiHead = e;
                                } else {
                                    hiTail.next = e;
                                } 
                                hiTail = e;
                            }
                        } while ((e = next) != null);

                        if (loTail != null) {
                            loTail.next = null;
                            newTab[j] = loHead;
                        }
                        if (hiTail != null) {
                            hiTail.next = null;
                            newTab[j + oldCap] = hiHead;
                        }
                    }
                }
            }
        }
        return newTab;
    }
}

2.6 链表转红黑树

public class HashMap<K,V> extends AbstractMap<K,V> implements Map<K,V>, Cloneable, Serializable {

    final void treeifyBin(Node<K,V>[] tab, int hash) {
        int n, index; Node<K,V> e;
        if (tab == null || (n = tab.length) < MIN_TREEIFY_CAPACITY) {
            // 如果数组容量小于MIN_TREEIFY_CAPACITY(64), 先进行扩容处理
            resize();
        } else if ((e = tab[index = (n - 1) & hash]) != null) {
            TreeNode<K,V> hd = null, tl = null; // 首节点, 尾节点
            do {
                // 如果满足要求, 先将所有的节点转换为双向链表, 然后转换为红黑树.
                TreeNode<K,V> p = replacementTreeNode(e, null);
                if (tl == null) { // 如果尾节点为空, 说明还没有首节点, 设置当前节点为首节点
                    hd = p;
                } else { // 尾节点不为空, 构建一个双向链表
                    p.prev = tl; // 当前节点的上一个节点上个循环中的节点.
                    tl.next = p; // 上一个循环中的节点的下一个节点是当前节点
                }
                tl = p; // 当前节点设定为尾节点
            } while ((e = e.next) != null);
            // 把转换后的双向链表替换原先位置上的单向链表
            if ((tab[index] = hd) != null)
                hd.treeify(tab); // 将双向链表转换成红黑树
        }
    }

    TreeNode<K,V> replacementTreeNode(Node<K,V> p, Node<K,V> next) {
        return new TreeNode<>(p.hash, p.key, p.value, next);
    }

    static final class TreeNode<K,V> extends LinkedHashMap.Entry<K,V> {
        // 此处是变换为红黑树的代码, 此处不再详细解释
        final void treeify(Node<K,V>[] tab) {
            TreeNode<K,V> root = null; 
            for (TreeNode<K,V> x = this, next; x != null; x = next) {
                next = (TreeNode<K,V>)x.next;
                x.left = x.right = null;
                if (root == null) {
                    x.parent = null;
                    x.red = false;
                    root = x;
                } else {
                    K k = x.key;
                    int h = x.hash;
                    Class<?> kc = null;
                    for (TreeNode<K,V> p = root;;) {
                        int dir, ph;
                        K pk = p.key;
                        if ((ph = p.hash) > h)
                            dir = -1;
                        else if (ph < h)
                            dir = 1;
                        else if ((kc == null && (kc = comparableClassFor(k)) == null) || (dir = compareComparables(kc, k, pk)) == 0)
                            dir = tieBreakOrder(k, pk);

                        TreeNode<K,V> xp = p;
                        if ((p = (dir <= 0) ? p.left : p.right) == null) {
                            x.parent = xp;
                            if (dir <= 0)
                                xp.left = x;
                            else
                                xp.right = x;
                            root = balanceInsertion(root, x);
                            break;
                        }
                    }
                }
            }
            moveRootToFront(tab, root);
        }
    }
}

treeifyBin方法, 应该可以解释为把容器里的元素变成树结构. 当HashMap的内部元素数组中某个位置上存在多个hash值相同的键值对, 这些Node已经形成了一个链表, 当该链表的长度大于等于9或者整个HashMap中数组长度超过64的时候, 会调用该方法来进行链表转换为红黑树的操作.

2.7 红黑树转链表

public class HashMap<K,V> extends AbstractMap<K,V> implements Map<K,V>, Cloneable, Serializable {

    final Node<K,V> untreeify(HashMap<K,V> map) {
        Node<K,V> hd = null, tl = null;
        for (Node<K,V> q = this; q != null; q = q.next) {
            Node<K,V> p = map.replacementNode(q, null);
            if (tl == null)
                hd = p;
            else
                tl.next = p;
            tl = p;
        }
        return hd;
    }
}

2.8 添加

put函数可以分为三种情况.

  1. 插入位置无数据, 直接存入当前的key在table的位置
  2. 插入位置有数据, 但是较少且符合链表结构存储的条件, 那么以链表操作存入
  3. 插入位置有数据, 但是以树结构进行存储, 那么以树的相关操作进行存入
public class HashMap<K,V> extends AbstractMap<K,V> implements Map<K,V>, Cloneable, Serializable {
    public V put(K key, V value) {
        return putVal(hash(key), key, value, false, true);
    }

    final V putVal(int hash, K key, V value, boolean onlyIfAbsent, boolean evict) {
        Node<K,V>[] tab; Node<K,V> p; int n, i;
        if ((tab = table) == null || (n = tab.length) == 0) 
            // 如果当前的table为 空 或者 长度为0, 即第一次做插入操作时, 做一次扩容
            n = (tab = resize()).length;
        if ((p = tab[i = (n - 1) & hash]) == null) { // 通过(n-1) & hash获取key所在的索引
            // 如果当前的node为null, 说明该索引下还没有任何值, 将当前元素构建为链表并保存
            tab[i] = newNode(hash, key, value, null);
        } else {
            // 根据hash值找到Node, 然后将value添加到Node中.
            Node<K,V> e; K k; // e: 临时节点, k: 存放当前节点的key
            if (p.hash == hash && ((k = p.key) == key || (key != null && key.equals(k)))) {
                // 数组中已经存在与当前元素hash相同, key也相同的元素
                e = p;
            } else if (p instanceof TreeNode) {
                // 如果该节点已经是TreeNode, 执行TreeNode的插入操作.
                // 需要注意的是这边的返回值, 如果key已经存在, 直接返回节点, 后续进行替换. 
                // 如果不存在, 进行插入, 然后返回null. 此处涉及红黑树的插入操作, 暂时不深入研究.
                e = ((TreeNode<K,V>)p).putTreeVal(this, tab, hash, key, value);
            } else {
                // 遍历链表
                for (int binCount = 0; ; ++binCount) {
                    if ((e = p.next) == null) { // 将下一个节点赋值给e
                        p.next = newNode(hash, key, value, null); // 插入到链表的尾端
                        // 如果超过TREEIFY_THRESHOLD - 1(注意这边从0开始的), 转换为红黑树.
                        if (binCount >= TREEIFY_THRESHOLD - 1)
                            treeifyBin(tab, hash);
                        break;
                    }
                    // 数组中已经存在与当前元素hash相同, key也相同的元素, 跳出循环
                    if (e.hash == hash && ((k = e.key) == key || (key != null && key.equals(k))))
                        break;
                    p = e;
                }
            }
            if (e != null) { // 此处e不为空说明节点中的key与参数key是相同的
                V oldValue = e.value;
                // 取出旧值, 根据onlyIfAbsent判断是否直接进行替换.
                if (!onlyIfAbsent || oldValue == null)
                    e.value = value;
                afterNodeAccess(e);
                return oldValue;
            }
        }
        ++modCount;
        if (++size > threshold) // 添加完成后, 再次确认是否需要resize
            resize();
        afterNodeInsertion(evict);
        return null;
    }

    Node<K,V> newNode(int hash, K key, V value, Node<K,V> next) {
        return new Node<>(hash, key, value, next);
    }
}

2.9 获取

public class HashMap<K,V> extends AbstractMap<K,V> implements Map<K,V>, Cloneable, Serializable {
    public V get(Object key) {
        Node<K,V> e;
        return (e = getNode(hash(key), key)) == null ? null : e.value;
    }

    final Node<K,V> getNode(int hash, Object key) {
        Node<K,V>[] tab; Node<K,V> first, e; int n; K k;
        // 如果数组不为为空, 长度大于0并且根据下标获取的Node不为空的情况, 进行数据获取, 否则返回null
        if ((tab = table) != null && (n = tab.length) > 0 && (first = tab[(n - 1) & hash]) != null) {
            if (first.hash == hash && ((k = first.key) == key || (key != null && key.equals(k))))
                // 数组中已经存在与当前元素hash相同, key也相同的元素
                return first;
            if ((e = first.next) != null) { // 存在hash碰撞的情况
                if (first instanceof TreeNode) // 红黑树的情况下
                    return ((TreeNode<K,V>)first).getTreeNode(hash, key);

                do {
                    // 接下来就是循环遍历知道找到节点.
                    if (e.hash == hash && ((k = e.key) == key || (key != null && key.equals(k))))
                        return e;
                } while ((e = e.next) != null);
            }
        }
        return null;
    }
}

2.10 删除

public class HashMap<K,V> extends AbstractMap<K,V> implements Map<K,V>, Cloneable, Serializable {
    public V remove(Object key) {
        Node<K,V> e;
        return (e = removeNode(hash(key), key, null, false, true)) == null ? null : e.value;
    }

    final Node<K,V> removeNode(int hash, Object key, Object value, boolean matchValue, boolean movable) {
        Node<K,V>[] tab; Node<K,V> p; int n, index;
        // 第一步, 先根据下标值查找对应的节点
        if ((tab = table) != null && (n = tab.length) > 0 && (p = tab[index = (n - 1) & hash]) != null) {
            Node<K,V> node = null, e; K k; V v;
            if (p.hash == hash && ((k = p.key) == key || (key != null && key.equals(k)))) {
                // 数组中已经存在与当前元素hash相同, key也相同的元素
                node = p;
            } else if ((e = p.next) != null) { // hash碰撞的情况下
                if (p instanceof TreeNode) { // 红黑树
                    node = ((TreeNode<K,V>)p).getTreeNode(hash, key);
                } else {
                    do { // 循环遍历链表查找对应的节点
                        if (e.hash == hash && ((k = e.key) == key || (key != null && key.equals(k)))) {
                            node = e;
                            break;
                        }
                        p = e;
                    } while ((e = e.next) != null);
                }
            }
            // 第二步, 删除
            if (node != null && (!matchValue || (v = node.value) == value || (value != null && value.equals(v)))) {
                if (node instanceof TreeNode) { // 红黑树删除节点
                    ((TreeNode<K,V>)node).removeTreeNode(this, tab, movable);
                } else if (node == p) { // 如果是链表的首节点, 数组中存储首节点的下一个节点
                    tab[index] = node.next;
                } else { // 从链表中删除
                    p.next = node.next;
                }
                ++modCount;
                --size;
                afterNodeRemoval(node);
                return node;
            }
        }
        return null;
    }
}

3. 总结

  1. HashMap中index的计算是扰动了hashCode, 并且通过位运算&来计算的, 这也是因为其长度为2的n次幂才能通过位运算来计算的.
  2. 对于hash碰撞的元素, 会连接成一个链表. 当链表长度过长会将链表转成红黑二叉树, 默认的长度阈值是8.
  3. 关于扩容, HashMap中默认容量是16, 当容量到达当前容量 * 比例因子(0.75)时, 就会发生扩容. 扩容时是扩大原tables的1倍. 扩容的代价是比较大的, 内存是扩充1倍, 且元素的存储都要进行相应的调整.
  4. 关于遍历, 遍历时不能再修改HashMap内的元素, 否则可能会造成ConcurrentModificationException.

posted on 2021-02-22 20:58  annwyn  阅读(100)  评论(0)    收藏  举报

导航