图(Graph)
顶点(vertex)和 边(edge)组成 。
无向图
顶点相连接的边数:度
有向图
入度(In-degree)和出度(Out-degree)
带权图(weighted graph)
如QQ好友亲密关系:
存储方法
邻接矩阵
- 无向图的话浪费了一半空间
- 稀疏图(Sparse Matrix):顶点很多,但每个顶点的边并不多(比如微信有好几亿的用户,但是每个用户的好友也就三五百个。)
所以,邻接矩阵很浪费空间,但是邻接矩阵在矩阵计算方面有优势。
邻接表
大致思路如此,按照需求可以改造:
改造实例:如何存储微博社交关系?(关注与粉丝)
- 判断用户 A 是否关注了用户 B;
- 判断用户 A 是否是用户 B 的粉丝;
- 用户 A 关注用户 B;
- 用户 A 取消关注用户 B;
- 根据用户名称的首字母排序,分页获取用户的粉丝列表;
- 根据用户名称的首字母排序,分页获取用户的关注列表。
-
因为社交网络是一张稀疏图,使用邻接矩阵存储比较浪费存储空间。所以,这里我们采用邻接表来存储。
-
如果只存储关注列表,则粉丝列表很能查询。所以我们需要一个关注列表(邻接表),一个粉丝列表(反邻接表)(当然我觉得也可以把两个表合并,左边一条链(粉丝),右边一条链(关注)😃)
-
链改造为跳表(时间复杂度是 O(logn),空间复杂度上稍高是 O(n))。最重要的一点,跳表中存储的数据本来就是有序的了,分页获取粉丝列表或关注列表,就非常高效。(其实红黑树也可以)
问题附加:微博有上亿的用户,数据规模太大,这就无法将淑君全部存储在内存中了。这个时候该怎么办呢?
(哎呀,一看到这种上亿级别的响应,肯定想到哈希算法分布式啊🧐)
通过哈希算法数据分片方式,将邻接表存储在不同的机器上。
查询的时候一样:用户id通过哈希算法的值%机器数量 = 对应机器编号,则从该机器的邻接表查询就可以了。
还有一种办法就是利用数据库建立索引:
思考题
一、像微信这种无向图,应该怎么存储呢?
稀疏图 ==> 邻接表:每个人所对应的好友列表。为了支持快速查找,好友列表可以使用红黑树存储。
二、符合图这种结构特点的例子还有很多,比如知识图谱(Knowledge Graph)。关于图这种数据结构,你还能想到其他生活或者工作中的例子吗?
地图;
网络;
Gradle这个编译工具,内部组织task的方式用的是有向图;
Android framework层提供了一个CoordinatorLayout,其内部协调子view的联动,也是用的图。
了解:
1 内存中用邻接表
2 要持久化存储就用数据库
2 超大图 并且涉及大量图计算,用专业的图数据库
图的搜索
构造无向图
注意邻接表及其初始化:
public class Graph { // 无向图
private int v; // 顶点的个数
private LinkedList<Integer> adj[]; // 邻接表
public Graph(int v) {
this.v = v;
adj = new LinkedList[v];
for (int i=0; i<v; ++i) {
adj[i] = new LinkedList<>();
}
}
public void addEdge(int s, int t) { // 无向图一条边存两次
adj[s].add(t);
adj[t].add(s);
}
}
广度优先搜索(BFS)
广度优先搜索(Breadth-First-Search):“地毯式”层层推进的搜索策略,即先查找离起始顶点最近的,然后是次近的,依次往外搜索。(这种按层搜索应该联想到二叉树的按层遍历:需要LinkedList队列)
求s到t的路径:
public void bfs(int s, int t) {
if (s == t) return;
boolean[] visited = new boolean[v];
visited[s]=true;
Queue<Integer> queue = new LinkedList<>();
queue.add(s);
int[] prev = new int[v];
for (int i = 0; i < v; ++i) {
prev[i] = -1;
}
while (queue.size() != 0) {
int w = queue.poll();
for (int i = 0; i < adj[w].size(); ++i) {
int q = adj[w].get(i);
if (!visited[q]) {
prev[q] = w;
if (q == t) {
print(prev, s, t);
return;
}
visited[q] = true;
queue.add(q);
}
}
}
}
- visited 是用来记录顶点是否已经被访问,用来避免顶点被重复访问。
- queue 是一个队列,用来存储“同一个圈🔵”上的顶点(就是上图中的黄色虚线圈,类似二叉树的一层)。因为广度优先搜索是逐层访问的,也就是说,我们只有把第 k 层的顶点都访问完成之后,才能访问第 k+1 层的顶点。
- prev 用来记录搜索路径。 不过,prev[w]存储的是,顶点 w 是从哪个前驱顶点遍历过来的。比如,我们通过顶点 2 的邻接表访问到顶点 3,那 prev[3]就等于 2。
- 为了正向打印出路径,我们需要递归地来打印,print() 函数的实现方式。
private void print(int[] prev, int s, int t) { // 递归打印s->t的路径
if (prev[t] != -1 && t != s) {
print(prev, s, prev[t]);
}
System.out.print(t + " ");
}
走一遍:
复杂度分析
时间复杂度:因为基本每个边都要访问一次,所以时间复杂度O(E)。(E为边数)
空间复杂度:因为要借助visited、queue、prev三个v,所以空间复杂度O(V)。(V为顶点数)
深度优先搜索(DFS)
深度优先搜索(Depth-First-Search),简称 DFS。最直观的例子就是“走迷宫”。
随意选择一个岔路口来走,走着走着发现走不通的时候,你就回退到上一个岔路口,重新选择一条路继续走,直到最终找到出口。(回溯思想)
求s到t的路径:
boolean found = false; // 全局变量或者类成员变量
public void dfs(int s, int t) {
found = false;
boolean[] visited = new boolean[v];
int[] prev = new int[v];
for (int i = 0; i < v; ++i) {
prev[i] = -1;
}
recurDfs(s, t, visited, prev);
print(prev, s, t);
}
private void recurDfs(int w, int t, boolean[] visited, int[] prev) {
if (found == true) return;
visited[w] = true;
if (w == t) {
found = true;
return;
}
for (int i = 0; i < adj[w].size(); ++i) {
int q = adj[w].get(i);
if (!visited[q]) {
prev[q] = w;
recurDfs(q, t, visited, prev);
}
}
}
复杂度分析
时间复杂度:每条边最多会被访问两次,一次是遍历,一次是回退。时间复杂度O(E)。(E为边数)
空间复杂度:要借助visited、prev 数组和递归调用栈,同样空间复杂度O(V)。(V为顶点数)
思考题:可能认识的人,找出社交网络中某个用户的三度好友关系?
使用广度搜索思想:
首先,遍历与起始顶点最近的一层顶点,也就是用户的一度好友。
然后再遍历与用户距离的边数为 2 的顶点,也就是二度好友关系。
同样遍历用户距离的边数为 3 的顶点,也就是三度好友关系。