Go官方指南---《Web爬虫练习》

最新推荐文章于 2022-04-14 19:41:58 发布

头前一点白

最新推荐文章于 2022-04-14 19:41:58 发布

阅读量402

点赞数

分类专栏：计算机语言---go语言文章标签： go

本文链接：https://blog.csdn.net/suoyudong/article/details/107617519

版权

本篇博客通过Go的并发特性，详细讲解如何构建一个并行抓取且避免重复的Web爬虫。实践过程中，重点在于利用map存储已抓取URL，但需注意并发环境下map的非安全性。

摘要由CSDN通过智能技术生成

练习：Web 爬虫
在这个练习中，我们将会使用 Go 的并发特性来并行化一个 Web 爬虫。

修改 Crawl 函数来并行地抓取 URL，并且保证不重复。

提示：你可以用一个 map 来缓存已经获取的 URL，但是要注意 map 本身并不是并发安全的！

package main

import (
	"fmt"
	"sync"
)

type Fetcher interface {
   
	// Fetch 返回 URL 的 body 内容，并且将在这个页面上找到的 URL 放到一个 slice 中。
	Fetch(url string) (body string, urls []string, err error)
}
/*
// Crawl 使用 fetcher 从某个 URL 开始递归的爬取页面，直到达到最大深度。
func Crawl(url string, depth int, fetcher Fetcher) {
	// TODO: 并行的抓取 URL。
	// TODO: 不重复抓取页面。
        // 下面并没有实现上面两种情况：
	if depth <= 0 {
		return
	}
	body, urls, err := fetcher.Fetch(url)
	if err != nil {
		fmt.Println(err)
		return
	}
	fmt.Printf("found: %s %q\n", url, body)
	for _, u := range urls {
		Crawl(u, depth-1, fetcher)
	}
	return
}
*/
var(
	m =make(map[string]int)
	l sync.Mutex
	i sync.WaitGroup
)

func Crawl(url string, depth int, fetcher Fetcher)