WebMagic抓取阿里司法拍卖信息

蜗牛2号

于 2018-09-11 11:14:10 发布

阅读量3.3w

点赞数 1

文章标签：爬虫 webmagic

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/qq_35813653/article/details/82622631

版权

本文介绍了如何利用WebMagic爬虫框架来抓取阿里司法拍卖网站上的房产信息，从引入pom文件开始，逐步讲解了爬虫工具的编写、测试过程，并在最后分享了抓取数据的存储结构和测试结果。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

1、引入pom文件

  <!--webmagic网络爬虫-->
        <dependency>
            <groupId>us.codecraft</groupId>
            <artifactId>webmagic-core</artifactId>
            <version>0.7.3</version>
        </dependency>
        <dependency>
            <groupId>us.codecraft</groupId>
            <artifactId>webmagic-extension</artifactId>
            <version>0.7.3</version>
        </dependency>

2、编写爬虫工具

/**
 * 网络爬虫工具
 *
 * @author sunyiran
 * @date 2018-09-11
 */
public class WebMagicUtils {


    /**
     * 抓取csdn文章标题
     * @param beginUrl
     * @param urlReg
     * @param xpath
     * @return
     */
    public Map<String, List<String>> getCsdnInfo(String beginUrl, String urlReg, Map<String, String> xpath) {
        Map<String,List<String>> map = new HashMap<>();
        //是否结束抓取
        AtomicBoolean end = new AtomicBoolean(false);
        //定义抓取规则
        PageProcessor processor = new PageProcessor() {

            @Override
            public void process(Page page) {
                page.addTargetRequests(page.getHtml().links().regex(urlReg).all());

                //lambda遍历map集合
                xpath.forEach((x, y) -> {
                    //根据xpath语法解析页面元素
                    Selectable selectable = page.getHtml().xpath(y);
                    //如果不再获取
                    if (selectable.get() == null) {
                        end.set(true);
                    } else {
                        //如果元素已经

最低0.47元/天解锁文章

博客等级

码龄9年

102
原创

197
点赞

532
收藏

294
粉丝

关注

私信

热门文章

分类专栏

展开全部收起

最新评论

Java实现在线模版预览和下载
sw1227em: 你好，可以给下源码吗
Docker入门实战（四）——基于jenkins部署微服务
社会小刚刚: 看完感觉很简单，搭建一遍报错看不懂，尴尬。求指导[code=html] [/code]Started by user admin Running as SYSTEM Building in workspace /root/workspace/istonecode Updating svn://122.9.156.48/xxxxxx/xxxxx/xxxxx/xx/V1.0 at revision '2022-01-11T12:35:44.818 +0800' --quiet Using sole credentials javaadmin/****** (SVN凭证) in realm ‘<svn://122.9.156.48:3690> /home/svn’ At revision 147 Triggering istonecode » default istonecode » default completed with result FAILURE Finished: FAILURE
WebMagic抓取阿里司法拍卖信息
辉仔988: 我想一个法拍房的小程序电话V：13112728988何生
JAVA基础（一）——什么是java
烨尧: 我的java个人心得，入门很重要，但是大多数人都搞错了方向，把入门变成了入土。。。：第一.切记不要一上来就找一大本厚书看。这样你绝对会放弃。《Java核心技术》《Java编程思想》等都不适合入门阅读，很容易半途而废。第二.先找一个入门级别的java教程看。网上有很多极简入门教程。例如runoob网站、w3cschool网站(它还有手机app)（上网搜一下关键词就有了）。我记得我一开始入门找的教程，知识面全而精炼简洁，含有基础、spring、Hibernate Servlet 等,地址如下仅供参考。https://how2j.cn/p/7245 第三.当你学完刚才那些网站之后，你应该此时对java有了一个整体的认识，那就去找一个小项目，GitHub很棒，https://github.com/上手练习，边做项目边查资料。进步会飞快。第四.这个阶段再回头精读一些java经典书籍。获得内功上的提升。总之，一定要循序渐进，一点点学才是最正确的选择。个人愚见，仅供参考
开发规范（一）——实体类
Tisfy: 真棒！就像：想当年，金戈铁马，气吞万里如虎。

大家在看

最新文章

目录

展开全部

收起

评论 3

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。