毕业设计:日志记录编写(3 17起更新中)(1)

当前周期目标:构建基本的python环境:运行爬虫程序

1.配置阿里云python加速镜像:

pip config set global.index-url https://mirrors.aliyun.com/pypi/simple/

安装chrome驱动到python安装目录下

在这里插入图片描述

2. 安装python3.9版本

在这里插入图片描述

3. 爬虫技术选择

爬虫技术是采集数据的主要手段之一。以下是一些常用的爬虫技术:

Requests + Beautiful Soup: 对于静态网页,使用 Python 的 Requests 库获取网页源代码,然后使用 Beautiful Soup 解析数据。

Scrapy: 对于动态网页或需要大规模数据采集的情况,可以考虑使用 Scrapy 框架,它提供了强大的爬虫功能和数据处理能力。

Selenium: 如果需要模拟用户操作,比如登录或者触发 JavaScript 事件,可以使用 Selenium 这样的工具。

4. 数据抓取和整理

针对短视频平台的数据采集,你可能需要考虑以下内容:

视频信息: 包括标题、描述、发布时间、观看次数、点赞数、评论数等。

评论信息: 获取视频的评论内容、评论者的信息(如用户名、头像、粉丝数等)以及评论时间等。

用户信息: 可能需要获取用户的基本信息和行为数据,比如关注数、粉丝数、发布的视频数量等。

5. 难点和挑战

反爬虫机制: 很多网站会有反爬虫机制,你可能需要应对验证码、IP 封锁等问题。

数据量和频率限制: 确保你的爬虫不会给目标网站造成过大的负担,遵守网站的访问频率限制。

数据存储和处理: 采集到的数据可能会很庞大,你需要考虑如何高效地存储和处理这些数据,以及如何建立合适的数据库结构。

3/24

周期目标:编写运行爬虫程序,拿到抖音用户和评论数据,并持久化存入MySQL:

1.数据库建表信息

创作者视频信息表设计:

CREATE TABLE douyin_aweme (
    id INT PRIMARY KEY AUTO\_INCREMENT,  -- 自增ID
    user_id VARCHAR(64),  -- 用户ID
    sec_uid VARCHAR(128),  -- 用户sec\_uid
    short_user_id VARCHAR(64),  -- 用户短ID
    user_unique_id VARCHAR(64),  -- 用户唯一ID
    nickname VARCHAR(64),  -- 用户昵称
    avatar VARCHAR(255),  -- 用户头像地址
    user_signature VARCHAR(500),  -- 用户签名
    ip_location VARCHAR(255),  -- 评论时的IP地址
    add_ts BIGINT,  -- 记录添加时间戳
    last_modify_ts BIGINT,  -- 记录最后修改时间戳
    aweme_id VARCHAR(64),  -- 视频ID
    aweme_type VARCHAR(16),  -- 视频类型
    title VARCHAR(500),  -- 视频标题
    `desc` TEXT,  -- 视频描述
    create_time BIGINT,  -- 视频发布时间戳
    liked_count VARCHAR(16),  -- 视频点赞数
    comment_count VARCHAR(16),  -- 视频评论数
    share_count VARCHAR(16),  -- 视频分享数
    collected_count VARCHAR(16),  -- 视频收藏数
    aweme_url VARCHAR(255)  -- 视频详情页URL
);

普通用户评论信息表设计:

CREATE TABLE douyin_aweme_comment (
    id INT PRIMARY KEY AUTO\_INCREMENT,  -- 自增ID
    user_id VARCHAR(64),  -- 用户ID
    sec_uid VARCHAR(128),  -- 用户sec\_uid
    short_user_id VARCHAR(64),  -- 用户短ID
    user_unique_id VARCHAR(64),  -- 用户唯一ID
 **自我介绍一下,小编13年上海交大毕业,曾经在小公司待过,也去过华为、OPPO等大厂,18年进入阿里一直到现在。**

**深知大多数Python工程师,想要提升技能,往往是自己摸索成长或者是报班学习,但对于培训机构动则几千的学费,着实压力不小。自己不成体系的自学效果低效又漫长,而且极易碰到天花板技术停滞不前!**

**因此收集整理了一份《2024年Python开发全套学习资料》,初衷也很简单,就是希望能够帮助到想自学提升又不知道该从何学起的朋友,同时减轻大家的负担。**

![img](https://img-blog.csdnimg.cn/img_convert/6260989f4f94e7cae4b4eea2d3337eea.png)

![img](https://img-blog.csdnimg.cn/img_convert/661e6f850a0a311609d51585e9cc42ed.png)

![img](https://img-blog.csdnimg.cn/img_convert/eb0655e64066fe9f94ab8ff87ef4cb38.png)

![img](https://img-blog.csdnimg.cn/img_convert/f01113464a9ce2b6308ea540821d7460.png)

![img](https://img-blog.csdnimg.cn/img_convert/6c361282296f86381401c05e862fe4e9.png)

![img](https://img-blog.csdnimg.cn/img_convert/9f49b566129f47b8a67243c1008edf79.png)

**既有适合小白学习的零基础资料,也有适合3年以上经验的小伙伴深入学习提升的进阶课程,基本涵盖了95%以上前端开发知识点,真正体系化!**

**由于文件比较大,这里只是将部分目录大纲截图出来,每个节点里面都包含大厂面经、学习笔记、源码讲义、实战项目、讲解视频,并且后续会持续更新**

**如果你觉得这些内容对你有帮助,可以扫码获取!!!(备注:Python)**

阶课程,基本涵盖了95%以上前端开发知识点,真正体系化!**

**由于文件比较大,这里只是将部分目录大纲截图出来,每个节点里面都包含大厂面经、学习笔记、源码讲义、实战项目、讲解视频,并且后续会持续更新**

**如果你觉得这些内容对你有帮助,可以扫码获取!!!(备注:Python)**

![](https://img-blog.csdnimg.cn/img_convert/00078fbcbf9a05b069278af4c79128b9.jpeg)
  • 3
    点赞
  • 5
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值