山东大学软件学院创新实训VCR系统个人博客(1)

本博客为山东大学软件学院2024创新实训,25组可视化课程知识问答系统(VCR)的个人博客,记载个人任务进展

数据源的分析与选择是数据分析过程中的关键步骤,它涉及到对数据的理解、质量评估、以及最终选择适合分析的数据源。我们的目的是为了实现一个可视化课程知识问答系统,主要是面向计算机网络这门课程。

数据源分析与选择的实现步骤 

  1. 明确分析目标
    • 在开始之前,首先要明确我们项目的分析目标。
    • 通过组内协商与讨论,我们最终选择计算机网络这门课程作为我们问答系统的训练目标。
  2. 数据源调研
    • 首先列出可能的数据源,比较可靠,可获取的数据源有教材,百度文库,百度百科等
    • 评估每个数据源的可靠性、数据质量
  3. 数据质量评估
    • 对于候选的数据源,进行初步的数据质量评估。
    • 检查数据的完整性、准确性。
  4. 数据抽样与预览
    • 从每个数据源中抽取一小部分数据进行预览。
    • 这有助于了解数据的结构、类型以及可能存在的问题。
  5. 数据源选择:                                                                                                                                 基于分析目标、数据质量评估以及数据预览的结果,选择最合适的数据源。最终决定选取我们的教材和百度百科里的相关数据作为我们本次项目的数据源进行后续工作。
  6. 数据获取与加载
    • 根据所选数据源,使用爬虫获取数据。
    • 将数据加载到分析环境中,准备进行后续的数据清洗和预处理工作。
  • 5
    点赞
  • 2
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值