本博客为山东大学软件学院2024创新实训,25组可视化课程知识问答系统(VCR)的个人博客,记载个人任务进展
数据源的分析与选择是数据分析过程中的关键步骤,它涉及到对数据的理解、质量评估、以及最终选择适合分析的数据源。我们的目的是为了实现一个可视化课程知识问答系统,主要是面向计算机网络这门课程。
数据源分析与选择的实现步骤
- 明确分析目标:
- 在开始之前,首先要明确我们项目的分析目标。
- 通过组内协商与讨论,我们最终选择计算机网络这门课程作为我们问答系统的训练目标。
- 数据源调研:
- 首先列出可能的数据源,比较可靠,可获取的数据源有教材,百度文库,百度百科等
- 评估每个数据源的可靠性、数据质量
- 数据质量评估:
- 对于候选的数据源,进行初步的数据质量评估。
- 检查数据的完整性、准确性。
- 数据抽样与预览:
- 从每个数据源中抽取一小部分数据进行预览。
- 这有助于了解数据的结构、类型以及可能存在的问题。
- 数据源选择: 基于分析目标、数据质量评估以及数据预览的结果,选择最合适的数据源。最终决定选取我们的教材和百度百科里的相关数据作为我们本次项目的数据源进行后续工作。
- 数据获取与加载:
- 根据所选数据源,使用爬虫获取数据。
- 将数据加载到分析环境中,准备进行后续的数据清洗和预处理工作。