- 博客(8)
- 收藏
- 关注
原创 《数据挖掘(主编:吕欣 王梦宁)》读书笔记:聚类分析的核心思想、评价指标与常见算法
本文系统梳理了聚类分析的核心概念、评价指标和常见算法。聚类作为无监督学习方法,通过样本相似性将数据划分为若干组,适用于探索性数据分析。文章详细介绍了簇、质心等基本概念,以及划分聚类、层次聚类、密度聚类等主要算法类型。重点讨论了外部评价指标(如兰德系数、调整互信息)和内部评价指标(如轮廓系数、DB指数),并提供了确定聚类数量的实用方法(肘部法、内部指标比较)。最后简要介绍了层次聚类的两种实现方式及其距离计算方法。全文为聚类分析提供了清晰的理论框架和实践指导。
2026-05-23 10:41:10
404
原创 《Python大数据实践(主编:吕欣 杨文川)》读书笔记:网络爬虫设计的基本流程与实践理解
《Python大数据实践》网络爬虫读书笔记摘要 网络爬虫是自动化数据采集程序,模拟浏览器访问网页的过程,核心能力包括访问、解析和沉淀数据。完整爬虫流程包括:目标分析、请求发送、页面解析、数据提取、清洗存储等环节。关键工具包括requests发送HTTP请求,BeautifulSoup和XPath解析HTML,正则表达式提取格式化文本。静态页面可直接解析HTML,动态数据需分析接口或使用Selenium。Scrapy框架适合工程化爬虫项目,提供完整的采集流程管理。爬虫开发需先观察网页结构,选择合适解析方式,并
2026-05-23 10:36:11
1478
原创 《数据挖掘(主编:吕欣 王梦宁)》读书笔记:关联规则挖掘的核心思想、评价指标与经典算法
本文总结了《数据挖掘》中关联规则挖掘的核心内容。关联规则用于发现事务数据中的频繁共现模式,典型应用包括购物篮分析。关键概念包括项集、支持度(衡量频率)和置信度(衡量可靠性)。强关联规则需同时满足最小支持度和置信度阈值。Apriori算法利用先验性质逐步生成频繁项集,但存在候选集膨胀问题。除支持度和置信度外,提升度等指标能更好评估规则价值。关联规则挖掘可广泛应用于推荐系统、医疗诊断等领域,是理解事物间关联关系的重要方法。
2026-05-21 21:02:29
312
原创 《数据挖掘(主编:吕欣 王梦宁)》读书笔记:异常检测方法梳理与实践理解
摘要 本文系统梳理了《数据挖掘》教材中的异常检测方法,从异常定义、检测原理和适用场景三个维度进行分析。异常检测旨在识别不符合多数样本规律的数据对象,其应用场景包括金融欺诈、设备故障监测等。文章将异常检测方法分为统计规则、分布估计、过程监控等7大类,详细介绍了3σ准则、箱线图、HBOS、CUSUM等典型算法。特别强调了不同方法对"正常模式"的定义差异,如统计分布符合性、空间密度分布或模型重构能力等。最后指出方法选择需结合数据特征和业务需求,单一方法往往存在局限性,实际应用中需要综合考量计算效率和检测精度。全文
2026-05-21 20:52:03
342
原创 06 深度学习应用——《Python大数据实践(主编:吕欣 杨文川)》读书笔记
通过本章学习,我认识到深度学习是一种以神经网络为基础的表示学习方法。它最大的优势是能够从数据中自动提取特征,特别适合处理图像、文本、语音、视频和图结构等复杂数据。PyTorch 为深度学习实践提供了方便的工具。通过张量、自动求导、神经网络模块、损失函数和优化器,可以较为清晰地完成模型构建与训练。MLP 适合基础向量数据;CNN 适合图像和空间结构数据;RNN、LSTM、GRU 适合序列数据;Transformer 适合文本和长距离依赖任务;GNN 适合图结构数据。
2026-05-18 09:35:53
380
原创 10 集成学习——《数据挖掘(主编:吕欣 王梦宁)》读书笔记
本文总结了《数据挖掘》教材中集成学习的主要内容,重点分析了集成学习的核心思想、主要类型及典型算法。集成学习通过组合多个基学习器提升模型性能,关键在于保证基学习器的准确性和差异性。文章详细对比了Bagging(如随机森林)和Boosting(如AdaBoost)两类方法:Bagging通过并行训练降低方差,适合易过拟合模型;Boosting通过串行训练降低偏差,关注错误样本修正。此外还介绍了随机森林和AdaBoost的基本流程、优缺点及代码实现,为数据挖掘实践提供了系统指导。
2026-05-18 09:22:15
403
原创 # 03 Python 数据管理——《Python大数据实践(主编:吕欣 杨文川)》读书笔记
本文摘要: 《Python大数据实践》读书笔记聚焦Python数据管理核心内容,从三个层次剖析数据管理能力:基础操作、结构设计和工程化思维。文章系统梳理了关系型数据库操作流程(连接、CRUD、事务控制),对比了关系型与非关系型数据库特点,并强调事务处理、索引优化等关键概念。特别介绍了Python连接MySQL的实践方法(pymysql、pandas交互),以及批量操作、异常处理等工程实践要点。全文突出数据管理的系统性思维,不仅关注技术实现,更强调数据一致性、安全性和可扩展性等工程化考量。
2026-05-17 18:12:36
395
原创 04 回归分析——《数据挖掘(主编:吕欣 王梦宁)》读书笔记
本文梳理了《数据挖掘》中回归分析的核心内容,包括回归模型的基本思想、评价指标(R²、MAE、RMSE等)、线性回归建模方法及其统计检验(F检验、t检验)。重点讨论了多元线性回归中的多重共线性问题及其解决方案(岭回归、LASSO回归),并简要介绍了非线性回归方法。文章系统总结了回归分析在预测和解释变量关系方面的应用价值,为数据挖掘实践提供了理论基础和方法指导。
2026-05-17 18:10:48
573
1
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅