数据挖掘笔记(一)

本文是数据挖掘课程的学习笔记,介绍了数据挖掘的历史、目的、定义,以及涉及的技术,包括机器学习、统计等。同时,探讨了数据挖掘在网页排名、银行贷款决策等方面的应用,以及数据探索的基本统计描述和数据可视化方法。
摘要由CSDN通过智能技术生成

主要是整理自己在数据挖掘课程上所做的一些笔记。
更多内容可以访问我的个人博客

  1. 数据挖掘介绍

  2. 数据探索


数据挖掘介绍(intro)

  • 历史

从数据中人工提取模式: Bayes理论(1700s) 回归分析(1800s)

  • 为什么进行数据挖掘

(1)已获得的大量数据往往是数据丰富但信息贫乏的
(2)计算设备变得廉价且功能强大
(3)没有强大的工具的话,数据量已经超过人类的理解能力
(4)数据收集存储的速度越来越快
(5)传统技术已经不适用于原始数据
(6)数据挖掘有助于科学研究

  • 什么是数据挖掘

(1)定义:对大量数据进行自动或半自动的探索和分析,以发现有意义的模式。
(2)数据挖掘是知识发现的一个步骤

  • 什么样的数据可以被挖掘

(1)关系型数据库数据
(2)数据仓库
(3)事务(transaction)数据 每一个记录(事务transaction)包含一组项集(items)
(4)时间-空间数据
(5)图以及网状数据(超链接图、社会和信息网络)
(6)超文本和多媒体数据(文本、图像、视频和音频数据)
(7)时间相关序列数据
(8)数据流(监控、传感器)

  • 可以挖掘出什么样的模式

(1)类别/概念描述:特征和区分
(2)挖掘频繁模式(频繁模式通常是指经常出现在事务性数据集中的一组项,挖掘频繁模式可以发现数据中有趣的关联和相关性)、关联关系
(3)使用分类和回归(找到一个描述和区分数据类或概念的模型)进行预测分析
(4)聚类分析
(5)异常分析(离群点分析)

  • 挖掘结果的意义

(1)可能会找到许多无意义的模式
(2)什么叫有意义的模式?:有效性、新的(对系统来说是未知的)、有用的(可以对项集采取动作的)

Python数据挖掘学习笔记主要包括以下几个方面的内容:Python基础知识、Python爬虫技术、Python数据分析与数据挖掘。其中,Python基础知识部分介绍了Python编程语言的基本语法、数据类型、流程控制等内容,为数据挖掘的学习打下了基础。Python爬虫技术部分介绍了如何使用Python编写爬虫程序,从网页中获取所需数据。Python数据分析与数据挖掘部分则介绍了使用Python进行数据分析和数据挖掘的相关技术和工具。 在Python数据挖掘中,还涉及到一些扩展库的使用,可以使用pip或apt-get进行安装,例如numpy库可以使用命令"sudo pip install numpy"或"sudo apt-get install python-numpy"进行安装。 另外,Matplotlib是Python中最常用的绘图库之一,主要用于绘制二维图形,也可以绘制简单的三维图形。下面是一个使用Matplotlib进行简单绘图的示例代码: ```python import numpy as np import matplotlib.pyplot as plt x = np.linspace(0, 10, 1000) y = np.sin(x) z = np.cos(x ** 2) plt.figure(figsize=(8, 4)) plt.plot(x, y, label='$\sin x$', color='red', linewidth=2) plt.plot(x, z, 'b--', label='$\cos x^2$') plt.xlabel('Time(s)') plt.ylabel('Volt') plt.title('A Simple Example') plt.ylim(0, 2.2) plt.legend() plt.show() ``` 这段代码使用了numpy库生成了一组x轴的数据,然后分别计算了对应的y轴和z轴的数值。接下来使用Matplotlib进行绘图,其中plt.plot函数用于绘制曲线,plt.xlabel和plt.ylabel分别设置x轴和y轴的标签,plt.title设置图的标题,plt.ylim设置y轴的范围,plt.legend用于显示图例,plt.show用于显示图形。 通过学习这些内容,你可以掌握Python数据挖掘的基本知识和常用技术,为进一步的学习和实践打下坚实的基础。<span class="em">1</span><span class="em">2</span><span class="em">3</span> #### 引用[.reference_title] - *1* [python数据挖掘学习笔记](https://blog.csdn.net/yinghuoai/article/details/88392141)[target="_blank" data-report-click={"spm":"1018.2226.3001.9630","extra":{"utm_source":"vip_chatgpt_common_search_pc_result","utm_medium":"distribute.pc_search_result.none-task-cask-2~all~insert_cask~default-1-null.142^v93^chatsearchT3_1"}}] [.reference_item style="max-width: 50%"] - *2* *3* [python数据挖掘笔记](https://blog.csdn.net/djm82755/article/details/101452842)[target="_blank" data-report-click={"spm":"1018.2226.3001.9630","extra":{"utm_source":"vip_chatgpt_common_search_pc_result","utm_medium":"distribute.pc_search_result.none-task-cask-2~all~insert_cask~default-1-null.142^v93^chatsearchT3_1"}}] [.reference_item style="max-width: 50%"] [ .reference_list ]
评论 2
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值