自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(54)
  • 收藏
  • 关注

原创 Python-sklearn-朴素贝叶斯

本文介绍了 Scikit-learn 中五种朴素贝叶斯分类器的使用方法和特点: 高斯朴素贝叶斯 (GaussianNB):适用于连续特征,假设特征服从高斯分布 多项式朴素贝叶斯 (MultinomialNB):适用于离散特征(如文本词频) 伯努利朴素贝叶斯 (BernoulliNB):适用于二值特征 补集朴素贝叶斯 (ComplementNB):针对不平衡数据集的改进版多项式NB 分类朴素贝叶斯 (CategoricalNB):适用于分类特征 文章详细说明了各分类器的参数设置、关键属性和预测方法,并提供了文

2026-08-12 09:56:18 252

原创 Python-sklearn-近邻方法

本文介绍了Scikit-learn中sklearn.neighbors模块的主要功能和方法: K-近邻算法: KNeighborsClassifier和KNeighborsRegressor实现KNN分类和回归 可配置邻居数量、距离权重、搜索算法(ball_tree/kd_tree/brute)、距离度量等参数 半径近邻算法: RadiusNeighborsClassifier和RadiusNeighborsRegressor基于半径进行邻居搜索 适用于数据密度不均匀的情况,但预测时邻居数量可能变化 底层数

2026-08-12 09:54:52 208

原创 Python-sklearn-集成学习

本文介绍了Scikit-learn中的集成学习方法,主要分为Bagging和Boosting两大类: Bagging方法: 随机森林分类器(RandomForestClassifier)和回归器(RandomForestRegressor),支持特征重要性评估和袋外分数计算 极端随机树(ExtraTrees)采用完全随机的分裂阈值 通用Bagging分类/回归器(BaggingClassifier/Regressor),可搭配任意基学习器 Boosting方法: 梯度提升分类器(GradientBoosti

2026-08-12 09:52:51 229

原创 Python-sklearn-SVM

本文介绍了Scikit-learn中的支持向量机(SVM)模块,包括分类、回归和异常检测三个主要应用场景。分类器部分详细说明了SVC、LinearSVC和NuSVC的使用方法及关键参数;回归部分介绍了SVR、LinearSVR和NuSVR;异常检测部分展示了OneClassSVM的应用。文章还总结了常用核函数(线性、多项式、RBF、Sigmoid)的特点,并提供了代码示例说明如何获取模型属性和进行预测。

2026-08-12 09:51:30 269

原创 Python-sklearn-决策树

提供决策树分类和回归模型。

2026-08-11 10:15:42 274

原创 Python-sklearn-线性模型

Scikit-learn的linear_model模块提供了多种线性模型,包括普通最小二乘回归(LinearRegression)、岭回归(Ridge,L2正则化)、Lasso回归(Lasso,L1正则化)以及弹性网络(ElasticNet,L1+L2)。这些模型支持参数调优,如正则化强度和交叉验证(RidgeCV、LassoCV)。此外,还包含贝叶斯方法(BayesianRidge)、最小角回归(Lars)和随机梯度下降回归(SGDRegressor)。关键功能包括系数提取、预测和评分,适用于不同场景如特

2026-08-11 10:13:59 525

原创 Python-sklearn-评估指标

本文总结了Scikit-learn(sklearn.metrics)中常用的评估指标,涵盖分类、回归和可视化功能。 分类指标: 基础指标:准确率(accuracy_score)、混淆矩阵(confusion_matrix) 综合报告:classification_report一键输出precision/recall/f1-score 核心指标:precision_score、recall_score、f1_score(支持macro/micro等平均方式) 概率指标:ROC-AUC(roc_auc_scor

2026-08-11 10:12:44 619

原创 Python-sklearn-模型选择

本文介绍了Scikit-learn中的模型选择与调优工具,重点涵盖数据分割和交叉验证两大核心功能。数据分割部分详细讲解了train_test_split、分层分割方法(StratifiedShuffleSplit)、K折交叉验证(KFold/StratifiedKFold)等常用分割器及其应用场景。交叉验证部分则介绍了cross_val_score、cross_validate等评估方法,以及learning_curve和validation_curve等分析工具,帮助实现模型性能评估和参数优化。文章特别强

2026-08-11 10:11:25 286

原创 Python-sklearn-特征工程

本文介绍了Scikit-learn中的特征工程工具,主要包括文本特征提取、图像特征提取和特征选择三部分: 文本特征提取:详细讲解了四种向量化方法 CountVectorizer(词频统计) TfidfVectorizer(TF-IDF加权) TfidfTransformer(词频转TF-IDF) HashingVectorizer(哈希技巧) 图像特征提取:展示了图像块提取与重建方法 extract_patches_2d/reconstruct_from_patches_2d 网格图生成等工具 特征选择:重

2026-08-10 09:59:34 327

原创 Python-sklearn-预处理

本文介绍了Scikit-learn(sklearn)中preprocessing模块的核心数据预处理技术,主要包括标准化/归一化方法和标签编码方法。 标准化与归一化部分涵盖: 最常用的Z-Score标准化(StandardScaler) 最小-最大缩放(MinMaxScaler) 最大绝对值缩放(MaxAbsScaler) 鲁棒缩放(RobustScaler) 样本归一化(Normalizer) 幂变换(PowerTransformer) 分位数变换(QuantileTransformer) 快速缩放函数(

2026-08-10 09:58:37 293

原创 Python-sklearn-数据集

Scikit-learn 提供了丰富的数据集资源,主要分为小型玩具数据集(load_*)和真实世界数据集(fetch_*)两大类。Toy Datasets 包括经典的鸢尾花分类(load_iris)、手写数字识别(load_digits)、乳腺癌诊断(load_breast_cancer)等,适用于算法验证和小规模实验。Real-World Datasets 如加州房价(fetch_california_housing)、20新闻组文本(fetch_20newsgroups)和OpenML平台数据集(fet

2026-08-10 09:57:06 332

原创 Python-matplotlib-高级图表

本文介绍了Matplotlib中的几种高级图表绘制方法:1)使用ax.twinx()和ax.twiny()创建双Y轴/双X轴图表;2)通过ax.errorbar()添加误差线,支持对称/非对称误差显示;3)利用fill_between()实现区域填充,包括固定值填充、曲线间填充和条件填充;4)使用projection='polar'创建极坐标图表,包括极坐标线图、散点图和风向玫瑰图。每种方法都提供了示例代码和关键参数说明,适用于不同场景下的数据可视化需求。

2026-08-07 08:18:38 245

原创 Python-matplotlib-动画

本文介绍了如何使用Matplotlib的animation模块创建动态图表。主要内容包括: FuncAnimation - 通过定义更新函数逐帧生成动画,适合数据更新场景 ArtistAnimation - 预先生成所有帧的Artist列表再播放,适合绘图元素变化的情况 实用示例 - 包含实时数据滚动、多子图同步、散点图动画等典型应用场景 保存动画 - 支持保存为GIF、MP4、HTML等多种格式,并介绍了相关参数配置 FuncAnimation是更推荐的方式,性能更好且内存占用低。文章提供了完整的代码示例

2026-08-07 08:16:32 235

原创 Python-matplotlib-刻度与格式

Matplotlib 刻度与格式控制摘要 Matplotlib 的 ticker 模块提供了精细控制坐标轴刻度的功能,主要包括: 1. 刻度定位器(Locator) 控制刻度位置,内置多种定位方式: AutoLocator(默认自动定位) MaxNLocator(限制最大刻度数) MultipleLocator(固定间隔) LogLocator(对数刻度) 支持主/次刻度分别设置 2. 格式化器(Formatter) 控制刻度标签显示格式: FormatStrFormatter(字符串格式化) Percen

2026-08-07 08:15:17 224

原创 Python-matplotlib-注解与图例

本文介绍了Matplotlib中图表标注与图例的高级用法,主要包括三部分内容: 精确注解(ax.annotate) - 详细讲解带箭头的标注方法,包括坐标系统设置、多种箭头样式、连接线样式以及文本框美化技巧。 自由文本(ax.text) - 演示如何在图表任意位置添加文本说明,包括轴坐标定位、水印效果和多行文本框的实现。 图例控制(ax.legend) - 涵盖图例的创建、位置调整、样式定制以及选择性显示技巧,包括图例边框、背景、多列布局等参数设置。 所有示例都配有完整代码片段和可视化效果说明,帮助用户掌握

2026-08-07 08:13:58 201

原创 Python-matplotlib-样式定制

本文介绍了Matplotlib的样式定制方法,主要包括三部分内容:1)rcParams全局参数配置,用于调整图表尺寸、字体、网格等默认设置;2)Style Sheets样式表,提供多种预设主题风格(如seaborn、ggplot等)快速切换;3)颜色定制,包括单色指定、调色板设置以及颜色映射(Colormap)的使用技巧。文章提供了详细的代码示例和参数速查表,帮助用户将默认图表优化为专业可视化效果,并推荐了感知均匀的科学配色方案如'viridis'。

2026-08-05 08:47:02 203

原创 Python-matplotlib-三维绘图

Matplotlib的mpl_toolkits.mplot3d模块提供了强大的三维数据可视化功能。本文介绍了创建3D坐标系的三种方式,并展示了多种三维图表的绘制方法: 使用plot3D()绘制三维线图(如螺旋线) 通过scatter3D()创建带颜色映射的三维散点图 利用plot_surface()和plot_wireframe()绘制曲面图和线框图 使用contour()/contourf()添加等高线 通过bar3D()创建三维柱状图 对非规则网格数据使用plot_trisurf()绘制三角曲面 每种方

2026-08-05 08:45:42 226

原创 Python-matplotlib-子图布局

本文介绍了Matplotlib中多种子图布局方法:1)plt.subplots()创建规则网格,支持共享坐标轴和批量设置;2)subplot_mosaic()通过字符串定义语义化布局,适合复杂结构;3)GridSpec提供精细网格控制,支持不等比例和嵌套布局;4)subplot2grid()可指定子图跨越范围。还对比了constrained_layout和tight_layout两种自动调整方法,并展示了设置间距的技巧。最后通过仪表盘示例演示了实际应用,推荐新项目优先使用subplot_mosaic。

2026-08-05 08:44:35 288

原创 Python-matplotlib-基础图表

本文介绍了Matplotlib中6种最常用的基础图表类型,能满足80%的数据可视化需求: 折线图(plot()):展示数据趋势变化,支持多线条绘制,可自定义线型、颜色和标记样式。 散点图(scatter()):显示变量间关系,支持用颜色/大小表示第三维数据,可分组绘制。 柱状图(bar()/barh()):比较类别数据差异,支持垂直/水平显示、分组和堆积形式。 直方图(hist()):展示数据分布特征,可叠加多组数据进行比较,支持密度曲线绘制。 每种图表都提供了示例代码和核心参数说明,包括颜色、透明度、标记

2026-08-05 08:42:45 313

原创 Python-matplotlib-基础入门

Matplotlib是Python最基础的数据可视化库,提供两种编程方式:快捷的pyplot方式和推荐的面向对象方式。其核心架构基于Figure(画布)和Axes(坐标系)概念。文章介绍了安装方法、基础绘图流程(包括数据准备、图表创建、样式设置和保存图片),详细讲解了颜色、线型、标记等样式设置,以及轴标签、标题、范围等图表元素的控制。还展示了subplots创建多子图的方法,并提供了正弦/余弦函数绘制的完整示例代码,适合数据可视化初学者快速入门Matplotlib的核心功能。

2026-08-05 08:40:35 29

原创 Python-pandas-高级技巧

本文介绍了Pandas库的多个高级技巧,主要包括: 数据转换方法: map()用于Series值映射,支持字典、函数和Series查找 apply()提供更灵活的元素级操作,可传额外参数 applymap()用于DataFrame的逐元素转换 transform()实现列级变换 管道操作: pipe()实现方法链式操作,提升代码可读性 类别数据类型: Categorical类型可显著减少内存占用并提升性能 支持有序类别、重命名、添加/删除类别等操作 内存优化: 数值类型降精度(如int64→int32) 字

2026-08-04 10:47:17 311

原创 Python-pandas-文本处理

Pandas 文本处理摘要 Pandas 提供 .str 访问器实现向量化字符串操作,支持常见文本处理功能: 基础操作:大小写转换、长度计算 切片索引:位置切片、安全取值 查找判断:包含检测、正则匹配、首尾判断 提取替换:正则分组提取、模式替换 拆分拼接:分隔符拆分、多列拼接 清理修整:去空格、填充对齐、文本换行 大小写转换:支持多种格式转换 数值处理:数字检测与提取 .str 方法自动处理 NaN 值,性能优于循环,但仅适用于 object/string 类型列。

2026-08-04 10:46:17 252

原创 Python-pandas-多层索引

Pandas多层索引(MultiIndex)是高维数据二维化表示的核心机制,本文介绍了其核心操作: 创建方法:5种方式创建多层索引,包括from_arrays、from_tuples、from_product(最常用)等 索引切片:支持层级索引、元组索引、xs跨层取值等灵活操作 层级操作:交换/重排/删除层级、索引转列等实用功能 列上应用:在columns上构建多层结构实现复杂数据表示 高级技巧:结合groupby分组聚合、使用IndexSlice进行高级切片 最佳实践建议:频繁分组操作时使用MultiIn

2026-08-04 10:45:26 296

原创 Python-pandas-时间序列

Pandas 提供了强大的时间序列处理功能,主要包括: 时间数据类型: Timestamp表示单个时间点,支持属性和时区处理 DatetimeIndex用于时间索引,可通过date_range()生成各种频率的时间序列 Timedelta表示时间差,支持时间运算 时间转换: to_datetime()将字符串转为时间,支持错误处理和格式指定 时间序列操作: 支持基于时间的切片和筛选 可提取时间属性(年/月/日等) 提供between_time()按时间段筛选 重采样: resample()支持频率转换(升/

2026-08-03 17:11:45 260

原创 Python-pandas-数据重塑

Pandas数据重塑方法摘要: pivot() - 将长格式数据转为宽格式,要求索引+列组合唯一,不进行聚合。 pivot_table() - 带聚合功能的透视表,可处理重复值,支持多级索引、多种聚合函数和汇总行。 melt() - 宽转长的逆透视操作,将列名转为行值,可保留指定列不变。 stack()/unstack() - 在多层索引的行列间转换数据,stack()使数据变长,unstack()使数据变宽。 crosstab() - 计算分组频率的交叉表,类似带计数功能的透视表。 这些方法实现了数据在宽

2026-08-03 17:10:26 305

原创 Python-pandas-合并连接

Pandas提供了多种数据合并方法: pd.merge():支持SQL风格的连接(内连接、左/右/外连接、交叉连接),可多列匹配、处理不同列名,通过indicator追踪数据来源,用suffixes解决列名冲突。 DataFrame.join():基于索引快速合并,适合左表保留全部行或外连接场景。 pd.concat():沿轴向(纵向/横向)拼接数据,支持忽略索引、添加分组键,通过join控制列对齐方式。 特殊合并: merge_asof():近似匹配(如时间序列对齐) merge_ordered():有序

2026-08-03 17:08:28 292

原创 Python-pandas-分组与聚合

Pandas分组聚合操作摘要 本文介绍了Pandas中强大的分组聚合功能,主要包含以下内容: 分组基础:使用df.groupby()创建分组对象,支持单列或多列分组,可查看分组信息(groups/indices/ngroups) 聚合操作: 基本聚合函数(sum/mean/count等) agg()多函数聚合(函数列表/字典/命名聚合) 内置字符串聚合函数 自定义聚合函数 其他分组操作: transform(组内变换,保持原数据形状) filter(组级筛选) apply(最灵活的组操作) 分组方式扩展:

2026-08-03 10:52:32 410

原创 Python-pandas-索引与筛选

这篇文章摘要(≤150字): Pandas索引与筛选核心方法指南:重点介绍.loc[](标签索引,含两端)、.iloc[](位置索引,不含右端)和布尔索引的使用技巧。.loc按行/列标签选择数据,支持切片和条件筛选;.iloc按整数位置访问,遵循Python切片规则。文章还对比了.at/.iat快速访问标量、query()字符串表达式筛选、where()/mask()条件替换等实用方法,并强调布尔索引中必须使用&|~而非and/or。包含常见错误示例和行列选择的最佳实践,是数据处理的高效参考手册。

2026-08-03 10:51:06 618

原创 Python-pandas-基础入门

Pandas是Python核心数据分析库,提供Series(一维带标签数组)和DataFrame(二维表格)两种核心数据结构。摘要内容涵盖: 基础安装与版本检查 Series创建与操作(从列表/字典创建、索引、运算、统计) DataFrame创建方式(字典/列表/Numpy数组)及基本属性 数据预览方法(head/tail/info/describe) 文件读写操作(CSV/Excel/JSON/SQL等格式) 典型应用包括数据清洗、统计分析、表格处理等场景,支持自动索引对齐和丰富的数据操作功能。

2026-08-02 11:07:52 221

原创 Python-numpy-高级技巧

本文介绍了NumPy的4个高级技巧: 向量化思维:强调用向量化操作替代循环,展示了条件运算(np.where)和矩阵运算(.mean(axis=1))的优化示例,速度可提升10-100倍。 np.einsum:详解爱因斯坦求和约定的强大功能,包括矩阵乘法、点积、转置等基础操作,以及批量矩阵乘法和注意力分数计算等高级应用,支持省略号处理任意维度。 结构化数组:演示如何创建类似数据库表的异构数据结构,支持不同类型字段、条件查询、排序和嵌套结构,适合处理复杂数据记录。 掩码数组:介绍用numpy.ma处理缺失值的

2026-08-02 11:05:57 648

原创 Python-numpy-文件操作

NumPy文件操作指南摘要 NumPy提供多种高效的数据存储方式: 二进制格式(.npy/.npz):读写速度快,保留元信息,适合单个(.npy)或多个数组(.npz)存储,支持压缩 文本格式:通过loadtxt/savetxt处理CSV/TXT,genfromtxt支持复杂文本处理 内存映射(memmap):处理超大文件,按需加载不占内存 HDF5格式:适合GB级以上数据集,支持分层存储和压缩 关键优势: 二进制格式比文本快10-100倍 memmap实现超大数据处理 自动保留数据类型和形状信息 提供压缩

2026-08-01 15:16:45 665

原创 Python-numpy-统计与数学

NumPy统计与数学函数摘要: 📊 统计功能: 提供完整统计量计算:集中趋势(均值、中位数)、离散程度(标准差、方差)、极值、分位数等 支持轴向统计(axis=0/1)和维度保持(keepdims) 高级统计包括相关系数、协方差、加权平均、直方图统计等 含NaN安全版本函数(nanmean/nanstd等) 🧮 线性代数: 矩阵运算:乘法(@/dot)、逆矩阵(inv)、行列式(det)、迹(trace) 矩阵分解:特征分解(eig)、SVD奇异值分解、QR分解 方程求解:solve解线性方程组、lst

2026-08-01 15:15:40 188

原创 Python-numpy-形状操作

NumPy形状操作总结: reshape:调整数组形状(总元素数不变),尽量返回视图 resize:原地修改/填充数组大小 展平操作:flatten()(副本)、ravel()/reshape(-1)(可能视图),支持C/F顺序 转置与轴交换:T、transpose()、swapaxes()、moveaxis() 维度调整:expand_dims/newaxis升维,squeeze降维 拼接与堆叠:concatenate(沿轴拼接)、stack(新增维度堆叠) 分割:split/array_split(均等

2026-07-30 09:55:13 495

原创 Python-numpy-数组运算

NumPy 数组运算与广播机制摘要: NumPy 的核心是向量化运算,通过底层 C/Fortran 实现比 Python 循环快 10-100 倍。主要特性包括: 逐元素运算:支持算术、比较等操作,自动应用于数组每个元素 通用函数(ufunc):提供数学、逻辑等高性能函数,支持 reduce/accumulate 等高级操作 广播机制:允许不同形状数组运算,按维度对齐规则自动扩展 矩阵运算:提供 dot/matmul 等线性代数操作,支持矩阵乘法、逆矩阵等 比较运算:支持元素级和全局比较判断 关键优势在于避

2026-07-30 09:54:05 191

原创 Python-numpy-索引与切片

NumPy 提供了强大的索引与切片功能,主要包括: 基本索引与切片 支持类似 Python list 的索引和切片操作,但返回的是视图而非副本,修改切片会影响原数组。 多维数组可通过逗号分隔索引(如 arr[行, 列]),支持 ... 省略部分维度。 花式索引(Fancy Indexing) 使用整数数组索引,返回副本而非视图,支持任意顺序和重复索引。 结合 np.ix_ 可提取子矩阵。 布尔索引 通过条件表达式筛选数据(如 arr[arr > 10]),支持多条件组合(需用 & | ~ 并加括号)。 可直

2026-07-28 09:22:41 828

原创 Python-numpy-基础入门

本文介绍了NumPy核心数据结构ndarray的基础知识。ndarray是一种同构多维数组,相比Python列表具有连续内存、固定类型和高效运算的优势。文章详细讲解了创建ndarray的多种方式,包括从Python数据结构转换、生成特殊数组(全零/全一/对角矩阵等)、序列数组生成(arange/linspace等)以及模仿形状创建。同时介绍了ndarray的重要属性(shape、dtype、strides等)和数据类型系统,包括常用数值类型、类型转换方法及运算时的类型提升规则。这些内容为NumPy科学计算提

2026-07-28 09:21:09 221

原创 Python-基础-更多技巧

本文介绍了Python的几个实用技巧:1)拆包操作(Unpacking),包括*拆包列表/元组、**拆包字典以及合并字典;2)海象运算符(:=)用于在表达式中赋值并返回值;3)字符串前缀(f、r、b、u)的使用方法;4)Python中会被视为False的值(如None、0、空容器等),以及如何利用真值测试进行简洁的条件判断。这些技巧能帮助编写更简洁高效的Python代码。

2026-07-27 09:50:39 135

原创 Python-基础-常用内置函数

Python内置函数速查摘要:map/filter用于映射过滤;sum/max/min/len聚合计算;enumerate/zip枚举压缩;sorted/reversed排序反转。类型转换含int/str/list等,chr/ord处理字符编码。逻辑判断函数all/any/isinstance等验证条件。内置常量包括True/False/None等。这些函数提供基础数据处理、类型转换和逻辑判断能力,是Python编程必备工具。(149字)

2026-07-27 09:49:25 219

原创 Python-基础-装饰器

摘要 装饰器是Python中在不修改原函数代码的情况下扩展函数功能的语法糖。其本质是将函数作为参数传递给装饰器函数(func = decorator(func))。文章展示了两种常见装饰器:1) 基础装饰器(如记录函数调用的@log),通过闭包实现功能扩展;2) 参数化装饰器(如@repeat(times=3)),通过嵌套函数结构接收额外参数。装饰器能优雅地实现代码复用,是Python的高级特性之一。

2026-07-26 19:35:07 172

原创 Python-基础-迭代器与生成器

本文介绍了Python中的迭代器与生成器概念。迭代器通过实现__iter__()和__next__()方法实现,示例展示了倒计时迭代器类。生成器使用yield关键字创建,能按需生成值而非一次性创建全部元素,更节省内存。文章还演示了生成器表达式和yield from语法,后者可以简化生成器委托操作。这些特性使得处理大数据流时更加高效。

2026-07-26 19:34:16 554

空空如也

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除