- 博客(35)
- 收藏
- 关注
原创 PX06-对比两个 Excel 文件的差异:从逐单元格到生产级实现
本文分享了基于xlwings的Excel差异对比方案演进:从逐格对比的低效实现,到批量读取数组的性能优化,最终构建生产级工具。通过一次性读取数据、统一处理空值与浮点精度、强制二维数组结构、异常防护及跨平台兼容性设计,实现高效精准的版本比对,显著提升处理速度并避免常见陷阱,适用于数据核对、合同修订等场景。
2026-09-28 17:33:08
552
原创 PX05-用 Python 实现 Excel 的 VLOOKUP:多表关联匹配的三种方案
本文介绍用Python替代Excel VLOOKUP的三种高效方案:基于pandas.merge()的左连接(推荐)、map()轻量映射及直接写入Excel公式。重点强调how="left"避免数据丢失,提醒注意validate校验一对多问题、电话号码应以字符串读取以防精度损失,并通过完整案例演示从读取多Sheet到回填数据的全流程,实现快速、准确、可复用的数据匹配。
2026-09-23 11:54:45
568
原创 PX04-用 Python 读 Excel 画折线图,还能直接插回 Excel 文件
本文介绍了一套基于Python的自动化报表绘图方案:使用xlwings读取Excel数据,pandas处理,matplotlib绘制高质量图表,并将图片精准插入原Excel工作表。通过配置中文字体、合理设置索引与定位,可实现数据更新后一键重跑生成新图,避免手动操作。重点提醒6个常见坑点,如中文乱码、图片重复叠加、内存泄漏等,确保脚本稳定高效运行。
2026-09-20 09:56:10
509
原创 PX03-用 Python 给学生随机分配考号:不重复、可复现、一键写回 Excel
本文介绍如何使用 numpy 与 xlwings 实现教育考试中考号的随机分配。通过固定种子确保结果可复现,利用 np.random.permutation() 生成不重复的 1~n 全排列,并一键写入 Excel E 列。强调正式抽签时应移除种子以保证公平性,同时提供常用随机函数速查表,助力高效、可审计的自动化考号分配。
2026-09-19 10:46:45
648
原创 PX02-pandas 透视表完全指南:从长表到宽表,一篇讲透
本文详解 pandas 中 pivot() 与 pivot_table() 的区别与使用场景,通过股票数据透视实例演示如何将长表转为宽表。强调 pivot_table() 在处理重复键时的聚合能力(如 aggfunc="sum"、"mean"),并解析关键参数:values 支持多列透视,aggfunc 可传列表实现多统计量输出。建议初学者统一使用 pivot_table() 以避免报错,提升代码鲁棒性。
2026-09-18 09:37:27
622
原创 Python 批量操作 Excel:10 个高频场景,看完就能上手
本文介绍使用Python批量处理Excel的10个高频场景,涵盖合并、拆分、格式保留等需求。推荐优先用pandas处理纯数据,xlwings保留格式与公式。强调使用pathlib统一路径管理,结合with语句确保资源释放,避免进程残留。提供合并多文件、按字段拆分、列拆分等实用代码,附踩坑提醒:注意sheet名限制、避免自循环读取、正确处理日期与混合类型数据。适合数据、运营、财务人员高效自动化办公。
2026-09-17 09:23:09
467
原创 PE10-Python 正则、文件遍历与网络请求:系统级编程三件套
本文系统介绍Python三大实用库:re(正则表达式)用于文本匹配与提取,os/shutil实现文件系统操作与分类,requests完成HTTP请求及数据下载。涵盖手机号屏蔽、目录遍历、文件归档、压缩打包、网页爬取等实战场景,结合反向引用、非贪婪匹配、二进制处理等技巧,助力高效自动化任务。
2026-09-16 09:03:03
293
原创 PE09-Python 文件读写进阶:同时多文件与数据计算
本文详解文件处理核心技巧:使用 with 语句安全打开多文件,结合逐行读取与格式化写入,实现数据转换、清洗与自动化报表。涵盖读写模式、编码处理、二进制操作、指针控制及 ETL 流程实战,适用于数据清洗、批处理等场景,强调内存效率与异常安全,配套练习强化实践能力。
2026-09-15 10:05:31
384
原创 PE08-Python datetime 与密码生成:时间运算与字符校验实战
A:会覆盖 Python 内置函数,后续用到时出错。:需要做时间计算、用户输入校验、随机生成的开发者。:把所有不通过项收集,一次性反馈,用户体验更好。:解析用户输入日期、数据库时间字段处理。:死循环 + 输入 + 校验 +更底层,主要做时间戳和暂停(面向日期对象(推荐);
2026-09-14 09:19:38
492
原创 PE07-Python JSON与while循环:数据持久化与控制流
本文系统讲解JSON序列化与while循环的核心用法,涵盖数据读写、格式化输出、循环控制及异常处理。通过实战案例展示如何结合JSON文件操作与while循环实现配置管理、用户输入验证和定时任务,适用于处理API数据、配置文件及循环逻辑的开发者。重点强调ensure_ascii=False、indent参数、break/continue/else机制及try-except安全编程,附带练习建议与常见问题解答,助力高效掌握基础开发技能。
2026-09-11 09:08:30
587
原创 PE06-Python文件批量处理:glob、os、shutil 三件套实战
本文介绍Python文件批处理核心三件套:glob(通配符找文件)、os(路径与目录操作)、shutil(复制移动压缩)。通过实战案例演示批量重命名、按扩展名分类、目录打包为ZIP等操作,结合pprint美化输出,适用于开发者高效处理大量文件。配套练习强化技能应用。
2026-09-10 09:48:03
477
原创 PE05-Python函数进阶:参数、作用域与文件操作
文件操作 + 异常处理 + 统计函数,这是日常工作的 80%。上下文管理器自动管理资源(打开/关闭),即使异常也保证关闭。A:函数定义时只执行一次默认值,所有调用共享同一对象。默认参数在函数定义时只创建一次,所有调用共享。声明外层嵌套函数变量(不能到 global)。声明时,赋值操作会创建局部变量而非修改全局。每次打开都会清空原内容!默认参数为什么不能用可变对象?关闭文件句柄,避免资源泄露。Windows 路径用。即使内部抛异常也会调用。
2026-09-09 09:55:24
308
原创 PE04-Python 循环与函数:for/while/控制流关键字精要
<think>我们根据要求生成≤150字的文章摘要。需要概括内容: for/while, break/continue/else, 函数基础, math模块, 适用对象, 核心句等。简洁。</think>本文面向初学Python流程控制的开发者,系统讲解for与while循环、break/continue控制、Python特色的for-else语法,并涉及函数基础与math模块。核心要点:for处理已知次数,while处理未知条件;break终止循环,continue跳过本轮;循环正常结束才执行else。附
2026-09-08 09:04:42
543
原创 PE03-Python字典与集合:键值对操作与美化输出
适用对象:需要处理结构化数据(配置、JSON、用户信息)的开发者阅读时长:约 9 分钟pe021-030环境要求:Python 3.14+、Jupyter 1.1+、Notebook 7.5+、nbconvert 7.17+
2026-09-07 08:56:12
552
原创 PE02-Python 序列操作:切片、range 与列表推导式实战指南
适用对象:掌握基础语法后想进阶 Pythonic 写法的开发者阅读时长:约 10 分钟pe011-020。
2026-09-06 11:55:32
596
原创 PE01-Python基础入门:变量、类型与运算符 核心知识
A:C/Java 是“变量绑定类型”,Python 是“变量绑定对象”;Python 变量更像标签,贴在不同对象上。Python 变量是对象的引用(标签),无需声明类型,赋值即创建。A:这是 IEEE 754 浮点精度问题,金融场景请用。的结果不能直接做数学运算,必须。判断是否为同一对象(常用。
2026-09-04 09:06:45
751
原创 手写数字识别:KNN vs 逻辑回归实战
手写数字是分类任务的「Hello World」,KNN 在 8×8 灰度图上可达 99% 准确率,是「局部结构敏感」任务的王者基线。
2026-09-01 10:19:53
623
原创 关联规则(购物篮分析):支持度 / 置信度 / 提升度
顾客买了面包,多大可能会买牛奶?买了啤酒的人,会不会买尿布?电商推荐、零售促销、货架摆放、捆绑销售。关联规则挖掘"经常一起买"的商品组合,核心是支持度 + 置信度 + 提升度三大指标,提升度 > 1 才算真关联。
2026-08-26 08:30:00
440
原创 PCA 数据降维:原理、Sklearn 实战与自动选 K
标准化先行:执行 PCA 前,必须使用进行标准化。智能选 K:使用让模型自动保留 95% 方差,是实践中的好习惯。正确使用转换:训练用,预测/测试用transform,这与的使用逻辑一致。理解线性局限:PCA 是线性方法,对于复杂的非线性数据结构,应考虑 t-SNE、UMAP 或 Kernel PCA。主成分的含义中的向量定义了新的坐标系,它们是最佳投影方向,但通常不再对应某个原始特征,解释性较差。
2026-08-25 08:00:00
503
原创 数据聚类实战:K-Means、层次聚类与DBSCAN算法详解
K-Means作为默认基线:速度快、效果好,工业首选肘部法则选K值:WCSS拐点 + 业务可解释性共同决定DBSCAN适合异常检测:噪声点天然可识别层次聚类适合小数据:输出树状图便于探索random_state必设:K-Means初始质心影响结果,确保可复现。
2026-08-24 10:25:20
599
原创 文本向量化实战:从词频到 TF-IDF,解锁中文文本处理
例如,“object” 和 “oriented” 单独出现与 “object oriented” 作为一个整体出现,含义完全不同。只考虑词频,但有些词(如 “the”、“是”、“的”)在所有文档中都高频出现,对区分文档类别没有帮助。默认按空格进行分词。这对于英文很有效,但对于中文来说,句子中没有空格,会导致整句话被当作一个“词”来处理,特征提取完全失效。表示只保留在至少两篇文档中都出现的词,这可以有效过滤掉一些只出现一次的噪声词(如人名、错别字)。来抑制这些“停用词”,提升有区分度的关键词的权重。
2026-08-21 16:44:18
287
原创 随机森林:Bagging集成的威力与实战调参指南
默认参数已很强:随机森林开箱即用,无需复杂调参Bagging 抗过拟合:多棵树平均,天然降低方差n_jobs=-1 慎用:Windows 上 joblib 可能有路径编码问题n_estimators 越大越好:但边际收益递减,100-500 性价比最高特征重要性免费送是特征选择利器。
2026-08-20 09:08:33
608
原创 决策树:从原理到 GridSearchCV 调参实战
决策树是一种基础的机器学习模型,通过特征阈值分裂数据,具有可解释性强、无需特征标准化等优势,但容易过拟合。本文介绍了决策树的核心机制、基础训练流程和关键超参数(如max_depth和min_samples_leaf),强调了剪枝的必要性。通过GridSearchCV网格搜索实现参数调优,对比了决策树与随机森林的差异,并提供了调参流程和常见陷阱。核心要点是必须通过双重参数限制防止过拟合,合理使用网格搜索提升模型性能。
2026-08-17 11:42:14
484
原创 数据指标计算完全指南:回归与分类评估核心指标详解
机器学习评估指标速查指南 核心要点: 回归任务:MAE(鲁棒)和MSE(敏感)分别适用于不同场景 分类任务:准确率、精确率、召回率构成评估三角,需结合混淆矩阵分析 概率转换:Sigmoid函数实现实数到概率的映射 特征选择:信息熵衡量概率分布不确定性 业务适配:垃圾邮件检测重精确率,疾病筛查重召回率 典型场景指标选择: 房价预测:MAE/RMSE 广告点击:AUC-ROC 异常检测:召回率+FPR 实现提示: # 常用指标计算 from sklearn.metrics import ( mean_absol
2026-08-13 09:28:36
502
原创 数值标准化:Sklearn StandardScaler 实战指南
机器学习中的标准化(Standardization)是消除特征量纲差异的关键步骤,尤其适用于基于距离、梯度或方差的算法(如KNN、SVM、神经网络、PCA等)。标准化的核心原理是将数据转换为均值为0、标准差为1的分布,公式为 ( z = \frac{x - \mu}{\sigma} )。 在实战中,可使用Sklearn的StandardScaler,但需注意防止数据泄露:仅在训练集上拟合(fit),然后统一转换训练集和测试集(transform)。生产环境中,标准化器应与模型一起保存和加载,确保新数据使用相
2026-08-12 09:44:07
458
原创 多项式特征(PolynomialFeatures):用线性模型拟合非线性关系的利器
本文系统介绍了Scikit-learn中的PolynomialFeatures工具,它通过多项式变换使线性模型能拟合非线性数据。核心内容包括:数学原理(如二次项x²和交叉项xy的生成)、代码实现、单变量/多变量转换示例(特征数量随degree指数增长),以及完整的建模流程(推荐使用Pipeline)。文章重点分析了双变量三次多项式转换的10个特征项,并强调交叉项对特征交互的重要性。最后提供了过拟合防护策略(正则化、特征选择等)和与其他非线性方案的对比表(样条、核方法等)。关键建议是:从小degree开始,结
2026-08-11 09:27:09
459
原创 线性回归:从公式推导到 Sklearn 实战
本文介绍了线性回归的原理与实现。线性回归通过直线拟合数据,核心是求解y = b + w*x中的系数w和截距b。文章对比了正规方程手算(需构造设计矩阵)和Sklearn实现(自动处理截距)两种方法,后者更推荐在实际项目中使用。关键要点包括:Sklearn要求特征矩阵为2D格式,R²分数用于评估模型拟合程度,以及不同场景下的模型选择建议(如小样本用岭回归、大数据用SGD)。文章还指出了数据标准化、异常值处理和共线性等常见陷阱,并提供了多项式回归等扩展应用场景。
2026-08-10 09:15:16
567
原创 Scikit-learn 实战:乳腺癌数据集建模与 stratify 分层拆分详解
本文以乳腺癌数据集为例,展示了从数据探索到模型训练准备的全流程。首先介绍了乳腺癌数据集的基本情况,包括569个样本、30个数值特征和二分类标签。随后演示了如何将特征数据和标签合并为numpy数组,并转换为pandas DataFrame以提高可读性。重点讲解了使用train_test_split进行数据拆分时保持类别比例一致的方法,通过stratify参数实现分层抽样,确保训练集和测试集的类别分布与原始数据相同。文章还对比了随机拆分和分层拆分的结果差异,并讨论了分层拆分的适用场景,最后提供了完整的代码模板。
2026-08-09 09:43:52
710
原创 Scikit-learn 类别编码:LabelEncoder 与 OneHotEncoder 完全指南
摘要速查表 核心区别 LabelEncoder → 单列整数编码(目标变量y) OneHotEncoder → 多列二元矩阵(特征变量X) 代码模板 # LabelEncoder(y) from sklearn.preprocessing import LabelEncoder le = LabelEncoder() df['y'] = le.fit_transform(df['y']) # OneHotEncoder(X) from sklearn.preprocessing import OneHotE
2026-08-07 09:15:21
487
原创 Scikit-learn 入门实战:IRIS 鸢尾花数据集完整建模流程
本文以经典的IRIS鸢尾花数据集为例,完整展示了机器学习标准流程,包括数据加载、探索分析、训练测试拆分、逻辑回归建模和模型评估。数据集包含150个样本,4个特征(花萼/花瓣长宽),均匀分布在3种鸢尾花类别。通过scikit-learn实现80/20数据拆分,建立逻辑回归模型,最终在测试集上达到100%准确率。文章详细介绍了混淆矩阵和分类报告的解读方法,并提供了完整代码模板,帮助读者快速掌握机器学习基础实践。
2026-08-06 08:30:00
373
原创 Pandas 特征提取:从原始数据到模型可用特征的 5 种技法
Pandas 特征提取速成指南 摘要:本文演示了使用 Pandas 从复杂数据中提取数值特征的 5 种核心方法: 列表计数:map(len) 统计列表元素数量 元素判断:map(lambda) 生成二元标志特征 字符串拆分:str.split(expand=True) 解构标签数据 缺失统计:isnull().sum(axis=1) 计算行缺失值 格式清洗:str.replace().astype() 转换字符串数字 配套提供代码示例、结果展示及常见问题解答(如 map vs apply 选择),适合数据预
2026-08-05 08:00:00
469
原创 Pandas 数值离散化:从连续数据到有序区间的完整指南
数值离散化是数据预处理中的重要步骤,pd.cut等宽划分:适用于探索性分析,无先验知识时使用指定边界:适用于业务规则明确的场景添加标签:提升数据的可读性和业务解释性虚拟编码:为机器学习模型准备数值输入通过合理使用离散化技术,可以将连续数值转换为更具业务意义的类别特征,提升模型的可解释性和稳定性。ant-exercises-sklearn: scikit-learn 编程练习 100例刚开始学习数据集的处理,在这里同步学习成果、激励自己坚持到底。
2026-08-04 13:12:14
562
原创 Scikit-learn 缺失值处理:SimpleImputer 完整指南
本文系统介绍了数据集中缺失值的处理方法,重点讲解了SimpleImputer工具的使用。文章详细阐述了四种填充策略(均值、常数、众数、批量填充)的具体实现和适用场景,并提供了进阶技巧如非缺失子集计算、fit-transform分离、Pipeline集成等。同时总结了策略选型决策树和常见陷阱,包括维度错误、数据泄露、类别不平衡等问题。最后给出了参数速查表,为数据预处理提供实用指导。
2026-07-30 10:58:34
709
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅