算法
文章平均质量分 86
THMAIL
985 C9 本硕毕业,9年开发经验,从底层算法架构到前沿大模型开发,从软件开发设计到安全逆向工程,涉猎广、钻研深。大学时期开始独立编写游戏辅助程序赢得人生第一桶金,从此走上程序员之路。先后任职于多家互联网大厂核心技术团队,主导并参与多款亿级用户产品的底层架构搭建与核心功能开发。在国际顶级开发者大赛中,凭借突破性的技术方案与极致的代码实现,多次力压全球顶尖团队摘得桂冠
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
随机森林的 “Bootstrap 采样” 与 “特征随机选择”:如何避免过拟合?(附分类 / 回归任务实战)
随机森林通过Bootstrap采样和特征随机选择有效避免过拟合。Bootstrap采样为每棵树生成独特训练数据,特征随机选择限制节点分裂时的候选特征,两者协同增强模型多样性。实战部分指导搭建Python环境,使用scikit-learn库实现随机森林分类和回归任务。这种集成学习方法通过集体决策提高模型泛化能力,相比单一决策树表现更稳健。原创 2025-08-29 08:38:02 · 1102 阅读 · 0 评论 -
朴素贝叶斯的 “条件独立性假设”:打破假设的改进方案(贝叶斯网络实战)
本文探讨了朴素贝叶斯分类器的局限性及其改进方案。文章首先指出朴素贝叶斯的核心问题在于其"条件独立性假设",即假设所有特征完全独立,这在现实中往往不成立。然后介绍了贝叶斯网络作为解决方案,它通过有向无环图表达变量间的依赖关系,能够更准确地建模现实世界的复杂关联。文章包含三个主要部分:1) 分析朴素贝叶斯的基本原理和假设缺陷;2) 介绍贝叶斯网络的概念及其结构优势;3) 提供Python实战指导,包括环境搭建、数据模拟和模型构建。通过医学诊断案例,展示了如何用贝叶斯网络处理特征相关性,从而提原创 2025-08-29 08:37:00 · 1156 阅读 · 0 评论 -
模型评估指标 “ROC-AUC”:从混淆矩阵到统计学意义,为什么比准确率更可靠?(医疗诊断场景实战)
摘要: 在医疗诊断等类别不均衡场景中,准确率(Accuracy)因易受多数类支配而失效。ROC-AUC通过综合评估模型在所有决策阈值下的表现,成为更可靠的评估指标。其核心基于混淆矩阵的四大指标(TPR、FPR、精确率、召回率),绘制ROC曲线并计算曲线下面积(AUC)。AUC的统计学意义是:模型对正样本的预测概率高于负样本的概率,值越接近1,模型区分能力越强。相比单一阈值指标,ROC-AUC能全面反映模型在“误诊”与“漏诊”间的权衡能力,尤其适合医疗等高代价漏诊场景。原创 2025-08-29 08:35:54 · 1335 阅读 · 0 评论 -
逻辑回归的 Sigmoid 函数:为什么是它?从概率解释到梯度消失问题解决
逻辑回归选择Sigmoid函数作为激活函数,主要基于以下几点原因:1) 其输出值在(0,1)区间内,可直接解释为概率;2) 作为伯努利分布的典则连接函数,从概率论角度看具有严格的数学基础;3) 其导数计算简便高效,便于梯度下降优化。虽然Sigmoid函数在深度学习中面临梯度消失问题,但在传统逻辑回归模型中,它仍是连接线性预测与概率输出的理想桥梁。原创 2025-08-29 08:35:08 · 1060 阅读 · 0 评论 -
线性回归的 “最小二乘法”:从矩阵求导到数值稳定性优化(附 Python 手动实现)
线性回归的最小二乘法:从理论到实践 本文系统介绍了线性回归的核心原理——最小二乘法。首先通过房产分析案例建立直观理解,定义了残差和损失函数的概念。随后将问题转化为矩阵形式,推导出正规方程解w=(X^TX)^-1X^Ty。文章强调从理论推导到代码实现的重要性,计划用纯Python和NumPy实现该算法,并探讨数值稳定性优化等实际问题。全文贯穿数学推导与工程实践的结合,旨在帮助读者深入理解这一基础而重要的机器学习方法。原创 2025-08-29 08:34:15 · 851 阅读 · 0 评论 -
KNN 的 “距离度量” 选择:欧氏距离 vs 曼哈顿距离,如何适配不同数据分布?(附高维数据降维后 KNN 优化)
这听起来很玄乎,但可以用一个简单的比喻来理解。原创 2025-08-29 08:32:44 · 1150 阅读 · 0 评论 -
异常检测的 “孤立森林”:二叉树分裂逻辑与工业设备故障检测落地
想象一下,你是一家大型工厂的负责人,一条价值连城的生产线正在全速运转。突然,一个不起眼的轴承因为微小的裂纹而应声断裂,整条生产线瞬间陷入停滞。数小时的停机、昂贵的维修费用、延迟的订单……这一切的根源,仅仅是一个未能被及时发现的“异常信号”。在工业4.0的浪潮下,设备无时无刻不在产生海量的数据:温度、压力、振动频率、转速……这些数据就像机器的“心电图”。经验丰富的老师傅能通过细微的异响或异常的震动,判断设备是否存在隐患。但我们能否让机器学会这种“直觉”,在灾难发生前,自动、精准地发出预警?答案是肯定的。原创 2025-08-29 08:31:36 · 1019 阅读 · 0 评论 -
聚类算法 K-Means 的 “肘部法则”:原理推导与实际业务中聚类数量确定(用户分群实战)
为何我们需要“客户分群”?想象一下,你是一家成长迅速的电商平台的运营负责人,手里掌握着成千上万的用户数据。双十一大促在即,你计划推送一系列优惠活动,但问题来了:是给所有用户推送同样的信息,还是针对不同用户“看人下菜”?凭直觉我们都知道,向一位刚刚购买了高端显卡的电脑发烧友推送母婴用品折扣,大概率是石沉大海。这种“一刀切”的营销方式,不仅浪费了宝贵的营销资源,还可能引起用户的反感。我们真正想要的,是——将合适的内容,在合适的时间,推送给合适的人。要实现这个目标,第一步就是要读懂我们的用户。原创 2025-08-29 08:28:19 · 1465 阅读 · 0 评论 -
一篇文章带你认识 PID算法
上述例子中,根据kp取值不同,水位最终都会达到1米,kp取值越大则上升的越快,kp取值越小则上升的越慢,不存在稳态误差。但是,假设这个水缸每次加水都会漏掉0.1米高度的水这种情况下,假设kp仍然取0.5,那么经过几次加水,水缸中的水位到0.8时,误差error=0.2. 每次往水缸中加水的量为u=0.5*0.2=0.1米,同时,缸里每加水0.1米,又会流出0.1米,也就是说,设定的目标值为1米,但是这种算法使系统水位在达到0.8米后就不再变化,由此产生的误差就是稳态误差了。式中的kd是一个系数项。转载 2024-04-08 16:09:52 · 434 阅读 · 0 评论 -
leetcode环境错误大全
问题1:Python测试没问题,提交不通过错误详情页:https://leetcode-cn.com/submissions/detail/238734431/解决:leetcode测试和提交环境不同,测试环境是每次都会给你开个新的执行环境,提交环境则比较混乱,不会重新初始化一个执行环境给你:报错的代码:class CQueue: self.temp_stack = [] self.queue = [] def __init__(self): pass def原创 2021-11-15 11:16:00 · 4747 阅读 · 0 评论 -
求解模线性方程
原文:https://www.cnblogs.com/ACSeed/archive/2013/01/31/2887248.html 1)求解线性不定方程 ax + by = c 先求出一组解, 然后考虑如何表示通解, 设d = gcd(a, b), 假设c不是d的倍数, 则左边是d的倍数而右边不是, 则方程无解, 所以方程有解当且仅当d | c. 设c = c' * d,...转载 2018-12-04 11:45:39 · 928 阅读 · 0 评论
分享