自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(10)
  • 收藏
  • 关注

原创 数据应用与分析学习总结

本文总结了数据分析从基础到进阶的全流程实践心得。通过《一元线性回归》《DBSCAN聚类》等案例,作者系统梳理了数据预处理、探索性分析、回归预测、分类建模和聚类分析的核心方法。重点包括:数据清洗的"地基意识"(缺失值处理、异常值修正)、模型选择的"实用主义"(根据业务需求匹配算法)、结果落地的"价值导向"(将技术指标转化为业务动作)。文章特别强调数据分析的本质是"用数据解决问题的思维",而非单纯的技术应用,最终目标是将数字结论转化

2026-01-05 09:22:17 1057

原创 Hadoop技术学习后心得

本文总结了Hadoop技术的学习心得,重点介绍了Hadoop核心组件(HDFS、MapReduce、YARN)的理论知识和实践应用。通过搭建集群环境、编写MapReduce程序(如单词统计)等实践,掌握了数据处理优化技巧。文章还展示了代码模块化、封装和测试的方法,并提出了未来学习Hive、Spark等生态组件,以及机器学习与大数据结合的研究方向。全文包含从基础概念到项目优化的完整学习路径,为大数据技术学习提供了实用参考。

2025-12-22 22:23:05 690

原创 螺蛳粉数据可视化分析心得

本文介绍了一个基于Flask+ECharts的螺蛳粉销量可视化大屏项目。该项目采用Flask作为后端框架提供数据接口,MySQL存储数据,ECharts实现前端可视化展示。系统包含六大核心功能模块:省份销量柱状图、每日销量折线图、省份销量地图、口味占比饼图、城市词云图和销量数字统计,通过多维度数据可视化完整呈现螺蛳粉销售情况。文章详细阐述了技术架构设计、接口实现和前端图表配置,展示了从数据存储到前端展示的全流程解决方案,为食品行业数据分析提供了可视化工具支持。

2025-10-25 15:07:20 882

原创 数据可视化的心得

本文介绍了数据可视化的重要性及其在螺蛳粉销售分析中的应用实践。数据可视化通过图表、地图等形式简化复杂信息,广泛应用于商业决策和趋势分析。案例展示了如何利用Python、MySQL和ECharts等技术,实现从数据获取到可视化展示的全流程,包括销售趋势折线图、地理热力图、产品成分饼图和用户评价词云等多元分析维度。该项目不仅为螺蛳粉市场分析提供了直观工具,还体现了数据可视化在识别消费偏好、优化营销策略方面的商业价值,同时强调了数据质量和可视化准确性等需要注意的局限性。

2025-10-20 09:33:06 959

原创 脱发因素数据分析

脱发数据分析与预测研究摘要 本研究基于Python工具对脱发影响因素进行系统分析。通过Pandas库处理包含遗传、荷尔蒙、医疗状况等12个维度的脱发数据集,包括数据清洗、缺失值处理和二值化转换。采用Matplotlib可视化分析,发现脱发与年龄、压力水平、遗传因素等存在显著关联。研究构建了随机森林和支持向量机预测模型,通过特征工程和标签编码处理分类变量。结果显示遗传与高压力组合因素对脱发影响尤为突出。热力图分析揭示了各因素间的相关性,为脱发防治提供了数据支持。该研究为理解脱发机制和开发预测工具提供了有效方法

2025-06-30 11:19:28 840

原创 【无标题】

该数据集记录了可能导致脱发的多种因素,包括遗传、荷尔蒙变化、医疗状况、药物、营养缺乏等12个特征。数据预处理包括导入分析工具包和查看数据样本。研究目标包括:1)构建脱发预测模型;2)分析各因素对脱发的影响程度;3)提出个性化预防建议。采用随机森林和支持向量机等算法进行建模分析,后续将评估模型性能并生成可视化结果。数据集包含年龄、压力水平等连续变量和吸烟习惯等分类变量,目标变量为二元脱发标识(1/0)。

2025-06-26 16:26:21 832

原创 心脏病数据分析

本研究基于1314例心脏病患者数据,通过系统分析和机器学习建模揭示心脏病风险因素。数据清洗阶段处理了极端异常值和逻辑错误(如收缩压/舒张压反序)。关键发现:心脏病患者的CK-MB和肌钙蛋白水平显著高于非患者,男性及高龄(>55岁)人群风险更高。构建的XGBoost模型表现最优(AUC=0.94),优于逻辑回归和SVM,其核心预测因子为肌钙蛋白(重要性35%)、CK-MB(28%)和年龄(22%)。研究为临床早期筛查提供了数据支持,建议结合血液检测指标与树模型进行风险评估。

2025-06-19 21:24:45 1051

原创 拓展任务5.2 聚类

本文展示了电商订单数据的读取与初步分析过程。首先导入pandas、numpy、matplotlib等数据分析库,并设置中文显示和忽略警告。然后读取订单数据,数据包含订单编号、用户信息、商品编号、金额(订单金额和付款金额)、渠道信息(渠道编号和平台类型)、时间信息(下单和付款时间)以及是否退款等字段。通过数据预览可以看到前5条记录的具体情况,包括不同平台的订单(微信公众号和APP)、不同金额的交易以及付款状态等基础信息。这为进一步的电商数据分析奠定了基础。

2025-06-12 21:17:24 14480

原创 项目5.1抑郁症数据分析

数据可视化分析,用饼图展示患者性别分布,其中女性患者 5361 人、男性患者 2927 人;用柱状图呈现年龄分布,19 - 40 岁年龄段人数最多,有 4256 人,80 岁以上人数最少,为 44 人;用折线图说明就诊次数分布,(0,5] 区间就诊人数最多,达 2690 人,(200,300] 区间人数最少,为 13 人;通过词云图展示患者标签分布,“抑郁症”“抑郁” 等词汇出现频率较高;用饼图显示就诊科室分布,精神科就诊人数最多,为 4601 人。

2025-06-06 13:51:09 726

原创 学习Python的心得体会

函数可以接受参数并返回结果,提高了代码的模块化程度。在处理复杂逻辑时,将不同功能的代码分别封装成函数,使整个程序结构更加清晰。

2024-12-20 10:26:00 982

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除