2024 年(第 7 届)“泰迪杯”数据分析技能赛B 题 特殊医学用途配方食品数据分析 完整代码 结果 可视化分享

一、背景特殊医学用途配方食品简称特医食品,是指为满足进食受限、消化吸收障碍、代谢素乱或者特定疾病状态人群对营养素或者膳食的特殊需要,专门加工配置而成的配方食品,包括0月龄至12月龄的特殊医学用途婴儿配方食品和适用于1岁以上的特殊医学用途配方食品。在医学营养管理与治疗方面起着重要作用。
特殊医学用途配方食品在生产和销售前需要经过严格的审批和注册过程,包括安全性、有效性的评估。所以在我国对于特殊医学用途配方食品的审核有着非常严格的规定。截至 2024 年4月,国内仅审批通过了 182 款特医食品(含已注销)。二、目标
1.提取 182款特殊医学用途配方食品产品标签、说明书(以下简称特医食品说明书)中的相关数据,并对提取的数据及 data.xlsx 数据进行预处理。
2.统计 182 款特医食品生产概况并可视化。
3.构建特医食品推荐系统。
三、任务
data.xlsx记录了 182 款特医食品的基本信息,特医食品说明书文件夹中包含 182 款特医食品说明书。请根据提供的数据,完成以下任务并撰写报告,在报告中详细描述各项任务的处理思路、过程及必要的结果。
任务1数据预处理
任务1.1读取182款特医食品说明书,按照表1的要求提取【营养成分表】中“每100k]”列的指定营养成分数据,将提取的数据保存到文件“result1.xlsx”中,同时在报告中列出每 100kJ(千焦)中蛋白质含量最高的三种特医食品,格式如表1(注意营养成分的单位)。

import pdfplumber
import pandas as pd
import os
import re

# 文件夹路径
folder_path = r"D:\desk\B题-特殊医学用途配方食品数据分析\数据\特医食品说明书"

# 要提取的营养成分及对应的列名
nutrient_mapping = {
    '能量': '能量(kJ)',
    '脂肪': '脂肪(g)',
    '碳水化合物': '碳水化合物(g)',
    '蛋白质': '蛋白质(g)',
    '钠': '钠(mg)',
    '氯': '氯(mg)',
    '钾': '钾(mg)',
    '磷': '磷(mg)',
    # 如果需要更多营养成分,可以在这里添加
}

# 初始化一个空的列表,用于存储所有的结果
results = []

# 获取文件夹中所有的PDF文件
pdf_files = [f for f in os.listdir(folder_path) if f.endswith('.pdf')]

for pdf_file in pdf_files:
    file_path = os.path.join(folder_path, pdf_file)
    # 提取注册证号,假设文件名就是注册证号
    registration_number = os.path.splitext(pdf_file)[0]

    # 初始化一个空的列表,用于存储所有的DataFrame
    dfs = []
    # 保存最新的表头
    last_header = None

    # 打开 PDF 文件
    with pdfplumber.open(file_path) as pdf:
        table_found = False  # 标记是否找到表格

 

 

任务1.2提取182款特医食品说明书中【产品类别】【组织状态】【适用人群】的数据,在 data.xlsx 数据中新增“产品类别”、“组织状态”、“适用人群”三列。以表2的格式将提取的数据保存到文件“result2.xlsx”中,同时在报告中列前5款特医食品的结果(须说明特殊情况的处理)。

任务 1.3 根据提取的【适用人群】信息,在 result2.xlsx 中新增“适用人群类别”列,对 182款特医食品的适用人群进行归类,类别分为“特医婴配食品”和“1岁以上特医食品”两种,将结果保存到文件“result2.xlsx”中。注3“特医婴配食品”是针对 0-12月龄人群的特殊医学用途配方食品,“婴儿”特指 0-12 月龄人群。

任务1.4特殊医学用途配方食品注册号的格式为:国食注字TY+4位年号+4位顺序号,顺序号第1位数字为“5”表示该食品为进口产品,顺序号第1位数字为“0”表示该食品为国产产品;4位年号为该食品的登记年份。基于任务1.3的result2.xlsx文件,新增“产品来源”和“登记年份”两列,提取 182 款特医食品的产品来源和登记年份数据其中产品来源分为“国产产品”和“进口产品”两种。以表3的格式将结果保存到文件“result2.xlsx”中,同时在报告中列出前5款特医食品任务 1.3和任务 1.4的结果。

任务2生产概况可视化
任务 2.1统计不同登记年份不同产品来源的特医食品获批量,绘制双折线图,并在报告中对结果进行必要分析。


任务2.2根据特医食品产品来源与适用人群类别绘制内层为饼图的旭日图,其中内层表示适用人群类别,外层表示不同适用人群类别的产品来源分布,并在报告中对结果进行必要分析。


任务2.3统计不同产品类别的特医食品获批量,按获批量进行降序排列,绘制柱状图,x轴为产品类别,y轴为获批量,并在报告中对结果进行必要分析。


任务2.4在同一坐标系中,分别用不同颜色绘制182款特医食品脂肪和蛋白质含量的频数分布直方图,并在报告中对结果进行必要分析。


任务 2.5 根据 182款特医食品的“适用人群”绘制词云图,并在报告中分析特医食品适用人群特征。
任务3特医食品推荐


在任务1和任务2的基础上,合理运用现有数据完成推荐任务。基于客户的需求描述(如年龄段、症状、特殊说明),从 182款特医食品中自动筛选出符合条件的产品选项,为客户提供个性化的特医食品推荐服务。实现方式不限,可以使用推荐算法或大型,但须在报告中详细描述实现过程、推荐逻辑以及推荐结果。

完整代码↓:

【标】第十泰迪数据挖掘挑战B是一个以数据分析和挖掘为核心的竞项目,参者需要通过解决一系列问来展示他们的技能和创新思维。这个压缩包包含了参者对B完整解答以及实现这些解答的源代码。 【描述】这个描述简单明了,表明压缩包中的内容是关于“第十泰迪数据挖掘挑战”的B解决方案。"完整代码"意味着文件中不仅有分析思路和方法论,还有实际的编程实现,这对于学习数据挖掘和机器学习的初学者或爱好者来说是非常宝贵的资源。 【标签】虽然没有提供具体的标签,但我们可以根据标和描述推断出一些关键标签,如“数据挖掘”、“数据分析”、“机器学习”、“Python编程”、“挑战”、“比策略”。 【压缩包子文件的文件名称列表】 1. 第一问第一小问.zip:这可能是参者对B第一部分的第一小问的解答和代码,可能涉及到数据预处理、探索性数据分析(EDA)和初步模型构建。 2. 第一问第二小问.zip:这涵盖了第一部分的第二个问,可能涉及更复杂的数据建模、特征工程或者模型优化。 3. 第二问第一小问.zip:这是针对B第二部分的第一个问,可能涉及到不同的数据挖掘任务,如分类、聚类或预测。 4. 第二问第二小问.zip:对应第二部分的第二个问,可能需要参者进行更深入的分析,如异常检测、关联规则学习或者时间序列分析。 5. 问二-异常时间点分析 (1).ipynb:这是一个Jupyter Notebook文件,专门针对问二中的异常时间点分析,可能包含了数据可视化、统计测试和异常检测算法的实现。 综合以上信息,我们可以了解到这个压缩包是围绕数据挖掘挑战的解过程,涉及到多个阶段的问解决,涵盖数据预处理、建模、模型评估和异常检测等核心步骤。参者可能使用了Python等编程语言,利用了如Pandas、Numpy、Scikit-learn等库进行数据分析和建模。通过研究这些文件,学习者可以深入理解如何在实际问中应用数据挖掘技术,并且能学习到如何组织和呈现一个完整数据挖掘项目。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值