泰坦尼克号生死预测(决策树)

# -*- coding: utf-8 -*-

from sklearn.naive_bayes import MultinomialNB
from sklearn.datasets import fetch_20newsgroups
from sklearn.model_selection import train_test_split
from  sklearn.feature_extraction.text import TfidfVectorizer
from  sklearn.metrics import classification_report
import pandas as pd
from sklearn.feature_extraction  import DictVectorizer
from sklearn.tree import DecisionTreeClassifier
def mul():
    # 获取20类新闻的数据集合
    news=fetch_20newsgroups(subset='all')
    # 进行数据分割
    x_train,x_test,y_train,y_test=train_test_split(news.data,news.target,test_size=0.25)
    #文章的特征值抽取(重要性)
    tf=TfidfVectorizer()
    # 进行特征抽取
    x_train=tf.fit_transform(x_train)
    print(tf.get_feature_names())
    x_test=tf.transform(x_test)

    mu=MultinomialNB(alpha=1.0)
    # print("训练集",x_train.toarray())
    mu.fit(x_train,y_train)
    y_predict=mu.predict(x_test)
    print("预测文章的类别",y_predict)
    print("准确率",mu.score(x_test,y_test))
    print(classification_report(y_test,y_predict,target_names=news.target_names))
    return None

def desc():
    taitan=pd.read_csv("http://biostat.mc.vanderbilt.edu/wiki/pub/Main/DataSets/titanic.txt")
    x=taitan[['pclass','age','sex']]
    y=taitan['survived']
    print(x)
    # 缺失值处理
    x['age'].fillna(x['age'].mean(),inplace=True)
    # 分割数据
    x_train,x_test,y_train,y_test=train_test_split(x,y,test_size=0.25)
    # 特征抽取
    dv=DictVectorizer(sparse=False)
    x_train=dv.fit_transform(x_train.to_dict(orient="records"))
    print(dv.get_feature_names())
    x_test=dv.transform(x_test.to_dict(orient="records"))
    print(x_train)

    dc=DecisionTreeClassifier()
    dc.fit(x_train,y_train)
    print("预测准确率",dc.score(x_test,y_test))

    return None

if __name__=="__main__":
    desc()

 

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
92讲视频课+16大项目实战+课件源码  为什么学习数据分析?       人工智能、大数据时代有什么技能是可以运用在各种行业的?数据分析就是。      从海量数据中获得别人看不见的信息,创业者可以通过数据分析来优化产品,营销人员可以通过数据分析改进营销策略,产品经理可以通过数据分析洞察用户习惯,金融从业者可以通过数据分析规避投资风险,程序员可以通过数据分析进一步挖掘出数据价值,它和编程一样,本质上也是一个工具,通过数据来对现实事物进行分析和识别的能力。不管你从事什么行业,掌握了数据分析能力,往往在其岗位上更有竞争力。   本课程共包含五大模块: 一、先导篇: 通过分析数据分析师的一天,让学员了解全面了解成为一个数据分析师的所有必修功法,对数据分析师不在迷惑。  二、基础篇: 围绕Python基础语法介绍、数据预处理、数据可视化以及数据分析与挖掘......这些核心技能模块展开,帮助你快速而全面的掌握和了解成为一个数据分析师的所有必修功法。 三、数据采集篇: 通过网络爬虫实战解决数据分析的必经之路:数据从何来的问题,讲解常见的爬虫套路并利用三大实战帮助学员扎实数据采集能力,避免没有数据可分析的尴尬。  四、分析工具篇: 讲解数据分析避不开的科学计算库Numpy、数据分析工具Pandas及常见可视化工具Matplotlib。  五、算法篇: 算法是数据分析的精华,课程精选10大算法,包括分类、聚类、预测3大类型,每个算法都从原理和案例两个角度学习,让你不仅能用起来,了解原理,还能知道为什么这么做。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值