clean

Lemon_guess

于 2021-07-23 12:58:34 发布

阅读量95

点赞数

分类专栏： python-bobo老师数据分析

本文链接：https://blog.csdn.net/lemonguess/article/details/119030650

版权

python-bobo老师数据分析专栏收录该内容

7 篇文章 2 订阅

订阅专栏

# 将list转化为dataframe
name_pd = pd.DataFrame(name)
year_pd = pd.DataFrame(year)
rate_pd = pd.DataFrame(rate)
director_pd = pd.DataFrame(director)
scriptwriter_pd = pd.DataFrame(scriptwriter)
protagonist_pd = pd.DataFrame(protagonist)
genre_pd = pd.DataFrame(genre)
country_pd = pd.DataFrame(country)
language_pd = pd.DataFrame(language)
length_pd = pd.DataFrame(length)
# 拼接
movie_data = pd.concat([name_pd,year_pd,rate_pd,director_pd,scriptwriter_pd,protagonist_pd,genre_pd,country_pd,language_pd,length_pd],axis=1)
movie_data.columns=['电影','年份','评分','导演','编剧','主演','类型','国家/地区','语言','时长']

#保留电影中文名
f = lambda x: re.split(' ',x)[0]
movie_data['电影'] = movie_data['电影'].apply(f)
#删去冗余部分
g = lambda x: x[4:-1] + x[-1]
movie_data['导演'] = movie_data['导演'].apply(g)
movie_data['编剧'] = movie_data['编剧'].apply(g)
movie_data['主演'] = movie_data['主演'].apply(g)
movie_data.head()

# 输出
outputpath='c:/Users/zxw/Desktop/修身/与自己/数据分析/数据分析/爬虫/豆瓣/data/movie.csv' ##这里需要改路径名
movie_data.to_csv(outputpath,sep=',',index=False,header=True,encoding='utf_8_sig')

————————————————
版权声明：本文为CSDN博主「晓炜」的原创文章，遵循CC 4.0 BY-SA版权协议，转载请附上原文出处链接及本声明。
原文链接：https://blog.csdn.net/weixin_43084570/article/details/108637208

def clean_title(title):

    if title == 'nan':
        return 'NaN'
    
    if title[0] == '[':
        title = title[1: title.find(']')]
        
    if 'by' in title:
        title = title[:title.find('by')]
    elif 'By' in title:
        title = title[:title.find('By')]
        
    if '[' in title:
        title = title[:title.find('[')]

    title = title[:-2]
        
    title = list(map(str.capitalize, title.split()))
    return ' '.join(title)

df['Title'] = df['Title'].apply(clean_title)

Lemon_guess

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
clean

# 将list转化为dataframename_pd = pd.DataFrame(name)year_pd = pd.DataFrame(year)rate_pd = pd.DataFrame(rate)director_pd = pd.DataFrame(director)scriptwriter_pd = pd.DataFrame(scriptwriter)protagonist_pd = pd.DataFrame(protagonist)genre_pd = pd.DataFrame(
复制链接

扫一扫

专栏目录