Python大数据-对淘宝用户的行为数据分析(1)

最新推荐文章于 2024-10-02 10:53:34 发布

2401_84003733

最新推荐文章于 2024-10-02 10:53:34 发布

阅读量330

点赞数 3

分类专栏：程序员文章标签： python 大数据数据分析

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/2401_84003733/article/details/137687792

版权

本文通过Python对淘宝用户行为数据进行分析，包括计算总PV值、日PV和UV的变化，以及不同时间下的流量分布。通过绘制图表展示每天的流量和独立访客数，揭示流量高峰和用户访问模式。此外，还探讨了用户行为漏斗模型，计算了从浏览到支付的转化率，指出用户流失的主要环节，为优化提供方向。

摘要由CSDN通过智能技术生成

data[‘hour’] = data[‘time’].map(lambda x:x.split(’ ')[1])

data[‘date’]=pd.to_datetime(data[‘date’])

data[‘hour’] = data[‘hour’].astype(‘int32’)

data.head()

data.dtypes

可以看到目前date和Hour的类型已经成功转换，符合我们的预期，查看表格中是否有空数据，并查看一下表格的量

3、查看是否有缺失值

data.isnull().sum()

data.shape

可以看到数据中并没有空数据，数据的规模在1000万左右，分为6列，依次为用户id、商品id、用户行为类型、时间。其中用户行为类型中1代表点击（当做pv），2代表collect（收藏），3代表cart（加入购物车）数据较为完整，不需要继续进行清洗，对数据进行分析

五、数据分析

流量指标分析：流量指标是指用户在某一个网站操作的每一个步骤记录的指标，埋点数据，PV是指其浏览量，UV代表独立访客数，访问深度代表每个独立访客的浏览量，页面跳出率则是指浏览某个页面离开的次数/这个页面的全部访问次数

1、不同时间下PV、UV的流量变化情况

1）每天的PV、UV变化情况

首先计算一下总流量

总PV值=数据条数

import pandas as pd

import numpy as np

import matplotlib.pyplot as plt

import os

data.shape[0]

总流量为12256906，在计算一下日平均流量、日平均独立访客数

##日PV

pv_daily = data.groupby([‘date’])[‘user_id’].count().reset_index().rename(columns={‘user_id’:‘pv_daily’})

pv_daily.head()

日平均独立访客数与日平均流量的区别在于要进行去重

##日UV

uv_daily = data.groupby([‘date’])[‘user_id’].apply(lambda x:x.drop_duplicates().count()).reset_index().rename(columns={‘user_id’:‘uv_daily’})

uv_daily.head()

s=uv_daily[‘uv_daily’]

pv_daily[‘uv_daily’]

最低0.47元/天解锁文章

关注

3
点赞
踩
3

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。