- 学习:知识的初次邂逅
- 复习:知识的温故知新
- 练习:知识的实践应用
目录
一,原题力扣链接
二,题干
Table:
Activity
+--------------+---------+ | Column Name | Type | +--------------+---------+ | player_id | int | | device_id | int | | event_date | date | | games_played | int | +--------------+---------+ (player_id, event_date) 是这个表的两个主键(具有唯一值的列的组合) 这个表显示的是某些游戏玩家的游戏活动情况 每一行是在某天使用某个设备登出之前登录并玩多个游戏(可能为0)的玩家的记录请编写解决方案,描述每一个玩家首次登陆的设备名称
返回结果格式如以下示例:
示例 1:
输入: Activity table: +-----------+-----------+------------+--------------+ | player_id | device_id | event_date | games_played | +-----------+-----------+------------+--------------+ | 1 | 2 | 2016-03-01 | 5 | | 1 | 2 | 2016-05-02 | 6 | | 2 | 3 | 2017-06-25 | 1 | | 3 | 1 | 2016-03-02 | 0 | | 3 | 4 | 2018-07-03 | 5 | +-----------+-----------+------------+--------------+ 输出: +-----------+-----------+ | player_id | device_id | +-----------+-----------+ | 1 | 2 | | 2 | 3 | | 3 | 1 | +-----------+-----------+
三,建表语句
import pandas as pd
data = [[1, 2, '2016-03-01', 5], [1, 2, '2016-05-02', 6], [2, 3, '2017-06-25', 1], [3, 1, '2016-03-02', 0], [3, 4, '2018-07-03', 5]]
activity = pd.DataFrame(data, columns=['player_id', 'device_id', 'event_date', 'games_played']).astype({'player_id':'Int64', 'device_id':'Int64', 'event_date':'datetime64[ns]', 'games_played':'Int64'})
四,分析
题解:
表:游戏表
字段:游戏id,设备id,游玩日期,游戏次数
求每个游戏id第一次游玩的设备id
第一步 以游戏id分组 以日期排序 生成一个排序列
activity['rn'] = activity.groupby('player_id')['event_date'].rank(method='first')
第二步,过滤rn=1 然后取对应的列即可
五,Pandas解答
import pandas as pd
def game_analysis(activity: pd.DataFrame) -> pd.DataFrame:
activity['rn'] = activity.groupby('player_id')['event_date'].rank(method='first')
df = activity[activity['rn']==1] #过滤 取第一
df2 = df[['player_id','device_id']] #取指定的列
return df2
六,验证
七,知识点总结
- Pandas分组的运用 API:groupby
- 使用 groupby 和 rank 方法实现类似 row_number 的功能
- Pandas分组排序的运用模拟sql中(row_nunber) API:rank
- Pandas经典案例 分组求top1
- 学习:知识的初次邂逅
- 复习:知识的温故知新
- 练习:知识的实践应用