使用pyspark统计用户访问(uv)TOP_N

2 篇文章 0 订阅
2 篇文章 0 订阅

使用pyspark统计用户访问TOP_N

说明:使用pyspark库uv的TOP_N实现

一、数据说明
  1. 用户访问数据,IP地址,URL
    在这里插入图片描述
二、代码实现
  1. 导入pyspark及环境配置
import os
from pyspark import SparkContext
import time
JAVA_HOME='/root/bigdata/jdk'
#向系统环境变量中添加 JAVA_HOME路径
os.environ['JAVA_HOME']=JAVA_HOME
PYSPARK_PYTHON = "/miniconda2/envs/py365/bin/python"
# PYSPARK使用Python位置
os.environ["PYSPARK_PYTHON"] = PYSPARK_PYTHON
# PYSPARK驱动使用Python的位置
os.environ["PYSPARK_DRIVER_PYTHON"] = PYSPARK_PYTHON
  1. 启动处理
if __name__ == '__main__':
    #创建sparkcontext 参数1 spark集群的master地址 参数2 应用的名字
        sc = SparkContext('local','pvcount')
        rdd1 = sc.textFile('file:///root/tmp/data/access.log',4)
        # 获取每一行后,分割每一行,过滤掉小于10列的行并使用第10的位置为key添加元组
        rdd2 = rdd1.map(lambda x:x.split(' ')).filter(lambda x : len(x)>10).map(lambda x:(x[10],1))
        # 对2进行累计并排序
        rdd3 = rdd2.reduceByKey(lambda a,b:a+b).sortBy(lambda x:x[1],ascending=False).filter(lambda x : len(x[0])>10)
        for r in rdd3.take(10):
                print(r)
        sc.stop()
三、总结

代码比较简单,但是实际测试没有问题,可以参考.

  • 2
    点赞
  • 3
    收藏
    觉得还不错? 一键收藏
  • 1
    评论
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值