支付宝红包
京东盲盒抽奖
幸运转盘
秒杀
自营热卖
支付宝红包

使用pyspark统计用户访问(uv)TOP_N

余生勿忘 1年前   阅读数 316 0

使用pyspark统计用户访问TOP_N

说明:使用pyspark库uv的TOP_N实现

一、数据说明

  1. 用户访问数据,IP地址,URL
    在这里插入图片描述

二、代码实现

  1. 导入pyspark及环境配置
import os
from pyspark import SparkContext
import time
JAVA_HOME='/root/bigdata/jdk'
#向系统环境变量中添加 JAVA_HOME路径
os.environ['JAVA_HOME']=JAVA_HOME
PYSPARK_PYTHON = "/miniconda2/envs/py365/bin/python"
# PYSPARK使用Python位置
os.environ["PYSPARK_PYTHON"] = PYSPARK_PYTHON
# PYSPARK驱动使用Python的位置
os.environ["PYSPARK_DRIVER_PYTHON"] = PYSPARK_PYTHON
  1. 启动处理
if __name__ == '__main__':
    #创建sparkcontext 参数1 spark集群的master地址 参数2 应用的名字
        sc = SparkContext('local','pvcount')
        rdd1 = sc.textFile('file:///root/tmp/data/access.log',4)
        # 获取每一行后,分割每一行,过滤掉小于10列的行并使用第10的位置为key添加元组
        rdd2 = rdd1.map(lambda x:x.split(' ')).filter(lambda x : len(x)>10).map(lambda x:(x[10],1))
        # 对2进行累计并排序
        rdd3 = rdd2.reduceByKey(lambda a,b:a+b).sortBy(lambda x:x[1],ascending=False).filter(lambda x : len(x[0])>10)
        for r in rdd3.take(10):
                print(r)
        sc.stop()

三、总结

代码比较简单,但是实际测试没有问题,可以参考.


注意:本文归作者所有,未经作者允许,不得转载

全部评论: 0

    我有话说: