spark中使用groupByKey进行分组排序的示例代码

更新时间：2023年03月09日 14:55:16 作者：starxhong

这篇文章主要介绍了spark中使用groupByKey进行分组排序的实例代码，本文通过实例代码给大家讲解的非常详细，对大家的学习或工作具有一定的参考借鉴价值,需要的朋友可以参考下

任务需求：已知RDD[(query:String, item_id:String, imp:Int, clk:Int)]，要求找到每个query对应的点击最多的前2个item_id，即：按照query分组，并按照clk降序排序，每组取前两个。

例如：

（连衣裙，1234, 22, 13）

（牛仔裤，2768, 34, 7）

（连衣裙，1673，45, 9）

（衬衣，3468， 67, 12）

（牛仔裤，2754, 68， 20）

（连衣裙，1976，93, 29）

希望得到：

（连衣裙，1976，93, 29）

（连衣裙，1234, 22, 13）

（牛仔裤，2754, 68， 20）

（牛仔裤，2768, 34, 7）

（衬衣，3468， 67, 12）

先看一个错误的版本：

val list = List(("连衣裙",1234, 22, 13),("牛仔裤",2768, 34, 7),("连衣裙",1673,45, 9)
    ,("衬衣",3468,67, 12),("牛仔裤",2754, 68, 20),("连衣裙",1976,93, 29))
val rdd = ss.sparkContext.parallelize(list)
 
val topItem_set= rdd.map(ele => (ele._1, (ele._2, ele._3, ele._4))).groupByKey()
  .map(line => {
        val topItem = line._2.toArray.sortBy(_._3)(Ordering[Int].reverse).take(2)
        topItem.mkString(",")
        topItem.map(x => {(line._1, x._1, x._2, x._3)})
  })
topItem_set.foreach(println)
println()
topItem_set.map(_.mkString).foreach(println)

我们把query作为key，其余放到一起，groupByKey后（map之前），类型为：RDD[(String, Iterable[(String, Int, Int)])]，根据query分组再map，line._2.toArray把Iterable转为Array，sortBy(_._3)是按最后一个Int即clk排序，(Ordering[Int].reverse)表示从大到小（sortBy默认从小到大，注意这里的sortBy是Array的成员函数而不是rdd的sortBy，用法比较不同），take(2)是取前2个，然后返回（query, item_id）。跑一下上面的过程。

[Lscala.Tuple4;@2b672e4
[Lscala.Tuple4;@52e50126
[Lscala.Tuple4;@1362b124
 
(连衣裙,1976,93,29)(连衣裙,1234,22,13)
(衬衣,3468,67,12)
(牛仔裤,2754,68,20)(牛仔裤,2768,34,7)

上面3行是直接打印跟预期稍有差别，同一个key下的top两个元素是作为一个整体，但已经很接近目标，如果希望拆分，需要使用flatMap:

val topItem_set= rdd.map(ele => (ele._1, (ele._2, ele._3, ele._4))).groupByKey()
  .flatMap(line => {
        val topItem = line._2.toArray.sortBy(_._3)(Ordering[Int].reverse).take(2)
        topItem.mkString(",")
        topItem.map(x => {(line._1, x._1, x._2, x._3)})
  })

为什么呢？GroupByKey后，类型为RDD[(String, Iterable[(String, Int, Int)])]，如果用map，那每一个key对应的一个Iterable变量，相当于一条数据，map后的结果自然还是一条。但flatMap，相当于map+flat操作，这才是我们真正的需要的形式。

任务进阶：要求找到每个query对应的点击最多的前2个item_id，当点击一样时，选曝光最少的，即：按照query分组，并优先按照clk降序排序，其次按照imp升序排序，每组取前两个。

例如：

（连衣裙，1234, 22, 13）

（牛仔裤，2768, 34, 7）

（连衣裙，1673，45, 9）

（衬衣，3468， 67, 12）

（牛仔裤，2754, 68， 20）

（连衣裙，1976，93, 29）

（牛仔裤，1232, 20， 7）

希望得到：

（连衣裙，1976，93, 29）

（连衣裙，1234, 22, 13）

（牛仔裤，2754, 68， 20）

（牛仔裤，1232, 20, 7）

（衬衣，2768, 34, 7）

注意，上面样本中牛仔裤有两个样本的点击都是7，但标红的样本曝光数是更小，所以应该入选top2，直接上代码吧：

val list2 = List(("连衣裙",1234, 22, 13),("牛仔裤",2768, 34, 7),("连衣裙",1673,45, 9)
    ,("衬衣",3468,67, 12),("牛仔裤",2754, 68, 20),("连衣裙",1976,93, 29),("牛仔裤",1232, 20, 7))
    val rdd2 = ss.sparkContext.parallelize(list2)
    rdd2.foreach(println)
    val topItem_set= rdd2.map(ele => (ele._1, (ele._2, ele._3, ele._4))).groupByKey()
      .flatMap(line => {
        val topItem = line._2.toArray.sortBy(x => (x._3, x._2))(Ordering.Tuple2(Ordering[Int].reverse, Ordering[Int])).take(2)
        topItem.map(x => {(line._1, x._1, x._2, x._3)})
      })
    topItem_set.foreach(println)

sortBy可以根据需要增加排序维度，参数按优先级排列，这个在日常使用较多。

到此这篇关于spark中使用groupByKey进行分组排序的文章就介绍到这了,更多相关spark使用groupByKey分组排序内容请搜索脚本之家以前的文章或继续浏览下面的相关文章希望大家以后多多支持脚本之家！

您可能感兴趣的文章:

spark dataframe全局排序id与分组后保留最大值行

深入了解JAVA数据类型与运算符
这篇文章主要介绍了Java基本数据类型和运算符,结合实例形式详细分析了java基本数据类型、数据类型转换、算术运算符、逻辑运算符等相关原理与操作技巧,需要的朋友可以参考下
2021-07-07
SpringCloud如何搭建一个多模块项目
这篇文章主要介绍了SpringCloud如何搭建一个多模块项目，记录下使用SpringCloud创建多模块项目，一步一步记录搭建的过程，感兴趣的可以了解一下
2021-05-05
浅析Java中comparator接口与Comparable接口的区别
本文要来详细分析一下Java中Comparable和Comparator接口的区别，两者都有比较的功能，那么究竟有什么区别呢，感兴趣的Java开发者继续看下去吧
2016-10-10
Java字节码中jvm实例用法
在本篇文章里小编给大家整理的是一篇关于Java字节码中jvm实例用法内容，有兴趣的朋友们可以学习参考下。
2021-02-02
SpringBoot2实现MessageQueue消息队列
本文主要介绍了 SpringBoot2实现MessageQueue消息队列,文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧
2023-04-04
Java springboot探究配置文件优先级
在springboot项目中，我们可以通过在yml文件中设置变量，再通过@Value注解来获得这个变量并使用，但如果这个项目已经部署到服务器上，我们想更改这个数据了需要怎么做呢，其实在springboot项目中，配置文件是有优先级的
2023-04-04
基于mybatis-plus QueryWrapper 排序的坑
这篇文章主要介绍了mybatis-plus QueryWrapper 排序的坑，具有很好的参考价值，希望对大家有所帮助。如有错误或未考虑完全的地方，望不吝赐教
2022-01-01
Java类初始化时机测试方法解析
这篇文章主要介绍了Java类初始化时机测试过程解析,文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值,需要的朋友可以参考下
2020-08-08
SpringBoot中创建bean的7种方式总结
Spring是一款广泛应用于企业级应用程序开发的Java框架，其 IOC 和 DI 特性可以有效地管理应用程序中的对象，提高了应用程序的可维护性和可扩展性，那你知道spring有哪些方式将bean放入容器嘛，今天就给大家总结一下
2023-07-07
Java读取文件的简单实现方法
这篇文章主要介绍了Java读取文件的简单实现方法,通过一个读取txt格式的log文件为例,详细的讲述了Java读取文件的方法及原理,需要的朋友可以参考下
2014-09-09