SpringBoot使用Spark过程详解

更新时间：2023年02月15日 10:46:31 作者：我有一只肥螳螂

这篇文章主要介绍SpringBoot使用Spark的方法的相关知识，小编通过实际案例向大家展示操作过程，操作方法简单快捷，实用性强，希望能帮助大家解决问题

读取 txt 文件

测试文件 word.txt

java 代码

textFile：获取文件内容，返回 JavaRDD
flatMap：过滤数据
mapToPair：把每个元素都转换成一个<K,V>类型的对象，如 <123,1>,<456,1>
reduceByKey：对相同key的数据集进行预聚合

public void testSparkText() {
    String file = "D:\\TEMP\\word.txt";
    JavaRDD<String> fileRDD =  javaSparkContext.textFile(file);
    JavaRDD<String> wordsRDD = fileRDD.flatMap(line -> Arrays.asList(line.split(" ")).iterator());
    JavaPairRDD<String, Integer> wordAndOneRDD = wordsRDD.mapToPair(word -> new Tuple2<>(word, 1));
    JavaPairRDD<String, Integer> wordAndCountRDD = wordAndOneRDD.reduceByKey((a, b) -> a + b);
    //输出结果
    List<Tuple2<String, Integer>> result = wordAndCountRDD.collect();
    result.forEach(System.out::println);
}

结果得出，123 有 3 个，456 有 2 个，789 有 1 个

读取 csv 文件

测试文件 testcsv.csv

java 代码

public void testSparkCsv() {
    String file = "D:\\TEMP\\testcsv.csv";
    JavaRDD<String> fileRDD = javaSparkContext.textFile(file);
    JavaRDD<String> wordsRDD = fileRDD.flatMap(line -> Arrays.asList(line.split(",")).iterator());
    //输出结果
    System.out.println(wordsRDD.collect());
}

输出结果

读取 MySQL 数据库表

format：获取数据库建议是 jdbc
option.url：添加 MySQL 连接 url
option.user：MySQL 用户名
option.password：MySQL 用户密码
option.dbtable：sql 语句
option.driver：数据库 driver，MySQL 使用 com.mysql.cj.jdbc.Driver

public void testSparkMysql() throws IOException {
    Dataset<Row> jdbcDF = sparkSession.read()
            .format("jdbc")
            .option("url", "jdbc:mysql://192.168.140.1:3306/user?useUnicode=true&characterEncoding=UTF-8&serverTimezone=Asia/Shanghai")
            .option("dbtable", "(SELECT * FROM xxxtable) tmp")
            .option("user", "root")
            .option("password", "xxxxxxxxxx*k")
            .option("driver", "com.mysql.cj.jdbc.Driver")
            .load();
    jdbcDF.printSchema();
    jdbcDF.show();
    //转化为RDD
    JavaRDD<Row> rowJavaRDD = jdbcDF.javaRDD();
    System.out.println(rowJavaRDD.collect());
}

也可以把表内容输出到文件，添加以下代码

List<Row> list = rowJavaRDD.collect();
BufferedWriter bw;
bw = new BufferedWriter(new FileWriter("d:/test.txt"));
for (int j = 0; j < list.size(); j++) {
    bw.write(list.get(j).toString());
    bw.newLine();
    bw.flush();
}
bw.close();

结果输出

读取 Json 文件

测试文件 testjson.json，内容如下

[{
	"name": "name1",
	"age": "1"
}, {
	"name": "name2",
	"age": "2"
}, {
	"name": "name3",
	"age": "3"
}, {
	"name": "name4",
	"age": "4"
}]

注意：testjson.json 文件的内容不能带格式，需要进行压缩

java 代码

createOrReplaceTempView：读取 json 数据后，创建数据表 t
sparkSession.sql：使用 sql 对 t 进行查询，输出 age 大于 3 的数据

public void testSparkJson() {
    Dataset<Row> df = sparkSession.read().json("D:\\TEMP\\testjson.json");
    df.printSchema();
    df.createOrReplaceTempView("t");
    Dataset<Row> row = sparkSession.sql("select age,name from t where age > 3");
    JavaRDD<Row> rowJavaRDD = row.javaRDD();
    System.out.println(rowJavaRDD.collect());
}

输出结果

中文输出乱码

测试文件 testcsv.csv

public void testSparkCsv() {
    String file = "D:\\TEMP\\testcsv.csv";
    JavaRDD<String> fileRDD = javaSparkContext.textFile(file);
    JavaRDD<String> wordsRDD = fileRDD.flatMap(line -> Arrays.asList(line.split(",")).iterator());
    //输出结果
    System.out.println(wordsRDD.collect());
}

输出结果，发现中文乱码，可恶

原因：textFile 读取文件没有解决乱码问题，但 sparkSession.read() 却不会乱码

解决办法：获取文件方式由 textFile 改成 hadoopFile，由 hadoopFile 指定具体编码

    public void testSparkCsv() {
        String file = "D:\\TEMP\\testcsv.csv";
        String code = "gbk";
        JavaRDD<String> gbkRDD = javaSparkContext.hadoopFile(file, TextInputFormat.class, LongWritable.class, Text.class).map(p -> new String(p._2.getBytes(), 0, p._2.getLength(), code));
        JavaRDD<String> gbkWordsRDD = gbkRDD.flatMap(line -> Arrays.asList(line.split(",")).iterator());
        //输出结果
        System.out.println(gbkWordsRDD.collect());
    }

输出结果

到此这篇关于SpringBoot使用Spark过程详解的文章就介绍到这了,更多相关SpringBoot Spark内容请搜索脚本之家以前的文章或继续浏览下面的相关文章希望大家以后多多支持脚本之家！

您可能感兴趣的文章:

SpringBoot对接Spark过程详解

SpringBoot Spark

Java进阶学习:jar打包详解
Java进阶学习:jar打包详解...
2006-12-12
java中Iterator和ListIterator实例详解
这篇文章主要介绍了java中Iterator和ListIterator实例详解，具有一定借鉴价值，需要的朋友可以参考下。
2017-12-12
模拟Ping操作的一个Java类
这篇文章主要为大家详细介绍了一个模拟Ping操作的Java类，感兴趣的小伙伴们可以参考一下
2016-03-03
浅谈java对象转json,数字精确出现丢失问题
下面小编就为大家带来一篇浅谈java对象转json, 数字精确出现丢失问题。小编觉得挺不错的，现在就分享给大家，也给大家做个参考。一起跟随小编过来看看吧
2017-03-03
解决fcitx输入法在IDEA中输入法候选框无法跟随光标移动的问题
这篇文章主要介绍了解决fcitx输入法在Intellij IDEA开发工具中输入法候选框无法跟随光标移动的问题,代码简单易懂对大家的学习或工作具有一定的参考借鉴价值，需要的朋友可以参考下
2020-10-10
Java中Map的九种遍历方式总结
日常工作中 Map 绝对是我们 Java 程序员高频使用的一种数据结构，那 Map 都有哪些遍历方式呢？这篇文章就带大家看一下，看看你经常使用的是哪一种
2022-11-11
Java设计模式之观察者模式_动力节点Java学院整理
这篇文章给大家介绍流量java设计模式之观察者模式，定义对象间一种一对多的依赖关系，使得当每一个对象改变状态。下面通过类图和实例代码给大家介绍java设计模式之观察者模式，感兴趣的朋友一起看看吧
2017-08-08
Java线程的生命周期和状态控制_动力节点Java学院整理
这篇文章主要介绍了Java线程的生命周期和状态控制,需要的朋友可以参考下
2017-05-05
超详细讲解Java异常
Java 异常机制可以使程序中异常处理代码和正常业务代码分离，保证程序代码更加优雅，并提高程序健壮性。本文超详细讲解了Java异常，感兴趣的小伙伴可以参考一下这篇文章
2021-09-09
SpringBoot中使用@ControllerAdvice注解详解
这篇文章主要介绍了SpringBoot中使用@ControllerAdvice注解详解,@ControllerAdvice,是Spring3.2提供的新注解,它是一个Controller增强器,可对controller中被 @RequestMapping注解的方法加一些逻辑处理,需要的朋友可以参考下
2023-10-10