您现在的位置是：首页 > 大数据

当前栏目

大数据ClickHouse（十八）：Spark 写入 ClickHouse API

数据 Spark API 写入 ClickHouse 十八

2023-06-13 09:11:54 时间

Spark 写入 ClickHouse API

SparkCore写入ClickHouse，可以直接采用写入方式。下面案例是使用SparkSQL将结果存入ClickHouse对应的表中。在ClickHouse中需要预先创建好对应的结果表。

一、导入依赖

<!-- 连接ClickHouse需要驱动包-->
<dependency>
  <groupId>ru.yandex.clickhouse</groupId>
  <artifactId>clickhouse-jdbc</artifactId>
  <version>0.2.4</version>
  <!-- 去除与Spark 冲突的包 -->
  <exclusions>
    <exclusion>
        <groupId>com.fasterxml.jackson.core</groupId>
        <artifactId>jackson-databind</artifactId>
    </exclusion>
    <exclusion>
        <groupId>net.jpountz.lz4</groupId>
        <artifactId>lz4</artifactId>
    </exclusion>
</exclusions>
</dependency>

<!-- Spark-core -->
<dependency>
  <groupId>org.apache.spark</groupId>
  <artifactId>spark-core_2.11</artifactId>
  <version>2.3.1</version>
</dependency>
<!-- SparkSQL -->
<dependency>
  <groupId>org.apache.spark</groupId>
  <artifactId>spark-sql_2.11</artifactId>
  <version>2.3.1</version>
</dependency>
<!-- SparkSQL  ON  Hive-->
<dependency>
  <groupId>org.apache.spark</groupId>
  <artifactId>spark-hive_2.11</artifactId>
  <version>2.3.1</version>
</dependency>

二、代码编写

val session: SparkSession = SparkSession.builder().master("local").appName("test").getOrCreate()
val jsonList = List[String](
  "{\"id\":1,\"name\":\"张三\",\"age\":18}",
  "{\"id\":2,\"name\":\"李四\",\"age\":19}",
  "{\"id\":3,\"name\":\"王五\",\"age\":20}"
)

//将jsonList数据转换成DataSet
import session.implicits._
val ds: Dataset[String] = jsonList.toDS()

val df: DataFrame = session.read.json(ds)
df.show()

//将结果写往ClickHouse
val url = "jdbc:clickhouse://node1:8123/default"
val table = "test"
val properties = new Properties()
properties.put("driver", "ru.yandex.clickhouse.ClickHouseDriver")
properties.put("user", "default")
properties.put("password", "")
properties.put("socket_timeout", "300000")
df.write.mode(SaveMode.Append).option(JDBCOptions.JDBC_BATCH_INSERT_SIZE, 100000).jdbc(url, table, properties)

猜你喜欢

阿里云云服务器Windows2008下IIS添加网站绑定域名图文教程
PostgreSQL Collation 怎么调整，为什么很多项目都选择 Ctype
Linux服务器IP地址设置指南（linux服务器ip设置）
Drools7.0.0.Final Unsupported major.minor version 52.0异常详解编程语言
如何自动获取、播报微博热搜榜？
SP Module 3 – Digital Speech Signals
MySQL实现个位数补0技巧（mysql 个位数补0）
Redis配置指南实战实例精解（redis配置实例）
asp：debug类调试程序
双绞线的制作与应用
挑战MySQL二级考试，实现职业跳跃！（mysql二级考试）
SearchEngineFriendly的URL设计
Apache网页的优化、安全与防盗链图文详解
两年了，当初轰动的TrueNorth芯片最近有哪些进展？
教你从零开始在 TensorFlow 上搭建 RNN（完整代码）！
操作系统虚拟存储管理实验报告_虚拟存储器技术
Androidxml文件的序列化实现代码

zl程序教程

当前栏目

大数据ClickHouse（十八）：Spark 写入 ClickHouse API

Spark 写入 ClickHouse API

一、导入依赖

二、代码编写

相关文章

当前栏目

大数据ClickHouse（十八）：Spark 写入 ClickHouse API

​Spark 写入 ClickHouse API

一、导入依赖

二、代码编写

相关文章

Spark 写入 ClickHouse API