spark读取mysql优化_Spark SQL性能优化

==>在内存中缓存数据--->性能调优主要是将数据放入内存中操作--->使用例子：//从Oracle数据库中读取数据，生成DataFramevaloracleDF=spark.read.format("jdbc").option("url","jdbc:oracle:thin:@192.168.10.100:1521/orcl.example.com").o...

ftggggc

317人浏览 · 2021-02-11 10:14:36

ftggggc · 2021-02-11 10:14:36 发布

==> 在内存中缓存数据

---> 性能调优主要是将数据放入内存中操作

---> 使用例子：// 从 Oracle 数据库中读取数据，生成 DataFrame

val oracleDF = spark.read.format("jdbc")

.option("url", "jdbc:oracle:thin:@192.168.10.100:1521/orcl.example.com")

.option("dbtable", "scott.emp")

.option("user", "scott")

.option("password", "tiger").load

// 将 DataFrame 注册成表

oracleDF.registerTempTable("emp")

// 执行查询，并通过 Web Console 监控执行的时间

spark.sql("select * from emp").show

// 将表进行缓存，并查询两次，通过 Web Console 监控执行的时间

spark.sqlContext.cacheTable("emp")

// 清空缓存

spark.sqlContext.cacheTable("emp")

spark.sqlContext.clearCache

==> 优化相关参数

---> spark.sql.inMemoryColumnarStorage.compressed

----默认值：true

---- Spark SQL 将会基于统计信息自动地为每一列选择一种压缩编码方式

---> spark.sql.inMemoryColumnarStorage.batchSize

---- 默认值： 10000

---- 缓存批处理大小，较大的批处理可以提高内存利用率和压缩率，但同时也会带来 OOM(Out Of Memory)的风险

---> spark.sql.files.maxPartitionBytes

---- 默认值： 128M

---- 读取文件时单个分区可容纳的最大字节数

---> spark.sql.files.openCostinBytes

---- 默认值： 4M

---- 打开文件的估算成本，按照同一时间能够扫描的字节数来测量，当往一个分区写入多个文件时会使用，高估相对较好，这样小文件分区将会比大文件分区速度更快(优先调度)

---> spark.sql.autoBroadcastJoinThreshold

---- 默认值：10M

---- 用于配置一个表在执行 join 操作时能够广播给所有 worker 节点的最大字节大小，通地将这个值设置为-1可以禁用广播，

---- 注意：当前数据统计仅支持已经运行了 ANALYZE TABLE COMPUTE STATISTICS noscan 命令的 Hive Metastore 表

---> spark.sql.shuffle.partitions

---- 默认值： 200

---- 用于配置 join 或聚合操作混洗(shuffle)数据时使用的分区数

腾讯云开发者社区

腾讯云面向开发者汇聚海量精品云计算使用和开发经验，营造开放的云计算技术生态圈。

更多推荐

终极指南：Flink SQL连接器版本管理从混乱到有序的升级之路

Apache Flink作为流处理领域的佼佼者，其SQL连接器的版本管理一直是开发者面临的核心挑战。本文将系统讲解Flink SQL连接器版本管理的最佳实践，帮助你轻松应对版本兼容性问题，实现从混乱到有序的升级之旅。## 连接器版本管理的常见痛点 😫在Flink应用开发中，连接器版本管理常常让开发者头疼不已。不同版本的连接器可能导致各种兼容性问题，例如API变更、功能差异甚至运行时错误。

腾讯云开发者社区

Elasticsearch复杂数据类型终极指南：从入门到精通

Elasticsearch作为功能强大的搜索引擎，支持多种复杂数据类型，让开发者能够灵活处理各种结构化和非结构化数据。本文将带你全面了解Elasticsearch中的复杂数据类型，从基础概念到实际应用，助你轻松掌握数据建模的核心技巧。## 内部对象：构建层级化数据结构在Elasticsearch中，对象类型（Object）是最基础的复杂数据类型之一，用于表示具有嵌套关系的数据。例如，我们可

腾讯云开发者社区

如何快速搭建Neon无服务器PostgreSQL：面向初学者的完整指南

Neon是一款革命性的无服务器PostgreSQL解决方案，它通过分离存储和计算层，实现了自动扩缩容、类代码式数据库分支以及零级扩展能力。本指南将帮助你从零开始搭建Neon开发环境，体验这款创新数据库的强大功能。## 准备工作：环境要求与依赖项在开始搭建Neon环境前，请确保你的系统满足以下要求：- Linux操作系统（推荐Ubuntu 20.04+或Debian 11+）- Git