Apache优化设置_Hive SQL逻辑优化-华为云

Hive SQL逻辑优化

Hive SQL逻辑优化操作场景在Hive上执行SQL语句查询时，如果语句中存在“(a&b) or (a&c)”逻辑时，建议将逻辑改为“a & (b or c)”。样例假设条件a为“p_partkey = l_partkey”，优化前样例如下所示： select

来自：帮助中心

查看更多 →
Hive Join数据优化

Hive Join数据优化操作场景使用Join语句时，如果数据量大，可能造成命令执行速度和查询速度慢，此时可进行Join优化。 Join优化可分为以下方式： Map Join Sort Merge Bucket Map Join Join顺序优化 Map Join Hive的Map

来自：帮助中心

查看更多 →
聚合算法优化

要启动聚合算法优化，在Spark客户端的“spark-defaults.conf”配置文件中进行设置。表1 参数介绍参数描述默认值 spark.sql.codegen.aggregate.map.twolevel.enabled 是否开启聚合算法优化： true：开启 false：不开启

来自：帮助中心

查看更多 →
Datasource表优化

Datasource表优化操作场景将datasource表的分区消息存储到Metastore中，并在Metastore中对分区消息进行处理。优化datasource表，支持对表中分区执行增加、删除和修改等语法，从而增加与Hive的兼容性。支持在查询语句中，把分区裁剪并下压

来自：帮助中心

查看更多 →
查询分子优化任务

查询分子优化任务功能介绍通过分子优化任务ID查询分子优化任务状态及结果。 URI GET /v1/{project_id}/task/optimization/{task_id} 表1 路径参数参数是否必选参数类型描述 project_id 是 String 华为云项目id

来自：帮助中心

查看更多 →
Datasource表优化

Datasource表优化操作场景将datasource表的分区消息存储到Metastore中，并在Metastore中对分区消息进行处理。优化datasource表，支持对表中分区执行增加、删除和修改等语法，从而增加与Hive的兼容性。支持在查询语句中，把分区裁剪并下压

来自：帮助中心

查看更多 →
Hive Group By语句优化

Hive Group By语句优化操作场景优化Group by语句，可提升命令执行速度和查询速度。 Group by的时候， Map端会先进行分组，分组完后分发到Reduce端， Reduce端再进行分组。可采用Map端聚合的方式来进行Group by优化，开启Map端初步聚合，减少Map的输出数据量。

来自：帮助中心

查看更多 →
Hive SQL逻辑优化

Hive SQL逻辑优化操作场景在Hive上执行SQL语句查询时，如果语句中存在“(a&b) or (a&c)”逻辑时，建议将逻辑改为“a & (b or c)”。样例假设条件a为“p_partkey = l_partkey”，优化前样例如下所示： select

来自：帮助中心

查看更多 →
优化器开销常量

seq_page_cost 参数说明：设置优化器计算一次顺序磁盘页面抓取的开销。该参数属于USERSET类型参数，请参考表1中对应设置方法进行设置。取值范围：浮点型，0～DBL_MAX。默认值：1 random_page_cost 参数说明：设置优化器计算一次非顺序抓取磁盘页面的开销。

来自：帮助中心

查看更多 →
基因查询优化器

基因查询优化器介绍基因查询优化器相关的参数。基因查询优化器（GEQO）是一种启发式的查询规划算法。这个算法减少了对复杂查询规划的时间，而且生成规划的开销有时也小于正常的详尽的查询算法。 geqo 参数说明：控制基因查询优化的使用。该参数属于USERSET类型参数，请参考表1中对应设置方法进行设置。

来自：帮助中心

查看更多 →
优化器方法配置

默认值：cost_base。在PDB场景内，若未设置该参数，则继承来自全局的设置。设置方式：该参数属于USERSET类型参数，请参考表1中对应设置方法进行设置。设置建议：推荐使用默认值，除非有异常场景或者发现优化器选择的计划查询性能低，需要手动调优才使用其他值。设置不当的风险与影响：该参数会影响优化器是否进行i

来自：帮助中心

查看更多 →
基因查询优化器

默认值：12。在PDB场景内，若未设置该参数，则继承来自全局的设置。设置方式：该参数属于USERSET类型参数，请参考表1中对应设置方法进行设置。设置建议：推荐使用默认值，若动态规划的性能开销能接受，可以调大此值；若当前动态规划的开销较难接受，可以调小此值。设置不当的风险与影响：设置过大，可能导

来自：帮助中心

查看更多 →
优化器方法配置

tream计划。 off：表示优化器对update语句仅能生成非stream计划。默认值：on 设置方式：该参数属于USERSET类型参数，请参考表1中对应设置方法进行设置。设置建议：推荐使用默认值。设置不当的风险与影响：关闭该参数会导致优化器倾向于选择其他方法，对upda

来自：帮助中心

查看更多 →
优化器开销常量

seq_page_cost 参数说明：设置优化器计算一次顺序磁盘页面抓取的开销。参数类型：浮点型参数单位：无取值范围：0 ~ DBL_MAX 默认值：1 设置方式：该参数属于USERSET类型参数，请参考表1中对应设置方法进行设置。设置建议：推荐使用默认值。设置不当的风险与影响：该参数

来自：帮助中心

查看更多 →
其他优化器选项

取值范围： on：表示优化器将优化PBE语句的查询计划，在FQS下选择gplan。 off：表示不使用优化。默认值：on 设置方式：该参数属于SUSET类型参数，请参考表1中对应设置方法进行设置。设置建议：推荐使用默认值，在不希望FQS选择gplan时可设置为off。设置不当的风险与

来自：帮助中心

查看更多 →
其他优化器选项

Execute）形式执行的语句进行查询计划的优化。该参数属于SUSET类型参数，请参考表1中对应设置方法进行设置。取值范围：布尔型。 on表示优化器将优化PBE语句的查询计划。 off表示不使用优化。默认值：on enable_global_stats 参数说明：标识当前统计

来自：帮助中心

查看更多 →
Kafka性能优化

Kafka性能优化 Kafka性能优化优化客户端配置生产者配置建议可参考配置建议。消费者配置建议参数推荐值说明 max.poll.records 500 消费者一次能消费到的最大消息数量，默认为500，如果每条消息处理时间较长，建议调小该值，确保在max.poll.interval

来自：帮助中心

查看更多 →
Spark性能优化

e数据。调优原则提高cpu使用率同时减少额外性能开销。提高内存使用率。优化业务逻辑，减少计算量和IO操作。典型业务的调优优化代码逻辑：在进行Spark参数调优之前，要进行相应的规划设计，优化代码逻辑。 Spark任务跑的比较慢，cpu利用率低：检测室executor线

来自：帮助中心

查看更多 →
优化器开销常量

优化器开销常量介绍优化器开销常量。这里描述的开销可以按照任意标准度量。只关心其相对值，因此以相同的系数缩放它们将不会对优化器的选择产生任何影响。缺省时，它们以抓取顺序页的开销为基本单位。也就是说将seq_page_cost设为1.0，同时其他开销参数以它为基准设置。也可以使用其他基准，比如以毫秒计的实际执行时间。

来自：帮助中心

查看更多 →
其他优化器选项

其他优化器选项 default_statistics_target 参数说明：为没有用ALTER TABLE SET STATIS TICS 设置字段目标的表设置缺省统计目标。此参数设置为正数是代表统计信息的样本数量，为负数时，代表使用百分比的形式设置统计目标，负数转换为对应的百分比

来自：帮助中心

查看更多 →
基因查询优化器

基因查询优化器介绍基因查询优化器相关的参数。基因查询优化器（GEQO）是一种启发式的查询规划算法。这个算法减少了对复杂查询规划的时间，而且生成规划的开销有时也小于正常的详尽的查询算法。 geqo 参数说明：控制基因查询优化的使用。参数类型：USERSET 取值范围：布尔型 on表示使用。

来自：帮助中心

查看更多 →