案例：选择合适的分布列

表定义如下：

    
         CREATE TABLE t1 (a int, b int);
CREATE TABLE t2 (a int, b int);

执行如下查询：

    
         SELECT * FROM t1, t2 WHERE t1.a = t2.b;

如果将a作为t1和t2的分布列：

    
         CREATE TABLE t1 (a int, b int) DISTRIBUTE BY HASH (a);
CREATE TABLE t2 (a int, b int) DISTRIBUTE BY HASH (a);

则执行计划将存在“Streaming”，导致DN之间存在较大通信数据量，如图1所示。

图1 选择合适的分布列案例（一）
点击放大

如果将a作为t1的分布列，将b作为t2的分布列：

    
         CREATE TABLE t1 (a int, b int) DISTRIBUTE BY HASH (a);
CREATE TABLE t2 (a int, b int) DISTRIBUTE BY HASH (b);

则执行计划将不包含“Streaming”，减少DN之间存在的通信数据量，从而提升查询性能，如图2所示。

图2 选择合适的分布列案例（二）
点击放大

父主题： 实际调优案例

提供反馈

提交成功！非常感谢您的反馈，我们会继续努力做到更好！

系统繁忙，请稍后重试

在使用文档中是否遇到以下问题

内容与产品页面不一致

内容不易理解

缺失示例代码

步骤不可操作

搜不到想要的内容

缺少最佳实践

意见反馈（选填）

0/500

请至少选择一项反馈信息并填写问题反馈

字符长度不能超过500

直接提交取消