“`” 参考回答:

避免创建重复的RDD,尽量复用同一RDD,尽量避免使用shuffle类算子,优化数据结构,使用Hive ETL预处理数据,过滤少数导致倾斜的key,提高shuffle操作的并行度,两阶段聚合,将reduce join转为map join。

<pre><code> "“`

Was this helpful?

0 / 0

发表回复 0

Your email address will not be published.