Skip to main content

常见异常

问题一

异常信息:Error while processing statement: FAILED: Execution Error, return code 1 from org.apache.hadoop.hive.ql.exec.MoveTask. Unable to move source hdfs://qccnn/data/hive/warehouse/applydata_bi_dw.db/dwd_cc_message_receipt_huawei_df/dates=20241124/.hive-staging_hive_2024-11-25_15-48-00_335_7507067293190294255-96280/-ext-10000 to destination hdfs://qccnn/data/hive/warehouse/applydata_bi_dw.db/dwd_cc_message_receipt_huawei_df/dates=20241124

insert overwrite 时发生了上述错误,因为之前的定时任务已经操作过一次,但中途失败了,重跑后就报了这个错误,猜测可能是hdfs上已经有了这个分区,但是show partitions时却看不到新分区。

所以根本原因就是:该分区表在 HIVE中的元数据与HDFS上实际的数据不一致,当执行 insert overwrite 操作时,hive 通过存储在 metastore 中的元数据信息发现目标分区并不存在,也就不会尝试去执行hdfs上该分区对应目录的删除操作了,而实际上hdfs上该分区对应的目录和文件都是存在的,所以作业底层的 rename 操作失败了。

解决方案:

修复 hive 元数据跟hdfs实际的数据一致,使用命令 msck repair table xxx来修复hive表的元数据。

最后show partitions检查发现新分区已经加载进来了,再次执行insert overwrite就不会报错了。

msck repair table applydata_bi_dw.dwd_cc_message_receipt_huawei_df;

数据倾斜

COALESCE(tab2.device_id,CONCAT('device_id:',UUID()))=tab3.device_id;

Hive 生成自增id

row_number() over(partition by 1 order by 1) as id

Buffer size too small. size = 262144 needed = 2205991

java.lang.IllegalArgumentException: Buffer size too small. size = 262144 needed = 2205991

最终的解决方案

这个问题有点偶发性,幼师能跑成功,有时会失败

最终的解决方案

是加了一个参数

--conf spark.sql.hive.convertMetastoreOrc=false



异常信息:org.apache.kyuubi.KyuubiSQLException: org.apache.kyuubi.KyuubiSQLException: Error operating ArrowBasedExecuteStatement: org.apache.spark.sql.AnalysisException: Cannot overwrite a path that is also being read from.
at org.apache.spark.sql.errors.QueryCompilationErrors$.cannotOverwritePathBeingReadFromError(QueryCompilationErrors.scala:1868)

spark.sql.hive.convertMetastoreOrc false

如果是parque的文件数据报错就用这个

spark.sql.hive.convertMetastoreParquet 参数