Databricks Autoloader流模式下无法读取.text文件问题排查
Databricks Autoloader处理text文件无输出问题排查
我正在使用Databricks Autoloader以流(微批)模式处理.text格式的源文件。虽然检查点(checkpoint)已创建且流任务未报错,但Delta表未生成,且文件似乎完全未被读取。
代码示例
(spark.readStream .format("cloudFiles") .option("cloudFiles.format", "text") .option("encoding", "UTF-16") .load(source_path) .withColumn("sourcefile", F.col("_metadata.file_path")) # .withColumn("load_timestamp", F.to_timestamp(F.regexp_extract(F.col("sourcefile"), "([0-9]{4}-[0-9]{2}-[0-9]{2}-[0-9]{2}-[0-9]{2}-[0-9]{2})", 1), 'yyyy-MM-dd-HH-mm-ss')) .writeStream .option("checkpointLocation", sink_path + '/checkpoints') # .option("path", sink_path + '/delta') .trigger(availableNow=True) # Process the file once and stop, new config .foreachBatch(lambda batch_df, batch_id: foreach_batch(batch_df, batch_id, sink_path, source_path, table_name, version, meta_data_path)) .queryName(f"AIDA_{BU}_staging") .start() .awaitTermination() )
已排查内容
- 检查点目录已创建
- 流任务运行无报错
请问是否存在配置问题,或我遗漏了Autoloader的必要配置项?
内容的提问来源于stack exchange,提问作者Shoaib Maroof
相关产品推荐
相关产品推荐

