Databricks上传25MB CSV报runtime duration timeout错误如何解决?
Databricks上传25MB CSV文件报runtime duration timeout的解决方案
这个报错一般是默认上传会话超时阈值不足、上传块大小设置不合理、本地到Databricks工作区网络不稳定三类原因导致的,可按以下步骤排查解决:
- 调整集群Spark配置,延长上传超时时间
进入对应集群的配置页,找到「Spark 配置」栏,添加以下两个参数后重启集群:
以上配置将上传超时时间延长至5分钟,单块上传大小调整为8MB,降低单块传输超时概率。spark.databricks.ui.fileUploadTimeout 300s spark.databricks.workspace.upload.maxChunkSize 8MB - 更换上传方式,避开UI上传限制
不使用工作区UI的上传入口,先将CSV文件上传到你使用的云厂商对象存储(S3/ADLS/OSS等),再在连接集群的notebook中执行dbutils命令拉取文件到DBFS:
拉取完成后再基于DBFS路径创建表即可。# 示例为S3路径,可替换为对应云存储路径 dbutils.fs.cp("s3://your-bucket/path/test.csv", "dbfs:/FileStore/tables/test.csv") - 优化本地网络环境
上传时关闭VPN、代理等网络中间件,优先使用有线网络传输,同时避免上传过程中刷新页面、将上传页切到后台标签页,部分浏览器的后台标签页资源限制会主动中断长耗时请求。 - 极端场景拆分文件
如果网络环境长期不稳定,可将25MB的CSV拆分为3-4个小文件分别上传,后续通过SQLUNION ALL合并为同一张表即可。
内容的提问来源于stack exchange,提问作者silbia
相关产品推荐
相关产品推荐

