如何在IBM DSX Scala-Spark Notebook中访问COS中的文本文件
解决IBM DSX中Cloud Object Storage上.txt文件无法在Spark-Scala Notebook访问的临时办法
最近在使用IBM DSX做数据处理时,我遇到了一个棘手的问题:把本地的纯文本.txt文件上传到Cloud Object Storage后,在Spark-Scala Notebook里怎么都没法正常访问它。查了平台的常规配置说明,还有社区里的大部分帮助资料,发现大家的讨论和官方指引基本都围绕CSV格式展开,针对纯文本文件的处理方案少之又少。
试了好几种方法都没成功,最后偶然想到一个临时的解决办法,亲测有效,分享给同样踩坑的朋友:
- 操作步骤:直接修改Cloud Object Storage中目标文件的扩展名,把
.txt改成.csv,之后回到Spark-Scala Notebook里就能正常读取这个文件了。
一点小分析
这个方法本质上是“骗”平台按照CSV的规则来读取纯文本内容,因为IBM DSX默认对CSV格式的文件做了更完善的读取适配,而纯文本文件的读取逻辑可能没有被默认启用。虽然这只是个临时方案,但在没有官方针对纯文本文件的适配配置前,能快速解决我们的燃眉之急。
内容的提问来源于stack exchange,提问作者H.Rehman
相关产品推荐
相关产品推荐

