咨询Azure Databricks中Spark SQL创建CSV表的官方文档及完整选项
Azure Databricks Spark SQL 创建CSV表配置指南
官方文档获取
你可以直接在Azure Databricks工作区内访问适配当前版本的官方文档:
- 打开笔记本时,点击顶部导航栏的「帮助」菜单,选择「文档」入口,即可查看Spark SQL的完整语法与配置说明。
- 也可通过工作区左侧边栏的「文档」图标(书本样式),快速进入包含表创建、格式配置的专属文档板块。
Spark SQL 创建CSV格式表的完整配置选项
使用CREATE TABLE语法创建CSV表时,通过OPTIONS子句可指定以下全量配置项:
基础格式配置
format = 'csv':指定存储格式为CSV(必填项)header = true/false:是否将文件首行作为列名,默认值falsesep = '<字符>':字段分隔符,默认逗号(,),支持自定义如'\t'、'|'等delimiter = '<字符>':与sep功能一致,为兼容旧版本保留的参数quote = '<字符>':字段引用符,默认双引号("),用于包裹含分隔符的字段escape = '<字符>':转义字符,默认反斜杠(\),用于转义字段内的引用符comment = '<字符>':注释标识,以该字符开头的行会被视为注释忽略
数据解析配置
nullValue = '<字符串>':定义代表空值的字符串,默认空字符串nanValue = '<字符串>':定义代表非数字(NaN)的字符串,默认'NaN'positiveInf = '<字符串>':定义代表正无穷的字符串,默认'Inf'negativeInf = '<字符串>':定义代表负无穷的字符串,默认'-Inf'ignoreLeadingWhiteSpace = true/false:是否忽略字段前的空白字符,默认falseignoreTrailingWhiteSpace = true/false:是否忽略字段后的空白字符,默认falseparseMode = '<模式>':解析错误处理策略,可选值:PERMISSIVE:默认模式,将解析失败的行存入_corrupt_record列DROPMALFORMED:直接丢弃解析错误的行FAILFAST:遇到解析错误立即抛出异常终止操作
文件与存储配置
path = '<存储路径>':指定表数据存储的ADLS或DBFS路径(外部表必填)recursiveFileLookup = true/false:是否递归扫描指定路径下的所有文件,默认falsemaxFilesPerTrigger = <数字>:流式查询场景下,每次触发处理的最大文件数量modifiedBefore = '<时间>':仅处理指定时间前修改的文件,格式示例:'2024-01-01T00:00:00Z'modifiedAfter = '<时间>':仅处理指定时间后修改的文件,格式同上
高级配置
charset = '<字符集>':指定文件字符编码,如'UTF-8'、'GBK'等multiLine = true/false:是否允许字段包含换行符(跨行字段),默认falsedateFormat = '<格式>':日期类型的解析/写入格式,默认'yyyy-MM-dd'timestampFormat = '<格式>':时间戳类型的解析/写入格式,默认'yyyy-MM-dd'T'HH:mm:ss[.SSS][XXX]'enableEmptyColumns = true/false:是否允许创建空列,默认true
示例代码
CREATE TABLE IF NOT EXISTS csv_user_table ( user_id INT, user_name STRING, register_date DATE ) USING csv OPTIONS ( header = 'true', sep = ',', quote = '"', path = '/mnt/adls/user_data/csv', dateFormat = 'yyyy/MM/dd', parseMode = 'PERMISSIVE' )
内容的提问来源于stack exchange,提问作者ausmod
相关产品推荐
相关产品推荐

