如何在Apache Spark SQL中将第一行设为表头(Databricks平台适用)
Databricks Spark SQL读取CSV设置表头方案
你当前使用的csv.文件路径``隐式读取语法无法自定义读取参数,需要改用显式指定CSV读取配置的语法实现将首行设为表头,有两种常用实现方式:
- 方式1:使用
read_files函数(适配你当前创建视图的需求,改动最小)
%sql CREATE OR REPLACE VIEW enrraces.race_circuits_df AS SELECT * FROM read_files( '/FileStore/tables/results.csv', format => 'csv', header => true, inferSchema => true -- 可选参数,自动推断字段类型,不需要可删除 )
其中header => true就是指定首行作为表头的配置项,和Python API里的header=True效果完全一致。
- 方式2:使用CREATE TABLE指定数据源参数(适合需要长期复用表结构的场景)
%sql CREATE OR REPLACE TABLE enrraces.race_circuits USING csv OPTIONS ( path '/FileStore/tables/results.csv', header 'true', inferSchema 'true' )
内容的提问来源于stack exchange,提问作者Patterson
相关产品推荐
相关产品推荐

