使用Redshift Copy命令从S3加载数据时遇无效空字节错误求助
解决Redshift COPY命令中的Invalid null字节错误
我来帮你搞定这个问题!你遇到的Invalid null byte - field longer than 1 byte错误,根源在于Redshift的acceptinvchars参数并不处理空字节(\u0000)——这个参数仅用于过滤不符合目标字符集的无效字符,而空字节属于Redshift明确拒绝的特殊控制字符,所以加了参数还是会报错。
下面给你两种可行的解决方案,按需选择:
方案一:用JSONPath在加载时自动移除空字节
这种方法不需要修改S3里的原始数据,直接通过Redshift的JSONPath功能在加载过程中处理空字节:
创建JSONPath配置文件
新建一个名为jsonpath_remove_null.json的文件,内容如下:{ "jsonpaths": [ "$.id", "translate($.name, '\u0000', '')" ] }这里的
translate函数会把name字段中的空字节(\u0000)替换成空字符串,避免触发错误。上传JSONPath文件到S3
将这个文件上传到你的S3桶中,比如路径为s3://<bucket_name>/jsonpath_remove_null.json。修改COPY命令
把原来的json 'auto'替换成指向这个JSONPath文件的路径,修改后的命令如下:copy sample_table from 's3://<bucket_name>/<sample_json>.gz' credentials 'aws_access_key_id=<key>;aws_secret_access_key=<secret>' json 's3://<bucket_name>/jsonpath_remove_null.json' gzip acceptinvchars;执行这个命令,就能成功加载数据了。
方案二:预处理S3中的数据
如果你的数据量很大,或者需要批量处理,可以用AWS Lambda或脚本先把S3文件中的空字节替换掉,再进行加载:
比如用Python脚本处理压缩的JSON文件:
import boto3 import gzip s3 = boto3.client('s3') def clean_null_bytes(bucket, source_key, target_key): # 下载并解压S3文件 response = s3.get_object(Bucket=bucket, Key=source_key) raw_content = gzip.decompress(response['Body'].read()).decode('utf-8') # 替换所有空字节 cleaned_content = raw_content.replace('\x00', '') # 重新压缩并上传到目标路径 s3.put_object( Bucket=bucket, Key=target_key, Body=gzip.compress(cleaned_content.encode('utf-8')) ) # 调用函数处理你的文件 clean_null_bytes('<bucket_name>', '<sample_json>.gz', 'processed/<sample_json>.gz')
处理完成后,用原来的COPY命令加载processed/路径下的文件即可。
内容的提问来源于stack exchange,提问作者rachit
相关产品推荐
相关产品推荐

