如何在Azure Data Factory复制数据活动中按记录数拆分JSON文件
在Azure Data Factory中拆分JSON输出文件(单文件最多20万条记录)
要实现将REST API返回的JSON数据保存到Blob存储时自动拆分文件,核心是配置复制活动的接收器参数,具体步骤如下:
配置Blob接收器的文件拆分规则
- 在复制活动的Sink选项卡中,选择Blob存储作为目标数据源,格式设置为JSON。
- 在File name option里选择
Generate automatically,让ADF自动生成拆分后的文件名。 - 找到Max rows per file配置项,输入
200000。这个参数会限制每个输出文件的最大记录数,当总记录数超过阈值时,ADF会自动将数据拆分成多个文件,文件名会自动添加序号后缀(如output_001.json、output_002.json)。
确保JSON数据可被正确拆分
要保证REST API返回的JSON是数组格式(例如[{"key1":"val1"},{"key2":"val2"},...])。如果API返回的是嵌套结构,需在复制活动的Source选项卡中,进入JSON settings,将Document form设置为Array of documents,确保ADF能正确识别单条数据记录。验证拆分结果
运行复制活动后,前往Blob存储的目标容器查看,即可看到拆分后的多个JSON文件,每个文件内的记录数不会超过20万条。
内容的提问来源于stack exchange,提问作者Sukanya
相关产品推荐
相关产品推荐

