Spring Batch自定义Line Mapper:实现CSV逐行存入数据库单列
Spring Batch读取CSV整行内容并附加文件名、执行ID写入数据库
当前代码的问题分析
你现有的实现存在几个核心问题:
DelimitedLineTokenizer设置delimiter=null不符合预期,它无法正确将整行内容映射到line_content;且file_name和execution_id并非CSV行内字段,不能通过Tokenizer解析获取。FlatFileItemReader的.names()配置属于冗余操作,因为这些字段并非行内数据。
最佳实现方案
方案一:复用Spring Batch组件(推荐)
通过PassThroughLineTokenizer直接获取整行内容,配合自定义FieldSetMapper补充外部字段,最大化复用框架现有能力。
1. 定义领域对象
public class MyDomainObject { private String fileName; private String lineContent; private Long executionId; // Getter & Setter 方法 }
2. 配置ItemReader与LineMapper
@Bean public FlatFileItemReader<MyDomainObject> itemReader(Resource resource) { return new FlatFileItemReaderBuilder<MyDomainObject>() .name("csvLineReader") .resource(resource) // 外部注入资源,支持动态指定文件路径 .lineMapper(defaultLineMapper()) .build(); } @Bean public LineMapper<MyDomainObject> defaultLineMapper() { DefaultLineMapper<MyDomainObject> lineMapper = new DefaultLineMapper<>(); // 使用PassThroughLineTokenizer直接将整行作为唯一字段 PassThroughLineTokenizer tokenizer = new PassThroughLineTokenizer(); tokenizer.setNames("lineContent"); lineMapper.setLineTokenizer(tokenizer); // 自定义FieldSetMapper,补充fileName和executionId lineMapper.setFieldSetMapper(new CustomFieldSetMapper()); return lineMapper; } // 自定义FieldSetMapper实现 public class CustomFieldSetMapper implements FieldSetMapper<MyDomainObject> { private String fileName; private Long executionId; @Override public MyDomainObject mapFieldSet(FieldSet fieldSet) throws BindException { MyDomainObject domainObject = new MyDomainObject(); domainObject.setLineContent(fieldSet.readString("lineContent")); domainObject.setFileName(fileName); domainObject.setExecutionId(executionId); return domainObject; } // 提供Setter方法,通过监听器注入外部数据 public void setFileName(String fileName) { this.fileName = fileName; } public void setExecutionId(Long executionId) { this.executionId = executionId; } }
3. 通过StepExecutionListener注入外部字段
@Bean public StepExecutionListener stepExecutionListener(CustomFieldSetMapper fieldSetMapper) { return new StepExecutionListenerSupport() { @Override public void beforeStep(StepExecution stepExecution) { // 注入作业执行ID fieldSetMapper.setExecutionId(stepExecution.getJobExecutionId()); // 注入文件名 FlatFileItemReader<MyDomainObject> reader = (FlatFileItemReader<MyDomainObject>) stepExecution.getStepContext() .getStepExecutionContext().get("flatFileItemReader"); if (reader != null) { Resource resource = reader.getResource(); try { fieldSetMapper.setFileName(resource.getFilename()); } catch (IOException e) { throw new RuntimeException("获取文件名失败", e); } } } }; } // 配置Step时添加监听器 @Bean public Step csvToDbStep(JobRepository jobRepository, PlatformTransactionManager transactionManager, FlatFileItemReader<MyDomainObject> itemReader, ItemWriter<MyDomainObject> itemWriter, StepExecutionListener stepExecutionListener) { return new StepBuilder("csvToDbStep", jobRepository) .<MyDomainObject, MyDomainObject>chunk(100, transactionManager) // 根据文件大小调整chunk值 .reader(itemReader) .writer(itemWriter) .listener(stepExecutionListener) .build(); }
方案二:完全自定义LineMapper
如果需要极致灵活的控制,可以直接实现LineMapper接口:
public class CustomCsvLineMapper implements LineMapper<MyDomainObject> { private String fileName; private Long executionId; @Override public MyDomainObject mapLine(String line, int lineNumber) throws Exception { MyDomainObject domainObject = new MyDomainObject(); domainObject.setLineContent(line); domainObject.setFileName(fileName); domainObject.setExecutionId(executionId); return domainObject; } // Setter方法用于注入外部数据 public void setFileName(String fileName) { this.fileName = fileName; } public void setExecutionId(Long executionId) { this.executionId = executionId; } }
配置ItemReader使用该自定义LineMapper:
@Bean public FlatFileItemReader<MyDomainObject> itemReader(Resource resource) { return new FlatFileItemReaderBuilder<MyDomainObject>() .name("csvLineReader") .resource(resource) .lineMapper(customCsvLineMapper()) .build(); } @Bean public CustomCsvLineMapper customCsvLineMapper() { return new CustomCsvLineMapper(); }
同样需要通过上述StepExecutionListener注入fileName和executionId。
关键注意事项
- execution_id的获取:只能通过
StepExecution获取运行时生成的作业执行ID,无法提前硬编码。 - file_name的获取:从ItemReader绑定的
Resource对象中读取,确保文件名与实际读取的文件一致。 - Chunk大小:根据CSV文件的体积和服务器内存情况调整,平衡处理性能与内存占用。
内容的提问来源于stack exchange,提问作者Ardoise012
相关产品推荐
相关产品推荐

