如何在Spring Batch中避免读取FlatFile中的无用记录
Spring Batch 跳过指定无用记录的实现方案
针对你处理20GB大文件、需要跳过Type=REJECT类无用记录的场景,Spring Batch可以通过以下两种高效方式实现,核心思路是在读取/映射阶段直接过滤,避免无用记录进入后续处理流程:
方案一:自定义LineMapper在映射阶段过滤(推荐,内存效率更高)
在将文件行映射为业务对象前,直接判断行内容是否为无用记录,返回null让Reader自动跳过该行,无需创建无用对象:
1. 实现自定义LineMapper
public class FilteredLineMapper implements LineMapper<YourBusinessItem> { private final DefaultLineMapper<YourBusinessItem> delegate = new DefaultLineMapper<>(); public FilteredLineMapper() { // 初始化默认LineMapper的解析规则(根据你的文件格式调整) DelimitedLineTokenizer tokenizer = new DelimitedLineTokenizer(); tokenizer.setNames("Type", "FieldA", "FieldB", "..."); // 对应文件字段名 tokenizer.setDelimiter(","); // 假设是逗号分隔的CSV文件 BeanWrapperFieldSetMapper<YourBusinessItem> fieldSetMapper = new BeanWrapperFieldSetMapper<>(); fieldSetMapper.setTargetType(YourBusinessItem.class); delegate.setLineTokenizer(tokenizer); delegate.setFieldSetMapper(fieldSetMapper); } @Override public YourBusinessItem mapLine(String line, int lineNumber) throws Exception { // 先解析行获取Type字段,判断是否为REJECT FieldSet fieldSet = delegate.getLineTokenizer().tokenize(line); if ("REJECT".equals(fieldSet.readString("Type"))) { return null; // 返回null表示跳过该行 } // 正常映射为业务对象 return delegate.mapLine(line, lineNumber); } }
2. 配置FlatFileItemReader
将自定义LineMapper注入Reader,还可配置跳过回调记录日志:
@Bean public FlatFileItemReader<YourBusinessItem> largeFileReader() { return new FlatFileItemReaderBuilder<YourBusinessItem>() .name("20GBFileReader") .resource(new FileSystemResource("/path/to/third-party-file.txt")) .lineMapper(new FilteredLineMapper()) // 可选:记录跳过的行信息,便于排查 .skippedLinesCallback((line, lineNumber) -> log.warn("跳过无用记录:行号{},内容{}", lineNumber, line) ) .build(); }
方案二:通过ItemProcessor过滤(适合已有成熟Reader配置的场景)
如果不想修改Reader的LineMapper,可在Processor阶段返回null,Spring Batch会自动跳过该Item,不进入Writer流程:
@Bean public ItemProcessor<YourBusinessItem, YourBusinessItem> rejectRecordFilterProcessor() { return item -> { if ("REJECT".equals(item.getType())) { return null; // 返回null过滤该记录 } return item; // 正常记录继续流转 }; }
然后在Step配置中添加该Processor即可。
注意事项
- 两种方案均为流式处理,逐行读取判断,不会将20GB文件一次性加载到内存,避免内存溢出;
- 方案一效率更高,因为无需创建无用的业务对象,直接在解析行阶段过滤;
- 可根据文件格式调整判断逻辑(比如固定长度文件需用
FixedLengthTokenizer,而非DelimitedLineTokenizer)。
内容的提问来源于stack exchange,提问作者PAA
相关产品推荐
相关产品推荐

