使用pollEnrich时是否会将整个文件内容加载至内存?
你的假设完全正确!
没错,pollEnrich在处理这个文件时确实会把整个abc.txt的内容一次性加载到内存中,这就是你在标记1的process里能拿到完整文件内容的原因。
为什么会这样?
pollEnrich的核心逻辑是同步拉取目标端点(这里是file:in/?fileName=abc.txt)的输出,并将其完整注入到当前Exchange的消息体中。而Camel的File组件默认行为是把文件内容读取为String(或byte[])返回,所以哪怕你后续用了split().streaming(),也改变不了pollEnrich已经提前把全量文件加载进内存的事实——流式拆分只是在内存里的完整内容上做逐行处理而已,并没有真正实现边读边处理的低内存开销。
怎么解决超大文件的内存问题?
如果你的目标是处理超大文件时避免内存溢出,有两种更合适的方案:
方案1:直接从File端点启动路由(推荐)
如果业务允许调整路由结构,完全可以跳过pollEnrich,直接从文件端点开始路由,这样split().streaming()就能真正实现流式读取,逐行处理文件,不会把整个文件加载到内存:
from("file:in/?fileName=abc.txt") .split(body().tokenize("\n")).streaming().stopOnException() .process(exchange -> { String line = exchange.getIn().getBody(String.class); // 这里处理每一行内容 });
方案2:让pollEnrich返回InputStream并流式处理
如果必须保留pollEnrich的结构,可以给File组件添加stream=true参数,让它返回InputStream而非完整的字符串,然后基于流做拆分处理,这样也能避免全量加载:
from("direct:fooBar") .pollEnrich() .simple("file:in/?fileName=abc.txt&stream=true") // 返回InputStream .split(bodyAs(InputStream.class).tokenize("\n")).streaming().stopOnException() .process(exchange -> { String line = exchange.getIn().getBody(String.class); // 逐行处理内容 });
这种方式下,pollEnrich只会拿到文件的输入流对象,而split会基于流逐行读取,内存里只会保留当前处理的那一行数据,真正实现低内存开销。
内容的提问来源于stack exchange,提问作者A5300
相关产品推荐
相关产品推荐

