如何用Antlr4的TokenStreamRewriter删除每行第66字符后的内容?
Antlr4 9.2 每行仅保留前66字符的实现方案
首先明确:TokenStreamRewriter 是作用在分词完成后的Token流上的组件,无法直接在文本进入分词器之前处理原始字符流。如果要实现「进入分词器前截断每行内容」的需求,优先选择字符流预处理方案,如果必须使用TokenStreamRewriter可以参考第二种方案。
方案1:预处理原始字符流(推荐)
直接在输入传给Antlr4的CharStream之前做逐行截断,逻辑简单性能高,完全匹配你的需求:
import org.antlr.v4.runtime.CharStreams; import java.io.BufferedReader; import java.io.StringReader; import java.util.stream.Collectors; // 原始输入文本 String rawInput = "你的原始输入内容"; // 逐行截断,仅保留前66个字符 String processedInput = new BufferedReader(new StringReader(rawInput)) .lines() .map(line -> line.length() > 66 ? line.substring(0, 66) : line) .collect(Collectors.joining("\n")); // 处理后的内容正常传入分词器即可 var charStream = CharStreams.fromString(processedInput); var lexer = new YourCustomLexer(charStream);
方案2:使用TokenStreamRewriter实现
如果必须用TokenStreamRewriter处理,可以通过词法规则标记超长内容后删除:
1. 修改词法规则文件(.g4)
保证规则优先级顺序如下:
// 匹配每行前1-66个非换行字符,正常保留 LINE_VALID: ~[\n\r]{1,66}; // 匹配同一行内超出66字符后的剩余内容,标记为待删除Token LINE_EXCESS: ~[\n\r]+; // 匹配换行符,正常保留 NEWLINE: [\r\n]+;
2. 调用TokenStreamRewriter删除超长内容
import org.antlr.v4.runtime.CommonTokenStream; import org.antlr.v4.runtime.TokenStreamRewriter; // 省略分词器初始化步骤 CommonTokenStream tokenStream = new CommonTokenStream(lexer); tokenStream.fill(); TokenStreamRewriter rewriter = new TokenStreamRewriter(tokenStream); // 遍历所有Token,删除标记为LINE_EXCESS的内容 for (var token : tokenStream.getTokens()) { if (token.getType() == YourCustomLexer.LINE_EXCESS) { rewriter.delete(token); } } // 获得处理后的完整文本 String result = rewriter.getText();
注意事项
两种方案都会直接丢弃所有行首66个字符之后的内容,包括HTML加粗、斜体等标记,符合你的需求。
内容的提问来源于stack exchange,提问作者yaccoff
相关产品推荐
相关产品推荐

