You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用Antlr4的TokenStreamRewriter删除每行第66字符后的内容?

Antlr4 9.2 每行仅保留前66字符的实现方案

首先明确:TokenStreamRewriter 是作用在分词完成后的Token流上的组件,无法直接在文本进入分词器之前处理原始字符流。如果要实现「进入分词器前截断每行内容」的需求,优先选择字符流预处理方案,如果必须使用TokenStreamRewriter可以参考第二种方案。

方案1:预处理原始字符流(推荐)

直接在输入传给Antlr4的CharStream之前做逐行截断,逻辑简单性能高,完全匹配你的需求:

import org.antlr.v4.runtime.CharStreams;
import java.io.BufferedReader;
import java.io.StringReader;
import java.util.stream.Collectors;

// 原始输入文本
String rawInput = "你的原始输入内容";
// 逐行截断,仅保留前66个字符
String processedInput = new BufferedReader(new StringReader(rawInput))
        .lines()
        .map(line -> line.length() > 66 ? line.substring(0, 66) : line)
        .collect(Collectors.joining("\n"));
// 处理后的内容正常传入分词器即可
var charStream = CharStreams.fromString(processedInput);
var lexer = new YourCustomLexer(charStream);

方案2:使用TokenStreamRewriter实现

如果必须用TokenStreamRewriter处理,可以通过词法规则标记超长内容后删除:

1. 修改词法规则文件(.g4)

保证规则优先级顺序如下:

// 匹配每行前1-66个非换行字符,正常保留
LINE_VALID: ~[\n\r]{1,66};
// 匹配同一行内超出66字符后的剩余内容,标记为待删除Token
LINE_EXCESS: ~[\n\r]+;
// 匹配换行符,正常保留
NEWLINE: [\r\n]+;

2. 调用TokenStreamRewriter删除超长内容

import org.antlr.v4.runtime.CommonTokenStream;
import org.antlr.v4.runtime.TokenStreamRewriter;

// 省略分词器初始化步骤
CommonTokenStream tokenStream = new CommonTokenStream(lexer);
tokenStream.fill();
TokenStreamRewriter rewriter = new TokenStreamRewriter(tokenStream);
// 遍历所有Token,删除标记为LINE_EXCESS的内容
for (var token : tokenStream.getTokens()) {
    if (token.getType() == YourCustomLexer.LINE_EXCESS) {
        rewriter.delete(token);
    }
}
// 获得处理后的完整文本
String result = rewriter.getText();

注意事项

两种方案都会直接丢弃所有行首66个字符之后的内容,包括HTML加粗、斜体等标记,符合你的需求。

内容的提问来源于stack exchange,提问作者yaccoff

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.02 00:18:03