Java正则表达式使用问题:如何提取tenant字段指定内容
Java正则表达式匹配问题排查
问题场景
现有如下Java输入字符串:
String URL = "{Records=[{messageId=ac013823-100a-4b92-bb7a-a891b7b113d1, " + "receiptHandle=AQEBtDp6D3AVkifVlrM/No2dtCxxazqQOGjFcNrUO2t0JLS0awsBMEEwPfbdwrLyrO8ovneeAs3LIr30kPsx/T7NDP3mAOnYfPAMswHf4hQxQS2H7XCFc5ii/fCNai9FdaV+I/281MCHswfWYhoQII6e+alGmkPuwXPjBvQG6PDsFh9OF+/B05MBYP2uGR4mPoBfAJinDbabyZ7QaTEkgeATgvrHB7OmF0AJaJi/cN8bioZ2W+54bTi5HOJPF/oyCScGOYdTjtSDtvc1L+GP3qm2cC2m5XQ05ziCF3S7LUhjN6Go9EGkn1K1BLQPI/EbkIr8fGOzCmvl3NzE222pAArn2UxNCztSAerkpSfPTVAM72AOygXYXVWosmRMo4E7uT0H, body={\r\n" + " \"tenant\": \"https://example.com,us-east-1-oe-stg-001-lc000chart,us-east-1\"\r\n" + "}, attributes={ApproximateReceiveCount=455, " + "SentTimestamp=1722503530891, SenderId=AIDAQKVRD5OEBZLPV7XNP, " + "ApproximateFirstReceiveTimestamp=1722503535891}, messageAttributes={}, " + "md5OfBody=5a8e4022b9b9876a4c854e2a02d4c3b9, eventSource=aws:sqs, eventSourceARN=arn:aws:sqs:us-east-1:022920031112:teq, " + "awsRegion=us-east-1}]}";
需要提取从"tenant"开始到最后一个us-east-1的内容,即:
"tenant": "https://example.com,us-east-1-oe-stg-001-lc000chart,us-east-1
现有错误代码
你编写的正则表达式无法匹配成功,代码如下:
Pattern pattern = Pattern.compile("[^tenant]+[0-9a-zA-Z]+(,[0-9a-zA-Z]+)*$"); Matcher matcher = pattern.matcher(URL); if (matcher.find()) { System.out.println(matcher.group(0)); // prints /{item}/ } else { System.out.println("Match not found"); }
错误分析
你的正则完全不符合需求,核心问题有三点:
[^tenant]+理解错误:这个表达式不是匹配"tenant"之前的内容,而是匹配任意不包含t、e、n、a单个字符的内容,和你要从"tenant"开始匹配的需求完全相反。- 末尾
$锚点错误:$表示匹配字符串的结尾,但你要提取的内容并不在整个字符串的末尾,这个锚点会直接导致匹配失败。 - 字符范围覆盖不全:目标内容包含冒号、引号、斜杠、连字符等特殊字符,你的正则只允许字母数字和逗号,无法匹配这些字符。
修正方案
要实现需求,正则需要匹配从"tenant": "开始,到最后一个us-east-1的所有内容。利用贪婪模式的特性,.*会尽可能匹配到最远的us-east-1,正好符合要求。
修正后的完整代码:
String URL = "{Records=[{messageId=ac013823-100a-4b92-bb7a-a891b7b113d1, " + "receiptHandle=AQEBtDp6D3AVkifVlrM/No2dtCxxazqQOGjFcNrUO2t0JLS0awsBMEEwPfbdwrLyrO8ovneeAs3LIr30kPsx/T7NDP3mAOnYfPAMswHf4hQxQS2H7XCFc5ii/fCNai9FdaV+I/281MCHswfWYhoQII6e+alGmkPuwXPjBvQG6PDsFh9OF+/B05MBYP2uGR4mPoBfAJinDbabyZ7QaTEkgeATgvrHB7OmF0AJaJi/cN8bioZ2W+54bTi5HOJPF/oyCScGOYdTjtSDtvc1L+GP3qm2cC2m5XQ05ziCF3S7LUhjN6Go9EGkn1K1BLQPI/EbkIr8fGOzCmvl3NzE222pAArn2UxNCztSAerkpSfPTVAM72AOygXYXVWosmRMo4E7uT0H, body={\r\n" + " \"tenant\": \"https://example.com,us-east-1-oe-stg-001-lc000chart,us-east-1\"\r\n" + "}, attributes={ApproximateReceiveCount=455, " + "SentTimestamp=1722503530891, SenderId=AIDAQKVRD5OEBZLPV7XNP, " + "ApproximateFirstReceiveTimestamp=1722503535891}, messageAttributes={}, " + "md5OfBody=5a8e4022b9b9876a4c854e2a02d4c3b9, eventSource=aws:sqs, eventSourceARN=arn:aws:sqs:us-east-1:022920031112:teq, " + "awsRegion=us-east-1}]}"; Pattern pattern = Pattern.compile("\"tenant\": \\\"https://.*us-east-1"); Matcher matcher = pattern.matcher(URL); if (matcher.find()) { System.out.println(matcher.group(0)); } else { System.out.println("Match not found"); }
正则解释
"tenant\": \\\":匹配目标起始的固定字符串(Java中需要转义双引号,所以用\"表示实际的").*:贪婪匹配任意字符,直到找到最远的us-east-1us-east-1:作为匹配的结束标记,确保截取到目标位置
内容的提问来源于stack exchange,提问作者user2315104
相关产品推荐
相关产品推荐

