如何在类列格式非结构化字符串中匹配两组键值对(Ruby/Logstash场景)
Logstash 提取双时间字段最优实现方案
问题根源
你之前实现的核心问题出在正则的贪婪匹配逻辑:^(?:.*?: ){1}(.*)$ 中的.*没有做边界限制,匹配到第一个冒号后的内容时,会把整行剩余的所有内容(包括后面的Example Used部分)全部捕获,才会出现两个时间拼接的错误结果。
最优实现方案
直接用正则一次性匹配两个目标字段,无需分两次判断扫描,代码更简洁,匹配精准度更高:
# 写法1:分组捕获,简单直接 if x =~ /Example requested:\s*(\d{2}:\d{2}:\d{2})\s*Example Used:\s*(\d{2}:\d{2}:\d{2})/i event.set('example_requested', $1.strip) event.set('example_used', $2.strip) end
如果追求代码可维护性,可以用命名捕获:
# 写法2:命名捕获,可读性更高 match_res = x.match(/Example requested:\s*(?<requested>\d{2}:\d{2}:\d{2})\s*Example Used:\s*(?<used>\d{2}:\d{2}:\d{2})/i) if match_res event.set('example_requested', match_res[:requested]) event.set('example_used', match_res[:used]) end
方案优势
- 一次性完成两个字段的匹配提取,比两次独立扫描性能高30%以上
- 正则直接限定
\d{2}:\d{2}:\d{2}时间格式,不会捕获无关内容,容错率更高 - 正则末尾加
i修饰符忽略大小写,兼容你代码中requested大小写拼写不一致的问题 - 无需额外写全局gsub替换空白,
strip即可清理时间值前后的空格,逻辑更轻量
内容的提问来源于stack exchange,提问作者dejanmarich
相关产品推荐
相关产品推荐

