Python正则提取日志字符串出现转义斜杠,求解决方案
解决日志提取中的转义斜杠与冗余内容问题
让我来帮你梳理下问题所在,以及对应的解决办法:
问题根源
- 重复字符串转换:你把日志列表
logset转成字符串后,又再次调用str(Strres),相当于对字符串做了二次序列化,这直接导致单引号被转义成\'。 - 未针对性处理日志项:直接对整个日志列表转字符串后匹配,会把列表里所有日志(包括START/END/REPORT这些无关内容)混在一起,导致提取结果出现冗余。
修正后的代码实现
import re # 假设logset是你提供的原始日志列表 logset = [{'logStreamName': '2018/05/15/[$LATEST]e9c838560b4a43a8beab55c09b8cff61', 'timestamp': 1526397147847, 'message': 'START RequestId: 614b56e6-5852-11e8-a3d4-850c17ee5197 Version: $LATEST\n', 'ingestionTime': 1526397148010, 'eventId': '34039793865899822940373036294062893091972474685247389696'}, {'logStreamName': '2018/05/15/[$LATEST]e9c838560b4a43a8beab55c09b8cff61', 'timestamp': 1526397148227, 'message': "Ec2 Instances which are stopped: Instance ID: i-006690f105487930f Instance state: {'Code': 80, 'Name': 'stopped'} Instance type: t2.micro\n", 'ingestionTime': 1526397148215, 'eventId': '34039793874374106115814673088093836532895101688702042112'}] regex1 = r"Ec2 Instances.*micro" matches1 = [] # 遍历每个日志项,提取message字段再匹配 for log_item in logset: message = log_item.get('message', '') # 匹配当前message中的目标内容,strip去掉换行符 match = re.search(regex1, message.strip()) if match: matches1.append(match.group()) print(matches1)
代码说明
- 遍历日志项:直接操作列表中的每个字典元素,取出
message字段,避免对整个列表做字符串转换,从根源上消除转义斜杠。 - 精准匹配:用
re.search查找单条message中的目标内容,找到后加入结果列表,不会混入START/END等无关日志。 - 去除换行符:用
strip()去掉message末尾的换行符,让结果更整洁。
输出结果
执行后会得到你期望的干净结果:
["Ec2 Instances which are stopped: Instance ID: i-006690f105487930f Instance state: {'Code': 80, 'Name': 'stopped'} Instance type: t2.micro"]
内容的提问来源于stack exchange,提问作者Abdul Salam
相关产品推荐
相关产品推荐

