如何从包含多元素值的XML字符串中提取Category字段的取值
你可以分两步完成提取:
- 第一步:先提取XML中
<worknotes>标签包裹的所有文本内容 - 第二步:从提取到的文本中匹配
Category:后的字段值,截止到换行/空格前的内容就是目标取值
Python 实现示例
import re # 替换为你实际的XML内容 xml_text = """ xx xx xx <worknotes> Detailed Description:xxx-- MM Info:xxx-- Opened by:xxxOpened at: 2020-11-25 20:21:22Email:aa@aa.com Entity: xxx Location:xxxCategory:xxxxxx Site:xxxx Service:xxx WorkInfo:xxx </worknotes> xx xx xx """ # 先匹配worknotes标签内容 worknotes_res = re.search(r'<worknotes>(.*?)</worknotes>', xml_text, re.DOTALL) if worknotes_res: worknotes_content = worknotes_res.group(1) # 提取Category字段值 category_res = re.search(r'Category:([^\s\n]+)', worknotes_content) if category_res: category_value = category_res.group(1).strip() print(category_value)
Shell 快速实现(适用于Linux/macOS环境)
grep -oP '(?<=Category:)[^\s\n]+' 你的XML文件路径
内容的提问来源于stack exchange,提问作者sathwik ajiri
相关产品推荐
相关产品推荐

