You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python中如何从XML格式字符串列表提取文本?

从XML字符串中提取文本的可行方案
  • 用专业XML解析库(优先选)
    别用正则表达式硬匹配,XML结构多变,正则很容易漏判或误提取。直接用对应编程语言的XML解析工具:

    • Python:用xml.etree.ElementTree或者lxml,递归遍历所有元素提取文本内容。示例代码:
      import xml.etree.ElementTree as ET
      
      def extract_xml_text(xml_str):
          # 先清理字符串里的多余引号转义
          cleaned_str = xml_str.replace("''", "\"").strip()
          root = ET.fromstring(cleaned_str)
          
          def get_text(node):
              text = node.text or ""
              for child in node:
                  text += get_text(child) + (child.tail or "")
              return text.strip()
          
          return get_text(root)
      
    • Java:用javax.xml.parsers.DocumentBuilder或者jsoup(支持XML解析)
    • JavaScript:用DOMParser解析XML文档后遍历节点提取文本
  • 处理特殊场景

    • 自闭合标签(比如<img/>)本身无文本,直接跳过
    • 提取后清理文本:去掉多余空格、换行符,统一格式
    • 应对XML声明、命名空间:如果字符串带XML声明,解析库大多能自动处理;遇到命名空间,解析时需指定对应前缀
  • 批量处理优化
    面对超大规模字符串集合时:

    • 用流式解析(比如Python的iterparse),避免一次性加载所有内容占满内存
    • 用多线程/多进程并行处理,提升整体效率

内容的提问来源于stack exchange,提问作者Eghbal

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.07 16:35:07