You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用Python提取XML文件中重复的seekvideo子元素内容?

解决XML提取seekvideo内容并保存文件的问题

需求说明

处理大型XML文件,提取所有<seekvideo>标签的文本内容(忽略id属性),每个内容单独占一行,最终保存到以对应<talkid>命名的TXT文件中。原代码能在终端打印所有内容,但写入文件时仅保存最后一条。

XML示例

<xml>
<file id="13">
  <head>
    <talkid>2458</talkid>
    <transcription>
      <seekvideo id="645">THIS PART SHOULD BE EXTRACTED</seekvideo>
      <seekvideo id="3349">THIS PART SHOULD BE EXTRACTED</seekvideo>
      <seekvideo id="4937">THIS PART SHOULD BE EXTRACTED</seekvideo>
      <seekvideo id="7423">THIS PART SHOULD BE EXTRACTED</seekvideo>
    </transcription>
  </head>
</file>
</xml>

原代码问题

原代码仅用单个变量存储seekvideo内容,每次覆盖前值;且在<file>结束时仅写入最后一次的变量值,导致文件仅保存一条内容。

import xml.etree.ElementTree as ET
from pathlib import Path

all_talks = Path(r'test.xml')
context = ET.iterparse(all_talks, events=('start', 'end'))

for event, element in context:
    if event == 'end':
        if element.tag == 'talkid':
            title = element.text
        elif  element.tag == 'seekvideo':
            seekvideo = element.text
            # print (seekvideo)
        elif element.tag == 'file' and title and seekvideo:
            with open(all_talks.with_name(title + '.txt'), 'w') as f:
                f.write(seekvideo)
    elif element.tag == 'file':
        seekvideo = title = None

修正后的代码

通过列表收集当前文件下所有seekvideo内容,处理完整个<file>标签后统一写入文件:

import xml.etree.ElementTree as ET
from pathlib import Path

all_talks = Path(r'test.xml')
context = ET.iterparse(all_talks, events=('start', 'end'))

for event, element in context:
    if event == 'start':
        if element.tag == 'file':
            # 进入file标签时初始化变量
            title = None
            seekvideo_contents = []
    elif event == 'end':
        if element.tag == 'talkid':
            title = element.text.strip() if element.text else None
        elif element.tag == 'seekvideo':
            # 收集每个seekvideo的文本内容
            content = element.text.strip() if element.text else ''
            if content:
                seekvideo_contents.append(content)
        elif element.tag == 'file' and title and seekvideo_contents:
            # 处理完整个file后写入所有内容
            output_file = all_talks.with_name(f"{title}.txt")
            with open(output_file, 'w', encoding='utf-8') as f:
                f.write('\n'.join(seekvideo_contents))
    # 清理元素,避免内存泄漏(处理大型XML必备)
    element.clear()

代码说明

  • 用seekvideo_contents列表收集当前<file>下的所有有效seekvideo文本
  • 处理<talkid>时去除首尾空白,避免文件名异常
  • 写入文件时用'\n'.join()将列表内容转为每行一条的格式
  • 添加element.clear()清理已处理元素,避免处理大型XML时内存溢出

内容的提问来源于stack exchange,提问作者Leila

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.15 05:55:15