如何用Python提取XML文件中重复的seekvideo子元素内容?
解决XML提取seekvideo内容并保存文件的问题
需求说明
处理大型XML文件,提取所有<seekvideo>标签的文本内容(忽略id属性),每个内容单独占一行,最终保存到以对应<talkid>命名的TXT文件中。原代码能在终端打印所有内容,但写入文件时仅保存最后一条。
XML示例
<xml> <file id="13"> <head> <talkid>2458</talkid> <transcription> <seekvideo id="645">THIS PART SHOULD BE EXTRACTED</seekvideo> <seekvideo id="3349">THIS PART SHOULD BE EXTRACTED</seekvideo> <seekvideo id="4937">THIS PART SHOULD BE EXTRACTED</seekvideo> <seekvideo id="7423">THIS PART SHOULD BE EXTRACTED</seekvideo> </transcription> </head> </file> </xml>
原代码问题
原代码仅用单个变量存储seekvideo内容,每次覆盖前值;且在<file>结束时仅写入最后一次的变量值,导致文件仅保存一条内容。
import xml.etree.ElementTree as ET from pathlib import Path all_talks = Path(r'test.xml') context = ET.iterparse(all_talks, events=('start', 'end')) for event, element in context: if event == 'end': if element.tag == 'talkid': title = element.text elif element.tag == 'seekvideo': seekvideo = element.text # print (seekvideo) elif element.tag == 'file' and title and seekvideo: with open(all_talks.with_name(title + '.txt'), 'w') as f: f.write(seekvideo) elif element.tag == 'file': seekvideo = title = None
修正后的代码
通过列表收集当前文件下所有seekvideo内容,处理完整个<file>标签后统一写入文件:
import xml.etree.ElementTree as ET from pathlib import Path all_talks = Path(r'test.xml') context = ET.iterparse(all_talks, events=('start', 'end')) for event, element in context: if event == 'start': if element.tag == 'file': # 进入file标签时初始化变量 title = None seekvideo_contents = [] elif event == 'end': if element.tag == 'talkid': title = element.text.strip() if element.text else None elif element.tag == 'seekvideo': # 收集每个seekvideo的文本内容 content = element.text.strip() if element.text else '' if content: seekvideo_contents.append(content) elif element.tag == 'file' and title and seekvideo_contents: # 处理完整个file后写入所有内容 output_file = all_talks.with_name(f"{title}.txt") with open(output_file, 'w', encoding='utf-8') as f: f.write('\n'.join(seekvideo_contents)) # 清理元素,避免内存泄漏(处理大型XML必备) element.clear()
代码说明
- 用
seekvideo_contents列表收集当前<file>下的所有有效seekvideo文本 - 处理
<talkid>时去除首尾空白,避免文件名异常 - 写入文件时用
'\n'.join()将列表内容转为每行一条的格式 - 添加
element.clear()清理已处理元素,避免处理大型XML时内存溢出
内容的提问来源于stack exchange,提问作者Leila
相关产品推荐
相关产品推荐

