You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用Python的lxml库替换网页链接的href属性?

解决lxml替换样式表href并保存HTML的问题

你的代码核心问题是错误地通过字符串替换修改内容,没有直接操作lxml的元素对象,导致修改无法生效。正确的做法是直接遍历目标元素,修改其href属性,最后将修改后的元素树保存为文件。

修正后的完整代码

import requests
from lxml import html

# 获取目标页面内容
page = requests.get('https://www.flashscore.co.uk/basketball/') 
root = html.fromstring(page.content)

# 直接筛选并修改符合条件的样式表链接
# XPath定位:所有带href属性且href以/开头的link标签
stylesheets = root.xpath('//link[@href and starts-with(@href, "/")]')
for link in stylesheets:
    original_href = link.get('href')
    # 去除href开头的斜杠
    new_href = original_href.lstrip('/')
    # 直接修改元素的href属性
    link.set('href', new_href)

# 将修改后的元素树转为HTML字符串
modified_html = html.tostring(root, encoding='unicode')

# 保存到新文件
with open('modified_basketball_page.html', 'w', encoding='utf-8') as f:
    f.write(modified_html)

关键优化点

  • 简化元素筛选:用XPath一步定位到目标link元素,无需额外生成原链接/新链接列表,减少冗余代码
  • 正确修改属性:使用lxml内置的link.set()方法直接修改元素属性,这是操作XML/HTML元素的标准方式
  • 统一生成HTML:修改完成后一次性将元素树转为字符串,避免多次转换导致的错误

逻辑说明

  1. 元素定位://link[@href and starts-with(@href, "/")]精准筛选出需要修改的样式表链接,避免处理无关元素
  2. 属性修改:link.set()直接修改内存中的元素对象,确保修改生效
  3. 文件保存:指定encoding='unicode'避免字节编码问题,用UTF-8编码写入文件保证内容完整性

内容的提问来源于stack exchange,提问作者DumbMathBoy

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.03 11:40:23