You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何修改HTML链接提取代码:保存所有链接并仅打印第4个?

提取HTML链接并获取第4个链接的实现方案

你的原代码存在一个问题:循环里每次用links = tag.get("href")赋值,会把之前的链接覆盖掉,最后links只会保留最后一个提取到的链接,没法存储所有链接。

修正后的代码如下:

from bs4 import BeautifulSoup

soup = BeautifulSoup(z["body"], features="lxml")
# 初始化空列表存所有链接
links = []
for tag in soup.find_all("a"):
    href = tag.get("href")
    # 只收集有效的非空链接
    if href:
        links.append(href)

# 打印第4个链接(Python索引从0开始,对应索引3)
if len(links) >= 4:
    print(links[3])
else:
    print("提取到的链接数量不足4个")

关键说明:

  • 先创建空列表links,用来累积所有提取到的链接,而不是每次覆盖单个变量
  • 过滤空href:有些<a>标签可能没有href属性,会返回None,这类无效值可以直接跳过
  • 注意索引:Python列表是从0开始计数的,第4个元素对应的索引是3
  • 加长度判断:避免当链接总数不足4个时,出现索引越界的报错

内容的提问来源于stack exchange,提问作者pylol

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.20 02:25:16