You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用Python进行Web Scraping:从SEC 10K HTML文件提取地址

提取SEC 10K文件中的地址
  • 你当前的代码获取了所有div元素,会返回大量无关内容,需要精准定位到包含目标地址的span标签。
  • 查看目标页面的HTML结构,目标地址位于class为"mailer street"的span标签内,可直接用这个CSS选择器定位。

修正后的代码如下:

from requests_html import HTMLSession

# 创建会话并请求页面
s = HTMLSession()
r = s.get('https://www.sec.gov/Archives/edgar/data/1652044/000165204419000032/goog10-qq32019.htm')

# 精准定位目标span标签
address_element = r.html.find('span.mailer.street', first=True)

# 提取并输出地址(处理元素不存在的情况)
if address_element:
    target_address = address_element.text.strip()
    print(target_address)  # 输出:1600 Amphitheatre parkway
else:
    print("未找到目标地址")
  • 关键说明:
    • 使用find()配合first=True直接获取第一个匹配元素(页面中该class的span仅一个)
    • strip()去除文本前后的空白字符
    • 增加判断逻辑,避免元素不存在时触发错误

内容的提问来源于stack exchange,提问作者Sushmitha Krishnan

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.02 13:15:57