使用Python进行Web Scraping:从SEC 10K HTML文件提取地址
提取SEC 10K文件中的地址
- 你当前的代码获取了所有
div元素,会返回大量无关内容,需要精准定位到包含目标地址的span标签。 - 查看目标页面的HTML结构,目标地址位于class为"mailer street"的span标签内,可直接用这个CSS选择器定位。
修正后的代码如下:
from requests_html import HTMLSession # 创建会话并请求页面 s = HTMLSession() r = s.get('https://www.sec.gov/Archives/edgar/data/1652044/000165204419000032/goog10-qq32019.htm') # 精准定位目标span标签 address_element = r.html.find('span.mailer.street', first=True) # 提取并输出地址(处理元素不存在的情况) if address_element: target_address = address_element.text.strip() print(target_address) # 输出:1600 Amphitheatre parkway else: print("未找到目标地址")
- 关键说明:
- 使用
find()配合first=True直接获取第一个匹配元素(页面中该class的span仅一个) strip()去除文本前后的空白字符- 增加判断逻辑,避免元素不存在时触发错误
- 使用
内容的提问来源于stack exchange,提问作者Sushmitha Krishnan
相关产品推荐
相关产品推荐

