You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何仅提取目标值?基于bs4、requests与pandas的技术问询

提取网页目标值的实现方法

核心步骤

  • 发起网页请求获取HTML源码
  • 用BeautifulSoup解析页面结构
  • 精准定位目标数值所在的HTML元素
  • 提取文本并清洗转换为可用数值

示例代码(适配图片中的表格结构)

假设目标数值在表格每行的第二列(对应图片里的数字列),代码如下:

# 替换为你要爬取的目标网页地址
target_url = "你的网页URL"

# 请求网页,添加短延迟避免触发反爬机制
resp = requests.get(target_url)
sleep(1)

# 解析HTML内容
soup = BeautifulSoup(resp.text, "html.parser")

# 定位所有目标数值所在的单元格(表格每行的第二个<td>标签)
value_cells = soup.select("tr td:nth-child(2)")

# 提取并清洗数值
result_values = []
for cell in value_cells:
    raw_text = cell.get_text(strip=True)
    # 处理带逗号的数值(比如1,234),并转换为整数/浮点数
    cleaned_text = raw_text.replace(",", "")
    try:
        result_values.append(int(cleaned_text))
    except ValueError:
        try:
            result_values.append(float(cleaned_text))
        except ValueError:
            # 跳过非数值内容
            continue

# 转为DataFrame方便后续分析
result_df = pd.DataFrame({"目标数值": result_values})
print(result_df)

注意事项

  • 如果目标元素有专属类名/id,直接用soup.find_all("td", class_="your-class-name")定位,比按列数定位更可靠
  • 若网页是动态加载(比如数值通过JS渲染),静态请求无法获取的话,需要额外引入selenium库处理动态内容

内容的提问来源于stack exchange,提问作者Vladyslav Nazarov

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.15 16:55:30