You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何从iahsp成员网站批量提取姓名及邮箱?求最简Web Scraping方案

最简单的网页数据提取操作指引

方法一:无需写代码的浏览器插件法(零门槛)

  • 打开Chrome浏览器,应用商店搜索「Scraper」插件并安装
  • 打开目标成员列表页面,滚动到底部加载完所有3000条成员信息
  • 右键点击第一个成员姓名,选择「Scraper」→「Create new scraper」
  • 在配置弹窗里做以下设置:
    • 先设置姓名抓取规则:右键检查姓名元素,复制它的CSS选择器填到「Selector」栏,字段名设为「Full Name」(后续可自行拆分姓名)
    • 开启「Follow link」选项,选择姓名对应的链接元素,让插件自动跳转到详情页
    • 在详情页里,右键检查邮箱元素,复制CSS选择器,添加新字段「Email」
  • 配置完点击「Scrape」,插件会自动遍历所有成员链接抓取数据,最后导出成CSV文件即可

方法二:极简Python脚本法(适合有基础电脑操作能力的)

  • 打开电脑的命令提示符(Win按Win+R输入cmd),输入pip install requests beautifulsoup4安装必要工具
  • 复制下面的脚本到记事本,保存为scrape_members.py:
import requests
from bs4 import BeautifulSoup
import csv
import time

# 成员列表页面地址
base_url = "https://www.iahsp.com/members"
# 模拟浏览器请求头,避免被拦截
headers = {"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0.0.0 Safari/537.36"}

# 获取成员列表
response = requests.get(base_url, headers=headers)
soup = BeautifulSoup(response.text, "html.parser")
# 替换成实际的成员姓名链接选择器(右键检查元素复制)
member_links = soup.select("a[href*='/member/']")

# 生成CSV文件
with open("iahsp_members.csv", "w", newline="", encoding="utf-8") as f:
    writer = csv.writer(f)
    writer.writerow(["First Name", "Last Name", "Email"])

    for idx, link in enumerate(member_links, 1):
        # 提取并拆分姓名
        full_name = link.get_text().strip()
        try:
            first_name, last_name = full_name.split(" ", 1)
        except:
            first_name = full_name
            last_name = ""
        # 访问详情页
        detail_url = link["href"]
        # 加1秒延迟,避免触发反爬
        time.sleep(1)
        detail_res = requests.get(detail_url, headers=headers)
        detail_soup = BeautifulSoup(detail_res.text, "html.parser")
        # 替换成实际的邮箱选择器
        email_tag = detail_soup.select_one("a[href^='mailto:']")
        email = email_tag.get_text().strip() if email_tag else "无邮箱"
        # 写入数据
        writer.writerow([first_name, last_name, email])
        print(f"已完成 {idx}/{len(member_links)}:{full_name}")
  • 右键检查网页元素,把脚本里的两个选择器(a[href*='/member/']和a[href^='mailto:'])替换成网页实际的选择器
  • 命令提示符里进入脚本所在文件夹,输入python scrape_members.py运行,等待完成后就能得到包含所有数据的CSV文件

注意事项

  • 插件法如果遇到滚动加载的列表,一定要先滑到底部加载完所有数据再开始配置
  • 脚本法里的延迟不能省,不然容易被网站封禁IP

内容的提问来源于stack exchange,提问作者Free Lancer

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.22 23:12:22