You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用HTMLAgilityPack爬取Dice网站无法获取职位URL的问题

解决Dice职位URL爬取无结果的问题

你遇到的问题核心是Dice的搜索结果是动态渲染的——页面初始加载的静态HTML里只有页面框架,实际职位数据是通过JavaScript调用后台API异步加载的,所以不管是直接看源码还是用HTMLAgilityPack解析静态HTML,都找不到职位URL。

下面是具体的解决方向:

  • 抓包获取数据接口:用Chrome开发者工具的「网络」面板,筛选XHR/Fetch类型的请求,找到返回职位数据的API接口。这类接口一般返回JSON格式内容,里面直接包含职位URL、标题、详情等信息,无需解析HTML就能提取数据。
    • 操作步骤:打开目标搜索页面,按F12打开开发者工具,切换到「网络」标签,刷新页面,在请求列表里找带有jobs、search这类关键词的接口,查看它的响应内容就能拿到你要的职位URL。
  • 模拟浏览器渲染页面:如果API接口有签名、token等复杂反爬验证,可使用支持JS渲染的工具(比如Puppeteer、Selenium)。这类工具会模拟真实浏览器加载页面,执行完所有JavaScript后再获取完整的DOM内容,之后你可以用HTMLAgilityPack解析,或者直接从工具里提取所需数据。
  • 适配反爬请求头:Dice会验证请求的合法性,爬取时要模拟真实浏览器的请求头,比如带上正确的User-Agent、Referer;部分接口需要携带登录或会话Cookie,可先手动访问页面获取Cookie后,将其加入爬取请求中。

内容的提问来源于stack exchange,提问作者Charlie Chaplin

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.21 10:45:39