You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用requests.get()获取的HTML代码与浏览器检查元素实际内容不一致

问题成因
  1. 动态客户端渲染
    该站点的核心列表内容由JavaScript动态加载生成,requests库只能获取服务端返回的初始静态HTML,不会执行页面内嵌的JS代码;而浏览器打开页面时会自动运行所有JS脚本、拉取异步数据并修改DOM结构,你在F12元素面板看到的是JS执行完成后的最终DOM,二者自然存在差异,这是该类问题最常见的原因。
  2. 反爬校验触发
    你当前仅携带了User-Agent请求头,部分站点会对请求做更严格的校验,缺失Cookie、Referer、Accept等必要请求头的请求会被识别为爬虫,返回验证页、空白页或简化版内容,和正常浏览器访问结果不一致。
  3. 会话状态差异
    浏览器访问站点时会保留登录态、历史浏览记录等Cookie信息,未登录和登录用户看到的页面内容本身就存在差异,requests默认发起无状态请求,拿到的是未授权游客视角的页面内容,也会和你本地浏览器的登录态页面有区别。
解决方案
  • 先校验请求返回结果:先打印halaman.status_code确认返回状态是否为200,若状态异常或返回内容是验证页,直接复制浏览器中对应请求的全部请求头替换当前的header参数,必要时先请求站点首页获取合法Cookie后再发起搜索请求。
  • 优先抓异步数据接口:打开浏览器控制台的「网络」面板,筛选XHR/ Fetch请求,刷新页面后找到返回房源列表数据的接口,直接请求该接口获取JSON格式的结构化数据,比解析HTML效率更高,也能避开动态渲染问题。
  • 若接口加密无法调用,使用无头浏览器模拟渲染:使用Selenium、Playwright等工具模拟真实浏览器运行,等待JS渲染完成后再提取页面源码,就能拿到和浏览器一致的内容,参考代码如下:
from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC

# 初始化Chrome浏览器
driver = webdriver.Chrome()
driver.get("https://mamikos.com/cari/ugm-bulaksumur-caturtunggal-kabupaten-sleman-daerah-istimewa-yogyakarta-indonesia/all/bulanan/0-15000000")
# 等待列表核心元素加载完成,可替换为页面实际存在的元素类名/ID
WebDriverWait(driver, 10).until(EC.presence_of_element_located((By.CLASS_NAME, "kost-list-item")))
# 获取渲染完成的完整页面源码
full_html = driver.page_source
driver.quit()
# 后续用BeautifulSoup解析full_html即可
soup = BeautifulSoup(full_html, 'html.parser')

内容的提问来源于stack exchange,提问作者Christo Ray

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.27 14:36:04