Python爬虫问题:无法从KakaoPay官网PR页面获取指定内容
无法爬取KakaoPay官网PR新闻区域数据,find_all返回空列表
我在使用Python爬取KakaoPay官网PR新闻页面(https://www.kakaopay.com/news/pr)时,无法获取目标区域的数据。执行代码后find_all返回空列表,推测未能成功获取body内的目标数据。以下是我的代码:
import requests from bs4 import BeautifulSoup url_kakao = "https://www.kakaopay.com/news/pr" headers = {"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/**********"} # 用户代理信息已隐去 res_kakao = requests.get(url_kakao, headers=headers) res_kakao.raise_for_status() soup_kakao = BeautifulSoup(res_kakao.text,'lxml') kakao = soup_kakao.find_all("div",attrs={"class":"css-1mqcdgs e2lpi48"}) print(kakao)
原因分析
- 动态内容渲染:该页面的PR新闻内容是通过JavaScript动态加载的。
requests库只能获取服务器返回的初始HTML源码,无法执行页面中的JavaScript,因此初始源码里不存在你要找的css-1mqcdgs e2lpi48类名对应的元素。 - 动态CSS类名:
css-1mqcdgs这类带随机后缀的类名通常是由CSS-in-JS框架(如Tailwind CSS、Emotion)生成的,类名会随页面部署或刷新变化,依赖这类类名定位元素极不稳定。
解决方法
方法1:使用浏览器渲染工具(如Selenium)
通过模拟真实浏览器加载页面,等待JavaScript执行完成后再提取数据:
from selenium import webdriver from selenium.webdriver.common.by import By from selenium.webdriver.support.ui import WebDriverWait from selenium.webdriver.support import expected_conditions as EC url_kakao = "https://www.kakaopay.com/news/pr" driver = webdriver.Chrome() # 需要提前安装ChromeDriver并配置环境变量 driver.get(url_kakao) # 等待目标元素加载完成(用更稳定的元素结构定位) wait = WebDriverWait(driver, 10) news_items = wait.until(EC.presence_of_all_elements_located((By.CSS_SELECTOR, "div[role='listitem']"))) for item in news_items: title = item.find_element(By.CSS_SELECTOR, "h3").text date = item.find_element(By.CSS_SELECTOR, "span.css-1f8x35y").text print(f"标题: {title}, 日期: {date}") driver.quit()
方法2:直接调用API接口(更高效)
打开浏览器开发者工具(F12),切换到「Network」标签页,刷新页面后筛选「XHR/Fetch」请求,可找到加载PR新闻数据的API接口。直接请求该接口能获取结构化的JSON数据,无需解析HTML:
import requests # 需替换为实际抓取到的API接口地址 api_url = "https://www.kakaopay.com/api/news/pr/list" headers = { "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/118.0.0.0", "Referer": "https://www.kakaopay.com/news/pr" } response = requests.get(api_url, headers=headers) data = response.json() for news in data["items"]: print(f"标题: {news['title']}, 日期: {news['date']}")
补充说明
KakaoPay官网并非完全禁止爬取,但需注意:
- 遵守网站的
robots.txt规则(可访问https://www.kakaopay.com/robots.txt查看) - 控制请求频率,避免给服务器造成过大压力
- 不要用于商业用途或违反网站条款的行为
内容的提问来源于stack exchange,提问作者winone
相关产品推荐
相关产品推荐

