You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python爬虫问题:无法从KakaoPay官网PR页面获取指定内容

无法爬取KakaoPay官网PR新闻区域数据,find_all返回空列表

我在使用Python爬取KakaoPay官网PR新闻页面(https://www.kakaopay.com/news/pr)时,无法获取目标区域的数据。执行代码后find_all返回空列表,推测未能成功获取body内的目标数据。以下是我的代码:

import requests
from bs4 import BeautifulSoup

url_kakao = "https://www.kakaopay.com/news/pr"
headers = {"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/**********"}
# 用户代理信息已隐去

res_kakao = requests.get(url_kakao, headers=headers)
res_kakao.raise_for_status()

soup_kakao = BeautifulSoup(res_kakao.text,'lxml')
kakao = soup_kakao.find_all("div",attrs={"class":"css-1mqcdgs e2lpi48"})
print(kakao)

原因分析

  1. 动态内容渲染:该页面的PR新闻内容是通过JavaScript动态加载的。requests库只能获取服务器返回的初始HTML源码,无法执行页面中的JavaScript,因此初始源码里不存在你要找的css-1mqcdgs e2lpi48类名对应的元素。
  2. 动态CSS类名:css-1mqcdgs这类带随机后缀的类名通常是由CSS-in-JS框架(如Tailwind CSS、Emotion)生成的,类名会随页面部署或刷新变化,依赖这类类名定位元素极不稳定。

解决方法

方法1:使用浏览器渲染工具(如Selenium)

通过模拟真实浏览器加载页面,等待JavaScript执行完成后再提取数据:

from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC

url_kakao = "https://www.kakaopay.com/news/pr"
driver = webdriver.Chrome()  # 需要提前安装ChromeDriver并配置环境变量
driver.get(url_kakao)

# 等待目标元素加载完成(用更稳定的元素结构定位)
wait = WebDriverWait(driver, 10)
news_items = wait.until(EC.presence_of_all_elements_located((By.CSS_SELECTOR, "div[role='listitem']")))

for item in news_items:
    title = item.find_element(By.CSS_SELECTOR, "h3").text
    date = item.find_element(By.CSS_SELECTOR, "span.css-1f8x35y").text
    print(f"标题: {title}, 日期: {date}")

driver.quit()

方法2:直接调用API接口(更高效)

打开浏览器开发者工具(F12),切换到「Network」标签页,刷新页面后筛选「XHR/Fetch」请求,可找到加载PR新闻数据的API接口。直接请求该接口能获取结构化的JSON数据,无需解析HTML:

import requests

# 需替换为实际抓取到的API接口地址
api_url = "https://www.kakaopay.com/api/news/pr/list"
headers = {
    "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/118.0.0.0",
    "Referer": "https://www.kakaopay.com/news/pr"
}

response = requests.get(api_url, headers=headers)
data = response.json()

for news in data["items"]:
    print(f"标题: {news['title']}, 日期: {news['date']}")

补充说明

KakaoPay官网并非完全禁止爬取,但需注意:

  • 遵守网站的robots.txt规则(可访问https://www.kakaopay.com/robots.txt查看)
  • 控制请求频率,避免给服务器造成过大压力
  • 不要用于商业用途或违反网站条款的行为

内容的提问来源于stack exchange,提问作者winone

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.21 07:00:14