使用requests爬取jlptsensei.com部分页面失效,求技术原因分析
爬取jlptsensei.com部分页面失效的问题分析
问题场景
爬取jlptsensei.com制作日语学习笔记时,约10%的页面出现爬取失效:页面外观与正常页面无差异,但requests.get()仅返回部分JavaScript代码,无法用BeautifulSoup提取目标内容(如带eng-definition p-lg类的元素)。测试代码如下:
import requests from bs4 import BeautifulSoup # 正常返回内容的页面 url = 'https://jlptsensei.com/learn-japanese-kanji/%e6%97%a5-nichi-jitsu-day-sun/' result = requests.get(url) doc = BeautifulSoup(result.text, 'html.parser') title = doc.find(class_='eng-definition p-lg') print(title) print('\n') # 失效页面(仅返回JS代码) url = 'https://jlptsensei.com/learn-japanese-kanji/%e4%bc%9a-kai-au-meet/' result = requests.get(url) doc = BeautifulSoup(result.text, 'html.parser') title = doc.find(clas_='eng-definition p-lg') # 注:此处存在拼写错误,应为class_ print(title)
执行结果:第一个页面能提取到「day, sun, Japan, counter for days」,第二个页面返回None。
原因分析
- 客户端渲染(CSR)反爬:网站对部分页面采用客户端渲染机制,核心内容需要浏览器执行JavaScript后才会生成。
requests仅能获取服务器返回的初始HTML(含JS代码),无法执行JS,因此拿不到渲染后的实际内容。 - 差异化反爬触发:网站可能根据请求频率、请求特征(如UA完整性、Cookie状态)动态调整响应策略。你的请求被判定为可疑时,会触发CSR渲染的反爬逻辑;而大部分请求符合正常特征,服务器直接返回SSR(服务器端渲染)的完整HTML。
- 代码拼写错误:第二个
find方法中clas_是拼写错误,正确应为class_,但这不是导致返回None的核心原因——即使修正拼写,不完整的初始HTML里也没有目标元素。
解决方案
1. 使用支持JS渲染的工具
用selenium或playwright模拟真实浏览器行为,等待JS执行完成后提取内容。示例代码(selenium):
from selenium import webdriver from selenium.webdriver.common.by import By from selenium.webdriver.support.ui import WebDriverWait from selenium.webdriver.support import expected_conditions as EC url = 'https://jlptsensei.com/learn-japanese-kanji/%e4%bc%9a-kai-au-meet/' # 初始化浏览器驱动(需提前对应浏览器安装驱动) driver = webdriver.Chrome() driver.get(url) # 等待目标元素加载完成,超时时间10秒 try: target_element = WebDriverWait(driver, 10).until( EC.presence_of_element_located((By.CLASS_NAME, 'eng-definition')) ) print(target_element.text) finally: driver.quit()
2. 完善请求特征与频率控制
- 补充完整请求头:除UA外,添加
Referer、Accept-Language、Accept-Encoding等字段,模拟真实浏览器请求。 - 控制请求间隔:避免短时间内批量请求,可加入
time.sleep()控制频率,降低被判定为爬虫的概率。 - 复用会话:使用
requests.Session()保持Cookie一致性,模拟用户浏览的会话状态。
内容的提问来源于stack exchange,提问作者petyko077
相关产品推荐
相关产品推荐

