Python3+Beautiful Soup爬取URL时获模板变量而非真实链接求助
如何获取动态渲染的展览页面真实链接?
这个问题我之前也碰到过!核心原因是你请求到的HTML是前端模板未渲染的原始代码,{{ card.url }}是模板引擎(比如Handlebars、Vue)的占位符,真实链接是浏览器执行JS后才生成的,所以直接用requests+BeautifulSoup拿不到真实链接。下面给你两种可行的解决方案:
方案1:静态提取内嵌的JSON数据(高效优先)
很多网站会把动态渲染需要的数据内嵌在页面的<script>标签里,你可以先检查页面源码,找有没有包含展览链接的JSON结构:
示例代码
import requests from bs4 import BeautifulSoup import json import re url = 'https://www.somemuseum.org/exhibitions/current-exhibitions' req = requests.get(url) soup = BeautifulSoup(req.text, 'html.parser') # 查找包含展览数据的script标签(关键词可以根据实际页面调整) script_tag = soup.find('script', text=re.compile('card|exhibition')) if script_tag: # 用正则提取JSON部分(假设数据格式是window.cardData = {...}) json_match = re.search(r'window\.cardData\s*=\s*({.*?});', script_tag.text, re.DOTALL) if json_match: card_data = json.loads(json_match.group(1)) # 提取所有真实链接 real_links = [card['url'] for card in card_data.get('cards', [])] # 拼接成完整URL(如果是相对路径的话) full_links = [f'https://www.somemuseum.org{link}' for link in real_links] print(full_links)
方案2:用无头浏览器模拟渲染(通用可靠)
如果数据是通过AJAX异步加载的,或者内嵌JSON不好提取,就用无头浏览器模拟浏览器的渲染过程,拿到完全渲染后的页面:
示例代码(用Selenium)
from selenium import webdriver from selenium.webdriver.support.ui import WebDriverWait from selenium.webdriver.support import expected_conditions as EC from selenium.webdriver.common.by import By from bs4 import BeautifulSoup url = 'https://www.somemuseum.org/exhibitions/current-exhibitions' # 初始化Chrome浏览器(需提前安装ChromeDriver并配置环境) driver = webdriver.Chrome() driver.get(url) # 等待页面加载完成(等待目标元素出现) wait = WebDriverWait(driver, 10) wait.until(EC.presence_of_all_elements_located((By.CLASS_NAME, 'card--exhibit'))) # 获取渲染后的页面源码 page_source = driver.page_source driver.quit() # 解析真实链接 soup = BeautifulSoup(page_source, 'html.parser') links = soup.find_all('a', class_='card--exhibit') real_links = [link['href'] for link in links] full_links = [f'https://www.somemuseum.org{link}' for link in real_links] print(full_links)
内容的提问来源于stack exchange,提问作者marrowgari
相关产品推荐
相关产品推荐

