使用BeautifulSoup和Selenium爬虫时的打印与CSV写入异常问题
问题分析与解决方案
为什么只输出最后一个标题?
你遇到的问题主要来自两个核心问题:
- CSV写入逻辑错误:你把文件写入代码放在了
for循环外面,这时候title变量只会保留最后一次循环迭代的内容,自然只会写入最后一个标题。 - 动态页面加载的坑:Reddit是动态渲染的网站,直接调用
driver.get(url)后立刻获取page_source,页面可能还没完全加载出所有帖子,导致post_box只抓到了少量(甚至最后一个)帖子元素,这也会让print看起来只输出最后一个标题。
修正后的代码
我调整了你的代码,解决了这两个问题,同时用更规范的方式处理文件写入:
from bs4 import BeautifulSoup from selenium import webdriver from selenium.webdriver.common.by import By from selenium.webdriver.support.ui import WebDriverWait from selenium.webdriver.support import expected_conditions as EC import csv url = 'https://www.reddit.com/r/soccer/' driver = webdriver.Chrome() driver.get(url) # 等待页面加载完成,确保所有帖子元素都渲染出来 try: # 最多等待10秒,直到目标帖子元素出现 WebDriverWait(driver, 10).until( EC.presence_of_all_elements_located((By.CLASS_NAME, '_1poyrkZ7g36PawDueRza-J')) ) finally: soup = BeautifulSoup(driver.page_source, 'html.parser') driver.quit() # 用完浏览器记得关闭,避免资源占用 post_box = soup.find_all('div', attrs={'class': '_1poyrkZ7g36PawDueRza-J'}) # 用csv模块规范写入,避免手动拼接的格式问题 filename = 'reddit_soccer.csv' with open(filename, 'w', newline='', encoding='utf-8') as f: writer = csv.writer(f) writer.writerow(['Title']) # 写入表头 for info in post_box: try: title = info.h3.get_text(strip=True) print(title) # 现在每次循环都会打印对应标题 writer.writerow([title]) # 在循环内逐个写入标题 except AttributeError: # 防止部分帖子结构异常(比如没有h3标签)导致程序崩溃 print("跳过一个无标题的帖子")
关键改进点
- 等待页面加载:用
WebDriverWait等待帖子元素加载完成,确保能抓到所有已渲染的帖子内容。 - 循环内写入CSV:把写入操作放到
for循环内部,每个标题都会被及时写入文件。 - 使用csv模块:避免手动拼接字符串导致的格式错误(比如标题里包含换行符的情况),同时处理编码问题保证内容正常显示。
- 异常处理:加入
try-except捕获可能的结构异常,防止程序中途崩溃。 - 及时释放资源:用完Selenium后调用
driver.quit()关闭浏览器,避免后台残留进程。
内容的提问来源于stack exchange,提问作者Rafael R
相关产品推荐
相关产品推荐

