You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用BeautifulSoup和Selenium爬虫时的打印与CSV写入异常问题

问题分析与解决方案

为什么只输出最后一个标题?

你遇到的问题主要来自两个核心问题:

  1. CSV写入逻辑错误:你把文件写入代码放在了for循环外面,这时候title变量只会保留最后一次循环迭代的内容,自然只会写入最后一个标题。
  2. 动态页面加载的坑:Reddit是动态渲染的网站,直接调用driver.get(url)后立刻获取page_source,页面可能还没完全加载出所有帖子,导致post_box只抓到了少量(甚至最后一个)帖子元素,这也会让print看起来只输出最后一个标题。

修正后的代码

我调整了你的代码,解决了这两个问题,同时用更规范的方式处理文件写入:

from bs4 import BeautifulSoup
from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC
import csv

url = 'https://www.reddit.com/r/soccer/'
driver = webdriver.Chrome()
driver.get(url)

# 等待页面加载完成,确保所有帖子元素都渲染出来
try:
    # 最多等待10秒,直到目标帖子元素出现
    WebDriverWait(driver, 10).until(
        EC.presence_of_all_elements_located((By.CLASS_NAME, '_1poyrkZ7g36PawDueRza-J'))
    )
finally:
    soup = BeautifulSoup(driver.page_source, 'html.parser')
    driver.quit()  # 用完浏览器记得关闭,避免资源占用

post_box = soup.find_all('div', attrs={'class': '_1poyrkZ7g36PawDueRza-J'})

# 用csv模块规范写入,避免手动拼接的格式问题
filename = 'reddit_soccer.csv'
with open(filename, 'w', newline='', encoding='utf-8') as f:
    writer = csv.writer(f)
    writer.writerow(['Title'])  # 写入表头
    
    for info in post_box:
        try:
            title = info.h3.get_text(strip=True)
            print(title)  # 现在每次循环都会打印对应标题
            writer.writerow([title])  # 在循环内逐个写入标题
        except AttributeError:
            # 防止部分帖子结构异常(比如没有h3标签)导致程序崩溃
            print("跳过一个无标题的帖子")

关键改进点

  • 等待页面加载:用WebDriverWait等待帖子元素加载完成,确保能抓到所有已渲染的帖子内容。
  • 循环内写入CSV:把写入操作放到for循环内部,每个标题都会被及时写入文件。
  • 使用csv模块:避免手动拼接字符串导致的格式错误(比如标题里包含换行符的情况),同时处理编码问题保证内容正常显示。
  • 异常处理:加入try-except捕获可能的结构异常,防止程序中途崩溃。
  • 及时释放资源:用完Selenium后调用driver.quit()关闭浏览器,避免后台残留进程。

内容的提问来源于stack exchange,提问作者Rafael R

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.06 16:07:39