You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Selenium调用browser.get()报错'url must be a string'如何解决

错误原因

  • 类型错误:你代码里output.append([link.get_attribute('href')])这行把href字符串套进了列表再存入output,后续调用browser.get(b)时传入的b是列表类型,不符合方法要求的字符串参数要求,直接触发报错。
  • 逻辑冗余错误:你在遍历单个商品链接的循环里嵌套了遍历整个output的循环,每新增一个链接就会重复访问之前所有已经访问过的商品页,不仅效率极低,还会导致中途页面跳转到详情页后,后续的列表页元素定位失败。

修正方案

建议先把所有分页的商品链接全部收集完成后,再统一遍历访问,避免页面中途跳转影响列表元素采集,修正后的代码如下:

!pip install selenium
from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support.wait import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC
import time

browser = webdriver.Chrome(executable_path='./chromedriver.exe')
wait = WebDriverWait(browser,5)
# 直接存储链接字符串,不需要套列表
output = []

# 第一步:遍历所有分页收集全部商品链接
# range参数可以根据实际总页数调整,示例为采集前2页
for i in range(1,3):
    browser.get("https://tw.mall.yahoo.com/search/product?p=%E5%B1%88%E8%87%A3%E6%B0%8F&pg={}".format(i))
    # 等待商品列表加载完成
    wait.until(EC.presence_of_element_located((By.XPATH,"//ul[@class='gridList']")))
    # 获取当前页所有商品链接元素
    product_links = browser.find_elements(By.XPATH,"//ul[@class='gridList']/li/a")
    for link in product_links:
        href = link.get_attribute('href')
        print(href)
        # 直接存入字符串,不要嵌套列表
        output.append(href)

# 第二步:统一遍历访问所有商品详情页
for product_url in output:
    browser.get(product_url)
    # 此处可以添加详情页的爬取逻辑,比如等待元素加载、提取字段等
    # 示例添加1秒延时避免请求过快被站点限制
    time.sleep(1)

# 全部任务处理完成后关闭浏览器
browser.quit()

如果不需要保留所有链接供后续使用,也可以在拿到单个商品链接时新开标签页访问,避免页面跳走影响当前列表页的后续采集操作。

内容的提问来源于stack exchange,提问作者QQdingyen

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.24 17:15:01