You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用MechanicalSoup捕获同一份验证码并提交表单?

解决MechanicalSoup捕获当前页面验证码的问题

你的问题核心在于单独用requests发起验证码请求时,脱离了MechanicalSoup的会话上下文——验证码是和当前会话的Cookies绑定的,新的requests请求相当于新开了一个会话,自然拿到的是不同的验证码。

要捕获当前页面显示的同一份验证码,必须复用MechanicalSoup已经建立好的会话,这样服务器才会认为你是同一个用户,返回和页面一致的验证码。

正确的实现步骤

  1. 保持MechanicalSoup的会话不中断,用它内部的session对象来请求验证码(这个session就是requests.Session实例,自动携带当前会话的所有Cookies)
  2. 保存验证码后,直接在同一个会话中提交表单,确保验证码和会话匹配

修改后的代码示例

from mechanicalsoup import StatefulBrowser

# 初始化浏览器并打开目标页面,建立会话
browser = mechanicalsoup.StatefulBrowser()
browser.open(site + ssite)
print(browser.get_url())

# 关键:用当前浏览器的会话请求验证码,保持Cookies一致
captcha_response = browser.session.get('https://uygulama.gtb.gov.tr/FirmaSorgulama/Captcha/CaptchaImage')

# 保存验证码到本地
with open('x.png', 'wb') as f:
    f.write(captcha_response.content)

# 接下来处理验证码识别(手动输入或OCR),然后提交表单
# 先找到页面中的表单
form = browser.select_form()
# 填充验证码(替换成实际的验证码输入框name和识别出的验证码)
form['captcha_field_name'] = '你读取到的验证码内容'
# 可以同时填充其他表单字段
form['other_field'] = '对应的值'
# 提交表单
response = browser.submit_selected()

更灵活的写法(从页面提取验证码URL)

如果验证码的URL是嵌入在页面的<img>标签里,建议不要硬编码URL,而是从页面中提取,这样适配性更强:

# 从当前页面找到验证码图片标签(根据实际的id/class/属性调整选择器)
captcha_img = browser.page.find('img', alt='验证码')
# 提取图片的src属性,转换为绝对URL
captcha_url = browser.absolute_url(captcha_img['src'])

# 用会话请求验证码
captcha_response = browser.session.get(captcha_url)
# 后续保存和提交步骤同上

注意事项

  • 不要在打开页面和请求验证码之间进行跳转或刷新操作,否则会话状态会改变,验证码也会随之更新
  • 提交表单时必须使用同一个StatefulBrowser实例,确保会话的一致性

内容的提问来源于stack exchange,提问作者emtiger

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.29 08:03:13