You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何让Beautiful Soup抓取多语言站点下同URL的阿拉伯语页面

解决方案

问题原因

  • 你自定义的Accept-Language请求头格式不符合HTTP标准,同时缺少User-Agent等浏览器常规请求头,站点的安全防护机制将你的请求判定为恶意爬虫直接拦截
  • 原有代码调用soup.getText忘记加括号,get_text是类方法需要传入括号执行调用

修复步骤

1. 修正并补全请求头

按照标准HTTP规范设置Accept-Language为阿拉伯语优先,补充浏览器常规请求头绕过拦截,示例配置如下:

import requests
from bs4 import BeautifulSoup

headers = {
    "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0.0.0 Safari/537.36",
    "Accept": "text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8",
    "Accept-Language": "ar-DZ,ar;q=0.9,fr;q=0.8,en;q=0.7",
    "Referer": "http://www.mae.gov.dz/Point-de-presse-communique-et-declarations_15.aspx",
    "Connection": "keep-alive"
}

r = requests.get("http://www.mae.gov.dz/news_article/6396.aspx", headers=headers)
soup = BeautifulSoup(r.content, "lxml")
print(soup.get_text())

2. 补充语言Cookie(可选,针对上文配置仍返回法语的情况)

该站点同URL对应多语言版本,语言偏好大概率会存在Cookie中。你可以手动用浏览器访问站点切换到阿拉伯语版本,抓包查看请求携带的Cookie中是否有类似lang=ar或者culture=ar-DZ的字段,将对应Cookie添加到请求中即可稳定获取阿拉伯语内容,示例如下:

# 替换为你抓包拿到的实际语言Cookie值
cookies = {
    "lang": "ar-DZ"
}
r = requests.get("http://www.mae.gov.dz/news_article/6396.aspx", headers=headers, cookies=cookies)

3. 兼容性方案(针对校验严格的场景)

如果上述方案仍无法正常获取内容,可以使用Selenium、Playwright等自动化工具模拟浏览器操作,访问页面后点击阿拉伯语切换按钮再提取内容,完全模拟正常用户访问行为,兼容性更高。

内容的提问来源于stack exchange,提问作者user3357814

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.24 05:57:03