You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用BeautifulSoup正确提取标签内Unicode文本解决爬取乱码问题

问题原因

核心是HTTP响应的字符编码解码错误。requests库默认会根据响应头的Content-Type字段猜测编码,如果响应头没明确指定编码,针对阿拉伯语这类非西欧语言页面很容易猜错编码,用错误的单字节编码解码UTF-8的阿拉伯语文本,就会产生你看到的乱码。

修复方案

有两种常用的修复方式,任选其一即可:

  • 方式1:手动指定响应编码为UTF-8
    修改获取HTML文本的步骤,拿到响应后先指定encoding属性再读取text:
from bs4 import BeautifulSoup
import requests

url='https://www.coursera.org/learn/applied-data-science-capstone-ar'
resp = requests.get(url)
# 手动指定编码为utf-8
resp.encoding = 'utf-8'
html = resp.text
soup=BeautifulSoup(html,'lxml')

info=soup.find('div',class_='_1wb6qi0n')
title=info.find('h1',class_='banner-title banner-title-without--subtitle m-b-0')
print(title.text)
  • 方式2:直接传入响应二进制内容让BeautifulSoup自动处理编码
    不用提前解码,直接把response.content(二进制字节流)传给BeautifulSoup,它会自动识别页面编码:
from bs4 import BeautifulSoup
import requests

url='https://www.coursera.org/learn/applied-data-science-capstone-ar'
resp = requests.get(url)
# 直接传入二进制字节流
soup=BeautifulSoup(resp.content,'lxml')

info=soup.find('div',class_='_1wb6qi0n')
title=info.find('h1',class_='banner-title banner-title-without--subtitle m-b-0')
print(title.text)

内容的提问来源于stack exchange,提问作者Nguyen Thai

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.30 19:36:06