You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用urllib读取网页返回带HTML标签文本,如何获取纯文本?

问题:如何从HTML页面提取纯文本用于NLTK分词?

你遇到的情况太常见了——原纯文本URL访问报错,换成HTML页面后直接读取的内容带满了HTML标签,导致分词结果全是标签碎片。别急,咱们用HTML解析工具就能轻松搞定这个问题。

解决思路

现在你请求的是HTML格式页面,不是纯文本文件,自然不能直接读取后就分词。核心思路是先剥离所有HTML标签,提取出页面里的纯文本内容,再交给NLTK处理。这里推荐用BeautifulSoup,它是Python处理HTML/XML的常用工具,能高效帮我们完成标签剥离和文本提取。

具体步骤&修改后的代码

  1. 先确保你安装了BeautifulSoup库,没装的话执行这条命令:
pip install beautifulsoup4
  1. 修改代码,加入HTML解析逻辑:
from urllib import request
from bs4 import BeautifulSoup
from nltk.tokenize import word_tokenize

# 你改用的HTML URL
url = "http://www.gutenberg.org/files/2554/2554-h/2554-h.htm"
response = request.urlopen(url)
raw = response.read().decode('utf8')

# 用BeautifulSoup解析HTML,提取纯文本
soup = BeautifulSoup(raw, 'html.parser')
clean_text = soup.get_text()

# 查看处理后的内容
print('data type of clean_text = ', type(clean_text))
print('length of clean_text = ', len(clean_text))
print('initial contents - ', clean_text[:175])

# 现在分词就不会有HTML标签了
tokens = word_tokenize(clean_text)
print('tokens\n', tokens[:100])

代码说明

  • BeautifulSoup(raw, 'html.parser'):把读取到的HTML内容交给BeautifulSoup,用Python内置的html.parser解析器处理,它能准确识别HTML的标签结构。
  • soup.get_text():这个方法会自动剥离所有HTML标签,只保留页面里的纯文本内容,还会自动处理多余的换行和空格,让文本格式更接近原纯文本文件。

这样处理后,你得到的clean_text就是干净的纯文本,分词结果也会是正常的单词,不会再出现<, ?xml这类标签相关的无效token了。

内容的提问来源于stack exchange,提问作者user3046659

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.27 07:22:45