You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

技术问询:如何从URL提取纯可见文本并去除HTML代码?

Hey Javi, 我来给你分享几个超简便的方法,不用复杂操作就能搞定从URL提取纯文本、清除HTML代码的需求!

方法1:Python + Requests + BeautifulSoup

这应该是最容易上手的脚本方案,代码量少,效果还靠谱。

首先先装依赖包:

pip install requests beautifulsoup4

然后写几行代码就行,复制粘贴改个URL就能用:

import requests
from bs4 import BeautifulSoup

# 替换成你要提取的目标URL
target_url = "https://example.com"
# 获取网页内容
response = requests.get(target_url)
# 用BeautifulSoup解析HTML
soup = BeautifulSoup(response.text, 'html.parser')
# 提取所有可见文本,自动去除HTML标签,同时清理多余空格换行
clean_text = soup.get_text(strip=True, separator='\n')

# 直接打印结果,或者保存到文件
print(clean_text)
# 保存到本地文件的话
with open('clean_output.txt', 'w', encoding='utf-8') as f:
    f.write(clean_text)

这个方法会自动过滤掉所有HTML标签,strip=True能帮你去掉网页里多余的空格和空行,separator='\n'让不同段落之间用换行分隔,可读性拉满。

方法2:命令行工具 Lynx

如果你不想写代码,只想快速搞定单次提取,Lynx这个文本浏览器绝对是神器——直接用终端命令就能把网页转成纯文本。

先安装Lynx(不同系统安装命令不一样):

  • Ubuntu/Debian系:sudo apt install lynx
  • macOS(需要先装Homebrew):brew install lynx

安装完直接跑命令,把结果存到文件里:

lynx -dump "https://example.com" > clean_output.txt

-dump参数就是让Lynx把网页内容以纯文本形式输出,重定向到文件里就搞定了,全程不用写一行代码!

方法3:Python专用库 html2text

如果你希望转出来的纯文本还能保留原网页的一些结构(比如列表缩进、标题层级),可以试试html2text这个专门做HTML转纯文本的库,它处理格式会更智能。

先安装:

pip install html2text

然后代码也很简单:

import requests
import html2text

target_url = "https://example.com"
response = requests.get(target_url)
# 初始化转换器
text_converter = html2text.HTML2Text()
# 可以设置参数,比如忽略链接里的URL,只保留链接文本
text_converter.ignore_links = True
# 转换HTML为纯文本
structured_text = text_converter.handle(response.text)

print(structured_text)

转出来的文本会保留比如列表的缩进、标题的标记,比纯提取文本更贴近原网页的阅读逻辑。

总结一下:如果要批量处理URL或者集成到自己的脚本里,选Python的方案;如果只是单次快速提取,用Lynx命令行最省事!

内容的提问来源于stack exchange,提问作者jakama

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.15 07:58:06