You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用Apache Nutch的readseg命令获取纯文本格式网页数据?

获取Apache Nutch段中的纯文本网页数据

嘿,这事儿好办!你可以通过调整readseg命令的参数,直接让Nutch输出解析后的纯文本内容,不用再处理那些带格式的输出。

方法一:指定提取纯文本字段

直接在readseg命令里加上字段过滤,只导出URL和Nutch解析后存储的纯文本内容(对应content字段):

bin/nutch readseg -dump /path/to/your/segment /path/to/output/dir -fields url,content

执行完这个命令后,输出目录里的文件会只包含网页的URL和对应的纯文本内容,完全没有HTML标签或其他格式干扰。

方法二:强制输出纯文本格式

如果你想更明确地指定输出纯文本,可以加上-contenttext true参数,让Nutch跳过原始HTML数据,直接输出解析后的纯文本:

bin/nutch readseg -dump /path/to/your/segment /path/to/output/dir -nocontent false -contenttext true

额外小技巧

如果已经有了带格式的readseg输出,也可以用awk或sed这类命令行工具快速过滤掉标签提取纯文本,但这种方法不如直接让Nutch输出纯文本高效哦。

内容的提问来源于stack exchange,提问作者Murthy Routhula

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.27 06:57:57