如何使用Apache Nutch的readseg命令获取纯文本格式网页数据?
获取Apache Nutch段中的纯文本网页数据
嘿,这事儿好办!你可以通过调整readseg命令的参数,直接让Nutch输出解析后的纯文本内容,不用再处理那些带格式的输出。
方法一:指定提取纯文本字段
直接在readseg命令里加上字段过滤,只导出URL和Nutch解析后存储的纯文本内容(对应content字段):
bin/nutch readseg -dump /path/to/your/segment /path/to/output/dir -fields url,content
执行完这个命令后,输出目录里的文件会只包含网页的URL和对应的纯文本内容,完全没有HTML标签或其他格式干扰。
方法二:强制输出纯文本格式
如果你想更明确地指定输出纯文本,可以加上-contenttext true参数,让Nutch跳过原始HTML数据,直接输出解析后的纯文本:
bin/nutch readseg -dump /path/to/your/segment /path/to/output/dir -nocontent false -contenttext true
额外小技巧
如果已经有了带格式的readseg输出,也可以用awk或sed这类命令行工具快速过滤掉标签提取纯文本,但这种方法不如直接让Nutch输出纯文本高效哦。
内容的提问来源于stack exchange,提问作者Murthy Routhula
相关产品推荐
相关产品推荐

