如何在Flowise中将Cheerio用作Agent工具?Python LangChain网页抓取方案
在Flowise中把Cheerio作为Agent工具使用的操作步骤
- 打开Flowise控制台,进入你的项目画布。
- 从左侧「Tools」面板里找到「Cheerio Scraper」工具,拖拽到画布上。
- 配置工具参数:可按需设置允许抓取的URL前缀(用来限制Agent的抓取范围),无需额外API密钥。
- 把Cheerio工具和你的Agent节点连接:点击Agent节点的「Tools」输入端口,连到Cheerio工具的输出端口。
- 调整Agent的系统提示词,明确告诉它可以用Cheerio工具抓网页,比如加一句「需要获取网页内容时,调用Cheerio Scraper工具,传入目标URL」。
- 保存后测试:运行Agent,输入目标网页URL,检查是否能正常返回抓取到的内容。
Python LangChain中抓取网页全部文本的方法
LangChain有现成的工具和灵活的自定义方案,两种常用方式如下:
方法1:用LangChain内置的CheerioWebBaseLoader
- 先装依赖:
pip install langchain langchain-community cheerio
- 代码示例:
from langchain_community.tools import CheerioWebBaseLoader # 初始化加载器并传入目标URL loader = CheerioWebBaseLoader("https://example.com") # 加载并解析网页 docs = loader.load() # 提取页面全部文本 full_page_text = docs[0].page_content print(full_page_text)
这个工具会自动用Cheerio解析网页,提取所有可见文本内容。
方法2:自定义Requests+BeautifulSoup实现(更灵活)
如果需要过滤广告、脚本这类无关内容,用这个方式更合适:
- 先装依赖:
pip install requests beautifulsoup4
- 代码示例:
import requests from bs4 import BeautifulSoup def get_full_page_text(url): # 请求网页 resp = requests.get(url) # 解析HTML soup = BeautifulSoup(resp.text, "html.parser") # 移除脚本、样式等无关标签 for tag in soup(["script", "style", "iframe"]): tag.decompose() # 提取并整理文本,去掉多余空格换行 clean_text = " ".join(soup.stripped_strings) return clean_text # 调用示例 target_url = "https://example.com" page_text = get_full_page_text(target_url) print(page_text)
内容的提问来源于stack exchange,提问作者batuhan
相关产品推荐
相关产品推荐

