You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Flowise中将Cheerio用作Agent工具?Python LangChain网页抓取方案

在Flowise中把Cheerio作为Agent工具使用的操作步骤
  • 打开Flowise控制台,进入你的项目画布。
  • 从左侧「Tools」面板里找到「Cheerio Scraper」工具,拖拽到画布上。
  • 配置工具参数:可按需设置允许抓取的URL前缀(用来限制Agent的抓取范围),无需额外API密钥。
  • 把Cheerio工具和你的Agent节点连接:点击Agent节点的「Tools」输入端口,连到Cheerio工具的输出端口。
  • 调整Agent的系统提示词,明确告诉它可以用Cheerio工具抓网页,比如加一句「需要获取网页内容时,调用Cheerio Scraper工具,传入目标URL」。
  • 保存后测试:运行Agent,输入目标网页URL,检查是否能正常返回抓取到的内容。
Python LangChain中抓取网页全部文本的方法

LangChain有现成的工具和灵活的自定义方案,两种常用方式如下:

方法1:用LangChain内置的CheerioWebBaseLoader

  • 先装依赖:
pip install langchain langchain-community cheerio
  • 代码示例:
from langchain_community.tools import CheerioWebBaseLoader

# 初始化加载器并传入目标URL
loader = CheerioWebBaseLoader("https://example.com")
# 加载并解析网页
docs = loader.load()
# 提取页面全部文本
full_page_text = docs[0].page_content
print(full_page_text)

这个工具会自动用Cheerio解析网页,提取所有可见文本内容。

方法2:自定义Requests+BeautifulSoup实现(更灵活)

如果需要过滤广告、脚本这类无关内容,用这个方式更合适:

  • 先装依赖:
pip install requests beautifulsoup4
  • 代码示例:
import requests
from bs4 import BeautifulSoup

def get_full_page_text(url):
    # 请求网页
    resp = requests.get(url)
    # 解析HTML
    soup = BeautifulSoup(resp.text, "html.parser")
    # 移除脚本、样式等无关标签
    for tag in soup(["script", "style", "iframe"]):
        tag.decompose()
    # 提取并整理文本,去掉多余空格换行
    clean_text = " ".join(soup.stripped_strings)
    return clean_text

# 调用示例
target_url = "https://example.com"
page_text = get_full_page_text(target_url)
print(page_text)

内容的提问来源于stack exchange,提问作者batuhan

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.14 06:30:05