You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用Jsoup如何选取指定文本?doc.select返回为空该怎么解决

问题原因分析

  • 你的选择器无法匹配到目标元素:p#latest-buy的作用是匹配id为latest-buy的<p>标签,你给出的HTML结构里的<p>标签没有设置该id属性,所以匹配结果为空,自然拿不到返回值。
  • 你要提取的目标内容是图片上的文字,HTML解析库的text()方法仅能提取HTML结构中直接存储的明文文本,无法读取嵌入在图片里的内容,这是核心问题。

正确实现步骤

  1. 先提取目标图片的资源地址,示例代码(以Jsoup为例):
// 匹配p标签下的img元素,提取src属性值
String imgSrc = doc.selectFirst("p > a > img").attr("src");
  1. 调用OCR(光学字符识别)能力处理获取到的图片,即可识别出红圈标注的文本内容。你可以根据技术栈选择合适的OCR方案,本地开源OCR库、云服务厂商的OCR接口都可以实现对应需求。

内容的提问来源于stack exchange,提问作者simmo

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.26 20:54:01