如何通过Azure认知服务提取文档中与文本关联的超链接?
解决Azure Search无法返回关联超链接的方案
Azure Text Analytics API确实没有直接提取文本关联超链接的功能,但可以通过以下方式实现需求:
自定义索引结构,保留超链接信息
不要让Azure Search直接提取纯文本,在索引阶段就把内容结构化处理:- 拆分字段:把带链接的文本和对应URL分成两个独立字段(比如
linked_text和linked_url)存入索引,搜索时就能同时获取两者; - 保留HTML标签:如果是HTML文档,在定义索引字段时设置
content: "html",让Azure Search保留原始的<a>标签结构,搜索返回结果后自行解析提取链接。
- 拆分字段:把带链接的文本和对应URL分成两个独立字段(比如
结合Azure Form Recognizer处理非结构化文档
如果你的文档是PDF、图片这类非结构化格式,先用Azure Form Recognizer的布局分析功能识别出文档中的超链接(包含关联文本和URL),将识别结果结构化后再存入Azure Search,后续搜索即可拿到对应关联信息。
此外,也可以在数据预处理阶段自行编写代码解析文档中的超链接,把文本与URL绑定后再进行索引,这种方式灵活性更高。
内容的提问来源于stack exchange,提问作者mukundha reddy
相关产品推荐
相关产品推荐

