You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

关于使用Azure Cognitive Search查询邮件内容的技术问询

使用Azure Cognitive Search处理邮件内容的解决方案

1. 提取日期、姓名、数字等结构化数据

完全可以实现。Azure Cognitive Search的技能集(Skillset) 自带实体识别能力,能自动从自然语言文本中提取日期、数字、人名、产品名等实体类型。

针对你举的例子“我想在7月20日买5个苹果”:

  • 配置实体识别技能时,指定要提取的实体类别:DateTime(日期)、Quantity(数量)、ProductName(可通过通用实体扩展或自定义规则实现)
  • 将提取出的实体映射到搜索索引的对应字段(比如extracted_date、extracted_quantity、extracted_product)
  • 后续查询时直接调用这些字段的值,就能用于更新你的软件

如果内置实体识别满足不了特定需求,还可以自定义技能,编写专属逻辑或调用外部NLP服务来提取更细分的数据。

2. 处理邮件中的HTML内容

Azure Cognitive Search对HTML内容有原生支持,具体处理方式分两种:

  • 自动提取纯文本:创建索引器时,设置parsingMode参数为html,索引器会自动剥离HTML标签,提取正文文本,同时忽略脚本、样式等非核心内容,适合只需要文本内容的场景。
  • 保留结构或自定义处理:如果需要保留HTML的部分结构(比如标题、段落层级),可以在技能集中添加文本拆分技能,结合字段映射保留特定元素;也可以通过自定义技能预处理HTML(比如提取指定标签内的内容)后,再导入搜索服务。

另外,若邮件混合纯文本与HTML格式,索引器会自动识别内容类型并对应处理,无需额外配置。

内容的提问来源于stack exchange,提问作者Alex Grossi

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.08 11:33:15