You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用Google Generative AI API做文档离群点检测,选哪种task_type?

文档语料库离群点检测的最佳task_type选择

在使用Google Generative AI的Text Embedding API检测文档语料库中的离群点时,CLUSTERING是最适合的task_type,具体分析如下:

各task_type适配性拆解

  • CLUSTERING:该类型的嵌入针对簇结构做了优化,会让语义相似的文档在嵌入空间中聚集,语义差异显著的文档自然远离核心簇。离群点检测的核心就是识别偏离主流语义簇的样本,这种优化方向完全匹配需求,你当前代码的选择是正确的。
  • RETRIEVAL_QUERY/RETRIEVAL_DOCUMENT:这两类是为检索场景设计的,分别针对查询文本、待检索文档的嵌入做优化,核心目标是提升查询与相关文档的匹配度,而非全局的簇分布,不适合离群点检测。
  • SEMANTIC_SIMILARITY:该类型优化的是两两文本的相似度计算逻辑,虽能通过相似度判断文本差异,但未针对全局簇结构做优化,面对大规模语料库时,离群点识别效果不如CLUSTERING。
  • CLASSIFICATION:这类嵌入是为已知类别的分类任务优化的,而离群点属于未知的异常类别,优化方向完全不匹配。

代码示例确认

你的现有代码已选用正确的task_type:

model = TextEmbeddingModel.from_pretrained("textembedding-gecko-multilingual@001")
text_input = TextEmbeddingInput(text=text, task_type='CLUSTERING')
embeddings = model.get_embeddings([text_input])

内容的提问来源于stack exchange,提问作者DarioB

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.30 08:43:14