LLM时代客服通话转录层级聚类的现代技术方案咨询
客服/呼叫中心对话层级聚类系统:LLM时代方案选型与实践指导
我们正在搭建客服/呼叫中心对话的层级聚类系统,输入涵盖完整通话转录、LLM生成的对话摘要、单行问题描述三类数据;核心目标包括自动发现问题的类别与子类别、构建层级问题树、检测新兴问题集群,同时要支持百万级规模对话的持续导入。我们已经了解Embedding+HDBSCAN、Embedding+BIRCH、层次聚类、BERTopic主题建模、KMeans/MiniBatchKMeans等传统方案,现在想探索强嵌入模型结合LLM的现代最优架构,具体问题如下:
具体问题
- 当前该场景是否仍以Embedding基础上的HDBSCAN为主流方案?
- 有没有通过LLM生成标签实现层级主题建模的成功落地案例?
- 聚类原始转录文本、LLM生成摘要、结构化问题提取结果,还是采用多层级融合表征的效果更优?
- 图/社区检测类方法是否已经超越经典聚类算法在该场景的表现?
- 有没有支持增量聚类、在线集群更新、动态分类生成、集群合并/拆分的生产级pipeline?
- 有没有适配当前主流嵌入模型的BERTopic现代替代方案?
- 如何处理重叠意图、多问题通话、含噪ASR转录、集群漂移这些场景痛点?
现有初步思路
我们当前的初步方案是:采用现代嵌入模型生成对话的向量表征,通过HDBSCAN完成粗聚类,仅用LLM进行集群的标注与摘要生成,再通过递归方式构建层级结构。但不确定这是否仍为当前最优方案,或是存在更高效的LLM原生架构。
核心需求
希望获取以下维度的实践指导:
- 系统架构设计方案
- 相关学术研究论文方向
- 开源工具选型建议
- 百万级对话系统的生产落地经验
- 系统扩容与性能优化策略
- 聚类效果的评估指标体系
- 实际落地中的失败案例与避坑指南
内容的提问来源于stack exchange,提问作者Jhutan Debnath
相关产品推荐
相关产品推荐

