You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

无监督时间序列分割算法的数据集划分策略咨询

时间序列分割任务的数据集划分方案(以Physionet ECG LUDB为例)

核心原则

无监督时间序列分割的数据集划分,核心要保证训练集能覆盖数据的主要变异模式,同时测试集完全独立于训练过程,绝对避免数据泄露。

两种候选方案的优劣分析

方案1:基于患者的分层抽样划分

  • 优势:彻底规避数据泄露(不同患者的ECG周期分布相互独立),贴合真实临床场景(模型在未知患者数据上的泛化能力);通过分层抽样(按年龄、性别、疾病类型)能确保训练集覆盖不同人群的ECG变异,让无监督算法学到更通用的周期分割模式。
  • 注意事项:若LUDB数据集的人口统计学标注不全,可先对所有患者的ECG周期做形态聚类,再从每个簇中按比例抽取患者,保证训练集的分布代表性。
  • 常用比例:通常按7:3或8:2划分训练/测试患者,确保训练集有足够样本覆盖各类变异。

方案2:单条记录内按周期拆分

  • 优势:能保留同患者内的周期变异(如同一人不同时刻的ECG周期波动),可用于测试模型在个体内的分割稳定性。
  • 劣势:存在明显数据泄露风险——同患者的前后ECG周期存在时序相关性,无监督算法可能学到个体特异性模式,而非通用的ECG周期分割规则,导致测试结果高估模型泛化能力;若10秒记录内存在心率漂移,前/后拆分还会造成训练、测试集的分布不一致。

推荐的改进混合策略

如果要兼顾模型泛化性测试与个体内稳定性验证,可采用以下混合方案:

  1. 先按患者分层抽样划分训练患者组和测试患者组(比如70%患者归入训练组);
  2. 训练组患者的所有ECG周期用于无监督模型的调参;
  3. 测试组患者的记录中,随机抽取部分周期作为调参验证,剩余周期作为最终测试——注意避免连续拆分,防止时序相关性泄露。

学术研究中的通用做法

  • 在无监督ECG分割领域,按患者独立划分是主流策略,相关研究论文中会直接将患者分为训练、测试集,确保模型从未接触过测试患者的任何数据,以此评估真实泛化能力。
  • 针对时间序列分割的通用方法,《Time Series Segmentation: A Survey》明确提到,无监督任务优先保证训练集的分布代表性,推荐基于实体(如患者)的分层抽样,避免时序拆分带来的数据泄露问题。

内容的提问来源于stack exchange,提问作者Arjun Chaudhary

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.12 15:10:24