TensorFlow股票场景的数据排布与模型选型技术问询
股票机器学习练习问题解答
问题1:预测x天后股票涨跌的回溯数据分组与模型数据排布问题
- 回溯数据必须按日期分组:股票数据是强时间依赖的序列,每天的RSI、MACD等指标是连续时间点的状态,按日期分组才能保留时间先后顺序,让模型学到指标变化趋势和未来涨跌的关联。按指标分组完全不合理,会把同一指标的所有日期数据混在一起,彻底破坏时序逻辑,模型根本学不到有用的规律。
- 模型非常在意数据排布:尤其是LSTM、Transformer这类时序预测模型,必须保证训练数据的时间顺序,绝对不能随机打乱数据集。此外,必须采用滚动窗口验证这类时序专属的验证方式,不能用常规的随机划分训练/测试集,否则会出现未来数据泄露,导致验证结果失真,这一步一定要做验证。
问题2:找出上涨股票同期常见技术指标值的TensorFlow适用模型
这个任务核心是挖掘上涨股票的指标共性特征,TensorFlow中适用的模型按实用性推荐:
- K-Means聚类:实现简单、解释性强,适合快速挖掘上涨股票的指标分组模式。可以用TensorFlow的
tf.compat.v1.estimator.KMeans,或者结合tf.keras自定义聚类层,将上涨股票的指标数据聚合成若干类别,每个类别对应一组常见的指标值组合。 - 自编码器(Autoencoder):适合处理高维度指标数据,能自动提取潜在的本质特征。用
tf.keras搭建全连接或轻量卷积自编码器,让模型学习上涨股票指标的压缩表示,之后通过分析潜在空间的聚类结果或解码特征,就能找到更精准的共性指标模式。 - 补充:如果数据量较小,先做基础统计分析(计算上涨时各指标的均值、中位数、分布区间)再结合模型,能更快得到直观结论。
内容的提问来源于stack exchange,提问作者Masoric
相关产品推荐
相关产品推荐

