LSTM二分类模型时序数据重塑:最后一行缺失问题排查
LSTM二分类数据重塑时遗漏最后一行的问题
我要为LSTM二分类模型准备数据,需要将数据重塑为(num_samples, time_steps, num_features)格式,我的训练数据集形状为(2487576, 21)。以下是我的示例代码:
import pandas as pd import numpy as np url="https://gist.githubusercontent.com/JishanAhmed2019/7381979ecafb7efd456421c324d7963a/raw/a50a653119471cd4fe323d7680fe82a161727169/test.csv" df=pd.read_csv(url,sep="\t") def generate_train_data(X, y, sequence_length=2, step = 1): X_local = [] y_local = [] for start in range(0, len(df) - sequence_length, step): end = start + sequence_length X_local.append(X[start:end]) y_local.append(y[end-1]) return np.array(X_local), np.array(y_local) train_X_sequence, train_y = generate_train_data(df.loc[:, "V1":"V2"].values, df.Class)
输出结果:train_X_sequence:
array([ [[ 30, 100], [ 40, 200]], [[ 40, 200], [ 50, 300]], [[ 50, 300], [ 60, 400]], [[ 60, 400], [ 70, 500]], [[ 70, 500], [ 80, 600]], [[ 80, 600], [ 90, 700]]])
train_y:
array([0, 1, 0, 0, 0, 1])
我发现重塑后的数据中最后一行未出现,请问问题出在哪里?我使用的是TensorFlow框架中的LSTM。
问题原因与解决方法
问题原因
循环终止条件range(0, len(df) - sequence_length, step)限制了start的最大值为len(df)-sequence_length - 1,导致最后一组以原数据末尾行结尾的序列无法被纳入。比如示例数据中,原数据最后一行是[100,800],本应组成序列[[90,700],[100,800]],但因为循环提前终止,这组序列被遗漏了。
解决方法
修改循环的终止边界,让start可以取到len(X)-sequence_length这个值,同时将函数内的len(df)替换为len(X)增强通用性:
def generate_train_data(X, y, sequence_length=2, step = 1): X_local = [] y_local = [] # 调整终止条件,+1确保最后一组序列被包含,用len(X)适配输入数据长度 for start in range(0, len(X) - sequence_length + 1, step): end = start + sequence_length X_local.append(X[start:end]) y_local.append(y[end-1]) return np.array(X_local), np.array(y_local)
修改后,循环会覆盖所有可能的合法序列,之前遗漏的最后一组数据就会被包含进来。
内容的提问来源于stack exchange,提问作者ForestGump
相关产品推荐
相关产品推荐

