Python可视化决策树报错IndexError: list index out of range求助
解决决策树可视化时的IndexError: list index out of range问题
嘿,我来帮你捋捋这个问题~你遇到的索引越界错误,核心原因是调用export_graphviz时,feature_names参数的设置出了问题,导致模型找不到对应节点的特征名称。
先拆解下问题根源:
- 你的决策树模型
regressor是用X里的全部10个特征训练的(X是clusterDF去掉Class后的所有列,也就是viewed、carted、knownpurchases等) - 但你给
feature_names传的要么是只有一个元素的列表['carted'],要么是整列数据[X['carted']],这两种写法都不符合要求:- 只传一个特征名的话,当决策树的节点用到第2个及以后的特征时,索引就超出了列表长度,直接触发索引越界
- 传整列数据的话,你给的是Series对象,而
feature_names需要的是字符串组成的列表,对应每个特征的名称
正确的解决办法
直接传入X的列名列表就行,因为X包含了所有训练时用到的特征,这样每个节点的特征都能匹配到对应的名称:
# 替换你原来的问题代码行 export_graphviz(regressor, out_file='foo.dot', feature_names=X.columns)
修正后的完整代码片段
给你贴好可以直接用的版本:
import pandas as pd from sklearn.model_selection import train_test_split from sklearn.tree import DecisionTreeRegressor, export_graphviz clusterDF=pd.DataFrame(data=clusterdata[:,:],index=list(range(len(clusterdata))), columns=['viewed','carted','knownpurchases','totlength','avgtime','stdtime','vartime','KMP','Leven','prodnum','Class']) X = clusterDF.drop('Class', axis=1) y = clusterDF['Class'] X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.20) regressor = DecisionTreeRegressor(max_depth=2) regressor.fit(X_train, y_train) y_pred = regressor.predict(X_test) df=pd.DataFrame({'Actual':y_test, 'Predicted':y_pred}) # 修正后的可视化代码 export_graphviz(regressor, out_file='foo.dot', feature_names=X.columns)
额外小提示
生成foo.dot文件后,你需要用Graphviz工具把它转成图片。如果是Linux系统,可以用命令:
dot -Tpng foo.dot -o tree.png
Windows或Mac的话,需要先安装Graphviz工具,然后用类似的命令或者可视化工具打开.dot文件。
内容的提问来源于stack exchange,提问作者Jessica Chambers
相关产品推荐
相关产品推荐

