【发布时间】:2021-09-12 07:00:37
【问题描述】:
我在 IPython Notebook 中进行了一些计算,最终得到了一个尚未保存在任何地方的数据框 df。在同一个 IPython Notebook 中,我想使用 sklearn 来处理这个数据框。
df 是一个有 4 列的数据框:id (string), value(int),rated(bool), score(float)。我正在尝试确定在example 中对分数的影响最大的因素。他们在那里加载了一个标准数据集,但我想在笔记本中使用我自己的数据框。
import numpy as np
import pandas as pd
from sklearn.model_selection import train_test_split
from sklearn.ensemble import RandomForestRegressor
from matplotlib import pyplot as plt
plt.rcParams.update({'figure.figsize': (12.0, 8.0)})
plt.rcParams.update({'font.size': 14})
dataset = df
X = pd.DataFrame(dataset.data, columns=dataset.feature_names)
y = dataset.target
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.25, random_state=12)
但我得到 'DataFrame' object has no attribute 'data' 的 AttributeError
【问题讨论】:
-
您似乎正在尝试从已经是数据框的东西中创建数据框?
-
@Geom So X = dataset.data?在这种情况下如何添加额外的列?或者,我不能将 df 保存为 csv 并应用我的帖子中的语法吗?唯一的问题是数据框很大,它冻结了我的机器。
-
抱歉,当您不清楚“df”是什么或您想用“columns=dataset.feature_names”做什么时,很难做出假设。你能提供更多关于你想要达到的目标的细节吗?
标签: python pandas dataframe scikit-learn