【发布时间】:2020-02-03 00:41:24
【问题描述】:
我只对单个数据集拆分进行了训练和测试。 我有一个监督学习问题:数据 1 训练/测试和数据 2:没有标签。我正在使用熊猫数据框。
数据集 1:监督
text y_variable
apple fruit
orange fruit
celery vegetable
mango fruit
数据集 2:没有标签
text to_be_predicted
orange ?
celery ?
mango ?
我正在使用 scikit 学习:
X = df['text']
y = df['y_variable']
X_train, X_test, y_train, y_test = train_test_split(
X, y, test_size=0.2
这会将现有数据框拆分为训练和测试。如何训练/测试第一个数据集 1 并将其应用于第二个数据集?机器学习。
数据集 2:没有标签
text to_be_predicted
orange fruit
celery vegetable
mango fruit
【问题讨论】:
-
您是否正在尝试训练有监督方法并作为无监督方法进行测试? + 你没有关于每个项目的额外信息吗?例如....形状/重量/颜色....??您的 df 只有 2 列?
标签: python scikit-learn train-test-split