【问题标题】:While splitting datasets why do people follow naming convention?在拆分数据集时,人们为什么要遵循命名约定?
【发布时间】:2018-09-08 16:47:41
【问题描述】:
X_train, X_test, y_train, y_test = \
    train_test_split(X, y, test_size=0.30, random_state=1)

在此示例中,(X_train, X_test) X 以大写形式提及,其中 (y_train, y_test) 这里y 小写。

是否有任何令人信服的理由遵循该命名约定?

【问题讨论】:

标签: python machine-learning


【解决方案1】:

这来自于您有多个特征(输入)和一个响应变量(输出)的情况​​。然后,输入X 是具有number_of_features 列和number_of_samples 行的矩阵,输出y 是具有number_of_samples 元素的列向量。按照在数学和/或相关领域中广泛使用的用大写字母命名矩阵和用小写字母命名向量的约定,X 必须是大写字母,y 必须是小写字母是有意义的。

如果你只有一个特征,所以输入是列向量而不是矩阵,那么x应该是小写的。如果你有多个响应变量并且输出是一个矩阵,那么Y应该是大写的。

最后,使用比Xy 更具描述性的名称总是一个好主意。然后,遵循 PEP 8 约定 uf 使用 snake_case 作为变量名 - 或者您遵循的样式指南推荐的任何内容 - 是要走的路。

【讨论】:

    猜你喜欢
    • 2010-10-08
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多