【问题标题】:ValueError: negative dimensions are not allowedValueError:不允许使用负尺寸
【发布时间】:2013-11-25 03:46:42
【问题描述】:

我正在玩一些关于 text_analysis 的 Kaggle 比赛的数据,每当我尝试适应我的算法时,我都会不断收到标题中描述的这个相当奇怪的错误。我查了一下,这与我的矩阵在呈现为稀疏矩阵时密集地填充了非零元素有关。我认为这个问题出在代码下面的 train_labels 上,标签由 24 列组成,一开始并不常见,标签是 0 和 1 之间的浮点数(包括 0 和 1)。尽管对问题所在有所了解,但我不知道如何正确解决它,而且我之前的尝试效果不佳。你们对我如何解决这个问题有什么建议吗?

代码:

import numpy as np
import pandas as p
import nltk
from sklearn.feature_extraction.text import TfidfVectorizer
import os
from sklearn.linear_model  import RidgeCV

dir = "C:/Users/Anonymous/Desktop/KAGA FOLDER/Hashtags"

def clean_the_text(data):
    alist = []
    data = nltk.word_tokenize(data)
    for j in data:
        alist.append(j.rstrip('\n'))
    alist = " ".join(alist)

    return alist
def loop_data(data):
    for i in range(len(data)):
        data[i] = clean_the_text(data[i])
    return data      

if __name__ == "__main__":
    print("loading data")
    train_text = loop_data(list(np.array(p.read_csv(os.path.join(dir,"train.csv")))[:,1]))
    test_set = loop_data(list(np.array(p.read_csv(os.path.join(dir,"test.csv")))[:,1]))
    train_labels  = np.array(p.read_csv(os.path.join(dir,"train.csv")))[:,4:]



    #Vectorizing
    vectorizer = TfidfVectorizer(max_features = 10000,strip_accents = "unicode",analyzer = "word")
    ridge_classifier = RidgeCV(alphas = [0.001,0.01,0.1,1,10])
    all_data = train_text + test_set
    train_length  = len(train_text)

    print("fitting Vectorizer")
    vectorizer.fit(all_data)
    print("transforming text")
    all_data = vectorizer.transform(all_data)
    train = all_data[:train_length]
    test = all_data[train_length:]

    print("fitting and selecting models") 
    ridge_classifier.fit(train,train_labels)
    print("predicting")
    pred = ridge_classifier.predict(test)


    np.savetxt(dir +"submission.csv", pred, fmt = "%d", delimiter = ",")
    print("submission_file created")

追溯:

Traceback (most recent call last):
  File "C:\Users\Anonymous\workspace\final_submission\src\linearSVM.py", line 56, in <module>
    ridge_classifier.fit(train,train_labels)
  File "C:\Python27\lib\site-packages\sklearn\linear_model\ridge.py", line 817, in fit
    estimator.fit(X, y, sample_weight=sample_weight)
  File "C:\Python27\lib\site-packages\sklearn\linear_model\ridge.py", line 724, in fit
    v, Q, QT_y = _pre_compute(X, y)
  File "C:\Python27\lib\site-packages\sklearn\linear_model\ridge.py", line 609, in _pre_compute
    K = safe_sparse_dot(X, X.T, dense_output=True)
  File "C:\Python27\lib\site-packages\sklearn\utils\extmath.py", line 78, in safe_sparse_dot
    ret = a * b
  File "C:\Python27\lib\site-packages\scipy\sparse\base.py", line 303, in __mul__
    return self._mul_sparse_matrix(other)
  File "C:\Python27\lib\site-packages\scipy\sparse\compressed.py", line 520, in _mul_sparse_matrix
    indices = np.empty(nnz, dtype=np.intc)
ValueError: negative dimensions are not allowed

我怀疑我的标签有问题,所以这里是标签:

In [12]:
undefined



import pandas as pd
import numpy as np
import os
dir = "C:\Users\Anonymous\Desktop\KAGA FOLDER\Hashtags"
labels = np.array(pd.read_csv(os.path.join(dir,"train.csv")))[:,4:]
labels


Out[12]:
array([[0.0, 0.0, 1.0, ..., 0.0, 0.0, 0.0],
       [0.0, 0.0, 0.0, ..., 0.0, 0.0, 0.0],
       [0.0, 0.0, 0.0, ..., 0.0, 0.0, 0.0],
       ..., 
       [0.0, 0.0, 0.0, ..., 1.0, 0.0, 0.0],
       [0.0, 0.385, 0.41, ..., 0.0, 0.0, 0.0],
       [0.0, 0.20199999999999999, 0.395, ..., 0.0, 0.0, 0.0]], dtype=object)
In [13]:
undefined



labels.shape
Out[13]:
(77946L, 24L)

【问题讨论】:

  • 可能与您的问题无关,但为什么是labels.dtype = object?您显示的值看起来像所有浮点数。
  • 这确实很奇怪。尝试将其转换为带有 astype 的浮点数,但出现错误。编辑:出于某种原因,我现在可以将其转换为浮动。
  • 其他(不相关的)错误:RidgeCV 是回归问题的模型,而不是分类问题。请改用RidgeClassifierCV 等分类器。此外,您应该只在训练集上调用 vectorize.fit,然后在训练和测试数据上调用 transform,否则矢量化器是“作弊”。

标签: python numpy machine-learning scikit-learn


【解决方案1】:

问题是因为尺寸不匹配。

train_labels 实际上是所有数据的类。 traintrain_labels 的大小应该匹配。

【讨论】:

  • 对不起,我有点困惑。由于我从 train.csv 中获取标签,因此大小不应该与 train 匹配吗?
  • 您正在阅读表单 train.csv,但您正在对训练数据进行一些处理。您将训练和测试数据附加到 all_data 并获得其中的一部分作为训练。你如何获得train_length 让我感到困惑。请尝试打印train 的大小,这将验证或反驳我的理论。
  • 火车的形状是:(77946, 10000)。
  • 你真的有一个分类的10000个属性吗,很大。
  • 不,我只使用了一个属性,而整个数据集有 3 个属性。所以我肯定在这里搞砸了。感谢您指出这一点!
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2023-02-26
  • 2020-01-18
  • 2020-10-08
  • 2016-04-25
  • 1970-01-01
  • 2020-05-04
  • 2017-04-29
相关资源
最近更新 更多