【问题标题】:How to fix "NaN or infinity" issue for sparse matrix in python?如何解决 Python 中稀疏矩阵的“NaN 或无穷大”问题?
【发布时间】:2013-09-27 16:34:06
【问题描述】:

我对 python 完全陌生。我使用了一些在线找到的代码,并尝试对其进行处理。所以我正在创建一个文本文档矩阵,并且我想在训练逻辑回归模型之前添加一些额外的功能。

虽然我用 R 检查了我的数据并且没有收到任何错误,但是当我运行逻辑回归时,我收到错误 “ValueError: Array contains NaN or infinity.” 我没有收到当我不添加自己的功能时,同样的错误。我的功能在文件“toPython.txt”中。

注意对返回“None”的 assert_all_finite 函数的两次调用!

下面是我使用的代码和我得到的输出:

def _assert_all_finite(X):
if X.dtype.char in np.typecodes['AllFloat'] and not np.isfinite(X.sum()) and not np.isfinite(X).all():
    raise ValueError("Array contains NaN or infinity.")

def assert_all_finite(X):
_assert_all_finite(X.data if sparse.issparse(X) else X)

def main():

print "loading data.."
traindata = list(np.array(p.read_table('data/train.tsv'))[:,2])
testdata = list(np.array(p.read_table('data/test.tsv'))[:,2])
y = np.array(p.read_table('data/train.tsv'))[:,-1]

tfv = TfidfVectorizer(min_df=12,  max_features=None, strip_accents='unicode',  
    analyzer='word',stop_words='english', lowercase=True,
    token_pattern=r'\w{1,}',ngram_range=(1, 1), use_idf=1,smooth_idf=1,sublinear_tf=1)

rd = lm.LogisticRegression(penalty='l2', dual=True, tol=0.0001, 
                         C=1, fit_intercept=True, intercept_scaling=1.0, 
                         class_weight=None, random_state=None)

X_all = traindata + testdata
lentrain = len(traindata)

f = np.array(p.read_table('data/toPython.txt'))
indices = np.nonzero(~np.isnan(f))
b = csr_matrix((f[indices], indices), shape=f.shape, dtype='float')

print b.get_shape
**print assert_all_finite(b)**
print "fitting pipeline"
tfv.fit(X_all)
print "transforming data"
X_all = tfv.transform(X_all)
print X_all.get_shape

X_all=hstack( [X_all,b], format='csr' )
print X_all.get_shape

**print assert_all_finite(X_all)**

X = X_all[:lentrain]
print "3 Fold CV Score: ", np.mean(cross_validation.cross_val_score(rd, X, y, cv=3, scoring='roc_auc'))

输出是:

loading data..
<bound method csr_matrix.get_shape of <10566x40 sparse matrix of type '<type 'numpy.float64'>'
with 422640 stored elements in Compressed Sparse Row format>>
**None**
fitting pipeline
transforming data
<bound method csr_matrix.get_shape of <10566x13913 sparse matrix of type '<type 'numpy.float64'>'
with 1450834 stored elements in Compressed Sparse Row format>>
<bound method csr_matrix.get_shape of <10566x13953 sparse matrix of type '<type 'numpy.float64'>'
with 1873474 stored elements in Compressed Sparse Row format>>
**None**
3 Fold CV Score: 
Traceback (most recent call last):
File "<stdin>", line 1, in <module>
File "C:\Python27\lib\site-packages\spyderlib\widgets\externalshell\sitecustomize.py", line 523, in runfile
execfile(filename, namespace)
File "C:\Users\Stergios\Documents\Python\beat_bench.py", line 100, in <module>
main()
File "C:\Users\Stergios\Documents\Python\beat_bench.py", line 97, in main
print "3 Fold CV Score: ", np.mean(cross_validation.cross_val_score(rd, X, y, cv=3, scoring='roc_auc'))
File "C:\Python27\lib\site-packages\sklearn\cross_validation.py", line 1152, in cross_val_score
for train, test in cv)
File "C:\Python27\lib\site-packages\sklearn\externals\joblib\parallel.py", line 517, in __call__
self.dispatch(function, args, kwargs)
File "C:\Python27\lib\site-packages\sklearn\externals\joblib\parallel.py", line 312, in dispatch
job = ImmediateApply(func, args, kwargs)
File "C:\Python27\lib\site-packages\sklearn\externals\joblib\parallel.py", line 136, in __init__
self.results = func(*args, **kwargs)
File "C:\Python27\lib\site-packages\sklearn\cross_validation.py", line 1064, in _cross_val_score
score = scorer(estimator, X_test, y_test)
File "C:\Python27\lib\site-packages\sklearn\metrics\scorer.py", line 141, in __call__
return self._sign * self._score_func(y, y_pred, **self._kwargs)
File "C:\Python27\lib\site-packages\sklearn\metrics\metrics.py", line 403, in roc_auc_score
fpr, tpr, tresholds = roc_curve(y_true, y_score)
File "C:\Python27\lib\site-packages\sklearn\metrics\metrics.py", line 672, in roc_curve
fps, tps, thresholds = _binary_clf_curve(y_true, y_score, pos_label)
File "C:\Python27\lib\site-packages\sklearn\metrics\metrics.py", line 504, in _binary_clf_curve
y_true, y_score = check_arrays(y_true, y_score)
File "C:\Python27\lib\site-packages\sklearn\utils\validation.py", line 233, in check_arrays
_assert_all_finite(array)
File "C:\Python27\lib\site-packages\sklearn\utils\validation.py", line 27, in _assert_all_finite
raise ValueError("Array contains NaN or infinity.")
ValueError: Array contains NaN or infinity.

有什么想法吗?谢谢!!

【问题讨论】:

  • 看来b 正在从以下分配中获取一些 NaN 元素。 b = csr_matrix((f[indices], indices), shape=f.shape, dtype='float') 。 Here 是 csr_matrix 文档。
  • @TharinduRusira 如果我在 f 中加载数据后直接使用 b=csr_matrix(f, dtype='float'),也会发生同样的情况。
  • 您的数据文件是否有缺失值?
  • @TharinduRusira 不,我使用 any(is.na(data)) 从 R 中检查了这个并得到了 FALSE。
  • 我的数据似乎有问题(尽管 R 说没有 NA)。我尝试对手动创建的数据做同样的事情,它奏效了。谢谢!!

标签: python scikit-learn nan


【解决方案1】:

这通常发生在您的数据中缺少值或由于您的处理而导致的情况下。

首先,在稀疏矩阵X 中找到具有Nan 或Inf 值的单元格:

def find_nan_in_csr(self, X):

    X = coo_matrix(X)
    for i, j, v in zip(X.row, X.col, X.data):
        if (np.isnan(v) or np.isinf(v)):
            print(i, j, v)
    return None

此函数将为您提供值有问题的稀疏矩阵中的行和列索引。
然后,“修复”这些值 - 这取决于导致这些值的原因(缺失值等)。

编辑: 请注意,sklearn 通常使用dtype=np.float32 以获得最大效率, 因此它会尽可能将稀疏矩阵转换为 np.float32(通过 X = X.astype(dtype = np.float32))。 在从 float64 到 np.float32 的转换中,一个非常大的数字(例如,2.9e+200)被转换为 inf。

【讨论】:

    【解决方案2】:

    我通常使用这个功能:

    x = np.nan_to_num(x)
    

    将 nan 替换为零,将 inf 替换为有限数。

    【讨论】:

      【解决方案3】:

      我发现,假设sm 是一个稀疏矩阵(我的是CSR 矩阵,如果你知道的话,请谈谈其他类型!)执行以下操作非常有效:

      用数据向量中的适当数字手动替换nans:

      In [4]: np.isnan(matrix.data).any()
      Out[4]: True
      
      In [5]: sm.data.shape
      Out[5]: (553555,)
      
      In [6]: sm.data = np.nan_to_num(sm.data)
      
      In [7]: np.isnan(matrix.data).any()
      Out[7]: False
      
      In [8]: sm.data.shape
      Out[8]: (553555,)
      

      所以我们不再有 nan 值,而是矩阵明确地将这些零编码为值索引。

      从稀疏矩阵中移除显式编码的零值:

      In [9]: sm.eliminate_zeros()
      
      In [10]: sm.data.shape
      Out[10]: (551391,)
      

      我们的矩阵现在实际上变小了,耶!

      【讨论】:

      • 优秀。这很好地解决了 sci-kit learn 中的数据输入值错误问题。
      • @dreab 出于好奇,您能否详细说明一下 scikit 中的问题?
      • @nirlzr 我正在尝试使用预处理函数 quantile_transform,但由于数据集有很多 nan,我得到了值错误。我也不希望将这些点视为零您上面的解决方案效果很好。最重要的是,我想保留数据的形状,因为它是一个网格数据集。
      猜你喜欢
      • 1970-01-01
      • 2014-05-11
      • 2014-12-01
      • 2016-10-03
      • 1970-01-01
      • 2015-03-01
      • 2015-04-26
      • 2014-07-14
      • 1970-01-01
      相关资源
      最近更新 更多