【发布时间】:2018-06-07 09:30:46
【问题描述】:
我想从一个文本文件中导入数据,并将其作为一个连续的内存数组读入。这是数据,每个受访者都用回车符分隔:
['vrouw', 43, '2', 'onbeantwoord', '2', '2', 'onbeantwoord', '']
['vrouw', 34, '2', 'onbeantwoord', '2', '2', 'onbeantwoord', '']
['vrouw', 32, '2', 'onbeantwoord', '2', '2', 'onbeantwoord', '']
['vrouw', 32, '2', 'onbeantwoord', '2', '2', 'onbeantwoord', '']
['vrouw', 43, '3', 'sport', '2', '2', 'onbeantwoord', '']
['vrouw', 32, '2', 'onbeantwoord', '2', '2', 'onbeantwoord', '']
['vrouw', 43, '2', 'onbeantwoord', '3', '3', 'collega', 'nee']
我尝试使用以下代码从文本文件中导入数据:
vragenlijst_data= np.genfromtxt('antwoorden.txt', delimiter=',', dtype=None, names=('geslacht', 'leeftijd', 'stelling1', 'doorvraag1', 'stelling2', 'stelling3', 'doorvraag3', 'opmerking'))
但是,这种方式我不能以矢量化方式使用 np.mean(来自 numpy 库),因为我没有连续的内存数组。有谁知道一种读取数据的方法,以便我拥有一个连续的内存数组(最好使用 numpy)?
【问题讨论】:
-
您不能使用
np.mean,因为您有一个带有字符串的dtype=object数组。或者您期望在str上使用np.mean会产生什么输出? -
您想在所有数字列上使用 np.mean 还是只在 leeftijd 上使用?
-
我只想在 'leftijd' 列上使用 np.mean
-
描述 genfrom 测试的结果。 shaoe,dtype 等。括号和引号使读取该文件变得混乱。还有你想要什么样的意思?
-
genfromtxt 的结果是:
。我想在 numpy 中计算 'leftijd' 的平均值。代码 'mean = np.mean([int(i[1]) for i in vragenlijst_data])' 有效,但我想以矢量化方式使用 np.mean,以便我可以使用 np.mean(vragenlijst_data[ 1])
标签: python python-2.7 numpy