【发布时间】:2020-05-02 01:33:11
【问题描述】:
我正在使用 pandas 在 Jupyter Notebook 中将 CSV 文件读入名为“data”的变量中
import pandas as pd
import numpy as np
import seaborn as sns
import matplotlib.pyplot as plt
data = pd.read_csv("C:/Users/hp/Desktop/dv project/googleplaystorecleaned.csv")
我尝试使用以下代码修改data set 的“大小”列以删除字符“M”和“k”
for i in range(len(data['Size'])):
data['Size'][i]=str(data['Size'][i])
data['Size'][i]=data['Size'][i].replace('M','')
data['Size'][i]=data['Size'][i].replace('k','')
data['Size'][i]=data['Size'][i].replace('Varies with device','')
data['Size'][i]=float(data['Size'][i])
print(data['Size'])
当我得到以下输出时,代码似乎只在数据集上部分起作用
0 19
1 14
2 8.7
3 25
4 2.8
...
10836 53M
10837 3.6M
10838 9.5M
10839 Varies with device
10840 19M
Name: Size, Length: 10829, dtype: object
请告诉一个正确的方法。
【问题讨论】:
-
您只是想提取数字吗?如果是这样,只需使用一些正则表达式
标签: python pandas jupyter-notebook