【发布时间】:2020-02-15 08:28:07
【问题描述】:
我有一个数据框,其中有一列名为“cleaned_tweet”。本专栏由带有几个缩写的推文组成,我想用适当的英文单词替换这些缩写。为此,我准备了一本名为“俚语”的字典,其中缩写。是键和所需的英语短语/单词作为值,我想替换所有出现的那些缩写。与他们在字典中的值。我已经在 stackoverflow 上寻找了其他几个解决方案,但它们似乎都没有工作。这是我尝试过的。我正在使用嵌套的 for 循环,我相信我非常接近解决方案,但我做错了什么,我似乎无法弄清楚。
这是嵌套循环:
for i in range(len(train_test_set)):
for j in slangs:
train_test_set['cleaned_tweet'][i] = train_test_set['cleaned_tweet'][i].replace(j, slangs[j])
当我执行此代码并打印 print(train_test_set['cleaned_tweet][0]) 时,我得到了一个意外的输出,如下所示:
"#mopanthank whyour | hi | years oldwhyour | hi | years oldhesitationospecial editekissas insekissperience wall hacken whyour | hi | years oldunited statesing a hallwhyour | hi | years olducinogenic drwhyour | hi | years olduglwhyour | hi | years oldung ladye rainbowhwhy | would whyour | hi | years olduohesitationents | rapper from atalk later | ekissperience wall hacken whyour | hi | years oldunited statesing a hallwhyour | hi | years olducinogenic drwhyour | hi | years olduglwhyour | hi | years oldung ladye rainbowhwhy | would whyour | hi | years olduoue loversatileionwhyes | yeah | yes | your | hi | years oldu | team leaderantaonwhysomethingop it | somethingwhyour | hi | years oldupid idiotake careal edwhyour | hi | years olducatekissas insekissperience wall hacken whyour | hi | years oldunited statesing a hallwhyour | hi | years olducinogenic drwhyour | hi | years olduglwhyour | hi | years oldung ladye..."
似乎许多不需要的值被附加到单元格中。 输出的大小真的很大,这里不能全部复制。这是执行代码之前我的数据集和字典的结构:
谁能告诉我我做错了什么?
【问题讨论】:
标签: python regex python-3.x loops dataframe