【发布时间】:2020-10-17 02:02:42
【问题描述】:
使用内容列训练数据框。内容列的每一行都有一个列表,其中包含该列表中的不同单词。
content
[sure, tune, …, watch, donald, trump, “,”, late, ’ , night]
[abc, xyz, “,”,late, ’, night]
删除正则表达式的代码
import re
train['content'] = train['content'].map(lambda x: re.sub(r'\W+', '', x))
错误
TypeError: expected string or bytes-like object
预期输出
content
[sure, tune, watch, donald, trump, late, night]
[abc, xyz,late, night]
请注意所有特殊字符,如 ...、“、” 和 ’ 都消失了,我们只剩下文字了。
【问题讨论】:
-
首先 - 每行内容必须是一个字符串本身,而不是一个实际的列表,否则你甚至在开始之前就会遇到语法错误,应该澄清一下。
-
每一行内容都是一个列表
-
那么列表中的所有项目都定义了变量吗?列表本身必须是字符串,项目必须是字符串/数字,或者它们是先前定义的变量。