【发布时间】:2021-12-19 22:00:54
【问题描述】:
大家下午好,我在清除数据框的字符串列中的特殊字符时遇到问题,我只想删除html组件,表情符号和unicode错误等特殊字符,例如\u2013。
有人有正则表达式来帮助我吗? 或者对如何处理这个问题有什么建议?
输入:
i want to remove ???? and codes "\u2022"
预期输出:
i want to remove and codes
我试过了:
re.sub('[^A-Za-z0-9 \u2022]+', '', nome)
regexp_replace('nome', '\r\n|/[\x00-\x1F\x7F]/u', ' ')
df = df.withColumn( “价值_2”, F.regexp_replace(F.regexp_replace("值", "[^\x00-\x7F]+", ""), '""', '') )
df = df.withColumn("new",df.text.encode('ascii', errors='ignore').decode('ascii'))
尝试了一些解决方案,但没有人识别字符“\u2013”,有人遇到过这种情况吗?
【问题讨论】:
-
一个简单的方法是简单地编码然后将你的字符串解码为 ascii
'i want to remove ☺ and codes "\u2022"'.encode('ascii', errors='ignore').decode('ascii'),现在你只需要处理双空格或双""如果你有它们,但是那是另一个简单的字符串替换
标签: python apache-spark pyspark apache-spark-sql