【发布时间】:2021-06-16 03:39:37
【问题描述】:
我想标记除 `*^
之外的字符串标点符号我试过但结果,所有类型的标点都被分开了,而对于某些标点我不想分开
当我使用时:
text = "hai*ini^ema`il saya lunar!?"
tokenizer = TweetTokenizer()
nltk_tokens = tokenizer.tokenize(text)
nltk_tokens
我明白了:
['hai', '*', 'ini', '^', 'ema', '`', 'il', 'saya', 'lunar', '!', '?']
我想要的是:
['hai*ini^ema`il', 'saya', 'lunar', '!', '?']
我想分词但不想分词 *^`
【问题讨论】:
-
这是什么语言?
-
NLP案例中用于清理数据的python
-
抱歉,不清楚:hai*ini^ema`il saya lunar 是什么语言!?
-
啊,语言是印度尼西亚语先生
标签: python jupyter-notebook nlp nltk tokenize