【发布时间】:2022-07-23 00:34:35
【问题描述】:
我正在尝试构建一个 TFIDVectorizer,它只接受使用 TFIdfVectorizer(token_pattern="(?u)\\b\\D\\D\\D+\\b")
但它的行为不正确,我知道 token_pattern="(?u)\\b\\w\\w\\w+\\b" 接受 3 个或更多 字母数字 字符的标记,所以我只是不明白为什么前者不起作用。
我错过了什么?
【问题讨论】:
-
三个或更多字母是
token_pattern="[^\W\d_]{3,}"或token_pattern="[a-zA-Z]{3,}"
标签: python regex tfidfvectorizer