【发布时间】:2019-04-21 20:51:30
【问题描述】:
如何解决构建标点预测器的问题?
可以在link 中找到该问题的工作演示。
输入文字如下:
"its been a little while Kirk tells me its actually been
three weeks now that Ive been using this device right here
that is of course the Galaxy S ten I mean Ive just been
living with this phone this has been my phone has the SIM
card in it I took photos I lived live I sent tweets whatsapp
slack email whatever other app this was my smart phone"
【问题讨论】:
-
也许你可以从创建一个列表开始。第一个元素第一个单词,第二个元素前两个单词,第三个元素前三个单词,第四个元素前四个单词....
-
我想过,但它不适用于我的情况。根据我正在处理的文件,我将有数千个单词。考虑到我有一个千字文件要处理,而您建议的 N-gram 方法将有 1000 个句子要分析。但如果我划分句子,我只会分析大约 100-200 个句子。
-
抱歉,您不能只用一个完全不同的问题替换一个问题,尤其是在已经有答案的情况下。我已将帖子回滚到发布的原始问题。不接受答案对他们为回答您的问题所付出的努力尤其不公平。
标签: python nlp stanford-nlp tokenize