【发布时间】:2015-07-11 20:58:53
【问题描述】:
实际上我要为波斯语制作一个 HMM POS 标记器。我正在研究如下的语料库。左边的第一列由波斯语单词组成,右边的第二列是词性标签。 我的问题是我如何阅读它,根据句子对其进行标记,然后像下面的代码一样将标签和单词保存在列表中?
words = [nltk.word_tokenize(s) for s in sentences]
tagged = [nltk.pos_tag(w) for w in words]
任何可以帮助我的建议或代码?
# DELM
اولين ADJ_SUP
سياره N_SING
خارج ADJ_SIM
از P
منظومه N_SING
شمسي ADJ_SIM
ديده ADJ_INO
شد V_PA
. DELM
# DELM
# DELM
واشنگتن N_SING
ـ DELM
خبرگزاري N_SING
جمهوري N_SING
اسلامي ADJ_SIM
# DELM
ستاره شناسان N_PL
مي گويند V_PRS
كه CON
ممكن ADJ_SIM
است V_PRE
اولين ADJ_SUP
سياره N_SING
خارج ADJ_SIM
از P
منظومه N_SING
شمسي ADJ_SIM
را P
ديده ADJ_INO
باشند V_SUB
. DELM
【问题讨论】:
-
你的文件格式是什么?
标签: python-3.x nltk