【发布时间】:2019-06-24 12:52:03
【问题描述】:
命名实体识别新闻数据集(文本)
这是一个示例:
<LOC Qatar> and <LOC Japan>, who met in the <EVENT <S Asian> <E Cup>> final in <DATE February>, are in third place in their groups.
我正在尝试提取 之间的实体,嵌套标签中的问题和输出是:
['<LOC Qatar>',
'<LOC Japan>',
'<EVENT <S Asian>',
'<E Cup>',
'<DATE February>']
这是错误的,因为“EVENT S Asian”、“E Cup”应该是一串而不是两串。
我尝试过正则表达式,但效果不佳。
import re
s = """<LOC Qatar> and <LOC Japan>,
who met in the <EVENT <S Asian> <E Cup>> final in <DATE February>, are in third place in their groups."""
re.findall('\<.*?\>',s)
实际结果:
['<LOC Qatar>',
'<LOC Japan>',
'<EVENT <S Asian>',
'<E Cup>',
'<DATE February>']
预期结果:
['<LOC Qatar>',
'<LOC Japan>',
'<EVENT <S Asian> <E Cup>>',
'<DATE February>']
【问题讨论】:
-
确实这个概念几乎是一样的,我试图在python中实现。