【发布时间】:2021-06-28 22:15:51
【问题描述】:
我正在研究语码转换。我有一组带有英语代码转换(比如语料库 A)的双语波兰语短信以及一本英语词典(也是一个列表,语料库 B)。我想从语料库 A 中提取语料库 B 中的所有单词实例——这样我可以看到哪些英语单词出现在双语语料库中。这是我用来创建这些常用词列表的代码(它远非优雅,但我是新手,所以不要对我太苛刻哈哈):
intersection=common.intersection(corpusB)
commonlist=list(intersection)
with open("commonlist.txt","w") as z:
print(commonlist, file=z)
但是,我注意到我的大部分数据存在偏差,因为其中包含与我的研究无关的词。例如,一些短信包含大量英文文本(例如,复制粘贴的英文文章段落 - 所以不是真正的代码转换,而是引用)。所以我想从语料库 A 中删除所有这些大块英文文本。
我认为我应该做的是找到并删除任何包含五个英文单词的文本消息(这些将是我的大块英文文本)。换句话说,我想扫描语料库 A 中包含来自语料库 B 的四个相邻单词的消息。我该怎么做呢?
(我也有两个语料库的 .csv 文件,也许更有用?)
【问题讨论】:
-
此代码不是 MCVE minimal reproducible example,您需要对其进行编辑以添加必要的导入和变量定义。什么是
common.intersection,是包吗?一个变量是一个集合?它在哪里定义?向我们展示示例输入数据。您可以直接从 URL 中pd.read_csv(),请向我们展示示例 corpusB 和消息 A。
标签: python nlp linguistics