【发布时间】:2021-07-07 12:06:15
【问题描述】:
我有 2 个文件,其中每个文件都出现了 3 次“test”一词。
distributed.txt
this
is
only
a
test
to
see
if
test
is
same
as
test
另一个文件有单词“test”。但它会立即重复或在 1 或 2 个单词之后重复。
closer.txt
this
is
only
a
test
to
test
test
see
if
is
same
as
“test”一词在两个文件中出现了 3 次。因此百分比是相同的。 但它在一个文件中彼此更接近,而在另一个文件中分布更广。机器学习中有什么方法可以知道一个单词在给定列表中的重复距离有多近或多远?
$ wc -l closer.txt
13 closer.txt
$ grep test closer.txt | wc -l
3
$ wc -l distributed.txt
13 distributed.txt
$ grep test distributed.txt | wc -l
3
【问题讨论】:
-
你的意思是“均匀分布”?
-
是的。这是正确的术语。
-
我猜机器学习或 NLP 必须为此提供方法/模块。我可以添加那个标签@Wiktor Stribiżew 吗?
-
@shantanuo 这不是机器学习的问题。图书馆也不是,这些只是一般概念。此外,如果你只是要求一个图书馆,这是一个关于 SO 的题外话。