【发布时间】:2021-06-22 16:14:43
【问题描述】:
我是 R 的初学者,正在寻求 Excel 或 R 方面的帮助。
我有一个包含两列(所有文本)的 Excel 表。
- Column1 有大约 100,000 行,是一个冗长名称的列表。
- Column2 大约有 500 行,是一个缩短名称的列表。
要求:如果Column1中的单元格包含Column2中的任何文本字符串,我需要将Column1中的单元格重命名为Column2中的字符串。 Column2 中的所有字符串都是唯一的,因此不应存在重叠问题。
我无法在 Excel 中计算出来,因为单元格不完全匹配,而且 Excel 的近似匹配太不准确而无法使用。我考虑在 R 中这样做,但列的行数不同,这让我很困惑。非常感谢任何可能的帮助。如果我应该包含更多/其他详细信息,请告诉我。谢谢!
这是 R 中的格式示例(由于行数不同,列是单独的 dfs 除外)
Column1 <- data.frame(Full_Name = c("Geico Auto Insurance",
"Geico Motorcycle Insurance",
"Geico Commercial Auto Insurance",
"State Farm Car Insurance",
"State Farm Life Insurance"))
Column2 <- data.frame(Group_Name = c("Geico ",
"State Farm",
"Allstate"))
【问题讨论】:
-
嗨,Panon,只是在考虑逻辑。 “Geico State Farm”将映射到什么?也许是“Geico”,因为从左到右工作,这是它找到的第一个?