【发布时间】:2021-09-15 02:05:28
【问题描述】:
我有两个数据框,我需要检查测试数据框(df_test)和参考数据框(df_reference)之间的差异。我需要报告测试数据框中不应存在的字符,如单引号或双引号、空格或大写:
list_reference = ['hey', 'ola', 'bonjour', 'Hello']
list_test = ['Hey', 'ol a', 'bon'jour', 'He"llo']
df_reference = pd.DataFrame(list_reference)
df_test = pd.DataFrame(list_test)
我想用 pandas 找到最简单的解决方案,以检测与 df_reference 不同的单词并发出错误消息以指示单词上存在引号、双引号、大写字母或空格来自 df_test。
什么是最好的解决方案?熊猫,python difflib?使用最少代码的解决方案?
谢谢。
【问题讨论】:
-
欢迎来到Stack Overflow. 请注意这不是代码编写或辅导服务。我们可以帮助解决具体的技术问题,而不是对代码或建议的开放式请求。请编辑您的问题以显示您迄今为止尝试过的内容,以及您需要帮助的具体问题。请参阅How To Ask a Good Question 页面,详细了解如何最好地帮助我们。
-
您是否想将每个测试词与每个参考词进行比较,或者您是否可以将“嘿”与“嘿”、“奥拉”与“奥尔 a”等进行比较...而无需浏览所有其他单词?
-
你好@DerekO,我想比较'hey' 和'Hey','ola 和'ol a',等等......而不必经历所有其他词。我想通过信息消息警告数据框参考中存在错误字符
标签: python-3.x pandas dataframe