【问题标题】:external dataset learning in python for machine learningpython中的外部数据集学习用于机器学习
【发布时间】:2017-04-20 13:47:38
【问题描述】:

您好,我想使用 naivebayesclassifier 对数据集进行分类。为此,我想使用从 google 下载的外部数据集。此数据集包含两个文件夹用于正面评论和负面评论。每个文件夹包含 1000 个 .txt 文件。如何在我的代码中将此文件作为 python 中的训练数据集导入。我是机器学习的新手,所以对此我知之甚少。请帮帮我。

【问题讨论】:

    标签: python-3.x machine-learning dataset naivebayes


    【解决方案1】:

    您可以使用来自 (https://docs.python.org/2/library/os.html) 的os.listdir,例如:

    import os
    fileList = os.listdir('train_directory')
    for file in fileList:
        # add content of file to dataset.
    

    【讨论】:

    • os.listdir 代码有效。感谢指导。我想阅读每个 .txt 文件并提取所有正面单词并在最后将单词标记为正面。下面的代码,但它显示错误说明 0_9 .txt 这个文件名不存在,但它在文件夹中 posfilenames = os.listdir("C:/Users/Sharmili/Desktop/movie_reviews/pos") print(posfilenames)for filename in posfilenames: f = open(filename, 'r') reviews = f.read() pos_reviews = reviews.split() pos_reviews.append((create_word_feature(words),"positive")) print(len(pos_reviews))
    • 你能帮帮我吗
    • 你需要使用 f = open(dir + "/" + filename)
    • 我已经尝试过您的代码,但它不起作用,所以我尝试了以下代码作为 posfilenames 中的文件名:f = open(os.path.join("C:/Users/Sharmili/Desktop/movie_reviews) /pos",filename),'r') pos_reviews = f.read().split(" ") print(pos_reviews)
    • 虽然它正在打印单词,但它给出了错误 return codecs.charmap_decode(input,self.errors,decoding_table)[0] UnicodeDecodeError: 'charmap' codec can't decode byte 0x9d in position 803 : 字符映射到
    猜你喜欢
    • 1970-01-01
    • 2017-03-03
    • 2019-05-14
    • 1970-01-01
    • 2016-05-25
    • 2019-09-23
    • 2017-06-25
    • 2017-06-21
    • 2016-05-06
    相关资源
    最近更新 更多