【问题标题】:Tokenize text containing digits标记包含数字的文本
【发布时间】:2022-01-20 09:51:38
【问题描述】:

我想创建一个文本分类器,模型的输入包含数字以及包含重要信息的文本(不要以为我可以扔掉数字)。有没有办法标记这种输入?

输入看起来像这样:

     input:
     -------
     Please have a look at case#345
     injector 1 and injector 3 is not responding for model 8
     Car has been running for 2345 km, try to do this procedure 
     .....
     .....

【问题讨论】:

    标签: python keras neural-network text-classification


    【解决方案1】:

    这有帮助:

    from keras.preprocessing.text import text_to_word_sequence
    
    text = 'Please have a look at case#345. injector1 and injector3 is not responding for model8. Car has been running for 2345 km, try to do this procedure .'
    # tokenize the document
    result = text_to_word_sequence(text)
    print(result)
    

    输出:

    ['please', 'have', 'a', 'look', 'at', 'case', '345', 'injector1', 'and', 'injector3', 'is', 'not', 'responding', 'for', 'model8', 'car', 'has', 'been', 'running', 'for', '2345', 'km', 'try', 'to', 'do', 'this', 'procedure']
    

    【讨论】:

    • 好的,谢谢。将 injector1 ("injector1") 视为一个完整的单词而不是两个单词 ("injector", "1") 会更好吗?如果我有更多行带有句子“Injector 1”?还是模型学习效果一样好?
    • 我会推荐injector1。在当前情况下,injector 和 1 充当两个不同的令牌。在进行预处理时,将注入器和 1 合并为注入器1
    • 用那些字符串和个位数的单词组合更新了答案..
    猜你喜欢
    • 2020-02-07
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2017-01-24
    • 1970-01-01
    相关资源
    最近更新 更多