【问题标题】:Converting to lower-case: every letter gets tokenized转换为小写:每个字母都被标记化
【发布时间】:2018-12-03 22:38:18
【问题描述】:

我有一个文本文档,我想将其转换为小写,但是当我按照以下方式进行转换时,我的文档中的每个字母都会被标记化。为什么会发生?

with open('assign_1.txt') as g:
    assign_1 = g.read()
assign_new = [word.lower() for word in assign_1]

我得到了什么:

assign_new
['b',
'a',
'n',
'g',
'l',
'a',
'd',
'e',
's',
'h',]

【问题讨论】:

  • 不管怎样,问题可能是g.read()产生了一个字符串,它是一个可迭代的字符。
  • for word in some_string 不会遍历单词。

标签: python lowercase


【解决方案1】:

您遍历整个输入,一次一个字符,将每个字符都删除为小写,并将结果指定为一个列表。比这更简单:

assign_lower = g.read().lower()

使用变量“word”不会让你遍历单词——assign_1 仍然是一个字符序列。

如果要将其分解为单词,请使用split 方法...独立于小写操作。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2013-02-04
    • 2015-07-28
    • 1970-01-01
    • 1970-01-01
    • 2015-08-07
    • 1970-01-01
    • 2021-04-30
    • 2010-12-28
    相关资源
    最近更新 更多