【问题标题】:How to train model on arabic language如何训练阿拉伯语模型
【发布时间】:2023-02-16 11:09:38
【问题描述】:

我有 2 个模型,一个用于英语,一个用于阿拉伯语,两者都检测文本中的情绪,阿拉伯语数据与刚刚翻译的英语相同。我目前在 excel 文件中有阿拉伯语数据集,我想像训练英语模型一样训练它,但我认为存在编码问题。

英语模型

TRAIN_2 = pd.read_csv("data/text/English/training.csv")
TEST_2 = pd.read_csv("data/text/English/test.csv")

for x,i in enumerate(TRAIN_2['label']):
    if i==0:
        TRAIN_2['label'][x]="sad"
    elif i==1:
        TRAIN_2['label'][x]="happy"
    elif i==2:
        TRAIN_2['label'][x]="happy"
    elif i==3:
        TRAIN_2['label'][x]="angry"
    elif i==4:
        TRAIN_2['label'][x]="fear"
    elif i==5:
        TRAIN_2['label'][x]="surprise"

def clean_text(data):
    data=re.sub(r"(#[\d\w\.]+)", '', data)
    data=re.sub(r"(@[\d\w\.]+)", '', data)
    data=word_tokenize(data)
    return data

texts=[' '.join(clean_text(text)) for text in data.text]

tokenizer=Tokenizer()
tokenizer.fit_on_texts(texts)
sequence_train=tokenizer.texts_to_sequences(texts_train)
sequence_test=tokenizer.texts_to_sequences(texts_test)
index_of_words=tokenizer.word_index
vocab_size=len(index_of_words)+1

X_train_pad=pad_sequences(sequence_train,maxlen=max_seq_len)
X_test_pad=pad_sequences(sequence_test,maxlen=max_seq_len)
encoding={'angry': 0,'disgust': 1, 'fear': 2, 'happy': 3, 'neutral': 4, 'sad': 5, 'surprise': 6}

英语模型

阿拉伯模型

【问题讨论】:

  • 我不清楚你的确切问题是什么。截图显示模型训练按预期开始

标签: python tensorflow deep-learning


【解决方案1】:

我可以看看阿拉伯语模型.. 你的问题解决了吗?

【讨论】:

    猜你喜欢
    • 2023-02-25
    • 2020-08-27
    • 2017-08-19
    • 1970-01-01
    • 2020-06-22
    • 2023-01-03
    • 2021-08-23
    • 1970-01-01
    • 2020-06-07
    相关资源
    最近更新 更多