【发布时间】:2023-03-11 05:40:02
【问题描述】:
我的问题是我从数据框中获取了名为 urls 的列的值,并使这些值等于名为 urlsCleaned 的熊猫系列。然后我根据自己的喜好清理了熊猫系列网址,称为 urlsCleaned。我遇到的问题是我想更改名为 urls 的数据框列,并使其与 panda 系列 urlsCleaned 的 URL 匹配。 urlsCleaned 中的值仍有大约 149 行,名为 NWO_data 的数据帧大约有 349 行。值匹配很重要,因为 url 与用户名和喜欢相关联。在开始清理之前,我是否应该在熊猫系列中创建一个新列来保持数字值,这样我才能匹配这些值?如果是这样,我该怎么做?
import csv
import twint
import datetime
import numpy as np
import pandas as pd
import matplotlib.pyplot as plt
import nest_asyncio
import re
nest_asyncio.apply()
NWO_data = pd.read_csv("TwitterLinksNWO.csv")
urlsCleaned = NWO_data["urls"]
urlsCleaned = urlsCleaned.str.replace('youtu.be', '4444')
urlsCleaned = urlsCleaned.str.replace('youtube', '4444')
urlsCleaned = urlsCleaned.str.replace('bitly', '4444')
urlsCleaned = urlsCleaned[~urlsCleaned.str.contains('4444')]
【问题讨论】:
-
不清楚您所说的“使其匹配”是什么意思。您能否提供每个输入数据帧的样本和预期输出的样本,以及到目前为止您尝试过的代码,以制作minimal reproducible example
-
回答的人解决了我的问题。不过感谢您的帮助。
标签: python pandas dataframe series