【发布时间】:2016-05-10 08:37:37
【问题描述】:
我有一些简单的数据,比如下面的 MovieLense 1M 数据文件
item_id title genres
1 1 Toy Story (1995) Animation|Children's|Comedy
2 2 Jumanji (1995) Adventure|Children's|Fantasy
3 3 Grumpier Old Men (1995) Comedy|Romance
4 4 Waiting to Exhale (1995) Comedy|Drama
5 5 Father of the Bride Part II (1995) Comedy
6 6 Heat (1995) Action|Crime|Thriller
我的genres 列数据包含 19 个值。我应该如何将我的数据更改为如上示例所示?
类型表
genreTbl['title']
title
1 unknown
2 Action
3 Adventure
4 Animation
5 Children's
6 Comedy
7 Crime
8 Documentary
9 Drama
10 Fantasy
11 Film-Noir
12 Horror
13 Musical
14 Mystery
15 Romance
16 Sci-Fi
17 Thriller
18 War
19 Western
我想把我的数据改成这个结构:
item_id movie_title release_date
1 1 Toy Story (1995) <NA>
2 2 GoldenEye (1995) <NA>
3 3 Four Rooms (1995) <NA>
4 4 Get Shorty (1995) <NA>
5 5 Copycat (1995) <NA>
6 6 Shanghai Triad (Yao a yao yao dao waipo qiao) (1995) <NA>
unknown Action Adventure Animation Children's Comedy Crime Documentary Drama
1 0 0 0 1 1 1 0 0 0
2 0 1 1 0 0 0 0 0 0
3 0 0 0 0 0 0 0 0 0
4 0 1 0 0 0 1 0 0 1
5 0 0 0 0 0 0 1 0 1
6 0 0 0 0 0 0 0 0 1
Fantasy Film-Noir Horror Musical Mystery Romance Sci-Fi Thriller War Western
1 0 0 0 0 0 0 0 0 0 0
2 0 0 0 0 0 0 0 1 0 0
3 0 0 0 0 0 0 0 1 0 0
4 0 0 0 0 0 0 0 0 0 0
5 0 0 0 0 0 0 0 1 0 0
6 0 0 0 0 0 0 0 0 0 0
我需要我所有的流派都像上面一样在列中,如果我的项目流派值包含选定的流派值应该是 1 否则 0。
【问题讨论】:
-
显示您尝试自己解决此问题的代码在哪里?
-
请在写作中使用标点符号。
-
@RichardScriven 我不知道如何解决这个问题:(
-
提示 - 编写一个函数,为“genrestring”返回 0/1 向量并将其应用于您的表。我可以帮你解决这个问题,但不是现在。
-
当您在 Google 上搜索标题“在 R 中分离一列”时发生了什么?请参观并阅读about SO:“包括有关您尝试过的内容的详细信息”; “不要问...... [q]你没有试图找到答案的问题(展示你的作品!)”。