从pandas系列中高效地创建多个掩码

3

给定类似以下的一系列:

0    foo
1    bar
2    foo
3    foo
4    bar
5    baz

我该如何创建一个数据框,其中每一列都是系列中唯一值的掩码?在这个例子中,它看起来像这样:
    foo     bar     baz
0   True    False   False
1   False   True    False
2   True    False   False
3   True    False   False
4   False   True    False
5   False   False   True

pandas.DataFrame.get_dummies() - Yuca
3个回答

4

使用get_dummies函数

s.str.get_dummies().astype(bool)
Out[392]: 
     bar    baz    foo
0  False  False   True
1   True  False  False
2  False  False   True
3  False  False   True
4   True  False  False
5  False   True  False

或者我们尝试一些新的东西 crosstab

pd.crosstab(s.index,s).astype(bool)
Out[395]: 
a        bar    baz    foo
row_0                     
0      False  False   True
1       True  False  False
2      False  False   True
3      False  False   True
4       True  False  False
5      False   True  False

2
这里有一个涉及 数组初始化 的例子 -
def series_hotencode(s):
    a,b = s.factorize()
    ar = np.zeros((len(a),len(b)), dtype=bool)
    ar[np.arange(len(a)),a] = 1
    return pd.DataFrame(ar,columns=b)

样例运行 -

In [40]: s
Out[40]: 
0    foo
1    bar
2    foo
3    foo
4    bar
5    baz
Name: 1, dtype: object

In [41]: series_hotencode(s)
Out[41]: 
     foo    bar    baz
0   True  False  False
1  False   True  False
2   True  False  False
3   True  False  False
4  False   True  False
5  False  False   True

2

让我们尝试使用pd.factorize+np.eye来获得一个快速、简洁的解决方案。

x,y = pd.factorize(s)
pd.DataFrame(np.eye(len(y), dtype=bool)[x], columns=y)

     foo    bar    baz
0   True  False  False
1  False   True  False
2   True  False  False
3   True  False  False
4  False   True  False
5  False  False   True

网页内容由stack overflow 提供, 点击上面的
可以查看英文原文,
原文链接