-
Notifications
You must be signed in to change notification settings - Fork 6
Expand file tree
/
Copy pathmmd_rnn.py
More file actions
155 lines (127 loc) · 5.28 KB
/
Copy pathmmd_rnn.py
File metadata and controls
155 lines (127 loc) · 5.28 KB
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
import concurrent.futures
from functools import partial
import networkx as nx
import numpy as np
from scipy.linalg import toeplitz
import pyemd
# source: https://github.com/JiaxuanYou/graph-generation
def emd(x, y, distance_scaling=1.0):
support_size = max(len(x), len(y))
d_mat = toeplitz(range(support_size)).astype(np.float)
distance_mat = d_mat / distance_scaling
# convert histogram values x and y to float, and make them equal len
x = x.astype(np.float)
y = y.astype(np.float)
if len(x) < len(y):
x = np.hstack((x, [0.0] * (support_size - len(x))))
elif len(y) < len(x):
y = np.hstack((y, [0.0] * (support_size - len(y))))
emd = pyemd.emd(x, y, distance_mat)
return emd
def l2(x, y):
dist = np.linalg.norm(x - y, 2)
return dist
def gaussian_tv(x, y, sigma=1.0):
support_size = max(len(x), len(y))
# convert histogram values x and y to float, and make them equal len
x = x.astype(np.float)
y = y.astype(np.float)
if len(x) < len(y):
x = np.hstack((x, [0.0] * (support_size - len(x))))
elif len(y) < len(x):
y = np.hstack((y, [0.0] * (support_size - len(y))))
dist = np.abs(x - y).sum() / 2.0
return np.exp(-dist * dist / (2 * sigma * sigma))
def gaussian_emd(x, y, sigma=1.0, distance_scaling=1.0):
''' Gaussian kernel with squared distance in exponential term replaced by EMD
Args:
x, y: 1D pmf of two distributions with the same support
sigma: standard deviation
'''
support_size = max(len(x), len(y))
d_mat = toeplitz(range(support_size)).astype(np.float)
distance_mat = d_mat / distance_scaling
# convert histogram values x and y to float, and make them equal len
x = x.astype(np.float)
y = y.astype(np.float)
if len(x) < len(y):
x = np.hstack((x, [0.0] * (support_size - len(x))))
elif len(y) < len(x):
y = np.hstack((y, [0.0] * (support_size - len(y))))
emd = pyemd.emd(x, y, distance_mat)
return np.exp(-emd * emd / (2 * sigma * sigma))
def gaussian(x, y, sigma=1.0):
dist = np.linalg.norm(x - y, 2)
return np.exp(-dist * dist / (2 * sigma * sigma))
def kernel_parallel_unpacked(x, samples2, kernel):
d = 0
for s2 in samples2:
d += kernel(x, s2)
return d
def kernel_parallel_worker(t):
return kernel_parallel_unpacked(*t)
def disc(samples1, samples2, kernel, is_parallel=False, *args, **kwargs):
''' Discrepancy between 2 samples
'''
d = 0
if not is_parallel:
for s1 in samples1:
for s2 in samples2:
d += kernel(s1, s2, *args, **kwargs)
else:
with concurrent.futures.ProcessPoolExecutor() as executor:
for dist in executor.map(kernel_parallel_worker,
[(s1, samples2, partial(kernel, *args, **kwargs)) for s1 in samples1]):
d += dist
d /= len(samples1) * len(samples2)
return d
def compute_mmd(samples1, samples2, kernel, is_hist=True, *args, **kwargs):
''' MMD between two samples
'''
# normalize histograms into pmf
if is_hist:
samples1 = [s1 / np.sum(s1) for s1 in samples1]
samples2 = [s2 / np.sum(s2) for s2 in samples2]
# print('===============================')
# print('s1: ', disc(samples1, samples1, kernel, *args, **kwargs))
# print('--------------------------')
# print('s2: ', disc(samples2, samples2, kernel, *args, **kwargs))
# print('--------------------------')
# print('cross: ', disc(samples1, samples2, kernel, *args, **kwargs))
# print('===============================')
return disc(samples1, samples1, kernel, *args, **kwargs) + \
disc(samples2, samples2, kernel, *args, **kwargs) - \
2 * disc(samples1, samples2, kernel, *args, **kwargs)
# return disc(samples1, samples1, kernel, *args, **kwargs)
def compute_emd(samples1, samples2, kernel, is_hist=True, *args, **kwargs):
''' EMD between average of two samples
'''
# normalize histograms into pmf
if is_hist:
samples1 = [np.mean(samples1)]
samples2 = [np.mean(samples2)]
# print('===============================')
# print('s1: ', disc(samples1, samples1, kernel, *args, **kwargs))
# print('--------------------------')
# print('s2: ', disc(samples2, samples2, kernel, *args, **kwargs))
# print('--------------------------')
# print('cross: ', disc(samples1, samples2, kernel, *args, **kwargs))
# print('===============================')
return disc(samples1, samples2, kernel, *args, **kwargs), [samples1[0], samples2[0]]
def test():
s1 = np.array([0.2, 0.8])
s2 = np.array([0.3, 0.7])
samples1 = [s1, s2]
s3 = np.array([0.25, 0.75])
s4 = np.array([0.35, 0.65])
samples2 = [s3, s4]
s5 = np.array([0.8, 0.2])
s6 = np.array([0.7, 0.3])
samples3 = [s5, s6]
print('between samples1 and samples2: ', compute_mmd(samples1, samples2, kernel=gaussian_emd,
is_parallel=False, sigma=1.0))
print('between samples1 and samples3: ', compute_mmd(samples1, samples3, kernel=gaussian_emd,
is_parallel=False, sigma=1.0))
print('between samples1 and samples3: ', compute_mmd(samples1, samples3, kernel=gaussian_tv))
if __name__ == '__main__':
test()