ChiefTheLord commited on
Commit
5adbb37
·
verified ·
1 Parent(s): 633d607

Upload folder using huggingface_hub

Browse files
.gitattributes CHANGED
@@ -97,3 +97,4 @@ checkpoints-v1.0a-discrete-condition/checkpoint-14336/eval_state.json filter=lfs
97
  checkpoints-v1.0a-discrete-condition/checkpoint-21651/eval_state.json filter=lfs diff=lfs merge=lfs -text
98
  checkpoints-v1.0b-discrete-condition/checkpoint-11264/eval_state.json filter=lfs diff=lfs merge=lfs -text
99
  checkpoints-v1.0c-discrete-condition/checkpoint-20992/eval_state.json filter=lfs diff=lfs merge=lfs -text
 
 
97
  checkpoints-v1.0a-discrete-condition/checkpoint-21651/eval_state.json filter=lfs diff=lfs merge=lfs -text
98
  checkpoints-v1.0b-discrete-condition/checkpoint-11264/eval_state.json filter=lfs diff=lfs merge=lfs -text
99
  checkpoints-v1.0c-discrete-condition/checkpoint-20992/eval_state.json filter=lfs diff=lfs merge=lfs -text
100
+ checkpoints-v1.0b-discrete-condition/checkpoint-20992/eval_state.json filter=lfs diff=lfs merge=lfs -text
checkpoints-v1.0b-discrete-condition/checkpoint-20992/eval_state.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:727c6d9f4e2b650044d49834cec11167aae2f782fd5ef7199512f6d0afb72a12
3
+ size 42838250
checkpoints-v1.0b-discrete-condition/checkpoint-20992/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a784bdd72ba6e92f6bf61fd063ffdf1fcf54ea4bc4cb943152984527e693089d
3
+ size 15210032
checkpoints-v1.0b-discrete-condition/checkpoint-20992/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:cf60c2acd9fd2d941d98bac024cbf967a1baf02eaaca81ed67b853efc63131db
3
+ size 13675339
checkpoints-v1.0b-discrete-condition/checkpoint-20992/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:43c35ac25977afe8d6879218c8167ff2488274f7bfd594f8321aa13a86f8f836
3
+ size 14645
checkpoints-v1.0b-discrete-condition/checkpoint-20992/scaler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4b2b626971ffe6a069c124d8434c7593fc027b681e0eae277b49d981e0cc5757
3
+ size 1383
checkpoints-v1.0b-discrete-condition/checkpoint-20992/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:08a961820a8c596930037f24818e1c4ab131497a8614687a953724ef42bc2e0e
3
+ size 1465
checkpoints-v1.0b-discrete-condition/checkpoint-20992/trainer_state.json ADDED
@@ -0,0 +1,1387 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.9695626068079997,
6
+ "eval_steps": 512,
7
+ "global_step": 20992,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.011823934229365849,
14
+ "grad_norm": 0.0374470092356205,
15
+ "learning_rate": 0.000498046875,
16
+ "loss": 1.7392830848693848,
17
+ "step": 256
18
+ },
19
+ {
20
+ "epoch": 0.023647868458731697,
21
+ "grad_norm": 0.6093892455101013,
22
+ "learning_rate": 0.000998046875,
23
+ "loss": 1.598156213760376,
24
+ "step": 512
25
+ },
26
+ {
27
+ "epoch": 0.023647868458731697,
28
+ "eval_bleu": 0.0,
29
+ "eval_cos_loss": 0.7696732297607752,
30
+ "eval_loss": 1.4412390649590863,
31
+ "eval_mse_loss": 1.4412390649590863,
32
+ "step": 512
33
+ },
34
+ {
35
+ "epoch": 0.023647868458731697,
36
+ "eval_bleu": 0.0,
37
+ "eval_cos_loss": 0.7696732297607752,
38
+ "eval_loss": 1.4412390649590863,
39
+ "eval_mse_loss": 1.4412390649590863,
40
+ "eval_runtime": 159.5986,
41
+ "eval_samples_per_second": 175.396,
42
+ "eval_steps_per_second": 2.744,
43
+ "step": 512
44
+ },
45
+ {
46
+ "epoch": 0.03547180268809755,
47
+ "grad_norm": 0.6309738159179688,
48
+ "learning_rate": 0.000999640996023194,
49
+ "loss": 1.3486289978027344,
50
+ "step": 768
51
+ },
52
+ {
53
+ "epoch": 0.047295736917463395,
54
+ "grad_norm": 0.9618902802467346,
55
+ "learning_rate": 0.0009985588674043958,
56
+ "loss": 1.2263447046279907,
57
+ "step": 1024
58
+ },
59
+ {
60
+ "epoch": 0.047295736917463395,
61
+ "eval_bleu": 0.002616386000515621,
62
+ "eval_cos_loss": 0.6618151305473015,
63
+ "eval_loss": 1.1486175982919458,
64
+ "eval_mse_loss": 1.1486175982919458,
65
+ "step": 1024
66
+ },
67
+ {
68
+ "epoch": 0.047295736917463395,
69
+ "eval_bleu": 0.002616386000515621,
70
+ "eval_cos_loss": 0.6618151305473015,
71
+ "eval_loss": 1.1486175982919458,
72
+ "eval_mse_loss": 1.1486175982919458,
73
+ "eval_runtime": 155.4374,
74
+ "eval_samples_per_second": 180.092,
75
+ "eval_steps_per_second": 2.818,
76
+ "step": 1024
77
+ },
78
+ {
79
+ "epoch": 0.05911967114682925,
80
+ "grad_norm": 0.807138204574585,
81
+ "learning_rate": 0.0009967551747861387,
82
+ "loss": 1.0810199975967407,
83
+ "step": 1280
84
+ },
85
+ {
86
+ "epoch": 0.0709436053761951,
87
+ "grad_norm": 0.7746097445487976,
88
+ "learning_rate": 0.000994232528651847,
89
+ "loss": 0.9834531545639038,
90
+ "step": 1536
91
+ },
92
+ {
93
+ "epoch": 0.0709436053761951,
94
+ "eval_bleu": 0.012529858522811724,
95
+ "eval_cos_loss": 0.5913034896600192,
96
+ "eval_loss": 0.9445572563502342,
97
+ "eval_mse_loss": 0.9445572563502342,
98
+ "step": 1536
99
+ },
100
+ {
101
+ "epoch": 0.0709436053761951,
102
+ "eval_bleu": 0.012529858522811724,
103
+ "eval_cos_loss": 0.5913034896600192,
104
+ "eval_loss": 0.9445572563502342,
105
+ "eval_mse_loss": 0.9445572563502342,
106
+ "eval_runtime": 157.248,
107
+ "eval_samples_per_second": 178.018,
108
+ "eval_steps_per_second": 2.785,
109
+ "step": 1536
110
+ },
111
+ {
112
+ "epoch": 0.08276753960556095,
113
+ "grad_norm": 0.7339635491371155,
114
+ "learning_rate": 0.0009909945800260092,
115
+ "loss": 0.929780900478363,
116
+ "step": 1792
117
+ },
118
+ {
119
+ "epoch": 0.09459147383492679,
120
+ "grad_norm": 0.6405588388442993,
121
+ "learning_rate": 0.0009870460151900522,
122
+ "loss": 0.8905904293060303,
123
+ "step": 2048
124
+ },
125
+ {
126
+ "epoch": 0.09459147383492679,
127
+ "eval_bleu": 0.024984530015966948,
128
+ "eval_cos_loss": 0.5550511261643885,
129
+ "eval_loss": 0.8596870847488647,
130
+ "eval_mse_loss": 0.8596870847488647,
131
+ "step": 2048
132
+ },
133
+ {
134
+ "epoch": 0.09459147383492679,
135
+ "eval_bleu": 0.024984530015966948,
136
+ "eval_cos_loss": 0.5550511261643885,
137
+ "eval_loss": 0.8596870847488647,
138
+ "eval_mse_loss": 0.8596870847488647,
139
+ "eval_runtime": 158.1254,
140
+ "eval_samples_per_second": 177.03,
141
+ "eval_steps_per_second": 2.77,
142
+ "step": 2048
143
+ },
144
+ {
145
+ "epoch": 0.10641540806429264,
146
+ "grad_norm": 0.44440358877182007,
147
+ "learning_rate": 0.0009823925488998885,
148
+ "loss": 0.8383368253707886,
149
+ "step": 2304
150
+ },
151
+ {
152
+ "epoch": 0.1182393422936585,
153
+ "grad_norm": 0.5447011590003967,
154
+ "learning_rate": 0.0009770409161149525,
155
+ "loss": 0.8073748350143433,
156
+ "step": 2560
157
+ },
158
+ {
159
+ "epoch": 0.1182393422936585,
160
+ "eval_bleu": 0.047084110969286816,
161
+ "eval_cos_loss": 0.5225583875560325,
162
+ "eval_loss": 0.790363206983157,
163
+ "eval_mse_loss": 0.790363206983157,
164
+ "step": 2560
165
+ },
166
+ {
167
+ "epoch": 0.1182393422936585,
168
+ "eval_bleu": 0.047084110969286816,
169
+ "eval_cos_loss": 0.5225583875560325,
170
+ "eval_loss": 0.790363206983157,
171
+ "eval_mse_loss": 0.790363206983157,
172
+ "eval_runtime": 159.2451,
173
+ "eval_samples_per_second": 175.786,
174
+ "eval_steps_per_second": 2.75,
175
+ "step": 2560
176
+ },
177
+ {
178
+ "epoch": 0.13006327652302435,
179
+ "grad_norm": 0.7619520425796509,
180
+ "learning_rate": 0.0009709988622506973,
181
+ "loss": 0.7779935598373413,
182
+ "step": 2816
183
+ },
184
+ {
185
+ "epoch": 0.1418872107523902,
186
+ "grad_norm": 0.7269508242607117,
187
+ "learning_rate": 0.000964275131968659,
188
+ "loss": 0.7515906691551208,
189
+ "step": 3072
190
+ },
191
+ {
192
+ "epoch": 0.1418872107523902,
193
+ "eval_bleu": 0.06069124069154519,
194
+ "eval_cos_loss": 0.49749508357211336,
195
+ "eval_loss": 0.7418757852626173,
196
+ "eval_mse_loss": 0.7418757852626173,
197
+ "step": 3072
198
+ },
199
+ {
200
+ "epoch": 0.1418872107523902,
201
+ "eval_bleu": 0.06069124069154519,
202
+ "eval_cos_loss": 0.49749508357211336,
203
+ "eval_loss": 0.7418757852626173,
204
+ "eval_mse_loss": 0.7418757852626173,
205
+ "eval_runtime": 159.5995,
206
+ "eval_samples_per_second": 175.395,
207
+ "eval_steps_per_second": 2.744,
208
+ "step": 3072
209
+ },
210
+ {
211
+ "epoch": 0.15371114498175603,
212
+ "grad_norm": 0.526964008808136,
213
+ "learning_rate": 0.0009568794565203123,
214
+ "loss": 0.7329623103141785,
215
+ "step": 3328
216
+ },
217
+ {
218
+ "epoch": 0.1655350792111219,
219
+ "grad_norm": 0.6683301329612732,
220
+ "learning_rate": 0.0009488225396630347,
221
+ "loss": 0.7124975323677063,
222
+ "step": 3584
223
+ },
224
+ {
225
+ "epoch": 0.1655350792111219,
226
+ "eval_bleu": 0.07747562521735782,
227
+ "eval_cos_loss": 0.4767472299674875,
228
+ "eval_loss": 0.7043111967986033,
229
+ "eval_mse_loss": 0.7043111967986033,
230
+ "step": 3584
231
+ },
232
+ {
233
+ "epoch": 0.1655350792111219,
234
+ "eval_bleu": 0.07747562521735782,
235
+ "eval_cos_loss": 0.4767472299674875,
236
+ "eval_loss": 0.7043111967986033,
237
+ "eval_mse_loss": 0.7043111967986033,
238
+ "eval_runtime": 162.4192,
239
+ "eval_samples_per_second": 172.35,
240
+ "eval_steps_per_second": 2.697,
241
+ "step": 3584
242
+ },
243
+ {
244
+ "epoch": 0.17735901344048774,
245
+ "grad_norm": 0.6260165572166443,
246
+ "learning_rate": 0.0009401160421685646,
247
+ "loss": 0.6971993446350098,
248
+ "step": 3840
249
+ },
250
+ {
251
+ "epoch": 0.18918294766985358,
252
+ "grad_norm": 0.7788051962852478,
253
+ "learning_rate": 0.0009307725649463714,
254
+ "loss": 0.6853694319725037,
255
+ "step": 4096
256
+ },
257
+ {
258
+ "epoch": 0.18918294766985358,
259
+ "eval_bleu": 0.0886926891607534,
260
+ "eval_cos_loss": 0.46421769383835465,
261
+ "eval_loss": 0.6790926791217229,
262
+ "eval_mse_loss": 0.6790926791217229,
263
+ "step": 4096
264
+ },
265
+ {
266
+ "epoch": 0.18918294766985358,
267
+ "eval_bleu": 0.0886926891607534,
268
+ "eval_cos_loss": 0.46421769383835465,
269
+ "eval_loss": 0.6790926791217229,
270
+ "eval_mse_loss": 0.6790926791217229,
271
+ "eval_runtime": 161.9861,
272
+ "eval_samples_per_second": 172.811,
273
+ "eval_steps_per_second": 2.704,
274
+ "step": 4096
275
+ },
276
+ {
277
+ "epoch": 0.20100688189921945,
278
+ "grad_norm": 0.5158849358558655,
279
+ "learning_rate": 0.0009208056308063659,
280
+ "loss": 0.6696363687515259,
281
+ "step": 4352
282
+ },
283
+ {
284
+ "epoch": 0.2128308161285853,
285
+ "grad_norm": 0.5475754141807556,
286
+ "learning_rate": 0.0009102296648873445,
287
+ "loss": 0.6564373970031738,
288
+ "step": 4608
289
+ },
290
+ {
291
+ "epoch": 0.2128308161285853,
292
+ "eval_bleu": 0.10135086888192472,
293
+ "eval_cos_loss": 0.45056082961493976,
294
+ "eval_loss": 0.6526828235415019,
295
+ "eval_mse_loss": 0.6526828235415019,
296
+ "step": 4608
297
+ },
298
+ {
299
+ "epoch": 0.2128308161285853,
300
+ "eval_bleu": 0.10135086888192472,
301
+ "eval_cos_loss": 0.45056082961493976,
302
+ "eval_loss": 0.6526828235415019,
303
+ "eval_mse_loss": 0.6526828235415019,
304
+ "eval_runtime": 160.4944,
305
+ "eval_samples_per_second": 174.417,
306
+ "eval_steps_per_second": 2.729,
307
+ "step": 4608
308
+ },
309
+ {
310
+ "epoch": 0.22465475035795113,
311
+ "grad_norm": 0.4408429265022278,
312
+ "learning_rate": 0.0008990599737794927,
313
+ "loss": 0.6503246426582336,
314
+ "step": 4864
315
+ },
316
+ {
317
+ "epoch": 0.236478684587317,
318
+ "grad_norm": 0.5507891774177551,
319
+ "learning_rate": 0.0008873127233711644,
320
+ "loss": 0.6398327946662903,
321
+ "step": 5120
322
+ },
323
+ {
324
+ "epoch": 0.236478684587317,
325
+ "eval_bleu": 0.11090334235828597,
326
+ "eval_cos_loss": 0.43968688012802437,
327
+ "eval_loss": 0.6368203232549641,
328
+ "eval_mse_loss": 0.6368203232549641,
329
+ "step": 5120
330
+ },
331
+ {
332
+ "epoch": 0.236478684587317,
333
+ "eval_bleu": 0.11090334235828597,
334
+ "eval_cos_loss": 0.43968688012802437,
335
+ "eval_loss": 0.6368203232549641,
336
+ "eval_mse_loss": 0.6368203232549641,
337
+ "eval_runtime": 163.0003,
338
+ "eval_samples_per_second": 171.736,
339
+ "eval_steps_per_second": 2.687,
340
+ "step": 5120
341
+ },
342
+ {
343
+ "epoch": 0.24830261881668284,
344
+ "grad_norm": 0.5450671911239624,
345
+ "learning_rate": 0.0008750049154520011,
346
+ "loss": 0.6276033520698547,
347
+ "step": 5376
348
+ },
349
+ {
350
+ "epoch": 0.2601265530460487,
351
+ "grad_norm": 0.4864253103733063,
352
+ "learning_rate": 0.0008621543631062487,
353
+ "loss": 0.6176455616950989,
354
+ "step": 5632
355
+ },
356
+ {
357
+ "epoch": 0.2601265530460487,
358
+ "eval_bleu": 0.13157973832317418,
359
+ "eval_cos_loss": 0.42597596265681803,
360
+ "eval_loss": 0.6125754146543267,
361
+ "eval_mse_loss": 0.6125754146543267,
362
+ "step": 5632
363
+ },
364
+ {
365
+ "epoch": 0.2601265530460487,
366
+ "eval_bleu": 0.13157973832317418,
367
+ "eval_cos_loss": 0.42597596265681803,
368
+ "eval_loss": 0.6125754146543267,
369
+ "eval_mse_loss": 0.6125754146543267,
370
+ "eval_runtime": 164.2634,
371
+ "eval_samples_per_second": 170.415,
372
+ "eval_steps_per_second": 2.666,
373
+ "step": 5632
374
+ },
375
+ {
376
+ "epoch": 0.27195048727541454,
377
+ "grad_norm": 0.43313494324684143,
378
+ "learning_rate": 0.0008487796649318904,
379
+ "loss": 0.6093599796295166,
380
+ "step": 5888
381
+ },
382
+ {
383
+ "epoch": 0.2837744215047804,
384
+ "grad_norm": 0.7482439279556274,
385
+ "learning_rate": 0.0008349001781229053,
386
+ "loss": 0.6033267974853516,
387
+ "step": 6144
388
+ },
389
+ {
390
+ "epoch": 0.2837744215047804,
391
+ "eval_bleu": 0.14631271028993093,
392
+ "eval_cos_loss": 0.41583949184581026,
393
+ "eval_loss": 0.5962636355123564,
394
+ "eval_mse_loss": 0.5962636355123564,
395
+ "step": 6144
396
+ },
397
+ {
398
+ "epoch": 0.2837744215047804,
399
+ "eval_bleu": 0.14631271028993093,
400
+ "eval_cos_loss": 0.41583949184581026,
401
+ "eval_loss": 0.5962636355123564,
402
+ "eval_mse_loss": 0.5962636355123564,
403
+ "eval_runtime": 162.422,
404
+ "eval_samples_per_second": 172.347,
405
+ "eval_steps_per_second": 2.697,
406
+ "step": 6144
407
+ },
408
+ {
409
+ "epoch": 0.2955983557341462,
410
+ "grad_norm": 0.6504518985748291,
411
+ "learning_rate": 0.0008205359904536107,
412
+ "loss": 0.5911573171615601,
413
+ "step": 6400
414
+ },
415
+ {
416
+ "epoch": 0.30742228996351206,
417
+ "grad_norm": 0.5136239528656006,
418
+ "learning_rate": 0.0008057078912056363,
419
+ "loss": 0.5828324556350708,
420
+ "step": 6656
421
+ },
422
+ {
423
+ "epoch": 0.30742228996351206,
424
+ "eval_bleu": 0.15939404724680464,
425
+ "eval_cos_loss": 0.4056242143726784,
426
+ "eval_loss": 0.5786329095494257,
427
+ "eval_mse_loss": 0.5786329095494257,
428
+ "step": 6656
429
+ },
430
+ {
431
+ "epoch": 0.30742228996351206,
432
+ "eval_bleu": 0.15939404724680464,
433
+ "eval_cos_loss": 0.4056242143726784,
434
+ "eval_loss": 0.5786329095494257,
435
+ "eval_mse_loss": 0.5786329095494257,
436
+ "eval_runtime": 163.4349,
437
+ "eval_samples_per_second": 171.279,
438
+ "eval_steps_per_second": 2.68,
439
+ "step": 6656
440
+ },
441
+ {
442
+ "epoch": 0.3192462241928779,
443
+ "grad_norm": 0.49864041805267334,
444
+ "learning_rate": 0.0007904373410796086,
445
+ "loss": 0.5757267475128174,
446
+ "step": 6912
447
+ },
448
+ {
449
+ "epoch": 0.3310701584222438,
450
+ "grad_norm": 0.5295012593269348,
451
+ "learning_rate": 0.0007747464411350876,
452
+ "loss": 0.567646324634552,
453
+ "step": 7168
454
+ },
455
+ {
456
+ "epoch": 0.3310701584222438,
457
+ "eval_bleu": 0.1685069007169743,
458
+ "eval_cos_loss": 0.39840105094321787,
459
+ "eval_loss": 0.5660831006966769,
460
+ "eval_mse_loss": 0.5660831006966769,
461
+ "step": 7168
462
+ },
463
+ {
464
+ "epoch": 0.3310701584222438,
465
+ "eval_bleu": 0.1685069007169743,
466
+ "eval_cos_loss": 0.39840105094321787,
467
+ "eval_loss": 0.5660831006966769,
468
+ "eval_mse_loss": 0.5660831006966769,
469
+ "eval_runtime": 162.053,
470
+ "eval_samples_per_second": 172.74,
471
+ "eval_steps_per_second": 2.703,
472
+ "step": 7168
473
+ },
474
+ {
475
+ "epoch": 0.34289409265160964,
476
+ "grad_norm": 0.48798659443855286,
477
+ "learning_rate": 0.000758657900803716,
478
+ "loss": 0.5626987814903259,
479
+ "step": 7424
480
+ },
481
+ {
482
+ "epoch": 0.3547180268809755,
483
+ "grad_norm": 0.4305446445941925,
484
+ "learning_rate": 0.000742195005021869,
485
+ "loss": 0.557548463344574,
486
+ "step": 7680
487
+ },
488
+ {
489
+ "epoch": 0.3547180268809755,
490
+ "eval_bleu": 0.17911785989508686,
491
+ "eval_cos_loss": 0.3920303521907493,
492
+ "eval_loss": 0.553923270269616,
493
+ "eval_mse_loss": 0.553923270269616,
494
+ "step": 7680
495
+ },
496
+ {
497
+ "epoch": 0.3547180268809755,
498
+ "eval_bleu": 0.17911785989508686,
499
+ "eval_cos_loss": 0.3920303521907493,
500
+ "eval_loss": 0.553923270269616,
501
+ "eval_mse_loss": 0.553923270269616,
502
+ "eval_runtime": 163.5661,
503
+ "eval_samples_per_second": 171.142,
504
+ "eval_steps_per_second": 2.678,
505
+ "step": 7680
506
+ },
507
+ {
508
+ "epoch": 0.3665419611103413,
509
+ "grad_norm": 0.4493429958820343,
510
+ "learning_rate": 0.0007253815805303786,
511
+ "loss": 0.552599310874939,
512
+ "step": 7936
513
+ },
514
+ {
515
+ "epoch": 0.37836589533970716,
516
+ "grad_norm": 0.42025429010391235,
517
+ "learning_rate": 0.0007082419613901028,
518
+ "loss": 0.5472441911697388,
519
+ "step": 8192
520
+ },
521
+ {
522
+ "epoch": 0.37836589533970716,
523
+ "eval_bleu": 0.18641399326852548,
524
+ "eval_cos_loss": 0.3872319327233589,
525
+ "eval_loss": 0.54537038974566,
526
+ "eval_mse_loss": 0.54537038974566,
527
+ "step": 8192
528
+ },
529
+ {
530
+ "epoch": 0.37836589533970716,
531
+ "eval_bleu": 0.18641399326852548,
532
+ "eval_cos_loss": 0.3872319327233589,
533
+ "eval_loss": 0.54537038974566,
534
+ "eval_mse_loss": 0.54537038974566,
535
+ "eval_runtime": 161.9209,
536
+ "eval_samples_per_second": 172.881,
537
+ "eval_steps_per_second": 2.705,
538
+ "step": 8192
539
+ },
540
+ {
541
+ "epoch": 0.390189829569073,
542
+ "grad_norm": 0.5434500575065613,
543
+ "learning_rate": 0.0006908009537632514,
544
+ "loss": 0.545592725276947,
545
+ "step": 8448
546
+ },
547
+ {
548
+ "epoch": 0.4020137637984389,
549
+ "grad_norm": 0.4888971447944641,
550
+ "learning_rate": 0.0006730838000114403,
551
+ "loss": 0.54087895154953,
552
+ "step": 8704
553
+ },
554
+ {
555
+ "epoch": 0.4020137637984389,
556
+ "eval_bleu": 0.196455213608019,
557
+ "eval_cos_loss": 0.3822596245976888,
558
+ "eval_loss": 0.5381640580963326,
559
+ "eval_mse_loss": 0.5381640580963326,
560
+ "step": 8704
561
+ },
562
+ {
563
+ "epoch": 0.4020137637984389,
564
+ "eval_bleu": 0.196455213608019,
565
+ "eval_cos_loss": 0.3822596245976888,
566
+ "eval_loss": 0.5381640580963326,
567
+ "eval_mse_loss": 0.5381640580963326,
568
+ "eval_runtime": 161.8948,
569
+ "eval_samples_per_second": 172.909,
570
+ "eval_steps_per_second": 2.705,
571
+ "step": 8704
572
+ },
573
+ {
574
+ "epoch": 0.41383769802780473,
575
+ "grad_norm": 0.47220879793167114,
576
+ "learning_rate": 0.0006551161421624341,
577
+ "loss": 0.5345809459686279,
578
+ "step": 8960
579
+ },
580
+ {
581
+ "epoch": 0.4256616322571706,
582
+ "grad_norm": 0.33014801144599915,
583
+ "learning_rate": 0.0006369239847984517,
584
+ "loss": 0.5279064774513245,
585
+ "step": 9216
586
+ },
587
+ {
588
+ "epoch": 0.4256616322571706,
589
+ "eval_bleu": 0.20667946656569708,
590
+ "eval_cos_loss": 0.3749828126332531,
591
+ "eval_loss": 0.5253440598238549,
592
+ "eval_mse_loss": 0.5253440598238549,
593
+ "step": 9216
594
+ },
595
+ {
596
+ "epoch": 0.4256616322571706,
597
+ "eval_bleu": 0.20667946656569708,
598
+ "eval_cos_loss": 0.3749828126332531,
599
+ "eval_loss": 0.5253440598238549,
600
+ "eval_mse_loss": 0.5253440598238549,
601
+ "eval_runtime": 160.6156,
602
+ "eval_samples_per_second": 174.286,
603
+ "eval_steps_per_second": 2.727,
604
+ "step": 9216
605
+ },
606
+ {
607
+ "epoch": 0.4374855664865364,
608
+ "grad_norm": 0.39421921968460083,
609
+ "learning_rate": 0.0006185336574197479,
610
+ "loss": 0.523585319519043,
611
+ "step": 9472
612
+ },
613
+ {
614
+ "epoch": 0.44930950071590225,
615
+ "grad_norm": 0.39712467789649963,
616
+ "learning_rate": 0.0005999717763379407,
617
+ "loss": 0.5216853618621826,
618
+ "step": 9728
619
+ },
620
+ {
621
+ "epoch": 0.44930950071590225,
622
+ "eval_bleu": 0.21239179754170903,
623
+ "eval_cos_loss": 0.37135064908086435,
624
+ "eval_loss": 0.5193090603504007,
625
+ "eval_mse_loss": 0.5193090603504007,
626
+ "step": 9728
627
+ },
628
+ {
629
+ "epoch": 0.44930950071590225,
630
+ "eval_bleu": 0.21239179754170903,
631
+ "eval_cos_loss": 0.37135064908086435,
632
+ "eval_loss": 0.5193090603504007,
633
+ "eval_mse_loss": 0.5193090603504007,
634
+ "eval_runtime": 162.2466,
635
+ "eval_samples_per_second": 172.534,
636
+ "eval_steps_per_second": 2.7,
637
+ "step": 9728
638
+ },
639
+ {
640
+ "epoch": 0.4611334349452681,
641
+ "grad_norm": 0.4306870102882385,
642
+ "learning_rate": 0.0005812652061542363,
643
+ "loss": 0.5166722536087036,
644
+ "step": 9984
645
+ },
646
+ {
647
+ "epoch": 0.472957369174634,
648
+ "grad_norm": 0.33111369609832764,
649
+ "learning_rate": 0.0005624410208783071,
650
+ "loss": 0.5125476121902466,
651
+ "step": 10240
652
+ },
653
+ {
654
+ "epoch": 0.472957369174634,
655
+ "eval_bleu": 0.22053615881947866,
656
+ "eval_cos_loss": 0.3653238587183495,
657
+ "eval_loss": 0.5105652859494022,
658
+ "eval_mse_loss": 0.5105652859494022,
659
+ "step": 10240
660
+ },
661
+ {
662
+ "epoch": 0.472957369174634,
663
+ "eval_bleu": 0.22053615881947866,
664
+ "eval_cos_loss": 0.3653238587183495,
665
+ "eval_loss": 0.5105652859494022,
666
+ "eval_mse_loss": 0.5105652859494022,
667
+ "eval_runtime": 161.4968,
668
+ "eval_samples_per_second": 173.335,
669
+ "eval_steps_per_second": 2.712,
670
+ "step": 10240
671
+ },
672
+ {
673
+ "epoch": 0.48478130340399983,
674
+ "grad_norm": 0.4274887442588806,
675
+ "learning_rate": 0.0005435264647440881,
676
+ "loss": 0.5081963539123535,
677
+ "step": 10496
678
+ },
679
+ {
680
+ "epoch": 0.49660523763336567,
681
+ "grad_norm": 0.39072319865226746,
682
+ "learning_rate": 0.000524548912779213,
683
+ "loss": 0.503269374370575,
684
+ "step": 10752
685
+ },
686
+ {
687
+ "epoch": 0.49660523763336567,
688
+ "eval_bleu": 0.22996295812492562,
689
+ "eval_cos_loss": 0.3602397588153952,
690
+ "eval_loss": 0.5025479411153488,
691
+ "eval_mse_loss": 0.5025479411153488,
692
+ "step": 10752
693
+ },
694
+ {
695
+ "epoch": 0.49660523763336567,
696
+ "eval_bleu": 0.22996295812492562,
697
+ "eval_cos_loss": 0.3602397588153952,
698
+ "eval_loss": 0.5025479411153488,
699
+ "eval_mse_loss": 0.5025479411153488,
700
+ "eval_runtime": 161.7807,
701
+ "eval_samples_per_second": 173.031,
702
+ "eval_steps_per_second": 2.707,
703
+ "step": 10752
704
+ },
705
+ {
706
+ "epoch": 0.5084291718627315,
707
+ "grad_norm": 0.4057266414165497,
708
+ "learning_rate": 0.0005055358311851499,
709
+ "loss": 0.5023725032806396,
710
+ "step": 11008
711
+ },
712
+ {
713
+ "epoch": 0.5202531060920974,
714
+ "grad_norm": 0.4108782708644867,
715
+ "learning_rate": 0.0004865147375853812,
716
+ "loss": 0.49648576974868774,
717
+ "step": 11264
718
+ },
719
+ {
720
+ "epoch": 0.5202531060920974,
721
+ "eval_bleu": 0.2398296736572509,
722
+ "eval_cos_loss": 0.3552770841883742,
723
+ "eval_loss": 0.49366489923707974,
724
+ "eval_mse_loss": 0.49366489923707974,
725
+ "step": 11264
726
+ },
727
+ {
728
+ "epoch": 0.5202531060920974,
729
+ "eval_bleu": 0.2398296736572509,
730
+ "eval_cos_loss": 0.3552770841883742,
731
+ "eval_loss": 0.49366489923707974,
732
+ "eval_mse_loss": 0.49366489923707974,
733
+ "eval_runtime": 161.5263,
734
+ "eval_samples_per_second": 173.303,
735
+ "eval_steps_per_second": 2.712,
736
+ "step": 11264
737
+ },
738
+ {
739
+ "epoch": 0.5320770403214632,
740
+ "grad_norm": 0.29895663261413574,
741
+ "learning_rate": 0.0004675131611991607,
742
+ "loss": 0.4914674460887909,
743
+ "step": 11520
744
+ },
745
+ {
746
+ "epoch": 0.5439009745508291,
747
+ "grad_norm": 0.3542506694793701,
748
+ "learning_rate": 0.0004485586029984899,
749
+ "loss": 0.4889347553253174,
750
+ "step": 11776
751
+ },
752
+ {
753
+ "epoch": 0.5439009745508291,
754
+ "eval_bleu": 0.24500752487918645,
755
+ "eval_cos_loss": 0.3514751479642032,
756
+ "eval_loss": 0.4874896002958899,
757
+ "eval_mse_loss": 0.4874896002958899,
758
+ "step": 11776
759
+ },
760
+ {
761
+ "epoch": 0.5439009745508291,
762
+ "eval_bleu": 0.24500752487918645,
763
+ "eval_cos_loss": 0.3514751479642032,
764
+ "eval_loss": 0.4874896002958899,
765
+ "eval_mse_loss": 0.4874896002958899,
766
+ "eval_runtime": 168.0651,
767
+ "eval_samples_per_second": 166.56,
768
+ "eval_steps_per_second": 2.606,
769
+ "step": 11776
770
+ },
771
+ {
772
+ "epoch": 0.5557249087801949,
773
+ "grad_norm": 0.43245935440063477,
774
+ "learning_rate": 0.00042967849590597266,
775
+ "loss": 0.4870545566082001,
776
+ "step": 12032
777
+ },
778
+ {
779
+ "epoch": 0.5675488430095608,
780
+ "grad_norm": 0.3832883834838867,
781
+ "learning_rate": 0.0004109001650911621,
782
+ "loss": 0.48517102003097534,
783
+ "step": 12288
784
+ },
785
+ {
786
+ "epoch": 0.5675488430095608,
787
+ "eval_bleu": 0.24820492883366965,
788
+ "eval_cos_loss": 0.34908691844711565,
789
+ "eval_loss": 0.48387067326127664,
790
+ "eval_mse_loss": 0.48387067326127664,
791
+ "step": 12288
792
+ },
793
+ {
794
+ "epoch": 0.5675488430095608,
795
+ "eval_bleu": 0.24820492883366965,
796
+ "eval_cos_loss": 0.34908691844711565,
797
+ "eval_loss": 0.48387067326127664,
798
+ "eval_mse_loss": 0.48387067326127664,
799
+ "eval_runtime": 160.8914,
800
+ "eval_samples_per_second": 173.987,
801
+ "eval_steps_per_second": 2.722,
802
+ "step": 12288
803
+ },
804
+ {
805
+ "epoch": 0.5793727772389267,
806
+ "grad_norm": 0.4227828085422516,
807
+ "learning_rate": 0.0003922507884228551,
808
+ "loss": 0.48317641019821167,
809
+ "step": 12544
810
+ },
811
+ {
812
+ "epoch": 0.5911967114682924,
813
+ "grad_norm": 0.3448359966278076,
814
+ "learning_rate": 0.00037375735713457723,
815
+ "loss": 0.47837942838668823,
816
+ "step": 12800
817
+ },
818
+ {
819
+ "epoch": 0.5911967114682924,
820
+ "eval_bleu": 0.2531402036971423,
821
+ "eval_cos_loss": 0.34504796700662677,
822
+ "eval_loss": 0.47720546197129166,
823
+ "eval_mse_loss": 0.47720546197129166,
824
+ "step": 12800
825
+ },
826
+ {
827
+ "epoch": 0.5911967114682924,
828
+ "eval_bleu": 0.2531402036971423,
829
+ "eval_cos_loss": 0.34504796700662677,
830
+ "eval_loss": 0.47720546197129166,
831
+ "eval_mse_loss": 0.47720546197129166,
832
+ "eval_runtime": 163.6877,
833
+ "eval_samples_per_second": 171.015,
834
+ "eval_steps_per_second": 2.676,
835
+ "step": 12800
836
+ },
837
+ {
838
+ "epoch": 0.6030206456976583,
839
+ "grad_norm": 0.36360684037208557,
840
+ "learning_rate": 0.00035544663676018276,
841
+ "loss": 0.4771166443824768,
842
+ "step": 13056
843
+ },
844
+ {
845
+ "epoch": 0.6148445799270241,
846
+ "grad_norm": 0.37906548380851746,
847
+ "learning_rate": 0.00033734512839611255,
848
+ "loss": 0.4736967086791992,
849
+ "step": 13312
850
+ },
851
+ {
852
+ "epoch": 0.6148445799270241,
853
+ "eval_bleu": 0.2565688470715538,
854
+ "eval_cos_loss": 0.3420428394182632,
855
+ "eval_loss": 0.47236150795738446,
856
+ "eval_mse_loss": 0.47236150795738446,
857
+ "step": 13312
858
+ },
859
+ {
860
+ "epoch": 0.6148445799270241,
861
+ "eval_bleu": 0.2565688470715538,
862
+ "eval_cos_loss": 0.3420428394182632,
863
+ "eval_loss": 0.47236150795738446,
864
+ "eval_mse_loss": 0.47236150795738446,
865
+ "eval_runtime": 163.0506,
866
+ "eval_samples_per_second": 171.683,
867
+ "eval_steps_per_second": 2.686,
868
+ "step": 13312
869
+ },
870
+ {
871
+ "epoch": 0.62666851415639,
872
+ "grad_norm": 0.40776699781417847,
873
+ "learning_rate": 0.0003194790303463687,
874
+ "loss": 0.4717385768890381,
875
+ "step": 13568
876
+ },
877
+ {
878
+ "epoch": 0.6384924483857558,
879
+ "grad_norm": 0.31089887022972107,
880
+ "learning_rate": 0.00030187420020572406,
881
+ "loss": 0.47123584151268005,
882
+ "step": 13824
883
+ },
884
+ {
885
+ "epoch": 0.6384924483857558,
886
+ "eval_bleu": 0.2603377447999264,
887
+ "eval_cos_loss": 0.34040493317390685,
888
+ "eval_loss": 0.4702722191402357,
889
+ "eval_mse_loss": 0.4702722191402357,
890
+ "step": 13824
891
+ },
892
+ {
893
+ "epoch": 0.6384924483857558,
894
+ "eval_bleu": 0.2603377447999264,
895
+ "eval_cos_loss": 0.34040493317390685,
896
+ "eval_loss": 0.4702722191402357,
897
+ "eval_mse_loss": 0.4702722191402357,
898
+ "eval_runtime": 164.2283,
899
+ "eval_samples_per_second": 170.452,
900
+ "eval_steps_per_second": 2.667,
901
+ "step": 13824
902
+ },
903
+ {
904
+ "epoch": 0.6503163826151217,
905
+ "grad_norm": 0.3649425506591797,
906
+ "learning_rate": 0.00028455611743603626,
907
+ "loss": 0.46850907802581787,
908
+ "step": 14080
909
+ },
910
+ {
911
+ "epoch": 0.6621403168444876,
912
+ "grad_norm": 0.3557349145412445,
913
+ "learning_rate": 0.0002675498464898373,
914
+ "loss": 0.46789348125457764,
915
+ "step": 14336
916
+ },
917
+ {
918
+ "epoch": 0.6621403168444876,
919
+ "eval_bleu": 0.2634448252307496,
920
+ "eval_cos_loss": 0.33840972035442857,
921
+ "eval_loss": 0.46750445663928986,
922
+ "eval_mse_loss": 0.46750445663928986,
923
+ "step": 14336
924
+ },
925
+ {
926
+ "epoch": 0.6621403168444876,
927
+ "eval_bleu": 0.2634448252307496,
928
+ "eval_cos_loss": 0.33840972035442857,
929
+ "eval_loss": 0.46750445663928986,
930
+ "eval_mse_loss": 0.46750445663928986,
931
+ "eval_runtime": 165.7714,
932
+ "eval_samples_per_second": 168.865,
933
+ "eval_steps_per_second": 2.642,
934
+ "step": 14336
935
+ },
936
+ {
937
+ "epoch": 0.6739642510738534,
938
+ "grad_norm": 0.3284558951854706,
939
+ "learning_rate": 0.0002508800005345623,
940
+ "loss": 0.4687961935997009,
941
+ "step": 14592
942
+ },
943
+ {
944
+ "epoch": 0.6857881853032193,
945
+ "grad_norm": 0.3627532422542572,
946
+ "learning_rate": 0.00023457070582992562,
947
+ "loss": 0.4676506817340851,
948
+ "step": 14848
949
+ },
950
+ {
951
+ "epoch": 0.6857881853032193,
952
+ "eval_bleu": 0.2635687309539156,
953
+ "eval_cos_loss": 0.3364402578982044,
954
+ "eval_loss": 0.46515356466922586,
955
+ "eval_mse_loss": 0.46515356466922586,
956
+ "step": 14848
957
+ },
958
+ {
959
+ "epoch": 0.6857881853032193,
960
+ "eval_bleu": 0.2635687309539156,
961
+ "eval_cos_loss": 0.3364402578982044,
962
+ "eval_loss": 0.46515356466922586,
963
+ "eval_mse_loss": 0.46515356466922586,
964
+ "eval_runtime": 165.4827,
965
+ "eval_samples_per_second": 169.16,
966
+ "eval_steps_per_second": 2.647,
967
+ "step": 14848
968
+ },
969
+ {
970
+ "epoch": 0.6976121195325851,
971
+ "grad_norm": 0.4217149019241333,
972
+ "learning_rate": 0.00021864556680999692,
973
+ "loss": 0.4648419916629791,
974
+ "step": 15104
975
+ },
976
+ {
977
+ "epoch": 0.709436053761951,
978
+ "grad_norm": 0.2952300012111664,
979
+ "learning_rate": 0.0002031276319205152,
980
+ "loss": 0.46303296089172363,
981
+ "step": 15360
982
+ },
983
+ {
984
+ "epoch": 0.709436053761951,
985
+ "eval_bleu": 0.26912024318334854,
986
+ "eval_cos_loss": 0.3343951459888998,
987
+ "eval_loss": 0.46137175508285766,
988
+ "eval_mse_loss": 0.46137175508285766,
989
+ "step": 15360
990
+ },
991
+ {
992
+ "epoch": 0.709436053761951,
993
+ "eval_bleu": 0.26912024318334854,
994
+ "eval_cos_loss": 0.3343951459888998,
995
+ "eval_loss": 0.46137175508285766,
996
+ "eval_mse_loss": 0.46137175508285766,
997
+ "eval_runtime": 165.341,
998
+ "eval_samples_per_second": 169.305,
999
+ "eval_steps_per_second": 2.649,
1000
+ "step": 15360
1001
+ },
1002
+ {
1003
+ "epoch": 0.7212599879913169,
1004
+ "grad_norm": 0.3024074137210846,
1005
+ "learning_rate": 0.00018803936026088542,
1006
+ "loss": 0.46073269844055176,
1007
+ "step": 15616
1008
+ },
1009
+ {
1010
+ "epoch": 0.7330839222206826,
1011
+ "grad_norm": 0.3609679341316223,
1012
+ "learning_rate": 0.00017340258907913464,
1013
+ "loss": 0.45995378494262695,
1014
+ "step": 15872
1015
+ },
1016
+ {
1017
+ "epoch": 0.7330839222206826,
1018
+ "eval_bleu": 0.27136888598501546,
1019
+ "eval_cos_loss": 0.3321892925321239,
1020
+ "eval_loss": 0.4582272280841113,
1021
+ "eval_mse_loss": 0.4582272280841113,
1022
+ "step": 15872
1023
+ },
1024
+ {
1025
+ "epoch": 0.7330839222206826,
1026
+ "eval_bleu": 0.27136888598501546,
1027
+ "eval_cos_loss": 0.3321892925321239,
1028
+ "eval_loss": 0.4582272280841113,
1029
+ "eval_mse_loss": 0.4582272280841113,
1030
+ "eval_runtime": 166.7621,
1031
+ "eval_samples_per_second": 167.862,
1032
+ "eval_steps_per_second": 2.626,
1033
+ "step": 15872
1034
+ },
1035
+ {
1036
+ "epoch": 0.7449078564500485,
1037
+ "grad_norm": 0.38130033016204834,
1038
+ "learning_rate": 0.0001592385021668743,
1039
+ "loss": 0.45690375566482544,
1040
+ "step": 16128
1041
+ },
1042
+ {
1043
+ "epoch": 0.7567317906794143,
1044
+ "grad_norm": 0.2479448765516281,
1045
+ "learning_rate": 0.0001455675992000087,
1046
+ "loss": 0.45666202902793884,
1047
+ "step": 16384
1048
+ },
1049
+ {
1050
+ "epoch": 0.7567317906794143,
1051
+ "eval_bleu": 0.27307857949279574,
1052
+ "eval_cos_loss": 0.33009844324360155,
1053
+ "eval_loss": 0.4545080685588323,
1054
+ "eval_mse_loss": 0.4545080685588323,
1055
+ "step": 16384
1056
+ },
1057
+ {
1058
+ "epoch": 0.7567317906794143,
1059
+ "eval_bleu": 0.27307857949279574,
1060
+ "eval_cos_loss": 0.33009844324360155,
1061
+ "eval_loss": 0.4545080685588323,
1062
+ "eval_mse_loss": 0.4545080685588323,
1063
+ "eval_runtime": 166.022,
1064
+ "eval_samples_per_second": 168.61,
1065
+ "eval_steps_per_second": 2.638,
1066
+ "step": 16384
1067
+ },
1068
+ {
1069
+ "epoch": 0.7685557249087802,
1070
+ "grad_norm": 0.40172311663627625,
1071
+ "learning_rate": 0.000132409666069565,
1072
+ "loss": 0.4527525007724762,
1073
+ "step": 16640
1074
+ },
1075
+ {
1076
+ "epoch": 0.780379659138146,
1077
+ "grad_norm": 0.35426196455955505,
1078
+ "learning_rate": 0.0001197837462455823,
1079
+ "loss": 0.451884925365448,
1080
+ "step": 16896
1081
+ },
1082
+ {
1083
+ "epoch": 0.780379659138146,
1084
+ "eval_bleu": 0.2760643752747577,
1085
+ "eval_cos_loss": 0.32866281366239397,
1086
+ "eval_loss": 0.4518035816275366,
1087
+ "eval_mse_loss": 0.4518035816275366,
1088
+ "step": 16896
1089
+ },
1090
+ {
1091
+ "epoch": 0.780379659138146,
1092
+ "eval_bleu": 0.2760643752747577,
1093
+ "eval_cos_loss": 0.32866281366239397,
1094
+ "eval_loss": 0.4518035816275366,
1095
+ "eval_mse_loss": 0.4518035816275366,
1096
+ "eval_runtime": 164.3824,
1097
+ "eval_samples_per_second": 170.292,
1098
+ "eval_steps_per_second": 2.665,
1099
+ "step": 16896
1100
+ },
1101
+ {
1102
+ "epoch": 0.7922035933675119,
1103
+ "grad_norm": 0.2980884611606598,
1104
+ "learning_rate": 0.00010770811321550749,
1105
+ "loss": 0.45119592547416687,
1106
+ "step": 17152
1107
+ },
1108
+ {
1109
+ "epoch": 0.8040275275968778,
1110
+ "grad_norm": 0.274273157119751,
1111
+ "learning_rate": 9.620024403698591e-05,
1112
+ "loss": 0.45083144307136536,
1113
+ "step": 17408
1114
+ },
1115
+ {
1116
+ "epoch": 0.8040275275968778,
1117
+ "eval_bleu": 0.2779774912080251,
1118
+ "eval_cos_loss": 0.32748106734393395,
1119
+ "eval_loss": 0.44997385865477124,
1120
+ "eval_mse_loss": 0.44997385865477124,
1121
+ "step": 17408
1122
+ },
1123
+ {
1124
+ "epoch": 0.8040275275968778,
1125
+ "eval_bleu": 0.2779774912080251,
1126
+ "eval_cos_loss": 0.32748106734393395,
1127
+ "eval_loss": 0.44997385865477124,
1128
+ "eval_mse_loss": 0.44997385865477124,
1129
+ "eval_runtime": 164.7092,
1130
+ "eval_samples_per_second": 169.954,
1131
+ "eval_steps_per_second": 2.659,
1132
+ "step": 17408
1133
+ },
1134
+ {
1135
+ "epoch": 0.8158514618262436,
1136
+ "grad_norm": 0.28362342715263367,
1137
+ "learning_rate": 8.527679404332429e-05,
1138
+ "loss": 0.4493226408958435,
1139
+ "step": 17664
1140
+ },
1141
+ {
1142
+ "epoch": 0.8276753960556095,
1143
+ "grad_norm": 0.37154051661491394,
1144
+ "learning_rate": 7.495357273823544e-05,
1145
+ "loss": 0.45012757182121277,
1146
+ "step": 17920
1147
+ },
1148
+ {
1149
+ "epoch": 0.8276753960556095,
1150
+ "eval_bleu": 0.2778228467381876,
1151
+ "eval_cos_loss": 0.32662650337230126,
1152
+ "eval_loss": 0.4487285473847498,
1153
+ "eval_mse_loss": 0.4487285473847498,
1154
+ "step": 17920
1155
+ },
1156
+ {
1157
+ "epoch": 0.8276753960556095,
1158
+ "eval_bleu": 0.2778228467381876,
1159
+ "eval_cos_loss": 0.32662650337230126,
1160
+ "eval_loss": 0.4487285473847498,
1161
+ "eval_mse_loss": 0.4487285473847498,
1162
+ "eval_runtime": 163.7722,
1163
+ "eval_samples_per_second": 170.926,
1164
+ "eval_steps_per_second": 2.674,
1165
+ "step": 17920
1166
+ },
1167
+ {
1168
+ "epoch": 0.8394993302849753,
1169
+ "grad_norm": 0.4016433656215668,
1170
+ "learning_rate": 6.524552091475183e-05,
1171
+ "loss": 0.4488871991634369,
1172
+ "step": 18176
1173
+ },
1174
+ {
1175
+ "epoch": 0.8513232645143411,
1176
+ "grad_norm": 0.37932220101356506,
1177
+ "learning_rate": 5.6166689031422024e-05,
1178
+ "loss": 0.44720983505249023,
1179
+ "step": 18432
1180
+ },
1181
+ {
1182
+ "epoch": 0.8513232645143411,
1183
+ "eval_bleu": 0.27914852361065007,
1184
+ "eval_cos_loss": 0.3257547163119599,
1185
+ "eval_loss": 0.447477480047914,
1186
+ "eval_mse_loss": 0.447477480047914,
1187
+ "step": 18432
1188
+ },
1189
+ {
1190
+ "epoch": 0.8513232645143411,
1191
+ "eval_bleu": 0.27914852361065007,
1192
+ "eval_cos_loss": 0.3257547163119599,
1193
+ "eval_loss": 0.447477480047914,
1194
+ "eval_mse_loss": 0.447477480047914,
1195
+ "eval_runtime": 165.4102,
1196
+ "eval_samples_per_second": 169.234,
1197
+ "eval_steps_per_second": 2.648,
1198
+ "step": 18432
1199
+ },
1200
+ {
1201
+ "epoch": 0.8631471987437069,
1202
+ "grad_norm": 0.2514086365699768,
1203
+ "learning_rate": 4.773021687709067e-05,
1204
+ "loss": 0.4477936327457428,
1205
+ "step": 18688
1206
+ },
1207
+ {
1208
+ "epoch": 0.8749711329730728,
1209
+ "grad_norm": 0.2987958490848541,
1210
+ "learning_rate": 3.994831455368719e-05,
1211
+ "loss": 0.4460706114768982,
1212
+ "step": 18944
1213
+ },
1214
+ {
1215
+ "epoch": 0.8749711329730728,
1216
+ "eval_bleu": 0.2805341496199294,
1217
+ "eval_cos_loss": 0.3250818059324674,
1218
+ "eval_loss": 0.44645912264852217,
1219
+ "eval_mse_loss": 0.44645912264852217,
1220
+ "step": 18944
1221
+ },
1222
+ {
1223
+ "epoch": 0.8749711329730728,
1224
+ "eval_bleu": 0.2805341496199294,
1225
+ "eval_cos_loss": 0.3250818059324674,
1226
+ "eval_loss": 0.44645912264852217,
1227
+ "eval_mse_loss": 0.44645912264852217,
1228
+ "eval_runtime": 165.0754,
1229
+ "eval_samples_per_second": 169.577,
1230
+ "eval_steps_per_second": 2.653,
1231
+ "step": 18944
1232
+ },
1233
+ {
1234
+ "epoch": 0.8867950672024387,
1235
+ "grad_norm": 0.317932665348053,
1236
+ "learning_rate": 3.283224480455282e-05,
1237
+ "loss": 0.44728997349739075,
1238
+ "step": 19200
1239
+ },
1240
+ {
1241
+ "epoch": 0.8986190014318045,
1242
+ "grad_norm": 0.42776671051979065,
1243
+ "learning_rate": 2.639230671387627e-05,
1244
+ "loss": 0.44506722688674927,
1245
+ "step": 19456
1246
+ },
1247
+ {
1248
+ "epoch": 0.8986190014318045,
1249
+ "eval_bleu": 0.2804138384135317,
1250
+ "eval_cos_loss": 0.32465831663238404,
1251
+ "eval_loss": 0.44588472588693717,
1252
+ "eval_mse_loss": 0.44588472588693717,
1253
+ "step": 19456
1254
+ },
1255
+ {
1256
+ "epoch": 0.8986190014318045,
1257
+ "eval_bleu": 0.2804138384135317,
1258
+ "eval_cos_loss": 0.32465831663238404,
1259
+ "eval_loss": 0.44588472588693717,
1260
+ "eval_mse_loss": 0.44588472588693717,
1261
+ "eval_runtime": 165.0136,
1262
+ "eval_samples_per_second": 169.641,
1263
+ "eval_steps_per_second": 2.654,
1264
+ "step": 19456
1265
+ },
1266
+ {
1267
+ "epoch": 0.9104429356611704,
1268
+ "grad_norm": 0.31525906920433044,
1269
+ "learning_rate": 2.063782080083576e-05,
1270
+ "loss": 0.44544658064842224,
1271
+ "step": 19712
1272
+ },
1273
+ {
1274
+ "epoch": 0.9222668698905362,
1275
+ "grad_norm": 0.27362895011901855,
1276
+ "learning_rate": 1.557711553001523e-05,
1277
+ "loss": 0.4467789828777313,
1278
+ "step": 19968
1279
+ },
1280
+ {
1281
+ "epoch": 0.9222668698905362,
1282
+ "eval_bleu": 0.28121517515118005,
1283
+ "eval_cos_loss": 0.32446934398450805,
1284
+ "eval_loss": 0.44549841967891884,
1285
+ "eval_mse_loss": 0.44549841967891884,
1286
+ "step": 19968
1287
+ },
1288
+ {
1289
+ "epoch": 0.9222668698905362,
1290
+ "eval_bleu": 0.28121517515118005,
1291
+ "eval_cos_loss": 0.32446934398450805,
1292
+ "eval_loss": 0.44549841967891884,
1293
+ "eval_mse_loss": 0.44549841967891884,
1294
+ "eval_runtime": 164.9211,
1295
+ "eval_samples_per_second": 169.736,
1296
+ "eval_steps_per_second": 2.656,
1297
+ "step": 19968
1298
+ },
1299
+ {
1300
+ "epoch": 0.9340908041199021,
1301
+ "grad_norm": 0.2280040830373764,
1302
+ "learning_rate": 1.1217515257622269e-05,
1303
+ "loss": 0.44553816318511963,
1304
+ "step": 20224
1305
+ },
1306
+ {
1307
+ "epoch": 0.945914738349268,
1308
+ "grad_norm": 0.3960188925266266,
1309
+ "learning_rate": 7.565329630950746e-06,
1310
+ "loss": 0.4465377926826477,
1311
+ "step": 20480
1312
+ },
1313
+ {
1314
+ "epoch": 0.945914738349268,
1315
+ "eval_bleu": 0.28108385004819936,
1316
+ "eval_cos_loss": 0.32414347396049326,
1317
+ "eval_loss": 0.44519047085280833,
1318
+ "eval_mse_loss": 0.44519047085280833,
1319
+ "step": 20480
1320
+ },
1321
+ {
1322
+ "epoch": 0.945914738349268,
1323
+ "eval_bleu": 0.28108385004819936,
1324
+ "eval_cos_loss": 0.32414347396049326,
1325
+ "eval_loss": 0.44519047085280833,
1326
+ "eval_mse_loss": 0.44519047085280833,
1327
+ "eval_runtime": 169.9862,
1328
+ "eval_samples_per_second": 164.678,
1329
+ "eval_steps_per_second": 2.577,
1330
+ "step": 20480
1331
+ },
1332
+ {
1333
+ "epoch": 0.9577386725786338,
1334
+ "grad_norm": 0.26473671197891235,
1335
+ "learning_rate": 4.62584445643166e-06,
1336
+ "loss": 0.44400015473365784,
1337
+ "step": 20736
1338
+ },
1339
+ {
1340
+ "epoch": 0.9695626068079997,
1341
+ "grad_norm": 0.3295203745365143,
1342
+ "learning_rate": 2.40331404948807e-06,
1343
+ "loss": 0.4468174874782562,
1344
+ "step": 20992
1345
+ },
1346
+ {
1347
+ "epoch": 0.9695626068079997,
1348
+ "eval_bleu": 0.2813555243303065,
1349
+ "eval_cos_loss": 0.3240796375900643,
1350
+ "eval_loss": 0.44507349803023144,
1351
+ "eval_mse_loss": 0.44507349803023144,
1352
+ "step": 20992
1353
+ },
1354
+ {
1355
+ "epoch": 0.9695626068079997,
1356
+ "eval_bleu": 0.2813555243303065,
1357
+ "eval_cos_loss": 0.3240796375900643,
1358
+ "eval_loss": 0.44507349803023144,
1359
+ "eval_mse_loss": 0.44507349803023144,
1360
+ "eval_runtime": 164.5162,
1361
+ "eval_samples_per_second": 170.153,
1362
+ "eval_steps_per_second": 2.662,
1363
+ "step": 20992
1364
+ }
1365
+ ],
1366
+ "logging_steps": 256,
1367
+ "max_steps": 21651,
1368
+ "num_input_tokens_seen": 0,
1369
+ "num_train_epochs": 1,
1370
+ "save_steps": 512,
1371
+ "stateful_callbacks": {
1372
+ "TrainerControl": {
1373
+ "args": {
1374
+ "should_epoch_stop": false,
1375
+ "should_evaluate": false,
1376
+ "should_log": false,
1377
+ "should_save": true,
1378
+ "should_training_stop": false
1379
+ },
1380
+ "attributes": {}
1381
+ }
1382
+ },
1383
+ "total_flos": 0.0,
1384
+ "train_batch_size": 64,
1385
+ "trial_name": null,
1386
+ "trial_params": null
1387
+ }
checkpoints-v1.0b-discrete-condition/checkpoint-20992/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ecd56bbefa515c916b0791362892dd6ccc687a6e1607fb7282c4a8421aff5927
3
+ size 5201