ChiefTheLord commited on
Commit
77e4a8a
·
verified ·
1 Parent(s): 61dd8d1

Upload folder using huggingface_hub

Browse files
.gitattributes CHANGED
@@ -110,3 +110,4 @@ checkpoints-v2.0a-discrete-condition/checkpoint-4096/eval_state.json filter=lfs
110
  checkpoints-v2.0a-discrete-condition/checkpoint-17408/eval_state.json filter=lfs diff=lfs merge=lfs -text
111
  checkpoints-v2.0a-discrete-condition/checkpoint-20480/eval_state.json filter=lfs diff=lfs merge=lfs -text
112
  checkpoints-v2.0a-discrete-condition/checkpoint-21651/eval_state.json filter=lfs diff=lfs merge=lfs -text
 
 
110
  checkpoints-v2.0a-discrete-condition/checkpoint-17408/eval_state.json filter=lfs diff=lfs merge=lfs -text
111
  checkpoints-v2.0a-discrete-condition/checkpoint-20480/eval_state.json filter=lfs diff=lfs merge=lfs -text
112
  checkpoints-v2.0a-discrete-condition/checkpoint-21651/eval_state.json filter=lfs diff=lfs merge=lfs -text
113
+ checkpoints-v2.0b-discrete-condition/checkpoint-8192/eval_state.json filter=lfs diff=lfs merge=lfs -text
checkpoints-v2.0b-discrete-condition/checkpoint-8192/eval_state.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c3fe0ebff799b34d161f91fcdad62a4c6c061d6375a7709ed2754befc5276f60
3
+ size 45263755
checkpoints-v2.0b-discrete-condition/checkpoint-8192/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8b4da1a40e3bf65732668519aee73822401415e9c58345251235a45e4a24e6a3
3
+ size 15210032
checkpoints-v2.0b-discrete-condition/checkpoint-8192/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d2fc1f80587800c6a527344bb573a6f304c6f4e79e151b3245be7b25abeeb782
3
+ size 13675339
checkpoints-v2.0b-discrete-condition/checkpoint-8192/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2d1f613303653b1a3af677f2191d6c262b245483e2fba234275ce63e24e78868
3
+ size 14645
checkpoints-v2.0b-discrete-condition/checkpoint-8192/scaler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0a5130818e119176ef32dc108ab82899b61b3c00c1926a90de76a426df570084
3
+ size 1383
checkpoints-v2.0b-discrete-condition/checkpoint-8192/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:633f4a51e3130420dcf105f63b87d79cc31db8e4efd560f5f6c0e0209526c2e9
3
+ size 1465
checkpoints-v2.0b-discrete-condition/checkpoint-8192/trainer_state.json ADDED
@@ -0,0 +1,474 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.37836589533970716,
6
+ "eval_steps": 1024,
7
+ "global_step": 8192,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.011823934229365849,
14
+ "grad_norm": 0.2690356373786926,
15
+ "learning_rate": 0.000498046875,
16
+ "loss": 2.567225456237793,
17
+ "step": 256
18
+ },
19
+ {
20
+ "epoch": 0.023647868458731697,
21
+ "grad_norm": 0.7925965785980225,
22
+ "learning_rate": 0.000998046875,
23
+ "loss": 1.9134947061538696,
24
+ "step": 512
25
+ },
26
+ {
27
+ "epoch": 0.03547180268809755,
28
+ "grad_norm": 1.418247103691101,
29
+ "learning_rate": 0.000999640996023194,
30
+ "loss": 1.630811333656311,
31
+ "step": 768
32
+ },
33
+ {
34
+ "epoch": 0.047295736917463395,
35
+ "grad_norm": 0.8778807520866394,
36
+ "learning_rate": 0.0009985588674043958,
37
+ "loss": 1.502601146697998,
38
+ "step": 1024
39
+ },
40
+ {
41
+ "epoch": 0.047295736917463395,
42
+ "eval_bleu": 0.0009829440445654548,
43
+ "eval_cos0_loss": 0.3603647586689692,
44
+ "eval_cos_loss": 0.3824953237488934,
45
+ "eval_loss": 1.4436643986397137,
46
+ "eval_mse0_loss": 1.4848588544484143,
47
+ "eval_mse_loss": 1.4004915827485525,
48
+ "eval_op_cos_loss": 0.3837161726875392,
49
+ "eval_op_mse_loss": 1.4044482999196335,
50
+ "step": 1024
51
+ },
52
+ {
53
+ "epoch": 0.047295736917463395,
54
+ "eval_bleu": 0.0009829440445654548,
55
+ "eval_cos0_loss": 0.3603647586689692,
56
+ "eval_cos_loss": 0.3824953237488934,
57
+ "eval_loss": 1.4436643986397137,
58
+ "eval_mse0_loss": 1.4848588544484143,
59
+ "eval_mse_loss": 1.4004915827485525,
60
+ "eval_op_cos_loss": 0.3837161726875392,
61
+ "eval_op_mse_loss": 1.4044482999196335,
62
+ "eval_runtime": 624.5636,
63
+ "eval_samples_per_second": 44.82,
64
+ "eval_steps_per_second": 0.701,
65
+ "step": 1024
66
+ },
67
+ {
68
+ "epoch": 0.05911967114682925,
69
+ "grad_norm": 1.361502766609192,
70
+ "learning_rate": 0.0009967551747861387,
71
+ "loss": 1.3899359703063965,
72
+ "step": 1280
73
+ },
74
+ {
75
+ "epoch": 0.0709436053761951,
76
+ "grad_norm": 1.701208472251892,
77
+ "learning_rate": 0.000994232528651847,
78
+ "loss": 1.308840036392212,
79
+ "step": 1536
80
+ },
81
+ {
82
+ "epoch": 0.08276753960556095,
83
+ "grad_norm": 1.2284104824066162,
84
+ "learning_rate": 0.0009909945800260092,
85
+ "loss": 1.2330195903778076,
86
+ "step": 1792
87
+ },
88
+ {
89
+ "epoch": 0.09459147383492679,
90
+ "grad_norm": 2.280683755874634,
91
+ "learning_rate": 0.0009870460151900522,
92
+ "loss": 1.163641095161438,
93
+ "step": 2048
94
+ },
95
+ {
96
+ "epoch": 0.09459147383492679,
97
+ "eval_bleu": 0.008117690959454648,
98
+ "eval_cos0_loss": 0.27556806632645053,
99
+ "eval_cos_loss": 0.33376140804051263,
100
+ "eval_loss": 1.1314381491648007,
101
+ "eval_mse0_loss": 1.0731379844282316,
102
+ "eval_mse_loss": 1.1875404857065035,
103
+ "eval_op_cos_loss": 0.33499729789827515,
104
+ "eval_op_mse_loss": 1.1919361415519019,
105
+ "step": 2048
106
+ },
107
+ {
108
+ "epoch": 0.09459147383492679,
109
+ "eval_bleu": 0.008117690959454648,
110
+ "eval_cos0_loss": 0.27556806632645053,
111
+ "eval_cos_loss": 0.33376140804051263,
112
+ "eval_loss": 1.1314381491648007,
113
+ "eval_mse0_loss": 1.0731379844282316,
114
+ "eval_mse_loss": 1.1875404857065035,
115
+ "eval_op_cos_loss": 0.33499729789827515,
116
+ "eval_op_mse_loss": 1.1919361415519019,
117
+ "eval_runtime": 617.7053,
118
+ "eval_samples_per_second": 45.318,
119
+ "eval_steps_per_second": 0.709,
120
+ "step": 2048
121
+ },
122
+ {
123
+ "epoch": 0.10641540806429264,
124
+ "grad_norm": 1.2745862007141113,
125
+ "learning_rate": 0.0009823925488998885,
126
+ "loss": 1.109260082244873,
127
+ "step": 2304
128
+ },
129
+ {
130
+ "epoch": 0.1182393422936585,
131
+ "grad_norm": 1.4149446487426758,
132
+ "learning_rate": 0.0009770409161149525,
133
+ "loss": 1.0698601007461548,
134
+ "step": 2560
135
+ },
136
+ {
137
+ "epoch": 0.13006327652302435,
138
+ "grad_norm": 1.6209443807601929,
139
+ "learning_rate": 0.0009709988622506973,
140
+ "loss": 1.0396567583084106,
141
+ "step": 2816
142
+ },
143
+ {
144
+ "epoch": 0.1418872107523902,
145
+ "grad_norm": 1.2111774682998657,
146
+ "learning_rate": 0.000964275131968659,
147
+ "loss": 1.0121068954467773,
148
+ "step": 3072
149
+ },
150
+ {
151
+ "epoch": 0.1418872107523902,
152
+ "eval_bleu": 0.033563816480858176,
153
+ "eval_cos0_loss": 0.241996217672139,
154
+ "eval_cos_loss": 0.30742351520279226,
155
+ "eval_loss": 1.0054655975947098,
156
+ "eval_mse0_loss": 0.9265603099239471,
157
+ "eval_mse_loss": 1.0819748758453211,
158
+ "eval_op_cos_loss": 0.3086226877148293,
159
+ "eval_op_mse_loss": 1.0867668872010219,
160
+ "step": 3072
161
+ },
162
+ {
163
+ "epoch": 0.1418872107523902,
164
+ "eval_bleu": 0.033563816480858176,
165
+ "eval_cos0_loss": 0.241996217672139,
166
+ "eval_cos_loss": 0.30742351520279226,
167
+ "eval_loss": 1.0054655975947098,
168
+ "eval_mse0_loss": 0.9265603099239471,
169
+ "eval_mse_loss": 1.0819748758453211,
170
+ "eval_op_cos_loss": 0.3086226877148293,
171
+ "eval_op_mse_loss": 1.0867668872010219,
172
+ "eval_runtime": 620.9592,
173
+ "eval_samples_per_second": 45.08,
174
+ "eval_steps_per_second": 0.705,
175
+ "step": 3072
176
+ },
177
+ {
178
+ "epoch": 0.15371114498175603,
179
+ "grad_norm": 1.7128350734710693,
180
+ "learning_rate": 0.0009568794565203123,
181
+ "loss": 0.9933720827102661,
182
+ "step": 3328
183
+ },
184
+ {
185
+ "epoch": 0.1655350792111219,
186
+ "grad_norm": 2.8741519451141357,
187
+ "learning_rate": 0.0009488225396630347,
188
+ "loss": 0.967034101486206,
189
+ "step": 3584
190
+ },
191
+ {
192
+ "epoch": 0.17735901344048774,
193
+ "grad_norm": 2.0762879848480225,
194
+ "learning_rate": 0.0009401160421685646,
195
+ "loss": 0.9411672949790955,
196
+ "step": 3840
197
+ },
198
+ {
199
+ "epoch": 0.18918294766985358,
200
+ "grad_norm": 1.4471893310546875,
201
+ "learning_rate": 0.0009307725649463714,
202
+ "loss": 0.9228276014328003,
203
+ "step": 4096
204
+ },
205
+ {
206
+ "epoch": 0.18918294766985358,
207
+ "eval_bleu": 0.052020585783013364,
208
+ "eval_cos0_loss": 0.21095720705784618,
209
+ "eval_cos_loss": 0.28916995336203816,
210
+ "eval_loss": 0.908736090137534,
211
+ "eval_mse0_loss": 0.8035404923027509,
212
+ "eval_mse_loss": 1.011488009261214,
213
+ "eval_op_cos_loss": 0.29041639147283826,
214
+ "eval_op_mse_loss": 1.0163753615122408,
215
+ "step": 4096
216
+ },
217
+ {
218
+ "epoch": 0.18918294766985358,
219
+ "eval_bleu": 0.052020585783013364,
220
+ "eval_cos0_loss": 0.21095720705784618,
221
+ "eval_cos_loss": 0.28916995336203816,
222
+ "eval_loss": 0.908736090137534,
223
+ "eval_mse0_loss": 0.8035404923027509,
224
+ "eval_mse_loss": 1.011488009261214,
225
+ "eval_op_cos_loss": 0.29041639147283826,
226
+ "eval_op_mse_loss": 1.0163753615122408,
227
+ "eval_runtime": 621.6523,
228
+ "eval_samples_per_second": 45.03,
229
+ "eval_steps_per_second": 0.705,
230
+ "step": 4096
231
+ },
232
+ {
233
+ "epoch": 0.20100688189921945,
234
+ "grad_norm": 2.4271538257598877,
235
+ "learning_rate": 0.0009208056308063659,
236
+ "loss": 0.9052898287773132,
237
+ "step": 4352
238
+ },
239
+ {
240
+ "epoch": 0.2128308161285853,
241
+ "grad_norm": 3.4062352180480957,
242
+ "learning_rate": 0.0009102296648873445,
243
+ "loss": 0.886395275592804,
244
+ "step": 4608
245
+ },
246
+ {
247
+ "epoch": 0.22465475035795113,
248
+ "grad_norm": 3.1074397563934326,
249
+ "learning_rate": 0.0008990599737794927,
250
+ "loss": 0.8743802905082703,
251
+ "step": 4864
252
+ },
253
+ {
254
+ "epoch": 0.236478684587317,
255
+ "grad_norm": 3.4324328899383545,
256
+ "learning_rate": 0.0008873127233711644,
257
+ "loss": 0.8594736456871033,
258
+ "step": 5120
259
+ },
260
+ {
261
+ "epoch": 0.236478684587317,
262
+ "eval_bleu": 0.07926506450551825,
263
+ "eval_cos0_loss": 0.20024654759119634,
264
+ "eval_cos_loss": 0.2791197347926767,
265
+ "eval_loss": 0.8700207179267657,
266
+ "eval_mse0_loss": 0.7612610093262642,
267
+ "eval_mse_loss": 0.9762748075674658,
268
+ "eval_op_cos_loss": 0.28037585025508655,
269
+ "eval_op_mse_loss": 0.9812860469839889,
270
+ "step": 5120
271
+ },
272
+ {
273
+ "epoch": 0.236478684587317,
274
+ "eval_bleu": 0.07926506450551825,
275
+ "eval_cos0_loss": 0.20024654759119634,
276
+ "eval_cos_loss": 0.2791197347926767,
277
+ "eval_loss": 0.8700207179267657,
278
+ "eval_mse0_loss": 0.7612610093262642,
279
+ "eval_mse_loss": 0.9762748075674658,
280
+ "eval_op_cos_loss": 0.28037585025508655,
281
+ "eval_op_mse_loss": 0.9812860469839889,
282
+ "eval_runtime": 621.0342,
283
+ "eval_samples_per_second": 45.075,
284
+ "eval_steps_per_second": 0.705,
285
+ "step": 5120
286
+ },
287
+ {
288
+ "epoch": 0.24830261881668284,
289
+ "grad_norm": 2.9458811283111572,
290
+ "learning_rate": 0.0008750049154520011,
291
+ "loss": 0.8498503565788269,
292
+ "step": 5376
293
+ },
294
+ {
295
+ "epoch": 0.2601265530460487,
296
+ "grad_norm": 3.388106107711792,
297
+ "learning_rate": 0.0008621543631062487,
298
+ "loss": 0.84010249376297,
299
+ "step": 5632
300
+ },
301
+ {
302
+ "epoch": 0.27195048727541454,
303
+ "grad_norm": 1.273484468460083,
304
+ "learning_rate": 0.0008487796649318904,
305
+ "loss": 0.8293308019638062,
306
+ "step": 5888
307
+ },
308
+ {
309
+ "epoch": 0.2837744215047804,
310
+ "grad_norm": 2.749922037124634,
311
+ "learning_rate": 0.0008349001781229053,
312
+ "loss": 0.8250018954277039,
313
+ "step": 6144
314
+ },
315
+ {
316
+ "epoch": 0.2837744215047804,
317
+ "eval_bleu": 0.1064852589300246,
318
+ "eval_cos0_loss": 0.18931846756096846,
319
+ "eval_cos_loss": 0.26743964381413915,
320
+ "eval_loss": 0.8231828152861225,
321
+ "eval_mse0_loss": 0.7119000969139953,
322
+ "eval_mse_loss": 0.9318836630751554,
323
+ "eval_op_cos_loss": 0.26869444518464886,
324
+ "eval_op_mse_loss": 0.9370474062825991,
325
+ "step": 6144
326
+ },
327
+ {
328
+ "epoch": 0.2837744215047804,
329
+ "eval_bleu": 0.1064852589300246,
330
+ "eval_cos0_loss": 0.18931846756096846,
331
+ "eval_cos_loss": 0.26743964381413915,
332
+ "eval_loss": 0.8231828152861225,
333
+ "eval_mse0_loss": 0.7119000969139953,
334
+ "eval_mse_loss": 0.9318836630751554,
335
+ "eval_op_cos_loss": 0.26869444518464886,
336
+ "eval_op_mse_loss": 0.9370474062825991,
337
+ "eval_runtime": 623.4472,
338
+ "eval_samples_per_second": 44.9,
339
+ "eval_steps_per_second": 0.703,
340
+ "step": 6144
341
+ },
342
+ {
343
+ "epoch": 0.2955983557341462,
344
+ "grad_norm": 1.9564300775527954,
345
+ "learning_rate": 0.0008205359904536107,
346
+ "loss": 0.8172543048858643,
347
+ "step": 6400
348
+ },
349
+ {
350
+ "epoch": 0.30742228996351206,
351
+ "grad_norm": 2.69132661819458,
352
+ "learning_rate": 0.0008057078912056363,
353
+ "loss": 0.8127719163894653,
354
+ "step": 6656
355
+ },
356
+ {
357
+ "epoch": 0.3192462241928779,
358
+ "grad_norm": 1.2459280490875244,
359
+ "learning_rate": 0.0007904373410796086,
360
+ "loss": 0.8043445348739624,
361
+ "step": 6912
362
+ },
363
+ {
364
+ "epoch": 0.3310701584222438,
365
+ "grad_norm": 1.679030179977417,
366
+ "learning_rate": 0.0007747464411350876,
367
+ "loss": 0.7973858714103699,
368
+ "step": 7168
369
+ },
370
+ {
371
+ "epoch": 0.3310701584222438,
372
+ "eval_bleu": 0.11764582579657883,
373
+ "eval_cos0_loss": 0.18387672284694567,
374
+ "eval_cos_loss": 0.25816574287877236,
375
+ "eval_loss": 0.7918145169406177,
376
+ "eval_mse0_loss": 0.6911438315698545,
377
+ "eval_mse_loss": 0.8898210989557989,
378
+ "eval_op_cos_loss": 0.25947807440066445,
379
+ "eval_op_mse_loss": 0.8951493017205364,
380
+ "step": 7168
381
+ },
382
+ {
383
+ "epoch": 0.3310701584222438,
384
+ "eval_bleu": 0.11764582579657883,
385
+ "eval_cos0_loss": 0.18387672284694567,
386
+ "eval_cos_loss": 0.25816574287877236,
387
+ "eval_loss": 0.7918145169406177,
388
+ "eval_mse0_loss": 0.6911438315698545,
389
+ "eval_mse_loss": 0.8898210989557989,
390
+ "eval_op_cos_loss": 0.25947807440066445,
391
+ "eval_op_mse_loss": 0.8951493017205364,
392
+ "eval_runtime": 626.051,
393
+ "eval_samples_per_second": 44.714,
394
+ "eval_steps_per_second": 0.7,
395
+ "step": 7168
396
+ },
397
+ {
398
+ "epoch": 0.34289409265160964,
399
+ "grad_norm": 2.451791763305664,
400
+ "learning_rate": 0.000758657900803716,
401
+ "loss": 0.7910720109939575,
402
+ "step": 7424
403
+ },
404
+ {
405
+ "epoch": 0.3547180268809755,
406
+ "grad_norm": 2.0209128856658936,
407
+ "learning_rate": 0.000742195005021869,
408
+ "loss": 0.7846375703811646,
409
+ "step": 7680
410
+ },
411
+ {
412
+ "epoch": 0.3665419611103413,
413
+ "grad_norm": 2.341242551803589,
414
+ "learning_rate": 0.0007253815805303786,
415
+ "loss": 0.7798209190368652,
416
+ "step": 7936
417
+ },
418
+ {
419
+ "epoch": 0.37836589533970716,
420
+ "grad_norm": 4.772252082824707,
421
+ "learning_rate": 0.0007082419613901028,
422
+ "loss": 0.7740265130996704,
423
+ "step": 8192
424
+ },
425
+ {
426
+ "epoch": 0.37836589533970716,
427
+ "eval_bleu": 0.11939785091250239,
428
+ "eval_cos0_loss": 0.18091393731636543,
429
+ "eval_cos_loss": 0.254198662732562,
430
+ "eval_loss": 0.7796027199046253,
431
+ "eval_mse0_loss": 0.680223688143029,
432
+ "eval_mse_loss": 0.8762989998135937,
433
+ "eval_op_cos_loss": 0.25553356053214094,
434
+ "eval_op_mse_loss": 0.881664497122917,
435
+ "step": 8192
436
+ },
437
+ {
438
+ "epoch": 0.37836589533970716,
439
+ "eval_bleu": 0.11939785091250239,
440
+ "eval_cos0_loss": 0.18091393731636543,
441
+ "eval_cos_loss": 0.254198662732562,
442
+ "eval_loss": 0.7796027199046253,
443
+ "eval_mse0_loss": 0.680223688143029,
444
+ "eval_mse_loss": 0.8762989998135937,
445
+ "eval_op_cos_loss": 0.25553356053214094,
446
+ "eval_op_mse_loss": 0.881664497122917,
447
+ "eval_runtime": 624.2884,
448
+ "eval_samples_per_second": 44.84,
449
+ "eval_steps_per_second": 0.702,
450
+ "step": 8192
451
+ }
452
+ ],
453
+ "logging_steps": 256,
454
+ "max_steps": 21651,
455
+ "num_input_tokens_seen": 0,
456
+ "num_train_epochs": 1,
457
+ "save_steps": 1024,
458
+ "stateful_callbacks": {
459
+ "TrainerControl": {
460
+ "args": {
461
+ "should_epoch_stop": false,
462
+ "should_evaluate": false,
463
+ "should_log": false,
464
+ "should_save": true,
465
+ "should_training_stop": false
466
+ },
467
+ "attributes": {}
468
+ }
469
+ },
470
+ "total_flos": 0.0,
471
+ "train_batch_size": 64,
472
+ "trial_name": null,
473
+ "trial_params": null
474
+ }
checkpoints-v2.0b-discrete-condition/checkpoint-8192/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f63a8a711fb280c6320e95476c532b75c862f31d6a218a0d05079e32411a5ae1
3
+ size 5201