ChiefTheLord commited on
Commit
dae12eb
·
verified ·
1 Parent(s): 3a41627

Upload folder using huggingface_hub

Browse files
.gitattributes CHANGED
@@ -93,3 +93,4 @@ checkpoints-v3.0-discrete/checkpoint-20480/eval_state.json filter=lfs diff=lfs m
93
  checkpoints-v4.0-discrete/checkpoint-20480/eval_state.json filter=lfs diff=lfs merge=lfs -text
94
  checkpoints-v4.0-discrete/checkpoint-20480-2/eval_state.json filter=lfs diff=lfs merge=lfs -text
95
  checkpoints-v6.0-discrete/checkpoint-21504/eval_state.json filter=lfs diff=lfs merge=lfs -text
 
 
93
  checkpoints-v4.0-discrete/checkpoint-20480/eval_state.json filter=lfs diff=lfs merge=lfs -text
94
  checkpoints-v4.0-discrete/checkpoint-20480-2/eval_state.json filter=lfs diff=lfs merge=lfs -text
95
  checkpoints-v6.0-discrete/checkpoint-21504/eval_state.json filter=lfs diff=lfs merge=lfs -text
96
+ checkpoints-v1.0a-discrete-condition/checkpoint-14336/eval_state.json filter=lfs diff=lfs merge=lfs -text
checkpoints-v1.0a-discrete-condition/checkpoint-14336/eval_state.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fe6e1edcb571efd9e905b9b7396ea0797a0bda27f9f98eee50bcb3b71f3d139c
3
+ size 43338527
checkpoints-v1.0a-discrete-condition/checkpoint-14336/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:afc5560af74ae197dbd5bbbaa132fbd5004d2e60b4377c7a9ad3a77332901197
3
+ size 15210032
checkpoints-v1.0a-discrete-condition/checkpoint-14336/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7107b59df2aee027f9833db58a73aa342decacc42b15ab9a0f4b26c0f14c0ee6
3
+ size 13675339
checkpoints-v1.0a-discrete-condition/checkpoint-14336/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b690021588a9b384635a1d28d8ed36560e26892d2443d8887b1c3a0097704b73
3
+ size 14645
checkpoints-v1.0a-discrete-condition/checkpoint-14336/scaler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:39155fe38ffb334a3282551d9c35e597e5888b999165a4e29369fa5fd86b0d5d
3
+ size 1383
checkpoints-v1.0a-discrete-condition/checkpoint-14336/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:43b80f7b54ea40edb7a4cdcd3092f35ad902ad030ad30567ab9fdfb8020c9dc4
3
+ size 1465
checkpoints-v1.0a-discrete-condition/checkpoint-14336/trainer_state.json ADDED
@@ -0,0 +1,958 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.6621403168444876,
6
+ "eval_steps": 512,
7
+ "global_step": 14336,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.011823934229365849,
14
+ "grad_norm": 0.3044687807559967,
15
+ "learning_rate": 0.000498046875,
16
+ "loss": 1.1410601139068604,
17
+ "step": 256
18
+ },
19
+ {
20
+ "epoch": 0.023647868458731697,
21
+ "grad_norm": 0.4270760416984558,
22
+ "learning_rate": 0.000998046875,
23
+ "loss": 0.43797242641448975,
24
+ "step": 512
25
+ },
26
+ {
27
+ "epoch": 0.023647868458731697,
28
+ "eval_bleu": 0.0005186165173185879,
29
+ "eval_cos_loss": 0.10953989810391104,
30
+ "eval_loss": 0.3043434491304502,
31
+ "eval_mse_loss": 0.3043434491304502,
32
+ "step": 512
33
+ },
34
+ {
35
+ "epoch": 0.023647868458731697,
36
+ "eval_bleu": 0.0005186165173185879,
37
+ "eval_cos_loss": 0.10953989810391104,
38
+ "eval_loss": 0.3043434491304502,
39
+ "eval_mse_loss": 0.3043434491304502,
40
+ "eval_runtime": 165.321,
41
+ "eval_samples_per_second": 169.325,
42
+ "eval_steps_per_second": 2.649,
43
+ "step": 512
44
+ },
45
+ {
46
+ "epoch": 0.03547180268809755,
47
+ "grad_norm": 0.7530630230903625,
48
+ "learning_rate": 0.000999640996023194,
49
+ "loss": 0.27274221181869507,
50
+ "step": 768
51
+ },
52
+ {
53
+ "epoch": 0.047295736917463395,
54
+ "grad_norm": 0.611813485622406,
55
+ "learning_rate": 0.0009985588674043958,
56
+ "loss": 0.23946227133274078,
57
+ "step": 1024
58
+ },
59
+ {
60
+ "epoch": 0.047295736917463395,
61
+ "eval_bleu": 0.0007332675311119044,
62
+ "eval_cos_loss": 0.0895256234256372,
63
+ "eval_loss": 0.23121154107595687,
64
+ "eval_mse_loss": 0.23121154107595687,
65
+ "step": 1024
66
+ },
67
+ {
68
+ "epoch": 0.047295736917463395,
69
+ "eval_bleu": 0.0007332675311119044,
70
+ "eval_cos_loss": 0.0895256234256372,
71
+ "eval_loss": 0.23121154107595687,
72
+ "eval_mse_loss": 0.23121154107595687,
73
+ "eval_runtime": 161.6975,
74
+ "eval_samples_per_second": 173.12,
75
+ "eval_steps_per_second": 2.709,
76
+ "step": 1024
77
+ },
78
+ {
79
+ "epoch": 0.05911967114682925,
80
+ "grad_norm": 0.5929787755012512,
81
+ "learning_rate": 0.0009967551747861387,
82
+ "loss": 0.22116343677043915,
83
+ "step": 1280
84
+ },
85
+ {
86
+ "epoch": 0.0709436053761951,
87
+ "grad_norm": 0.511510968208313,
88
+ "learning_rate": 0.000994232528651847,
89
+ "loss": 0.2033715695142746,
90
+ "step": 1536
91
+ },
92
+ {
93
+ "epoch": 0.0709436053761951,
94
+ "eval_bleu": 0.000928574398968481,
95
+ "eval_cos_loss": 0.07899834833120646,
96
+ "eval_loss": 0.19764879485379616,
97
+ "eval_mse_loss": 0.19764879485379616,
98
+ "step": 1536
99
+ },
100
+ {
101
+ "epoch": 0.0709436053761951,
102
+ "eval_bleu": 0.000928574398968481,
103
+ "eval_cos_loss": 0.07899834833120646,
104
+ "eval_loss": 0.19764879485379616,
105
+ "eval_mse_loss": 0.19764879485379616,
106
+ "eval_runtime": 160.0193,
107
+ "eval_samples_per_second": 174.935,
108
+ "eval_steps_per_second": 2.737,
109
+ "step": 1536
110
+ },
111
+ {
112
+ "epoch": 0.08276753960556095,
113
+ "grad_norm": 0.41512331366539,
114
+ "learning_rate": 0.0009909945800260092,
115
+ "loss": 0.19373537600040436,
116
+ "step": 1792
117
+ },
118
+ {
119
+ "epoch": 0.09459147383492679,
120
+ "grad_norm": 0.43761223554611206,
121
+ "learning_rate": 0.0009870460151900522,
122
+ "loss": 0.1857086569070816,
123
+ "step": 2048
124
+ },
125
+ {
126
+ "epoch": 0.09459147383492679,
127
+ "eval_bleu": 0.0014553628244971277,
128
+ "eval_cos_loss": 0.07385358049376914,
129
+ "eval_loss": 0.18289226021396515,
130
+ "eval_mse_loss": 0.18289226021396515,
131
+ "step": 2048
132
+ },
133
+ {
134
+ "epoch": 0.09459147383492679,
135
+ "eval_bleu": 0.0014553628244971277,
136
+ "eval_cos_loss": 0.07385358049376914,
137
+ "eval_loss": 0.18289226021396515,
138
+ "eval_mse_loss": 0.18289226021396515,
139
+ "eval_runtime": 158.809,
140
+ "eval_samples_per_second": 176.268,
141
+ "eval_steps_per_second": 2.758,
142
+ "step": 2048
143
+ },
144
+ {
145
+ "epoch": 0.10641540806429264,
146
+ "grad_norm": 0.4605104327201843,
147
+ "learning_rate": 0.0009823925488998885,
148
+ "loss": 0.17990536987781525,
149
+ "step": 2304
150
+ },
151
+ {
152
+ "epoch": 0.1182393422936585,
153
+ "grad_norm": 0.29295089840888977,
154
+ "learning_rate": 0.0009770409161149525,
155
+ "loss": 0.17212478816509247,
156
+ "step": 2560
157
+ },
158
+ {
159
+ "epoch": 0.1182393422936585,
160
+ "eval_bleu": 0.0023391031194396,
161
+ "eval_cos_loss": 0.0687075220728846,
162
+ "eval_loss": 0.16848488893683097,
163
+ "eval_mse_loss": 0.16848488893683097,
164
+ "step": 2560
165
+ },
166
+ {
167
+ "epoch": 0.1182393422936585,
168
+ "eval_bleu": 0.0023391031194396,
169
+ "eval_cos_loss": 0.0687075220728846,
170
+ "eval_loss": 0.16848488893683097,
171
+ "eval_mse_loss": 0.16848488893683097,
172
+ "eval_runtime": 158.2586,
173
+ "eval_samples_per_second": 176.881,
174
+ "eval_steps_per_second": 2.768,
175
+ "step": 2560
176
+ },
177
+ {
178
+ "epoch": 0.13006327652302435,
179
+ "grad_norm": 0.4083748161792755,
180
+ "learning_rate": 0.0009709988622506973,
181
+ "loss": 0.16507142782211304,
182
+ "step": 2816
183
+ },
184
+ {
185
+ "epoch": 0.1418872107523902,
186
+ "grad_norm": 0.25093817710876465,
187
+ "learning_rate": 0.000964275131968659,
188
+ "loss": 0.15988650918006897,
189
+ "step": 3072
190
+ },
191
+ {
192
+ "epoch": 0.1418872107523902,
193
+ "eval_bleu": 0.004337513755218438,
194
+ "eval_cos_loss": 0.06480927773024121,
195
+ "eval_loss": 0.15791784556897265,
196
+ "eval_mse_loss": 0.15791784556897265,
197
+ "step": 3072
198
+ },
199
+ {
200
+ "epoch": 0.1418872107523902,
201
+ "eval_bleu": 0.004337513755218438,
202
+ "eval_cos_loss": 0.06480927773024121,
203
+ "eval_loss": 0.15791784556897265,
204
+ "eval_mse_loss": 0.15791784556897265,
205
+ "eval_runtime": 158.9164,
206
+ "eval_samples_per_second": 176.149,
207
+ "eval_steps_per_second": 2.756,
208
+ "step": 3072
209
+ },
210
+ {
211
+ "epoch": 0.15371114498175603,
212
+ "grad_norm": 0.4949483573436737,
213
+ "learning_rate": 0.0009568794565203123,
214
+ "loss": 0.1544014811515808,
215
+ "step": 3328
216
+ },
217
+ {
218
+ "epoch": 0.1655350792111219,
219
+ "grad_norm": 0.33947989344596863,
220
+ "learning_rate": 0.0009488225396630347,
221
+ "loss": 0.14944614470005035,
222
+ "step": 3584
223
+ },
224
+ {
225
+ "epoch": 0.1655350792111219,
226
+ "eval_bleu": 0.008657950909142042,
227
+ "eval_cos_loss": 0.06050370987419668,
228
+ "eval_loss": 0.14653842760139404,
229
+ "eval_mse_loss": 0.14653842760139404,
230
+ "step": 3584
231
+ },
232
+ {
233
+ "epoch": 0.1655350792111219,
234
+ "eval_bleu": 0.008657950909142042,
235
+ "eval_cos_loss": 0.06050370987419668,
236
+ "eval_loss": 0.14653842760139404,
237
+ "eval_mse_loss": 0.14653842760139404,
238
+ "eval_runtime": 156.9912,
239
+ "eval_samples_per_second": 178.309,
240
+ "eval_steps_per_second": 2.79,
241
+ "step": 3584
242
+ },
243
+ {
244
+ "epoch": 0.17735901344048774,
245
+ "grad_norm": 0.5737375617027283,
246
+ "learning_rate": 0.0009401160421685646,
247
+ "loss": 0.14433179795742035,
248
+ "step": 3840
249
+ },
250
+ {
251
+ "epoch": 0.18918294766985358,
252
+ "grad_norm": 0.4044644236564636,
253
+ "learning_rate": 0.0009307725649463714,
254
+ "loss": 0.13923336565494537,
255
+ "step": 4096
256
+ },
257
+ {
258
+ "epoch": 0.18918294766985358,
259
+ "eval_bleu": 0.016024884962666415,
260
+ "eval_cos_loss": 0.05712421540358023,
261
+ "eval_loss": 0.13752998503511898,
262
+ "eval_mse_loss": 0.13752998503511898,
263
+ "step": 4096
264
+ },
265
+ {
266
+ "epoch": 0.18918294766985358,
267
+ "eval_bleu": 0.016024884962666415,
268
+ "eval_cos_loss": 0.05712421540358023,
269
+ "eval_loss": 0.13752998503511898,
270
+ "eval_mse_loss": 0.13752998503511898,
271
+ "eval_runtime": 157.5213,
272
+ "eval_samples_per_second": 177.709,
273
+ "eval_steps_per_second": 2.781,
274
+ "step": 4096
275
+ },
276
+ {
277
+ "epoch": 0.20100688189921945,
278
+ "grad_norm": 0.4381753206253052,
279
+ "learning_rate": 0.0009208056308063659,
280
+ "loss": 0.13583530485630035,
281
+ "step": 4352
282
+ },
283
+ {
284
+ "epoch": 0.2128308161285853,
285
+ "grad_norm": 0.38595834374427795,
286
+ "learning_rate": 0.0009102296648873445,
287
+ "loss": 0.13296422362327576,
288
+ "step": 4608
289
+ },
290
+ {
291
+ "epoch": 0.2128308161285853,
292
+ "eval_bleu": 0.022313272160969743,
293
+ "eval_cos_loss": 0.05505079787105458,
294
+ "eval_loss": 0.13222655992461665,
295
+ "eval_mse_loss": 0.13222655992461665,
296
+ "step": 4608
297
+ },
298
+ {
299
+ "epoch": 0.2128308161285853,
300
+ "eval_bleu": 0.022313272160969743,
301
+ "eval_cos_loss": 0.05505079787105458,
302
+ "eval_loss": 0.13222655992461665,
303
+ "eval_mse_loss": 0.13222655992461665,
304
+ "eval_runtime": 156.4154,
305
+ "eval_samples_per_second": 178.966,
306
+ "eval_steps_per_second": 2.8,
307
+ "step": 4608
308
+ },
309
+ {
310
+ "epoch": 0.22465475035795113,
311
+ "grad_norm": 0.340983122587204,
312
+ "learning_rate": 0.0008990599737794927,
313
+ "loss": 0.13080570101737976,
314
+ "step": 4864
315
+ },
316
+ {
317
+ "epoch": 0.236478684587317,
318
+ "grad_norm": 0.25848904252052307,
319
+ "learning_rate": 0.0008873127233711644,
320
+ "loss": 0.12910281121730804,
321
+ "step": 5120
322
+ },
323
+ {
324
+ "epoch": 0.236478684587317,
325
+ "eval_bleu": 0.026597415563799583,
326
+ "eval_cos_loss": 0.05339692005692007,
327
+ "eval_loss": 0.12794435223283834,
328
+ "eval_mse_loss": 0.12794435223283834,
329
+ "step": 5120
330
+ },
331
+ {
332
+ "epoch": 0.236478684587317,
333
+ "eval_bleu": 0.026597415563799583,
334
+ "eval_cos_loss": 0.05339692005692007,
335
+ "eval_loss": 0.12794435223283834,
336
+ "eval_mse_loss": 0.12794435223283834,
337
+ "eval_runtime": 156.0359,
338
+ "eval_samples_per_second": 179.401,
339
+ "eval_steps_per_second": 2.807,
340
+ "step": 5120
341
+ },
342
+ {
343
+ "epoch": 0.24830261881668284,
344
+ "grad_norm": 0.286683589220047,
345
+ "learning_rate": 0.0008750049154520011,
346
+ "loss": 0.1271289438009262,
347
+ "step": 5376
348
+ },
349
+ {
350
+ "epoch": 0.2601265530460487,
351
+ "grad_norm": 0.3022914230823517,
352
+ "learning_rate": 0.0008621543631062487,
353
+ "loss": 0.12510433793067932,
354
+ "step": 5632
355
+ },
356
+ {
357
+ "epoch": 0.2601265530460487,
358
+ "eval_bleu": 0.03309418059788915,
359
+ "eval_cos_loss": 0.051935992105842724,
360
+ "eval_loss": 0.12439160714070546,
361
+ "eval_mse_loss": 0.12439160714070546,
362
+ "step": 5632
363
+ },
364
+ {
365
+ "epoch": 0.2601265530460487,
366
+ "eval_bleu": 0.03309418059788915,
367
+ "eval_cos_loss": 0.051935992105842724,
368
+ "eval_loss": 0.12439160714070546,
369
+ "eval_mse_loss": 0.12439160714070546,
370
+ "eval_runtime": 157.922,
371
+ "eval_samples_per_second": 177.258,
372
+ "eval_steps_per_second": 2.774,
373
+ "step": 5632
374
+ },
375
+ {
376
+ "epoch": 0.27195048727541454,
377
+ "grad_norm": 0.3412926197052002,
378
+ "learning_rate": 0.0008487796649318904,
379
+ "loss": 0.12324099242687225,
380
+ "step": 5888
381
+ },
382
+ {
383
+ "epoch": 0.2837744215047804,
384
+ "grad_norm": 0.2614317536354065,
385
+ "learning_rate": 0.0008349001781229053,
386
+ "loss": 0.12232518196105957,
387
+ "step": 6144
388
+ },
389
+ {
390
+ "epoch": 0.2837744215047804,
391
+ "eval_bleu": 0.04185625264994691,
392
+ "eval_cos_loss": 0.05078601403391524,
393
+ "eval_loss": 0.12143099438994442,
394
+ "eval_mse_loss": 0.12143099438994442,
395
+ "step": 6144
396
+ },
397
+ {
398
+ "epoch": 0.2837744215047804,
399
+ "eval_bleu": 0.04185625264994691,
400
+ "eval_cos_loss": 0.05078601403391524,
401
+ "eval_loss": 0.12143099438994442,
402
+ "eval_mse_loss": 0.12143099438994442,
403
+ "eval_runtime": 159.5869,
404
+ "eval_samples_per_second": 175.409,
405
+ "eval_steps_per_second": 2.745,
406
+ "step": 6144
407
+ },
408
+ {
409
+ "epoch": 0.2955983557341462,
410
+ "grad_norm": 0.2630632221698761,
411
+ "learning_rate": 0.0008205359904536107,
412
+ "loss": 0.12037820369005203,
413
+ "step": 6400
414
+ },
415
+ {
416
+ "epoch": 0.30742228996351206,
417
+ "grad_norm": 0.28438350558280945,
418
+ "learning_rate": 0.0008057078912056363,
419
+ "loss": 0.11895089596509933,
420
+ "step": 6656
421
+ },
422
+ {
423
+ "epoch": 0.30742228996351206,
424
+ "eval_bleu": 0.04830444570067303,
425
+ "eval_cos_loss": 0.04939154238699506,
426
+ "eval_loss": 0.11797671299002487,
427
+ "eval_mse_loss": 0.11797671299002487,
428
+ "step": 6656
429
+ },
430
+ {
431
+ "epoch": 0.30742228996351206,
432
+ "eval_bleu": 0.04830444570067303,
433
+ "eval_cos_loss": 0.04939154238699506,
434
+ "eval_loss": 0.11797671299002487,
435
+ "eval_mse_loss": 0.11797671299002487,
436
+ "eval_runtime": 158.8762,
437
+ "eval_samples_per_second": 176.194,
438
+ "eval_steps_per_second": 2.757,
439
+ "step": 6656
440
+ },
441
+ {
442
+ "epoch": 0.3192462241928779,
443
+ "grad_norm": 0.32841956615448,
444
+ "learning_rate": 0.0007904373410796086,
445
+ "loss": 0.11719170957803726,
446
+ "step": 6912
447
+ },
448
+ {
449
+ "epoch": 0.3310701584222438,
450
+ "grad_norm": 0.2692711055278778,
451
+ "learning_rate": 0.0007747464411350876,
452
+ "loss": 0.11580982059240341,
453
+ "step": 7168
454
+ },
455
+ {
456
+ "epoch": 0.3310701584222438,
457
+ "eval_bleu": 0.05707366836436282,
458
+ "eval_cos_loss": 0.04825041684658016,
459
+ "eval_loss": 0.11517858171844048,
460
+ "eval_mse_loss": 0.11517858171844048,
461
+ "step": 7168
462
+ },
463
+ {
464
+ "epoch": 0.3310701584222438,
465
+ "eval_bleu": 0.05707366836436282,
466
+ "eval_cos_loss": 0.04825041684658016,
467
+ "eval_loss": 0.11517858171844048,
468
+ "eval_mse_loss": 0.11517858171844048,
469
+ "eval_runtime": 159.2882,
470
+ "eval_samples_per_second": 175.738,
471
+ "eval_steps_per_second": 2.75,
472
+ "step": 7168
473
+ },
474
+ {
475
+ "epoch": 0.34289409265160964,
476
+ "grad_norm": 0.24981003999710083,
477
+ "learning_rate": 0.000758657900803716,
478
+ "loss": 0.11493993550539017,
479
+ "step": 7424
480
+ },
481
+ {
482
+ "epoch": 0.3547180268809755,
483
+ "grad_norm": 0.2567964196205139,
484
+ "learning_rate": 0.000742195005021869,
485
+ "loss": 0.11348389834165573,
486
+ "step": 7680
487
+ },
488
+ {
489
+ "epoch": 0.3547180268809755,
490
+ "eval_bleu": 0.06587505034257662,
491
+ "eval_cos_loss": 0.04732463612608169,
492
+ "eval_loss": 0.11294627512834932,
493
+ "eval_mse_loss": 0.11294627512834932,
494
+ "step": 7680
495
+ },
496
+ {
497
+ "epoch": 0.3547180268809755,
498
+ "eval_bleu": 0.06587505034257662,
499
+ "eval_cos_loss": 0.04732463612608169,
500
+ "eval_loss": 0.11294627512834932,
501
+ "eval_mse_loss": 0.11294627512834932,
502
+ "eval_runtime": 160.8596,
503
+ "eval_samples_per_second": 174.021,
504
+ "eval_steps_per_second": 2.723,
505
+ "step": 7680
506
+ },
507
+ {
508
+ "epoch": 0.3665419611103413,
509
+ "grad_norm": 0.36263951659202576,
510
+ "learning_rate": 0.0007253815805303786,
511
+ "loss": 0.11203160881996155,
512
+ "step": 7936
513
+ },
514
+ {
515
+ "epoch": 0.37836589533970716,
516
+ "grad_norm": 0.2504832446575165,
517
+ "learning_rate": 0.0007082419613901028,
518
+ "loss": 0.1110883429646492,
519
+ "step": 8192
520
+ },
521
+ {
522
+ "epoch": 0.37836589533970716,
523
+ "eval_bleu": 0.07300823928300985,
524
+ "eval_cos_loss": 0.04627396378104817,
525
+ "eval_loss": 0.11028832457449338,
526
+ "eval_mse_loss": 0.11028832457449338,
527
+ "step": 8192
528
+ },
529
+ {
530
+ "epoch": 0.37836589533970716,
531
+ "eval_bleu": 0.07300823928300985,
532
+ "eval_cos_loss": 0.04627396378104817,
533
+ "eval_loss": 0.11028832457449338,
534
+ "eval_mse_loss": 0.11028832457449338,
535
+ "eval_runtime": 159.2059,
536
+ "eval_samples_per_second": 175.829,
537
+ "eval_steps_per_second": 2.751,
538
+ "step": 8192
539
+ },
540
+ {
541
+ "epoch": 0.390189829569073,
542
+ "grad_norm": 0.24803084135055542,
543
+ "learning_rate": 0.0006908009537632514,
544
+ "loss": 0.1101049929857254,
545
+ "step": 8448
546
+ },
547
+ {
548
+ "epoch": 0.4020137637984389,
549
+ "grad_norm": 0.3906862139701843,
550
+ "learning_rate": 0.0006730838000114403,
551
+ "loss": 0.10908006131649017,
552
+ "step": 8704
553
+ },
554
+ {
555
+ "epoch": 0.4020137637984389,
556
+ "eval_bleu": 0.08488511983611245,
557
+ "eval_cos_loss": 0.04576081680516674,
558
+ "eval_loss": 0.10910753419274065,
559
+ "eval_mse_loss": 0.10910753419274065,
560
+ "step": 8704
561
+ },
562
+ {
563
+ "epoch": 0.4020137637984389,
564
+ "eval_bleu": 0.08488511983611245,
565
+ "eval_cos_loss": 0.04576081680516674,
566
+ "eval_loss": 0.10910753419274065,
567
+ "eval_mse_loss": 0.10910753419274065,
568
+ "eval_runtime": 160.2544,
569
+ "eval_samples_per_second": 174.678,
570
+ "eval_steps_per_second": 2.733,
571
+ "step": 8704
572
+ },
573
+ {
574
+ "epoch": 0.41383769802780473,
575
+ "grad_norm": 0.3117774426937103,
576
+ "learning_rate": 0.0006551161421624341,
577
+ "loss": 0.10793899744749069,
578
+ "step": 8960
579
+ },
580
+ {
581
+ "epoch": 0.4256616322571706,
582
+ "grad_norm": 0.23388367891311646,
583
+ "learning_rate": 0.0006369239847984517,
584
+ "loss": 0.10695473849773407,
585
+ "step": 9216
586
+ },
587
+ {
588
+ "epoch": 0.4256616322571706,
589
+ "eval_bleu": 0.09512749248852158,
590
+ "eval_cos_loss": 0.044867240947131154,
591
+ "eval_loss": 0.10682911129846964,
592
+ "eval_mse_loss": 0.10682911129846964,
593
+ "step": 9216
594
+ },
595
+ {
596
+ "epoch": 0.4256616322571706,
597
+ "eval_bleu": 0.09512749248852158,
598
+ "eval_cos_loss": 0.044867240947131154,
599
+ "eval_loss": 0.10682911129846964,
600
+ "eval_mse_loss": 0.10682911129846964,
601
+ "eval_runtime": 160.4019,
602
+ "eval_samples_per_second": 174.518,
603
+ "eval_steps_per_second": 2.731,
604
+ "step": 9216
605
+ },
606
+ {
607
+ "epoch": 0.4374855664865364,
608
+ "grad_norm": 0.27336016297340393,
609
+ "learning_rate": 0.0006185336574197479,
610
+ "loss": 0.10611770302057266,
611
+ "step": 9472
612
+ },
613
+ {
614
+ "epoch": 0.44930950071590225,
615
+ "grad_norm": 0.23575982451438904,
616
+ "learning_rate": 0.0005999717763379407,
617
+ "loss": 0.10516544431447983,
618
+ "step": 9728
619
+ },
620
+ {
621
+ "epoch": 0.44930950071590225,
622
+ "eval_bleu": 0.10343097218645242,
623
+ "eval_cos_loss": 0.044066149605327544,
624
+ "eval_loss": 0.10490067886639404,
625
+ "eval_mse_loss": 0.10490067886639404,
626
+ "step": 9728
627
+ },
628
+ {
629
+ "epoch": 0.44930950071590225,
630
+ "eval_bleu": 0.10343097218645242,
631
+ "eval_cos_loss": 0.044066149605327544,
632
+ "eval_loss": 0.10490067886639404,
633
+ "eval_mse_loss": 0.10490067886639404,
634
+ "eval_runtime": 159.6275,
635
+ "eval_samples_per_second": 175.365,
636
+ "eval_steps_per_second": 2.744,
637
+ "step": 9728
638
+ },
639
+ {
640
+ "epoch": 0.4611334349452681,
641
+ "grad_norm": 0.23086896538734436,
642
+ "learning_rate": 0.0005812652061542363,
643
+ "loss": 0.10434820502996445,
644
+ "step": 9984
645
+ },
646
+ {
647
+ "epoch": 0.472957369174634,
648
+ "grad_norm": 0.19423653185367584,
649
+ "learning_rate": 0.0005624410208783071,
650
+ "loss": 0.10352878272533417,
651
+ "step": 10240
652
+ },
653
+ {
654
+ "epoch": 0.472957369174634,
655
+ "eval_bleu": 0.11055462315611204,
656
+ "eval_cos_loss": 0.04341814211956714,
657
+ "eval_loss": 0.10340308597030705,
658
+ "eval_mse_loss": 0.10340308597030705,
659
+ "step": 10240
660
+ },
661
+ {
662
+ "epoch": 0.472957369174634,
663
+ "eval_bleu": 0.11055462315611204,
664
+ "eval_cos_loss": 0.04341814211956714,
665
+ "eval_loss": 0.10340308597030705,
666
+ "eval_mse_loss": 0.10340308597030705,
667
+ "eval_runtime": 161.3086,
668
+ "eval_samples_per_second": 173.537,
669
+ "eval_steps_per_second": 2.715,
670
+ "step": 10240
671
+ },
672
+ {
673
+ "epoch": 0.48478130340399983,
674
+ "grad_norm": 0.21835283935070038,
675
+ "learning_rate": 0.0005435264647440881,
676
+ "loss": 0.10247565805912018,
677
+ "step": 10496
678
+ },
679
+ {
680
+ "epoch": 0.49660523763336567,
681
+ "grad_norm": 0.23124203085899353,
682
+ "learning_rate": 0.000524548912779213,
683
+ "loss": 0.101834237575531,
684
+ "step": 10752
685
+ },
686
+ {
687
+ "epoch": 0.49660523763336567,
688
+ "eval_bleu": 0.11814825679523086,
689
+ "eval_cos_loss": 0.04272205974549463,
690
+ "eval_loss": 0.10157620621054139,
691
+ "eval_mse_loss": 0.10157620621054139,
692
+ "step": 10752
693
+ },
694
+ {
695
+ "epoch": 0.49660523763336567,
696
+ "eval_bleu": 0.11814825679523086,
697
+ "eval_cos_loss": 0.04272205974549463,
698
+ "eval_loss": 0.10157620621054139,
699
+ "eval_mse_loss": 0.10157620621054139,
700
+ "eval_runtime": 159.5803,
701
+ "eval_samples_per_second": 175.416,
702
+ "eval_steps_per_second": 2.745,
703
+ "step": 10752
704
+ },
705
+ {
706
+ "epoch": 0.5084291718627315,
707
+ "grad_norm": 0.18530890345573425,
708
+ "learning_rate": 0.0005055358311851499,
709
+ "loss": 0.1013505682349205,
710
+ "step": 11008
711
+ },
712
+ {
713
+ "epoch": 0.5202531060920974,
714
+ "grad_norm": 0.26730409264564514,
715
+ "learning_rate": 0.0004865147375853812,
716
+ "loss": 0.10057492554187775,
717
+ "step": 11264
718
+ },
719
+ {
720
+ "epoch": 0.5202531060920974,
721
+ "eval_bleu": 0.12275680545899822,
722
+ "eval_cos_loss": 0.04225792291842095,
723
+ "eval_loss": 0.10049243439754395,
724
+ "eval_mse_loss": 0.10049243439754395,
725
+ "step": 11264
726
+ },
727
+ {
728
+ "epoch": 0.5202531060920974,
729
+ "eval_bleu": 0.12275680545899822,
730
+ "eval_cos_loss": 0.04225792291842095,
731
+ "eval_loss": 0.10049243439754395,
732
+ "eval_mse_loss": 0.10049243439754395,
733
+ "eval_runtime": 158.8797,
734
+ "eval_samples_per_second": 176.19,
735
+ "eval_steps_per_second": 2.757,
736
+ "step": 11264
737
+ },
738
+ {
739
+ "epoch": 0.5320770403214632,
740
+ "grad_norm": 0.27949991822242737,
741
+ "learning_rate": 0.0004675131611991607,
742
+ "loss": 0.09975230693817139,
743
+ "step": 11520
744
+ },
745
+ {
746
+ "epoch": 0.5439009745508291,
747
+ "grad_norm": 0.20420485734939575,
748
+ "learning_rate": 0.0004485586029984899,
749
+ "loss": 0.09914066642522812,
750
+ "step": 11776
751
+ },
752
+ {
753
+ "epoch": 0.5439009745508291,
754
+ "eval_bleu": 0.12975609425338133,
755
+ "eval_cos_loss": 0.04190053881813674,
756
+ "eval_loss": 0.09959512977907646,
757
+ "eval_mse_loss": 0.09959512977907646,
758
+ "step": 11776
759
+ },
760
+ {
761
+ "epoch": 0.5439009745508291,
762
+ "eval_bleu": 0.12975609425338133,
763
+ "eval_cos_loss": 0.04190053881813674,
764
+ "eval_loss": 0.09959512977907646,
765
+ "eval_mse_loss": 0.09959512977907646,
766
+ "eval_runtime": 158.0706,
767
+ "eval_samples_per_second": 177.092,
768
+ "eval_steps_per_second": 2.771,
769
+ "step": 11776
770
+ },
771
+ {
772
+ "epoch": 0.5557249087801949,
773
+ "grad_norm": 0.20577751100063324,
774
+ "learning_rate": 0.00042967849590597266,
775
+ "loss": 0.0986473560333252,
776
+ "step": 12032
777
+ },
778
+ {
779
+ "epoch": 0.5675488430095608,
780
+ "grad_norm": 0.25362300872802734,
781
+ "learning_rate": 0.0004109001650911621,
782
+ "loss": 0.09841401129961014,
783
+ "step": 12288
784
+ },
785
+ {
786
+ "epoch": 0.5675488430095608,
787
+ "eval_bleu": 0.13531822052044473,
788
+ "eval_cos_loss": 0.04134656955832488,
789
+ "eval_loss": 0.0982762188161617,
790
+ "eval_mse_loss": 0.0982762188161617,
791
+ "step": 12288
792
+ },
793
+ {
794
+ "epoch": 0.5675488430095608,
795
+ "eval_bleu": 0.13531822052044473,
796
+ "eval_cos_loss": 0.04134656955832488,
797
+ "eval_loss": 0.0982762188161617,
798
+ "eval_mse_loss": 0.0982762188161617,
799
+ "eval_runtime": 157.484,
800
+ "eval_samples_per_second": 177.751,
801
+ "eval_steps_per_second": 2.781,
802
+ "step": 12288
803
+ },
804
+ {
805
+ "epoch": 0.5793727772389267,
806
+ "grad_norm": 0.18240386247634888,
807
+ "learning_rate": 0.0003922507884228551,
808
+ "loss": 0.0975782573223114,
809
+ "step": 12544
810
+ },
811
+ {
812
+ "epoch": 0.5911967114682924,
813
+ "grad_norm": 0.1780499815940857,
814
+ "learning_rate": 0.00037375735713457723,
815
+ "loss": 0.09720117598772049,
816
+ "step": 12800
817
+ },
818
+ {
819
+ "epoch": 0.5911967114682924,
820
+ "eval_bleu": 0.14140026886110868,
821
+ "eval_cos_loss": 0.04091669377534901,
822
+ "eval_loss": 0.09719095440351799,
823
+ "eval_mse_loss": 0.09719095440351799,
824
+ "step": 12800
825
+ },
826
+ {
827
+ "epoch": 0.5911967114682924,
828
+ "eval_bleu": 0.14140026886110868,
829
+ "eval_cos_loss": 0.04091669377534901,
830
+ "eval_loss": 0.09719095440351799,
831
+ "eval_mse_loss": 0.09719095440351799,
832
+ "eval_runtime": 157.2335,
833
+ "eval_samples_per_second": 178.035,
834
+ "eval_steps_per_second": 2.786,
835
+ "step": 12800
836
+ },
837
+ {
838
+ "epoch": 0.6030206456976583,
839
+ "grad_norm": 0.2029908448457718,
840
+ "learning_rate": 0.00035544663676018276,
841
+ "loss": 0.09679730236530304,
842
+ "step": 13056
843
+ },
844
+ {
845
+ "epoch": 0.6148445799270241,
846
+ "grad_norm": 0.14197683334350586,
847
+ "learning_rate": 0.00033734512839611255,
848
+ "loss": 0.09641503542661667,
849
+ "step": 13312
850
+ },
851
+ {
852
+ "epoch": 0.6148445799270241,
853
+ "eval_bleu": 0.14466560094776604,
854
+ "eval_cos_loss": 0.04052989707077475,
855
+ "eval_loss": 0.09625409164181038,
856
+ "eval_mse_loss": 0.09625409164181038,
857
+ "step": 13312
858
+ },
859
+ {
860
+ "epoch": 0.6148445799270241,
861
+ "eval_bleu": 0.14466560094776604,
862
+ "eval_cos_loss": 0.04052989707077475,
863
+ "eval_loss": 0.09625409164181038,
864
+ "eval_mse_loss": 0.09625409164181038,
865
+ "eval_runtime": 157.9328,
866
+ "eval_samples_per_second": 177.246,
867
+ "eval_steps_per_second": 2.773,
868
+ "step": 13312
869
+ },
870
+ {
871
+ "epoch": 0.62666851415639,
872
+ "grad_norm": 0.18578514456748962,
873
+ "learning_rate": 0.0003194790303463687,
874
+ "loss": 0.09595735371112823,
875
+ "step": 13568
876
+ },
877
+ {
878
+ "epoch": 0.6384924483857558,
879
+ "grad_norm": 0.18685129284858704,
880
+ "learning_rate": 0.00030187420020572406,
881
+ "loss": 0.0954282134771347,
882
+ "step": 13824
883
+ },
884
+ {
885
+ "epoch": 0.6384924483857558,
886
+ "eval_bleu": 0.14865180488517837,
887
+ "eval_cos_loss": 0.04023367106132039,
888
+ "eval_loss": 0.09560299717468214,
889
+ "eval_mse_loss": 0.09560299717468214,
890
+ "step": 13824
891
+ },
892
+ {
893
+ "epoch": 0.6384924483857558,
894
+ "eval_bleu": 0.14865180488517837,
895
+ "eval_cos_loss": 0.04023367106132039,
896
+ "eval_loss": 0.09560299717468214,
897
+ "eval_mse_loss": 0.09560299717468214,
898
+ "eval_runtime": 158.2849,
899
+ "eval_samples_per_second": 176.852,
900
+ "eval_steps_per_second": 2.767,
901
+ "step": 13824
902
+ },
903
+ {
904
+ "epoch": 0.6503163826151217,
905
+ "grad_norm": 0.19189825654029846,
906
+ "learning_rate": 0.00028455611743603626,
907
+ "loss": 0.09495263546705246,
908
+ "step": 14080
909
+ },
910
+ {
911
+ "epoch": 0.6621403168444876,
912
+ "grad_norm": 0.17977699637413025,
913
+ "learning_rate": 0.0002675498464898373,
914
+ "loss": 0.09477033466100693,
915
+ "step": 14336
916
+ },
917
+ {
918
+ "epoch": 0.6621403168444876,
919
+ "eval_bleu": 0.15228623945506375,
920
+ "eval_cos_loss": 0.039867439847354476,
921
+ "eval_loss": 0.0946794286132131,
922
+ "eval_mse_loss": 0.0946794286132131,
923
+ "step": 14336
924
+ },
925
+ {
926
+ "epoch": 0.6621403168444876,
927
+ "eval_bleu": 0.15228623945506375,
928
+ "eval_cos_loss": 0.039867439847354476,
929
+ "eval_loss": 0.0946794286132131,
930
+ "eval_mse_loss": 0.0946794286132131,
931
+ "eval_runtime": 159.0411,
932
+ "eval_samples_per_second": 176.011,
933
+ "eval_steps_per_second": 2.754,
934
+ "step": 14336
935
+ }
936
+ ],
937
+ "logging_steps": 256,
938
+ "max_steps": 21651,
939
+ "num_input_tokens_seen": 0,
940
+ "num_train_epochs": 1,
941
+ "save_steps": 512,
942
+ "stateful_callbacks": {
943
+ "TrainerControl": {
944
+ "args": {
945
+ "should_epoch_stop": false,
946
+ "should_evaluate": false,
947
+ "should_log": false,
948
+ "should_save": true,
949
+ "should_training_stop": false
950
+ },
951
+ "attributes": {}
952
+ }
953
+ },
954
+ "total_flos": 0.0,
955
+ "train_batch_size": 64,
956
+ "trial_name": null,
957
+ "trial_params": null
958
+ }
checkpoints-v1.0a-discrete-condition/checkpoint-14336/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:cb0e41e9d1757d7bc692542655083161f482bd1086f4c5bd816bb8c6cb983325
3
+ size 5137