Safetensors
OminiControlRotation / nl_tasks /exp395 /run_ex09 /trainer_state.json
nvan15's picture
Batch upload part 16
e6dd826 verified
Raw
History Blame Contribute Delete
12.2 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 500,
"global_step": 9375,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.064,
"grad_norm": 0.24448873102664948,
"learning_rate": 0.00199936844222861,
"loss": 0.3757,
"step": 200
},
{
"epoch": 0.128,
"grad_norm": 0.25495460629463196,
"learning_rate": 0.0019946753128925747,
"loss": 0.3045,
"step": 400
},
{
"epoch": 0.16,
"eval_loss": 0.2806861102581024,
"eval_runtime": 18.6896,
"eval_samples_per_second": 54.094,
"eval_steps_per_second": 0.856,
"step": 500
},
{
"epoch": 0.192,
"grad_norm": 0.12310587614774704,
"learning_rate": 0.001985425114055429,
"loss": 0.2727,
"step": 600
},
{
"epoch": 0.256,
"grad_norm": 0.15234604477882385,
"learning_rate": 0.0019716602251735175,
"loss": 0.2555,
"step": 800
},
{
"epoch": 0.32,
"grad_norm": 0.10114556550979614,
"learning_rate": 0.001953443709594746,
"loss": 0.2475,
"step": 1000
},
{
"epoch": 0.32,
"eval_loss": 0.25135913491249084,
"eval_runtime": 18.5064,
"eval_samples_per_second": 54.63,
"eval_steps_per_second": 0.865,
"step": 1000
},
{
"epoch": 0.384,
"grad_norm": 0.09664544463157654,
"learning_rate": 0.0019308590256360988,
"loss": 0.2449,
"step": 1200
},
{
"epoch": 0.448,
"grad_norm": 0.09191286563873291,
"learning_rate": 0.0019040096442223358,
"loss": 0.2387,
"step": 1400
},
{
"epoch": 0.48,
"eval_loss": 0.24170711636543274,
"eval_runtime": 18.503,
"eval_samples_per_second": 54.64,
"eval_steps_per_second": 0.865,
"step": 1500
},
{
"epoch": 0.512,
"grad_norm": 0.08609094470739365,
"learning_rate": 0.0018730185748376353,
"loss": 0.2332,
"step": 1600
},
{
"epoch": 0.576,
"grad_norm": 0.08084086328744888,
"learning_rate": 0.0018380278019620281,
"loss": 0.2295,
"step": 1800
},
{
"epoch": 0.64,
"grad_norm": 0.08400174230337143,
"learning_rate": 0.0017991976345745596,
"loss": 0.2278,
"step": 2000
},
{
"epoch": 0.64,
"eval_loss": 0.22995951771736145,
"eval_runtime": 18.5154,
"eval_samples_per_second": 54.603,
"eval_steps_per_second": 0.864,
"step": 2000
},
{
"epoch": 0.704,
"grad_norm": 0.06514922529459,
"learning_rate": 0.0017567059717034153,
"loss": 0.2236,
"step": 2200
},
{
"epoch": 0.768,
"grad_norm": 0.061288416385650635,
"learning_rate": 0.0017107474873878648,
"loss": 0.2217,
"step": 2400
},
{
"epoch": 0.8,
"eval_loss": 0.2240372747182846,
"eval_runtime": 18.5034,
"eval_samples_per_second": 54.639,
"eval_steps_per_second": 0.865,
"step": 2500
},
{
"epoch": 0.832,
"grad_norm": 0.0703856498003006,
"learning_rate": 0.0016615327387860851,
"loss": 0.2195,
"step": 2600
},
{
"epoch": 0.896,
"grad_norm": 0.06190377473831177,
"learning_rate": 0.001609287201515044,
"loss": 0.2192,
"step": 2800
},
{
"epoch": 0.96,
"grad_norm": 0.058891598135232925,
"learning_rate": 0.0015542502366419986,
"loss": 0.2119,
"step": 3000
},
{
"epoch": 0.96,
"eval_loss": 0.21980270743370056,
"eval_runtime": 18.5017,
"eval_samples_per_second": 54.644,
"eval_steps_per_second": 0.865,
"step": 3000
},
{
"epoch": 1.024,
"grad_norm": 0.08175381273031235,
"learning_rate": 0.001496673994060291,
"loss": 0.2067,
"step": 3200
},
{
"epoch": 1.088,
"grad_norm": 0.058054033666849136,
"learning_rate": 0.0014368222572736001,
"loss": 0.1904,
"step": 3400
},
{
"epoch": 1.12,
"eval_loss": 0.21591630578041077,
"eval_runtime": 18.5104,
"eval_samples_per_second": 54.618,
"eval_steps_per_second": 0.864,
"step": 3500
},
{
"epoch": 1.152,
"grad_norm": 0.06751835346221924,
"learning_rate": 0.0013749692348812186,
"loss": 0.1906,
"step": 3600
},
{
"epoch": 1.216,
"grad_norm": 0.06137789785861969,
"learning_rate": 0.0013113983043011267,
"loss": 0.1906,
"step": 3800
},
{
"epoch": 1.28,
"grad_norm": 0.05203723534941673,
"learning_rate": 0.0012464007134864482,
"loss": 0.1883,
"step": 4000
},
{
"epoch": 1.28,
"eval_loss": 0.21353089809417725,
"eval_runtime": 18.5177,
"eval_samples_per_second": 54.596,
"eval_steps_per_second": 0.864,
"step": 4000
},
{
"epoch": 1.3439999999999999,
"grad_norm": 0.0589132197201252,
"learning_rate": 0.0011802742465833352,
"loss": 0.1902,
"step": 4200
},
{
"epoch": 1.408,
"grad_norm": 0.06806980073451996,
"learning_rate": 0.0011133218596435107,
"loss": 0.1883,
"step": 4400
},
{
"epoch": 1.44,
"eval_loss": 0.20915259420871735,
"eval_runtime": 18.5243,
"eval_samples_per_second": 54.577,
"eval_steps_per_second": 0.864,
"step": 4500
},
{
"epoch": 1.472,
"grad_norm": 0.06540437787771225,
"learning_rate": 0.0010458502926419136,
"loss": 0.189,
"step": 4600
},
{
"epoch": 1.536,
"grad_norm": 0.05099968612194061,
"learning_rate": 0.0009781686641584368,
"loss": 0.1862,
"step": 4800
},
{
"epoch": 1.6,
"grad_norm": 0.056332822889089584,
"learning_rate": 0.0009105870551621664,
"loss": 0.184,
"step": 5000
},
{
"epoch": 1.6,
"eval_loss": 0.20469947159290314,
"eval_runtime": 18.5065,
"eval_samples_per_second": 54.629,
"eval_steps_per_second": 0.865,
"step": 5000
},
{
"epoch": 1.6640000000000001,
"grad_norm": 0.04745101556181908,
"learning_rate": 0.0008434150883864713,
"loss": 0.1866,
"step": 5200
},
{
"epoch": 1.728,
"grad_norm": 0.04577454924583435,
"learning_rate": 0.0007769605098034851,
"loss": 0.186,
"step": 5400
},
{
"epoch": 1.76,
"eval_loss": 0.20063205063343048,
"eval_runtime": 18.5081,
"eval_samples_per_second": 54.625,
"eval_steps_per_second": 0.864,
"step": 5500
},
{
"epoch": 1.792,
"grad_norm": 0.04938381910324097,
"learning_rate": 0.0007115277786969001,
"loss": 0.1831,
"step": 5600
},
{
"epoch": 1.8559999999999999,
"grad_norm": 0.05956464633345604,
"learning_rate": 0.0006474166727926085,
"loss": 0.1804,
"step": 5800
},
{
"epoch": 1.92,
"grad_norm": 0.050873901695013046,
"learning_rate": 0.0005849209148377339,
"loss": 0.1808,
"step": 6000
},
{
"epoch": 1.92,
"eval_loss": 0.19810360670089722,
"eval_runtime": 22.7592,
"eval_samples_per_second": 44.422,
"eval_steps_per_second": 0.703,
"step": 6000
},
{
"epoch": 1.984,
"grad_norm": 0.09603903442621231,
"learning_rate": 0.0005243268269203323,
"loss": 0.1806,
"step": 6200
},
{
"epoch": 2.048,
"grad_norm": 0.05339692533016205,
"learning_rate": 0.0004659120186949479,
"loss": 0.1613,
"step": 6400
},
{
"epoch": 2.08,
"eval_loss": 0.1972031444311142,
"eval_runtime": 18.5168,
"eval_samples_per_second": 54.599,
"eval_steps_per_second": 0.864,
"step": 6500
},
{
"epoch": 2.112,
"grad_norm": 0.053911786526441574,
"learning_rate": 0.0004099441155238748,
"loss": 0.1544,
"step": 6600
},
{
"epoch": 2.176,
"grad_norm": 0.050456177443265915,
"learning_rate": 0.0003566795323610935,
"loss": 0.155,
"step": 6800
},
{
"epoch": 2.24,
"grad_norm": 0.05330171436071396,
"learning_rate": 0.0003063622989963002,
"loss": 0.1529,
"step": 7000
},
{
"epoch": 2.24,
"eval_loss": 0.1969524472951889,
"eval_runtime": 18.4963,
"eval_samples_per_second": 54.659,
"eval_steps_per_second": 0.865,
"step": 7000
},
{
"epoch": 2.304,
"grad_norm": 0.053924355655908585,
"learning_rate": 0.0002592229420411184,
"loss": 0.1545,
"step": 7200
},
{
"epoch": 2.368,
"grad_norm": 0.055782243609428406,
"learning_rate": 0.00021547742877964395,
"loss": 0.1569,
"step": 7400
},
{
"epoch": 2.4,
"eval_loss": 0.19416877627372742,
"eval_runtime": 18.4948,
"eval_samples_per_second": 54.664,
"eval_steps_per_second": 0.865,
"step": 7500
},
{
"epoch": 2.432,
"grad_norm": 0.05896177887916565,
"learning_rate": 0.00017532617772202807,
"loss": 0.1557,
"step": 7600
},
{
"epoch": 2.496,
"grad_norm": 0.05818909779191017,
"learning_rate": 0.0001389531403942159,
"loss": 0.1558,
"step": 7800
},
{
"epoch": 2.56,
"grad_norm": 0.05467315390706062,
"learning_rate": 0.00010652495857058375,
"loss": 0.1535,
"step": 8000
},
{
"epoch": 2.56,
"eval_loss": 0.19276997447013855,
"eval_runtime": 18.5042,
"eval_samples_per_second": 54.636,
"eval_steps_per_second": 0.865,
"step": 8000
},
{
"epoch": 2.624,
"grad_norm": 0.052459824830293655,
"learning_rate": 7.81902008105898e-05,
"loss": 0.1515,
"step": 8200
},
{
"epoch": 2.6879999999999997,
"grad_norm": 0.05594847351312637,
"learning_rate": 5.407868179721254e-05,
"loss": 0.1535,
"step": 8400
},
{
"epoch": 2.7199999999999998,
"eval_loss": 0.1920287013053894,
"eval_runtime": 18.5152,
"eval_samples_per_second": 54.604,
"eval_steps_per_second": 0.864,
"step": 8500
},
{
"epoch": 2.752,
"grad_norm": 0.054888200014829636,
"learning_rate": 3.430086759560602e-05,
"loss": 0.1503,
"step": 8600
},
{
"epoch": 2.816,
"grad_norm": 0.06011143699288368,
"learning_rate": 1.8947369556759353e-05,
"loss": 0.1535,
"step": 8800
},
{
"epoch": 2.88,
"grad_norm": 0.04984534904360771,
"learning_rate": 8.088529184821281e-06,
"loss": 0.1522,
"step": 9000
},
{
"epoch": 2.88,
"eval_loss": 0.19162563979625702,
"eval_runtime": 18.5125,
"eval_samples_per_second": 54.612,
"eval_steps_per_second": 0.864,
"step": 9000
},
{
"epoch": 2.944,
"grad_norm": 0.05723896995186806,
"learning_rate": 1.774095870004544e-06,
"loss": 0.1492,
"step": 9200
},
{
"epoch": 3.0,
"step": 9375,
"total_flos": 6.0970588176384e+18,
"train_loss": 0.19560041158040364,
"train_runtime": 8921.5527,
"train_samples_per_second": 33.626,
"train_steps_per_second": 1.051
}
],
"logging_steps": 200,
"max_steps": 9375,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 0,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 6.0970588176384e+18,
"train_batch_size": 32,
"trial_name": null,
"trial_params": null
}