| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 3.0, |
| "eval_steps": 500, |
| "global_step": 9375, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.064, |
| "grad_norm": 0.24448873102664948, |
| "learning_rate": 0.00199936844222861, |
| "loss": 0.3757, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.128, |
| "grad_norm": 0.25495460629463196, |
| "learning_rate": 0.0019946753128925747, |
| "loss": 0.3045, |
| "step": 400 |
| }, |
| { |
| "epoch": 0.16, |
| "eval_loss": 0.2806861102581024, |
| "eval_runtime": 18.6896, |
| "eval_samples_per_second": 54.094, |
| "eval_steps_per_second": 0.856, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.192, |
| "grad_norm": 0.12310587614774704, |
| "learning_rate": 0.001985425114055429, |
| "loss": 0.2727, |
| "step": 600 |
| }, |
| { |
| "epoch": 0.256, |
| "grad_norm": 0.15234604477882385, |
| "learning_rate": 0.0019716602251735175, |
| "loss": 0.2555, |
| "step": 800 |
| }, |
| { |
| "epoch": 0.32, |
| "grad_norm": 0.10114556550979614, |
| "learning_rate": 0.001953443709594746, |
| "loss": 0.2475, |
| "step": 1000 |
| }, |
| { |
| "epoch": 0.32, |
| "eval_loss": 0.25135913491249084, |
| "eval_runtime": 18.5064, |
| "eval_samples_per_second": 54.63, |
| "eval_steps_per_second": 0.865, |
| "step": 1000 |
| }, |
| { |
| "epoch": 0.384, |
| "grad_norm": 0.09664544463157654, |
| "learning_rate": 0.0019308590256360988, |
| "loss": 0.2449, |
| "step": 1200 |
| }, |
| { |
| "epoch": 0.448, |
| "grad_norm": 0.09191286563873291, |
| "learning_rate": 0.0019040096442223358, |
| "loss": 0.2387, |
| "step": 1400 |
| }, |
| { |
| "epoch": 0.48, |
| "eval_loss": 0.24170711636543274, |
| "eval_runtime": 18.503, |
| "eval_samples_per_second": 54.64, |
| "eval_steps_per_second": 0.865, |
| "step": 1500 |
| }, |
| { |
| "epoch": 0.512, |
| "grad_norm": 0.08609094470739365, |
| "learning_rate": 0.0018730185748376353, |
| "loss": 0.2332, |
| "step": 1600 |
| }, |
| { |
| "epoch": 0.576, |
| "grad_norm": 0.08084086328744888, |
| "learning_rate": 0.0018380278019620281, |
| "loss": 0.2295, |
| "step": 1800 |
| }, |
| { |
| "epoch": 0.64, |
| "grad_norm": 0.08400174230337143, |
| "learning_rate": 0.0017991976345745596, |
| "loss": 0.2278, |
| "step": 2000 |
| }, |
| { |
| "epoch": 0.64, |
| "eval_loss": 0.22995951771736145, |
| "eval_runtime": 18.5154, |
| "eval_samples_per_second": 54.603, |
| "eval_steps_per_second": 0.864, |
| "step": 2000 |
| }, |
| { |
| "epoch": 0.704, |
| "grad_norm": 0.06514922529459, |
| "learning_rate": 0.0017567059717034153, |
| "loss": 0.2236, |
| "step": 2200 |
| }, |
| { |
| "epoch": 0.768, |
| "grad_norm": 0.061288416385650635, |
| "learning_rate": 0.0017107474873878648, |
| "loss": 0.2217, |
| "step": 2400 |
| }, |
| { |
| "epoch": 0.8, |
| "eval_loss": 0.2240372747182846, |
| "eval_runtime": 18.5034, |
| "eval_samples_per_second": 54.639, |
| "eval_steps_per_second": 0.865, |
| "step": 2500 |
| }, |
| { |
| "epoch": 0.832, |
| "grad_norm": 0.0703856498003006, |
| "learning_rate": 0.0016615327387860851, |
| "loss": 0.2195, |
| "step": 2600 |
| }, |
| { |
| "epoch": 0.896, |
| "grad_norm": 0.06190377473831177, |
| "learning_rate": 0.001609287201515044, |
| "loss": 0.2192, |
| "step": 2800 |
| }, |
| { |
| "epoch": 0.96, |
| "grad_norm": 0.058891598135232925, |
| "learning_rate": 0.0015542502366419986, |
| "loss": 0.2119, |
| "step": 3000 |
| }, |
| { |
| "epoch": 0.96, |
| "eval_loss": 0.21980270743370056, |
| "eval_runtime": 18.5017, |
| "eval_samples_per_second": 54.644, |
| "eval_steps_per_second": 0.865, |
| "step": 3000 |
| }, |
| { |
| "epoch": 1.024, |
| "grad_norm": 0.08175381273031235, |
| "learning_rate": 0.001496673994060291, |
| "loss": 0.2067, |
| "step": 3200 |
| }, |
| { |
| "epoch": 1.088, |
| "grad_norm": 0.058054033666849136, |
| "learning_rate": 0.0014368222572736001, |
| "loss": 0.1904, |
| "step": 3400 |
| }, |
| { |
| "epoch": 1.12, |
| "eval_loss": 0.21591630578041077, |
| "eval_runtime": 18.5104, |
| "eval_samples_per_second": 54.618, |
| "eval_steps_per_second": 0.864, |
| "step": 3500 |
| }, |
| { |
| "epoch": 1.152, |
| "grad_norm": 0.06751835346221924, |
| "learning_rate": 0.0013749692348812186, |
| "loss": 0.1906, |
| "step": 3600 |
| }, |
| { |
| "epoch": 1.216, |
| "grad_norm": 0.06137789785861969, |
| "learning_rate": 0.0013113983043011267, |
| "loss": 0.1906, |
| "step": 3800 |
| }, |
| { |
| "epoch": 1.28, |
| "grad_norm": 0.05203723534941673, |
| "learning_rate": 0.0012464007134864482, |
| "loss": 0.1883, |
| "step": 4000 |
| }, |
| { |
| "epoch": 1.28, |
| "eval_loss": 0.21353089809417725, |
| "eval_runtime": 18.5177, |
| "eval_samples_per_second": 54.596, |
| "eval_steps_per_second": 0.864, |
| "step": 4000 |
| }, |
| { |
| "epoch": 1.3439999999999999, |
| "grad_norm": 0.0589132197201252, |
| "learning_rate": 0.0011802742465833352, |
| "loss": 0.1902, |
| "step": 4200 |
| }, |
| { |
| "epoch": 1.408, |
| "grad_norm": 0.06806980073451996, |
| "learning_rate": 0.0011133218596435107, |
| "loss": 0.1883, |
| "step": 4400 |
| }, |
| { |
| "epoch": 1.44, |
| "eval_loss": 0.20915259420871735, |
| "eval_runtime": 18.5243, |
| "eval_samples_per_second": 54.577, |
| "eval_steps_per_second": 0.864, |
| "step": 4500 |
| }, |
| { |
| "epoch": 1.472, |
| "grad_norm": 0.06540437787771225, |
| "learning_rate": 0.0010458502926419136, |
| "loss": 0.189, |
| "step": 4600 |
| }, |
| { |
| "epoch": 1.536, |
| "grad_norm": 0.05099968612194061, |
| "learning_rate": 0.0009781686641584368, |
| "loss": 0.1862, |
| "step": 4800 |
| }, |
| { |
| "epoch": 1.6, |
| "grad_norm": 0.056332822889089584, |
| "learning_rate": 0.0009105870551621664, |
| "loss": 0.184, |
| "step": 5000 |
| }, |
| { |
| "epoch": 1.6, |
| "eval_loss": 0.20469947159290314, |
| "eval_runtime": 18.5065, |
| "eval_samples_per_second": 54.629, |
| "eval_steps_per_second": 0.865, |
| "step": 5000 |
| }, |
| { |
| "epoch": 1.6640000000000001, |
| "grad_norm": 0.04745101556181908, |
| "learning_rate": 0.0008434150883864713, |
| "loss": 0.1866, |
| "step": 5200 |
| }, |
| { |
| "epoch": 1.728, |
| "grad_norm": 0.04577454924583435, |
| "learning_rate": 0.0007769605098034851, |
| "loss": 0.186, |
| "step": 5400 |
| }, |
| { |
| "epoch": 1.76, |
| "eval_loss": 0.20063205063343048, |
| "eval_runtime": 18.5081, |
| "eval_samples_per_second": 54.625, |
| "eval_steps_per_second": 0.864, |
| "step": 5500 |
| }, |
| { |
| "epoch": 1.792, |
| "grad_norm": 0.04938381910324097, |
| "learning_rate": 0.0007115277786969001, |
| "loss": 0.1831, |
| "step": 5600 |
| }, |
| { |
| "epoch": 1.8559999999999999, |
| "grad_norm": 0.05956464633345604, |
| "learning_rate": 0.0006474166727926085, |
| "loss": 0.1804, |
| "step": 5800 |
| }, |
| { |
| "epoch": 1.92, |
| "grad_norm": 0.050873901695013046, |
| "learning_rate": 0.0005849209148377339, |
| "loss": 0.1808, |
| "step": 6000 |
| }, |
| { |
| "epoch": 1.92, |
| "eval_loss": 0.19810360670089722, |
| "eval_runtime": 22.7592, |
| "eval_samples_per_second": 44.422, |
| "eval_steps_per_second": 0.703, |
| "step": 6000 |
| }, |
| { |
| "epoch": 1.984, |
| "grad_norm": 0.09603903442621231, |
| "learning_rate": 0.0005243268269203323, |
| "loss": 0.1806, |
| "step": 6200 |
| }, |
| { |
| "epoch": 2.048, |
| "grad_norm": 0.05339692533016205, |
| "learning_rate": 0.0004659120186949479, |
| "loss": 0.1613, |
| "step": 6400 |
| }, |
| { |
| "epoch": 2.08, |
| "eval_loss": 0.1972031444311142, |
| "eval_runtime": 18.5168, |
| "eval_samples_per_second": 54.599, |
| "eval_steps_per_second": 0.864, |
| "step": 6500 |
| }, |
| { |
| "epoch": 2.112, |
| "grad_norm": 0.053911786526441574, |
| "learning_rate": 0.0004099441155238748, |
| "loss": 0.1544, |
| "step": 6600 |
| }, |
| { |
| "epoch": 2.176, |
| "grad_norm": 0.050456177443265915, |
| "learning_rate": 0.0003566795323610935, |
| "loss": 0.155, |
| "step": 6800 |
| }, |
| { |
| "epoch": 2.24, |
| "grad_norm": 0.05330171436071396, |
| "learning_rate": 0.0003063622989963002, |
| "loss": 0.1529, |
| "step": 7000 |
| }, |
| { |
| "epoch": 2.24, |
| "eval_loss": 0.1969524472951889, |
| "eval_runtime": 18.4963, |
| "eval_samples_per_second": 54.659, |
| "eval_steps_per_second": 0.865, |
| "step": 7000 |
| }, |
| { |
| "epoch": 2.304, |
| "grad_norm": 0.053924355655908585, |
| "learning_rate": 0.0002592229420411184, |
| "loss": 0.1545, |
| "step": 7200 |
| }, |
| { |
| "epoch": 2.368, |
| "grad_norm": 0.055782243609428406, |
| "learning_rate": 0.00021547742877964395, |
| "loss": 0.1569, |
| "step": 7400 |
| }, |
| { |
| "epoch": 2.4, |
| "eval_loss": 0.19416877627372742, |
| "eval_runtime": 18.4948, |
| "eval_samples_per_second": 54.664, |
| "eval_steps_per_second": 0.865, |
| "step": 7500 |
| }, |
| { |
| "epoch": 2.432, |
| "grad_norm": 0.05896177887916565, |
| "learning_rate": 0.00017532617772202807, |
| "loss": 0.1557, |
| "step": 7600 |
| }, |
| { |
| "epoch": 2.496, |
| "grad_norm": 0.05818909779191017, |
| "learning_rate": 0.0001389531403942159, |
| "loss": 0.1558, |
| "step": 7800 |
| }, |
| { |
| "epoch": 2.56, |
| "grad_norm": 0.05467315390706062, |
| "learning_rate": 0.00010652495857058375, |
| "loss": 0.1535, |
| "step": 8000 |
| }, |
| { |
| "epoch": 2.56, |
| "eval_loss": 0.19276997447013855, |
| "eval_runtime": 18.5042, |
| "eval_samples_per_second": 54.636, |
| "eval_steps_per_second": 0.865, |
| "step": 8000 |
| }, |
| { |
| "epoch": 2.624, |
| "grad_norm": 0.052459824830293655, |
| "learning_rate": 7.81902008105898e-05, |
| "loss": 0.1515, |
| "step": 8200 |
| }, |
| { |
| "epoch": 2.6879999999999997, |
| "grad_norm": 0.05594847351312637, |
| "learning_rate": 5.407868179721254e-05, |
| "loss": 0.1535, |
| "step": 8400 |
| }, |
| { |
| "epoch": 2.7199999999999998, |
| "eval_loss": 0.1920287013053894, |
| "eval_runtime": 18.5152, |
| "eval_samples_per_second": 54.604, |
| "eval_steps_per_second": 0.864, |
| "step": 8500 |
| }, |
| { |
| "epoch": 2.752, |
| "grad_norm": 0.054888200014829636, |
| "learning_rate": 3.430086759560602e-05, |
| "loss": 0.1503, |
| "step": 8600 |
| }, |
| { |
| "epoch": 2.816, |
| "grad_norm": 0.06011143699288368, |
| "learning_rate": 1.8947369556759353e-05, |
| "loss": 0.1535, |
| "step": 8800 |
| }, |
| { |
| "epoch": 2.88, |
| "grad_norm": 0.04984534904360771, |
| "learning_rate": 8.088529184821281e-06, |
| "loss": 0.1522, |
| "step": 9000 |
| }, |
| { |
| "epoch": 2.88, |
| "eval_loss": 0.19162563979625702, |
| "eval_runtime": 18.5125, |
| "eval_samples_per_second": 54.612, |
| "eval_steps_per_second": 0.864, |
| "step": 9000 |
| }, |
| { |
| "epoch": 2.944, |
| "grad_norm": 0.05723896995186806, |
| "learning_rate": 1.774095870004544e-06, |
| "loss": 0.1492, |
| "step": 9200 |
| }, |
| { |
| "epoch": 3.0, |
| "step": 9375, |
| "total_flos": 6.0970588176384e+18, |
| "train_loss": 0.19560041158040364, |
| "train_runtime": 8921.5527, |
| "train_samples_per_second": 33.626, |
| "train_steps_per_second": 1.051 |
| } |
| ], |
| "logging_steps": 200, |
| "max_steps": 9375, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 3, |
| "save_steps": 0, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 6.0970588176384e+18, |
| "train_batch_size": 32, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|