Code-Autopsy / training_log.json
devanshty's picture
Upload training_log.json with huggingface_hub
428807e verified
Raw
History Blame Contribute Delete
20.3 kB
{
"best_global_step": 246,
"best_metric": 0.244215190410614,
"best_model_checkpoint": "C:\\Users\\Devansh Tyagi\\Desktop\\Projects\\Code-Autopsy\\checkpoints\\checkpoint-246",
"epoch": 3.0,
"eval_steps": 20,
"global_step": 246,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.2720158830285073,
"epoch": 0.06144393241167435,
"grad_norm": 0.2734375,
"learning_rate": 6.153846153846155e-05,
"loss": 2.1623348236083983,
"mean_token_accuracy": 0.6029356420040131,
"num_tokens": 7832.0,
"step": 5
},
{
"entropy": 1.2995335638523102,
"epoch": 0.1228878648233487,
"grad_norm": 0.435546875,
"learning_rate": 0.00013846153846153847,
"loss": 2.1435720443725588,
"mean_token_accuracy": 0.6072336934506893,
"num_tokens": 15169.0,
"step": 10
},
{
"entropy": 1.3567075744271277,
"epoch": 0.18433179723502305,
"grad_norm": 0.5703125,
"learning_rate": 0.00019999091026277928,
"loss": 1.8734064102172852,
"mean_token_accuracy": 0.6238010875880718,
"num_tokens": 22884.0,
"step": 15
},
{
"entropy": 1.5021331459283829,
"epoch": 0.2457757296466974,
"grad_norm": 0.59765625,
"learning_rate": 0.0001996729429353878,
"loss": 1.6023683547973633,
"mean_token_accuracy": 0.6496468104422093,
"num_tokens": 30047.0,
"step": 20
},
{
"epoch": 0.2457757296466974,
"eval_entropy": 1.4432531578900063,
"eval_loss": 1.3970026969909668,
"eval_mean_token_accuracy": 0.6886225922466958,
"eval_num_tokens": 30047.0,
"eval_runtime": 98.8045,
"eval_samples_per_second": 0.739,
"eval_steps_per_second": 0.739,
"step": 20
},
{
"entropy": 1.3366006165742874,
"epoch": 0.30721966205837176,
"grad_norm": 0.6171875,
"learning_rate": 0.00019890213986358148,
"loss": 1.2767066955566406,
"mean_token_accuracy": 0.7060731440782547,
"num_tokens": 37561.0,
"step": 25
},
{
"entropy": 0.8943048655986786,
"epoch": 0.3686635944700461,
"grad_norm": 0.69921875,
"learning_rate": 0.00019768200297248193,
"loss": 0.9884555816650391,
"mean_token_accuracy": 0.772250434756279,
"num_tokens": 45476.0,
"step": 30
},
{
"entropy": 0.6866158157587051,
"epoch": 0.43010752688172044,
"grad_norm": 0.734375,
"learning_rate": 0.00019601807560796713,
"loss": 0.7711129665374756,
"mean_token_accuracy": 0.8339575499296188,
"num_tokens": 53130.0,
"step": 35
},
{
"entropy": 0.6559636496007443,
"epoch": 0.4915514592933948,
"grad_norm": 0.86328125,
"learning_rate": 0.00019391791735205182,
"loss": 0.6632838726043702,
"mean_token_accuracy": 0.8613109961152077,
"num_tokens": 60631.0,
"step": 40
},
{
"epoch": 0.4915514592933948,
"eval_entropy": 0.5521646117510861,
"eval_loss": 0.630871057510376,
"eval_mean_token_accuracy": 0.8730851166868863,
"eval_num_tokens": 60631.0,
"eval_runtime": 97.1898,
"eval_samples_per_second": 0.751,
"eval_steps_per_second": 0.751,
"step": 40
},
{
"entropy": 0.5553950414061546,
"epoch": 0.5529953917050692,
"grad_norm": 0.68359375,
"learning_rate": 0.00019139106967807062,
"loss": 0.6109470844268798,
"mean_token_accuracy": 0.8708647087216377,
"num_tokens": 68147.0,
"step": 45
},
{
"entropy": 0.5107979021966458,
"epoch": 0.6144393241167435,
"grad_norm": 0.498046875,
"learning_rate": 0.0001884490126017005,
"loss": 0.5680758953094482,
"mean_token_accuracy": 0.8782492533326149,
"num_tokens": 75622.0,
"step": 50
},
{
"entropy": 0.5033965408802032,
"epoch": 0.6758832565284179,
"grad_norm": 0.50390625,
"learning_rate": 0.00018510511252476587,
"loss": 0.5488744735717773,
"mean_token_accuracy": 0.8770601689815521,
"num_tokens": 83564.0,
"step": 55
},
{
"entropy": 0.4694289192557335,
"epoch": 0.7373271889400922,
"grad_norm": 0.4375,
"learning_rate": 0.00018137456150878303,
"loss": 0.4926635265350342,
"mean_token_accuracy": 0.8881596863269806,
"num_tokens": 91409.0,
"step": 60
},
{
"epoch": 0.7373271889400922,
"eval_entropy": 0.4363853490515931,
"eval_loss": 0.46880096197128296,
"eval_mean_token_accuracy": 0.8960385273580682,
"eval_num_tokens": 91409.0,
"eval_runtime": 95.7743,
"eval_samples_per_second": 0.762,
"eval_steps_per_second": 0.762,
"step": 60
},
{
"entropy": 0.43721060529351236,
"epoch": 0.7987711213517665,
"grad_norm": 0.60546875,
"learning_rate": 0.00017727430825413792,
"loss": 0.4627737522125244,
"mean_token_accuracy": 0.9004349738359452,
"num_tokens": 98711.0,
"step": 65
},
{
"entropy": 0.4222001314163208,
"epoch": 0.8602150537634409,
"grad_norm": 0.66015625,
"learning_rate": 0.00017282298109847345,
"loss": 0.47431230545043945,
"mean_token_accuracy": 0.8917310431599617,
"num_tokens": 105785.0,
"step": 70
},
{
"entropy": 0.4233152411878109,
"epoch": 0.9216589861751152,
"grad_norm": 0.443359375,
"learning_rate": 0.00016804080338412108,
"loss": 0.4605244159698486,
"mean_token_accuracy": 0.902459979057312,
"num_tokens": 112840.0,
"step": 75
},
{
"entropy": 0.4323478534817696,
"epoch": 0.9831029185867896,
"grad_norm": 0.4453125,
"learning_rate": 0.00016294950157908132,
"loss": 0.44331941604614256,
"mean_token_accuracy": 0.897197200357914,
"num_tokens": 120233.0,
"step": 80
},
{
"epoch": 0.9831029185867896,
"eval_entropy": 0.4033231739312002,
"eval_loss": 0.39226189255714417,
"eval_mean_token_accuracy": 0.9040106412482588,
"eval_num_tokens": 120233.0,
"eval_runtime": 99.948,
"eval_samples_per_second": 0.73,
"eval_steps_per_second": 0.73,
"step": 80
},
{
"entropy": 0.4201068043708801,
"epoch": 1.0368663594470047,
"grad_norm": 0.5,
"learning_rate": 0.00015757220656897896,
"loss": 0.41355881690979,
"mean_token_accuracy": 0.9027445759092059,
"num_tokens": 126530.0,
"step": 85
},
{
"entropy": 0.3881114762276411,
"epoch": 1.098310291858679,
"grad_norm": 0.4609375,
"learning_rate": 0.00015193334856844528,
"loss": 0.3866158723831177,
"mean_token_accuracy": 0.9028143763542176,
"num_tokens": 134195.0,
"step": 90
},
{
"entropy": 0.37071702964603903,
"epoch": 1.1597542242703534,
"grad_norm": 0.58203125,
"learning_rate": 0.00014605854612936728,
"loss": 0.38562917709350586,
"mean_token_accuracy": 0.9037379220128059,
"num_tokens": 142095.0,
"step": 95
},
{
"entropy": 0.39508153647184374,
"epoch": 1.2211981566820276,
"grad_norm": 0.498046875,
"learning_rate": 0.00013997448975026382,
"loss": 0.37968151569366454,
"mean_token_accuracy": 0.902898819744587,
"num_tokens": 150281.0,
"step": 100
},
{
"epoch": 1.2211981566820276,
"eval_entropy": 0.3728377917041517,
"eval_loss": 0.32667699456214905,
"eval_mean_token_accuracy": 0.9168023311928527,
"eval_num_tokens": 150281.0,
"eval_runtime": 100.3144,
"eval_samples_per_second": 0.728,
"eval_steps_per_second": 0.728,
"step": 100
},
{
"entropy": 0.3990515094250441,
"epoch": 1.282642089093702,
"grad_norm": 0.498046875,
"learning_rate": 0.00013370882061557635,
"loss": 0.35355989933013915,
"mean_token_accuracy": 0.9085300818085671,
"num_tokens": 158311.0,
"step": 105
},
{
"entropy": 0.34259250313043593,
"epoch": 1.3440860215053765,
"grad_norm": 0.515625,
"learning_rate": 0.0001272900050157875,
"loss": 0.3187845706939697,
"mean_token_accuracy": 0.9141712740063668,
"num_tokens": 165531.0,
"step": 110
},
{
"entropy": 0.3513215810060501,
"epoch": 1.4055299539170507,
"grad_norm": 0.447265625,
"learning_rate": 0.00012074720501890484,
"loss": 0.34308681488037107,
"mean_token_accuracy": 0.9139169871807098,
"num_tokens": 172730.0,
"step": 115
},
{
"entropy": 0.3432418659329414,
"epoch": 1.466973886328725,
"grad_norm": 0.4609375,
"learning_rate": 0.00011411014598087644,
"loss": 0.3543131113052368,
"mean_token_accuracy": 0.9060193613171578,
"num_tokens": 180674.0,
"step": 120
},
{
"epoch": 1.466973886328725,
"eval_entropy": 0.3156628967964486,
"eval_loss": 0.28925180435180664,
"eval_mean_token_accuracy": 0.9195440672848323,
"eval_num_tokens": 180674.0,
"eval_runtime": 100.8258,
"eval_samples_per_second": 0.724,
"eval_steps_per_second": 0.724,
"step": 120
},
{
"entropy": 0.328844403848052,
"epoch": 1.5284178187403994,
"grad_norm": 0.6484375,
"learning_rate": 0.0001074089814968676,
"loss": 0.3134729862213135,
"mean_token_accuracy": 0.9172038078308106,
"num_tokens": 187909.0,
"step": 125
},
{
"entropy": 0.3347533904016018,
"epoch": 1.5898617511520738,
"grad_norm": 0.46484375,
"learning_rate": 0.0001006741564069543,
"loss": 0.32318768501281736,
"mean_token_accuracy": 0.915935255587101,
"num_tokens": 195418.0,
"step": 130
},
{
"entropy": 0.31085881143808364,
"epoch": 1.651305683563748,
"grad_norm": 0.6953125,
"learning_rate": 9.393626847862763e-05,
"loss": 0.28849263191223146,
"mean_token_accuracy": 0.9287568554282188,
"num_tokens": 202302.0,
"step": 135
},
{
"entropy": 0.36759571749716996,
"epoch": 1.7127496159754223,
"grad_norm": 0.5546875,
"learning_rate": 8.722592939451625e-05,
"loss": 0.3258425951004028,
"mean_token_accuracy": 0.9135418727993965,
"num_tokens": 210159.0,
"step": 140
},
{
"epoch": 1.7127496159754223,
"eval_entropy": 0.2999503336948891,
"eval_loss": 0.2642817199230194,
"eval_mean_token_accuracy": 0.9280164380596109,
"eval_num_tokens": 210159.0,
"eval_runtime": 95.0047,
"eval_samples_per_second": 0.768,
"eval_steps_per_second": 0.768,
"step": 140
},
{
"entropy": 0.2923012483865023,
"epoch": 1.7741935483870968,
"grad_norm": 0.470703125,
"learning_rate": 8.057362567688942e-05,
"loss": 0.28111426830291747,
"mean_token_accuracy": 0.9294544145464897,
"num_tokens": 217668.0,
"step": 145
},
{
"entropy": 0.3098321039229631,
"epoch": 1.8356374807987712,
"grad_norm": 0.400390625,
"learning_rate": 7.400958018079008e-05,
"loss": 0.2959801197052002,
"mean_token_accuracy": 0.9246162533760071,
"num_tokens": 224914.0,
"step": 150
},
{
"entropy": 0.30831411490216853,
"epoch": 1.8970814132104454,
"grad_norm": 0.435546875,
"learning_rate": 6.756361478506578e-05,
"loss": 0.3086764097213745,
"mean_token_accuracy": 0.9224985137581825,
"num_tokens": 232318.0,
"step": 155
},
{
"entropy": 0.29551686625927687,
"epoch": 1.9585253456221197,
"grad_norm": 0.58203125,
"learning_rate": 6.1265014905121e-05,
"loss": 0.2773712635040283,
"mean_token_accuracy": 0.9252645134925842,
"num_tokens": 239672.0,
"step": 160
},
{
"epoch": 1.9585253456221197,
"eval_entropy": 0.26235738804895586,
"eval_loss": 0.25179651379585266,
"eval_mean_token_accuracy": 0.9296977715949489,
"eval_num_tokens": 239672.0,
"eval_runtime": 95.912,
"eval_samples_per_second": 0.761,
"eval_steps_per_second": 0.761,
"step": 160
},
{
"entropy": 0.26158358571784834,
"epoch": 2.0122887864823347,
"grad_norm": 0.4140625,
"learning_rate": 5.5142396442938795e-05,
"loss": 0.24724166393280028,
"mean_token_accuracy": 0.9323797225952148,
"num_tokens": 246006.0,
"step": 165
},
{
"entropy": 0.2724688397720456,
"epoch": 2.0737327188940093,
"grad_norm": 0.61328125,
"learning_rate": 4.9223575778847085e-05,
"loss": 0.2526975393295288,
"mean_token_accuracy": 0.9308534324169159,
"num_tokens": 253437.0,
"step": 170
},
{
"entropy": 0.2712310256436467,
"epoch": 2.1351766513056836,
"grad_norm": 0.439453125,
"learning_rate": 4.353544339568448e-05,
"loss": 0.2677891254425049,
"mean_token_accuracy": 0.9274151250720024,
"num_tokens": 260911.0,
"step": 175
},
{
"entropy": 0.2781375008635223,
"epoch": 2.196620583717358,
"grad_norm": 0.55078125,
"learning_rate": 3.8103841709519084e-05,
"loss": 0.29916017055511473,
"mean_token_accuracy": 0.9209732711315155,
"num_tokens": 268425.0,
"step": 180
},
{
"epoch": 2.196620583717358,
"eval_entropy": 0.2463044097570524,
"eval_loss": 0.24747803807258606,
"eval_mean_token_accuracy": 0.930726853135514,
"eval_num_tokens": 268425.0,
"eval_runtime": 95.1097,
"eval_samples_per_second": 0.768,
"eval_steps_per_second": 0.768,
"step": 180
},
{
"entropy": 0.2690023283474147,
"epoch": 2.258064516129032,
"grad_norm": 0.4765625,
"learning_rate": 3.29534476619609e-05,
"loss": 0.27658329010009763,
"mean_token_accuracy": 0.9289590641856194,
"num_tokens": 275782.0,
"step": 185
},
{
"entropy": 0.2697915196418762,
"epoch": 2.3195084485407067,
"grad_norm": 0.44921875,
"learning_rate": 2.8107660607477328e-05,
"loss": 0.28579936027526853,
"mean_token_accuracy": 0.9249747917056084,
"num_tokens": 283440.0,
"step": 190
},
{
"entropy": 0.28678075782954693,
"epoch": 2.380952380952381,
"grad_norm": 0.5078125,
"learning_rate": 2.3588496005063287e-05,
"loss": 0.300011134147644,
"mean_token_accuracy": 0.9201881185173988,
"num_tokens": 290391.0,
"step": 195
},
{
"entropy": 0.2683371202088892,
"epoch": 2.442396313364055,
"grad_norm": 0.49609375,
"learning_rate": 1.9416485397247795e-05,
"loss": 0.26392982006072996,
"mean_token_accuracy": 0.9297228127717971,
"num_tokens": 298116.0,
"step": 200
},
{
"epoch": 2.442396313364055,
"eval_entropy": 0.24947702108997188,
"eval_loss": 0.24490928649902344,
"eval_mean_token_accuracy": 0.931492513989749,
"eval_num_tokens": 298116.0,
"eval_runtime": 96.5333,
"eval_samples_per_second": 0.756,
"eval_steps_per_second": 0.756,
"step": 200
},
{
"entropy": 0.27692094454541805,
"epoch": 2.50384024577573,
"grad_norm": 0.396484375,
"learning_rate": 1.5610583130854128e-05,
"loss": 0.2804937601089478,
"mean_token_accuracy": 0.922454084455967,
"num_tokens": 305768.0,
"step": 205
},
{
"entropy": 0.29743164833635094,
"epoch": 2.565284178187404,
"grad_norm": 0.396484375,
"learning_rate": 1.2188080243301437e-05,
"loss": 0.29574849605560305,
"mean_token_accuracy": 0.9198502600193024,
"num_tokens": 313660.0,
"step": 210
},
{
"entropy": 0.2640182925388217,
"epoch": 2.6267281105990783,
"grad_norm": 0.49609375,
"learning_rate": 9.164525905680709e-06,
"loss": 0.25743927955627444,
"mean_token_accuracy": 0.9311310544610023,
"num_tokens": 320841.0,
"step": 215
},
{
"entropy": 0.27618018090724944,
"epoch": 2.688172043010753,
"grad_norm": 0.51953125,
"learning_rate": 6.553656779506468e-06,
"loss": 0.2789269685745239,
"mean_token_accuracy": 0.9260447949171067,
"num_tokens": 328470.0,
"step": 220
},
{
"epoch": 2.688172043010753,
"eval_entropy": 0.24862186620904975,
"eval_loss": 0.24429786205291748,
"eval_mean_token_accuracy": 0.9314827543415435,
"eval_num_tokens": 328470.0,
"eval_runtime": 93.481,
"eval_samples_per_second": 0.781,
"eval_steps_per_second": 0.781,
"step": 220
},
{
"entropy": 0.2760592779144645,
"epoch": 2.749615975422427,
"grad_norm": 0.40625,
"learning_rate": 4.367334608091389e-06,
"loss": 0.29435703754425047,
"mean_token_accuracy": 0.9220241814851761,
"num_tokens": 336107.0,
"step": 225
},
{
"entropy": 0.2630997773259878,
"epoch": 2.8110599078341014,
"grad_norm": 0.466796875,
"learning_rate": 2.6154923260801934e-06,
"loss": 0.2583890914916992,
"mean_token_accuracy": 0.9310009226202964,
"num_tokens": 343384.0,
"step": 230
},
{
"entropy": 0.28990690847858785,
"epoch": 2.8725038402457757,
"grad_norm": 0.390625,
"learning_rate": 1.3060889319784885e-06,
"loss": 0.2960776090621948,
"mean_token_accuracy": 0.9223004102706909,
"num_tokens": 351180.0,
"step": 235
},
{
"entropy": 0.2609599939547479,
"epoch": 2.93394777265745,
"grad_norm": 0.388671875,
"learning_rate": 4.4507332870059594e-07,
"loss": 0.25511951446533204,
"mean_token_accuracy": 0.9273923814296723,
"num_tokens": 359106.0,
"step": 240
},
{
"epoch": 2.93394777265745,
"eval_entropy": 0.24859930197261784,
"eval_loss": 0.24424654245376587,
"eval_mean_token_accuracy": 0.9321725441984934,
"eval_num_tokens": 359106.0,
"eval_runtime": 96.2762,
"eval_samples_per_second": 0.758,
"eval_steps_per_second": 0.758,
"step": 240
},
{
"entropy": 0.2684542080387473,
"epoch": 2.9953917050691246,
"grad_norm": 0.390625,
"learning_rate": 3.635729641654484e-08,
"loss": 0.2732724666595459,
"mean_token_accuracy": 0.9262633189558983,
"num_tokens": 366418.0,
"step": 245
},
{
"epoch": 3.0,
"eval_entropy": 0.24880487002330284,
"eval_loss": 0.244215190410614,
"eval_mean_token_accuracy": 0.9320176945973749,
"eval_num_tokens": 366954.0,
"eval_runtime": 94.6685,
"eval_samples_per_second": 0.771,
"eval_steps_per_second": 0.771,
"step": 246
}
],
"logging_steps": 5,
"max_steps": 246,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 20,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.5578662344763392e+16,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}