{
  "best_global_step": null,
  "best_metric": null,
  "best_model_checkpoint": null,
  "epoch": 1.0,
  "eval_steps": 500,
  "global_step": 6100,
  "is_hyper_param_search": false,
  "is_local_process_zero": true,
  "is_world_process_zero": true,
  "log_history": [
    {
      "epoch": 0.01639344262295082,
      "grad_norm": 0.80078125,
      "learning_rate": 1.6229508196721314e-06,
      "loss": 0.1011,
      "step": 100
    },
    {
      "epoch": 0.03278688524590164,
      "grad_norm": 0.703125,
      "learning_rate": 3.2622950819672133e-06,
      "loss": 0.1136,
      "step": 200
    },
    {
      "epoch": 0.04918032786885246,
      "grad_norm": 0.318359375,
      "learning_rate": 4.901639344262296e-06,
      "loss": 0.1236,
      "step": 300
    },
    {
      "epoch": 0.06557377049180328,
      "grad_norm": 0.43359375,
      "learning_rate": 6.540983606557377e-06,
      "loss": 0.1187,
      "step": 400
    },
    {
      "epoch": 0.08196721311475409,
      "grad_norm": 0.0,
      "learning_rate": 8.180327868852461e-06,
      "loss": 0.1012,
      "step": 500
    },
    {
      "epoch": 0.09836065573770492,
      "grad_norm": 0.93359375,
      "learning_rate": 9.819672131147541e-06,
      "loss": 0.1092,
      "step": 600
    },
    {
      "epoch": 0.11475409836065574,
      "grad_norm": 0.08447265625,
      "learning_rate": 9.837887067395265e-06,
      "loss": 0.1213,
      "step": 700
    },
    {
      "epoch": 0.13114754098360656,
      "grad_norm": 0.85546875,
      "learning_rate": 9.655737704918033e-06,
      "loss": 0.1127,
      "step": 800
    },
    {
      "epoch": 0.14754098360655737,
      "grad_norm": 0.050048828125,
      "learning_rate": 9.473588342440803e-06,
      "loss": 0.1237,
      "step": 900
    },
    {
      "epoch": 0.16393442622950818,
      "grad_norm": 0.095703125,
      "learning_rate": 9.29143897996357e-06,
      "loss": 0.1326,
      "step": 1000
    },
    {
      "epoch": 0.18032786885245902,
      "grad_norm": 0.58984375,
      "learning_rate": 9.10928961748634e-06,
      "loss": 0.1072,
      "step": 1100
    },
    {
      "epoch": 0.19672131147540983,
      "grad_norm": 0.006866455078125,
      "learning_rate": 8.927140255009109e-06,
      "loss": 0.0989,
      "step": 1200
    },
    {
      "epoch": 0.21311475409836064,
      "grad_norm": 0.232421875,
      "learning_rate": 8.744990892531877e-06,
      "loss": 0.1135,
      "step": 1300
    },
    {
      "epoch": 0.22950819672131148,
      "grad_norm": 1.015625,
      "learning_rate": 8.562841530054646e-06,
      "loss": 0.1074,
      "step": 1400
    },
    {
      "epoch": 0.2459016393442623,
      "grad_norm": 0.37109375,
      "learning_rate": 8.380692167577414e-06,
      "loss": 0.0975,
      "step": 1500
    },
    {
      "epoch": 0.26229508196721313,
      "grad_norm": 1.53125,
      "learning_rate": 8.198542805100183e-06,
      "loss": 0.1077,
      "step": 1600
    },
    {
      "epoch": 0.2786885245901639,
      "grad_norm": 1.015625,
      "learning_rate": 8.016393442622951e-06,
      "loss": 0.1008,
      "step": 1700
    },
    {
      "epoch": 0.29508196721311475,
      "grad_norm": 0.59765625,
      "learning_rate": 7.83424408014572e-06,
      "loss": 0.1151,
      "step": 1800
    },
    {
      "epoch": 0.3114754098360656,
      "grad_norm": 1.1328125,
      "learning_rate": 7.65209471766849e-06,
      "loss": 0.1037,
      "step": 1900
    },
    {
      "epoch": 0.32786885245901637,
      "grad_norm": 0.83203125,
      "learning_rate": 7.469945355191257e-06,
      "loss": 0.1066,
      "step": 2000
    },
    {
      "epoch": 0.3442622950819672,
      "grad_norm": 0.00189971923828125,
      "learning_rate": 7.2877959927140265e-06,
      "loss": 0.0981,
      "step": 2100
    },
    {
      "epoch": 0.36065573770491804,
      "grad_norm": 0.5390625,
      "learning_rate": 7.105646630236794e-06,
      "loss": 0.1135,
      "step": 2200
    },
    {
      "epoch": 0.3770491803278688,
      "grad_norm": 0.00775146484375,
      "learning_rate": 6.9234972677595635e-06,
      "loss": 0.1026,
      "step": 2300
    },
    {
      "epoch": 0.39344262295081966,
      "grad_norm": 0.2890625,
      "learning_rate": 6.741347905282332e-06,
      "loss": 0.0943,
      "step": 2400
    },
    {
      "epoch": 0.4098360655737705,
      "grad_norm": 0.578125,
      "learning_rate": 6.5591985428051e-06,
      "loss": 0.0904,
      "step": 2500
    },
    {
      "epoch": 0.4262295081967213,
      "grad_norm": 2.339482307434082e-06,
      "learning_rate": 6.377049180327869e-06,
      "loss": 0.0993,
      "step": 2600
    },
    {
      "epoch": 0.4426229508196721,
      "grad_norm": 0.25,
      "learning_rate": 6.194899817850638e-06,
      "loss": 0.0905,
      "step": 2700
    },
    {
      "epoch": 0.45901639344262296,
      "grad_norm": 0.61328125,
      "learning_rate": 6.012750455373406e-06,
      "loss": 0.1051,
      "step": 2800
    },
    {
      "epoch": 0.47540983606557374,
      "grad_norm": 0.1943359375,
      "learning_rate": 5.830601092896175e-06,
      "loss": 0.0936,
      "step": 2900
    },
    {
      "epoch": 0.4918032786885246,
      "grad_norm": 1.2421875,
      "learning_rate": 5.648451730418944e-06,
      "loss": 0.0866,
      "step": 3000
    },
    {
      "epoch": 0.5081967213114754,
      "grad_norm": 0.38671875,
      "learning_rate": 5.466302367941713e-06,
      "loss": 0.1012,
      "step": 3100
    },
    {
      "epoch": 0.5245901639344263,
      "grad_norm": 0.00167083740234375,
      "learning_rate": 5.284153005464482e-06,
      "loss": 0.0929,
      "step": 3200
    },
    {
      "epoch": 0.5409836065573771,
      "grad_norm": 0.69140625,
      "learning_rate": 5.10200364298725e-06,
      "loss": 0.1015,
      "step": 3300
    },
    {
      "epoch": 0.5573770491803278,
      "grad_norm": 0.859375,
      "learning_rate": 4.919854280510018e-06,
      "loss": 0.0841,
      "step": 3400
    },
    {
      "epoch": 0.5737704918032787,
      "grad_norm": 0.2294921875,
      "learning_rate": 4.737704918032788e-06,
      "loss": 0.0975,
      "step": 3500
    },
    {
      "epoch": 0.5901639344262295,
      "grad_norm": 0.478515625,
      "learning_rate": 4.555555555555556e-06,
      "loss": 0.1009,
      "step": 3600
    },
    {
      "epoch": 0.6065573770491803,
      "grad_norm": 0.447265625,
      "learning_rate": 4.3734061930783245e-06,
      "loss": 0.0957,
      "step": 3700
    },
    {
      "epoch": 0.6229508196721312,
      "grad_norm": 0.96484375,
      "learning_rate": 4.191256830601093e-06,
      "loss": 0.089,
      "step": 3800
    },
    {
      "epoch": 0.639344262295082,
      "grad_norm": 0.439453125,
      "learning_rate": 4.0091074681238615e-06,
      "loss": 0.0834,
      "step": 3900
    },
    {
      "epoch": 0.6557377049180327,
      "grad_norm": 0.66796875,
      "learning_rate": 3.826958105646631e-06,
      "loss": 0.0794,
      "step": 4000
    },
    {
      "epoch": 0.6721311475409836,
      "grad_norm": 0.1123046875,
      "learning_rate": 3.644808743169399e-06,
      "loss": 0.0935,
      "step": 4100
    },
    {
      "epoch": 0.6885245901639344,
      "grad_norm": 0.12158203125,
      "learning_rate": 3.4626593806921677e-06,
      "loss": 0.0903,
      "step": 4200
    },
    {
      "epoch": 0.7049180327868853,
      "grad_norm": 0.057373046875,
      "learning_rate": 3.280510018214936e-06,
      "loss": 0.0916,
      "step": 4300
    },
    {
      "epoch": 0.7213114754098361,
      "grad_norm": 1.78125,
      "learning_rate": 3.098360655737705e-06,
      "loss": 0.0905,
      "step": 4400
    },
    {
      "epoch": 0.7377049180327869,
      "grad_norm": 0.703125,
      "learning_rate": 2.9162112932604736e-06,
      "loss": 0.0906,
      "step": 4500
    },
    {
      "epoch": 0.7540983606557377,
      "grad_norm": 0.4140625,
      "learning_rate": 2.734061930783242e-06,
      "loss": 0.0996,
      "step": 4600
    },
    {
      "epoch": 0.7704918032786885,
      "grad_norm": 0.7734375,
      "learning_rate": 2.551912568306011e-06,
      "loss": 0.0837,
      "step": 4700
    },
    {
      "epoch": 0.7868852459016393,
      "grad_norm": 1.1171875,
      "learning_rate": 2.36976320582878e-06,
      "loss": 0.0906,
      "step": 4800
    },
    {
      "epoch": 0.8032786885245902,
      "grad_norm": 1.8359375,
      "learning_rate": 2.1876138433515483e-06,
      "loss": 0.0817,
      "step": 4900
    },
    {
      "epoch": 0.819672131147541,
      "grad_norm": 0.890625,
      "learning_rate": 2.005464480874317e-06,
      "loss": 0.1076,
      "step": 5000
    },
    {
      "epoch": 0.8360655737704918,
      "grad_norm": 0.1396484375,
      "learning_rate": 1.8233151183970856e-06,
      "loss": 0.0931,
      "step": 5100
    },
    {
      "epoch": 0.8524590163934426,
      "grad_norm": 0.81640625,
      "learning_rate": 1.6411657559198543e-06,
      "loss": 0.0744,
      "step": 5200
    },
    {
      "epoch": 0.8688524590163934,
      "grad_norm": 0.25390625,
      "learning_rate": 1.459016393442623e-06,
      "loss": 0.1011,
      "step": 5300
    },
    {
      "epoch": 0.8852459016393442,
      "grad_norm": 0.034912109375,
      "learning_rate": 1.2768670309653917e-06,
      "loss": 0.0873,
      "step": 5400
    },
    {
      "epoch": 0.9016393442622951,
      "grad_norm": 0.0010986328125,
      "learning_rate": 1.0947176684881603e-06,
      "loss": 0.0894,
      "step": 5500
    },
    {
      "epoch": 0.9180327868852459,
      "grad_norm": 1.1640625,
      "learning_rate": 9.12568306010929e-07,
      "loss": 0.0919,
      "step": 5600
    },
    {
      "epoch": 0.9344262295081968,
      "grad_norm": 0.0299072265625,
      "learning_rate": 7.304189435336977e-07,
      "loss": 0.0996,
      "step": 5700
    },
    {
      "epoch": 0.9508196721311475,
      "grad_norm": 1.828125,
      "learning_rate": 5.482695810564664e-07,
      "loss": 0.0966,
      "step": 5800
    },
    {
      "epoch": 0.9672131147540983,
      "grad_norm": 1.125,
      "learning_rate": 3.66120218579235e-07,
      "loss": 0.0893,
      "step": 5900
    },
    {
      "epoch": 0.9836065573770492,
      "grad_norm": 0.1201171875,
      "learning_rate": 1.8397085610200363e-07,
      "loss": 0.0852,
      "step": 6000
    },
    {
      "epoch": 1.0,
      "grad_norm": 1.1171875,
      "learning_rate": 1.8214936247723134e-09,
      "loss": 0.1025,
      "step": 6100
    }
  ],
  "logging_steps": 100,
  "max_steps": 6100,
  "num_input_tokens_seen": 0,
  "num_train_epochs": 1,
  "save_steps": 2000,
  "stateful_callbacks": {
    "TrainerControl": {
      "args": {
        "should_epoch_stop": false,
        "should_evaluate": false,
        "should_log": false,
        "should_save": true,
        "should_training_stop": true
      },
      "attributes": {}
    }
  },
  "total_flos": 0.0,
  "train_batch_size": 4,
  "trial_name": null,
  "trial_params": null
}
