LightOnOCR-2-1B-catmus / trainer_state.json
wjbmattingly's picture
Upload folder using huggingface_hub
34c5e26 verified
Raw
History Blame Contribute Delete
147 kB
{
"best_global_step": 15850,
"best_metric": 0.5063754320144653,
"best_model_checkpoint": "output/LightOnOCR-ft-catmus/checkpoint-6500",
"epoch": 2.0,
"eval_steps": 50,
"global_step": 18184,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0054994912970550225,
"grad_norm": 1.7269556522369385,
"learning_rate": 5.9871244635193135e-05,
"loss": 3.2000225830078124,
"step": 50
},
{
"epoch": 0.0054994912970550225,
"eval_loss": 2.544747829437256,
"eval_runtime": 1.22,
"eval_samples_per_second": 81.966,
"eval_steps_per_second": 13.934,
"step": 50
},
{
"epoch": 0.010998982594110045,
"grad_norm": 2.1817049980163574,
"learning_rate": 5.970617365467151e-05,
"loss": 2.204842987060547,
"step": 100
},
{
"epoch": 0.010998982594110045,
"eval_loss": 1.9304633140563965,
"eval_runtime": 1.2142,
"eval_samples_per_second": 82.358,
"eval_steps_per_second": 14.001,
"step": 100
},
{
"epoch": 0.01649847389116507,
"grad_norm": 2.861886739730835,
"learning_rate": 5.954110267414989e-05,
"loss": 1.7260311889648436,
"step": 150
},
{
"epoch": 0.01649847389116507,
"eval_loss": 1.7684886455535889,
"eval_runtime": 1.2169,
"eval_samples_per_second": 82.178,
"eval_steps_per_second": 13.97,
"step": 150
},
{
"epoch": 0.02199796518822009,
"grad_norm": 2.9910781383514404,
"learning_rate": 5.937603169362826e-05,
"loss": 1.5795289611816405,
"step": 200
},
{
"epoch": 0.02199796518822009,
"eval_loss": 1.5510659217834473,
"eval_runtime": 1.2158,
"eval_samples_per_second": 82.249,
"eval_steps_per_second": 13.982,
"step": 200
},
{
"epoch": 0.027497456485275112,
"grad_norm": 3.234337329864502,
"learning_rate": 5.921096071310663e-05,
"loss": 1.4427146911621094,
"step": 250
},
{
"epoch": 0.027497456485275112,
"eval_loss": 1.4127395153045654,
"eval_runtime": 1.2374,
"eval_samples_per_second": 80.816,
"eval_steps_per_second": 13.739,
"step": 250
},
{
"epoch": 0.03299694778233014,
"grad_norm": 3.6628358364105225,
"learning_rate": 5.904588973258501e-05,
"loss": 1.3803778076171875,
"step": 300
},
{
"epoch": 0.03299694778233014,
"eval_loss": 1.3498808145523071,
"eval_runtime": 1.2372,
"eval_samples_per_second": 80.827,
"eval_steps_per_second": 13.741,
"step": 300
},
{
"epoch": 0.03849643907938516,
"grad_norm": 3.2028181552886963,
"learning_rate": 5.8880818752063386e-05,
"loss": 1.2370665740966797,
"step": 350
},
{
"epoch": 0.03849643907938516,
"eval_loss": 1.3298417329788208,
"eval_runtime": 1.2864,
"eval_samples_per_second": 77.736,
"eval_steps_per_second": 13.215,
"step": 350
},
{
"epoch": 0.04399593037644018,
"grad_norm": 3.344433307647705,
"learning_rate": 5.8715747771541766e-05,
"loss": 1.1885470581054687,
"step": 400
},
{
"epoch": 0.04399593037644018,
"eval_loss": 1.296607494354248,
"eval_runtime": 1.2337,
"eval_samples_per_second": 81.058,
"eval_steps_per_second": 13.78,
"step": 400
},
{
"epoch": 0.0494954216734952,
"grad_norm": 3.601663827896118,
"learning_rate": 5.855067679102014e-05,
"loss": 1.149856185913086,
"step": 450
},
{
"epoch": 0.0494954216734952,
"eval_loss": 1.264522910118103,
"eval_runtime": 1.2178,
"eval_samples_per_second": 82.114,
"eval_steps_per_second": 13.959,
"step": 450
},
{
"epoch": 0.054994912970550223,
"grad_norm": 4.889139175415039,
"learning_rate": 5.838560581049852e-05,
"loss": 1.0299188232421874,
"step": 500
},
{
"epoch": 0.054994912970550223,
"eval_loss": 1.2139334678649902,
"eval_runtime": 1.2138,
"eval_samples_per_second": 82.388,
"eval_steps_per_second": 14.006,
"step": 500
},
{
"epoch": 0.060494404267605245,
"grad_norm": 4.471691608428955,
"learning_rate": 5.822053482997689e-05,
"loss": 1.063873519897461,
"step": 550
},
{
"epoch": 0.060494404267605245,
"eval_loss": 1.1947441101074219,
"eval_runtime": 1.2397,
"eval_samples_per_second": 80.663,
"eval_steps_per_second": 13.713,
"step": 550
},
{
"epoch": 0.06599389556466027,
"grad_norm": 5.005523204803467,
"learning_rate": 5.805546384945527e-05,
"loss": 1.0306187438964844,
"step": 600
},
{
"epoch": 0.06599389556466027,
"eval_loss": 1.1054185628890991,
"eval_runtime": 1.2867,
"eval_samples_per_second": 77.72,
"eval_steps_per_second": 13.212,
"step": 600
},
{
"epoch": 0.07149338686171529,
"grad_norm": 5.433160781860352,
"learning_rate": 5.7890392868933643e-05,
"loss": 0.9948115539550781,
"step": 650
},
{
"epoch": 0.07149338686171529,
"eval_loss": 1.118335247039795,
"eval_runtime": 1.2905,
"eval_samples_per_second": 77.488,
"eval_steps_per_second": 13.173,
"step": 650
},
{
"epoch": 0.07699287815877032,
"grad_norm": 4.089204788208008,
"learning_rate": 5.7725321888412016e-05,
"loss": 0.9623870086669922,
"step": 700
},
{
"epoch": 0.07699287815877032,
"eval_loss": 1.1011381149291992,
"eval_runtime": 1.2137,
"eval_samples_per_second": 82.396,
"eval_steps_per_second": 14.007,
"step": 700
},
{
"epoch": 0.08249236945582533,
"grad_norm": 4.5177459716796875,
"learning_rate": 5.7560250907890396e-05,
"loss": 0.9822674560546875,
"step": 750
},
{
"epoch": 0.08249236945582533,
"eval_loss": 1.0355230569839478,
"eval_runtime": 1.2185,
"eval_samples_per_second": 82.066,
"eval_steps_per_second": 13.951,
"step": 750
},
{
"epoch": 0.08799186075288036,
"grad_norm": 5.314192295074463,
"learning_rate": 5.7395179927368776e-05,
"loss": 0.9478108978271484,
"step": 800
},
{
"epoch": 0.08799186075288036,
"eval_loss": 1.026939868927002,
"eval_runtime": 1.2207,
"eval_samples_per_second": 81.923,
"eval_steps_per_second": 13.927,
"step": 800
},
{
"epoch": 0.09349135204993538,
"grad_norm": 4.419743061065674,
"learning_rate": 5.723010894684714e-05,
"loss": 0.9230728149414062,
"step": 850
},
{
"epoch": 0.09349135204993538,
"eval_loss": 1.0253421068191528,
"eval_runtime": 1.2215,
"eval_samples_per_second": 81.867,
"eval_steps_per_second": 13.917,
"step": 850
},
{
"epoch": 0.0989908433469904,
"grad_norm": 4.689808368682861,
"learning_rate": 5.706503796632552e-05,
"loss": 0.9336647033691406,
"step": 900
},
{
"epoch": 0.0989908433469904,
"eval_loss": 0.9888076782226562,
"eval_runtime": 1.2198,
"eval_samples_per_second": 81.981,
"eval_steps_per_second": 13.937,
"step": 900
},
{
"epoch": 0.10449033464404543,
"grad_norm": 4.178891181945801,
"learning_rate": 5.68999669858039e-05,
"loss": 0.8509888458251953,
"step": 950
},
{
"epoch": 0.10449033464404543,
"eval_loss": 0.9283347129821777,
"eval_runtime": 1.2217,
"eval_samples_per_second": 81.854,
"eval_steps_per_second": 13.915,
"step": 950
},
{
"epoch": 0.10998982594110045,
"grad_norm": 4.549170017242432,
"learning_rate": 5.6734896005282274e-05,
"loss": 0.8530999755859375,
"step": 1000
},
{
"epoch": 0.10998982594110045,
"eval_loss": 0.9180505871772766,
"eval_runtime": 1.2178,
"eval_samples_per_second": 82.114,
"eval_steps_per_second": 13.959,
"step": 1000
},
{
"epoch": 0.11548931723815548,
"grad_norm": 5.8048095703125,
"learning_rate": 5.656982502476065e-05,
"loss": 0.8161511993408204,
"step": 1050
},
{
"epoch": 0.11548931723815548,
"eval_loss": 0.9668211936950684,
"eval_runtime": 1.2152,
"eval_samples_per_second": 82.292,
"eval_steps_per_second": 13.99,
"step": 1050
},
{
"epoch": 0.12098880853521049,
"grad_norm": 4.776002883911133,
"learning_rate": 5.6404754044239026e-05,
"loss": 0.8362539672851562,
"step": 1100
},
{
"epoch": 0.12098880853521049,
"eval_loss": 0.9686654806137085,
"eval_runtime": 1.21,
"eval_samples_per_second": 82.647,
"eval_steps_per_second": 14.05,
"step": 1100
},
{
"epoch": 0.1264882998322655,
"grad_norm": 4.652673721313477,
"learning_rate": 5.62396830637174e-05,
"loss": 0.8160650634765625,
"step": 1150
},
{
"epoch": 0.1264882998322655,
"eval_loss": 0.9779856204986572,
"eval_runtime": 1.2121,
"eval_samples_per_second": 82.5,
"eval_steps_per_second": 14.025,
"step": 1150
},
{
"epoch": 0.13198779112932055,
"grad_norm": 4.988180160522461,
"learning_rate": 5.607461208319577e-05,
"loss": 0.8510865020751953,
"step": 1200
},
{
"epoch": 0.13198779112932055,
"eval_loss": 0.9197137951850891,
"eval_runtime": 1.2363,
"eval_samples_per_second": 80.884,
"eval_steps_per_second": 13.75,
"step": 1200
},
{
"epoch": 0.13748728242637556,
"grad_norm": 5.33247709274292,
"learning_rate": 5.590954110267415e-05,
"loss": 0.8393131256103515,
"step": 1250
},
{
"epoch": 0.13748728242637556,
"eval_loss": 0.9012404084205627,
"eval_runtime": 1.2371,
"eval_samples_per_second": 80.834,
"eval_steps_per_second": 13.742,
"step": 1250
},
{
"epoch": 0.14298677372343058,
"grad_norm": 4.81198787689209,
"learning_rate": 5.5744470122152525e-05,
"loss": 0.7720973205566406,
"step": 1300
},
{
"epoch": 0.14298677372343058,
"eval_loss": 0.8723539710044861,
"eval_runtime": 1.2195,
"eval_samples_per_second": 81.999,
"eval_steps_per_second": 13.94,
"step": 1300
},
{
"epoch": 0.1484862650204856,
"grad_norm": 4.492185115814209,
"learning_rate": 5.5579399141630904e-05,
"loss": 0.8052091217041015,
"step": 1350
},
{
"epoch": 0.1484862650204856,
"eval_loss": 0.8542118668556213,
"eval_runtime": 1.2288,
"eval_samples_per_second": 81.379,
"eval_steps_per_second": 13.834,
"step": 1350
},
{
"epoch": 0.15398575631754063,
"grad_norm": 3.353337287902832,
"learning_rate": 5.541432816110928e-05,
"loss": 0.7565326690673828,
"step": 1400
},
{
"epoch": 0.15398575631754063,
"eval_loss": 0.8505687117576599,
"eval_runtime": 1.2947,
"eval_samples_per_second": 77.24,
"eval_steps_per_second": 13.131,
"step": 1400
},
{
"epoch": 0.15948524761459565,
"grad_norm": 4.658541202545166,
"learning_rate": 5.524925718058765e-05,
"loss": 0.7905632781982422,
"step": 1450
},
{
"epoch": 0.15948524761459565,
"eval_loss": 0.8416154980659485,
"eval_runtime": 1.3011,
"eval_samples_per_second": 76.857,
"eval_steps_per_second": 13.066,
"step": 1450
},
{
"epoch": 0.16498473891165066,
"grad_norm": 4.894554615020752,
"learning_rate": 5.508418620006603e-05,
"loss": 0.7522599029541016,
"step": 1500
},
{
"epoch": 0.16498473891165066,
"eval_loss": 0.8781094551086426,
"eval_runtime": 1.3077,
"eval_samples_per_second": 76.472,
"eval_steps_per_second": 13.0,
"step": 1500
},
{
"epoch": 0.1704842302087057,
"grad_norm": 5.099001407623291,
"learning_rate": 5.491911521954441e-05,
"loss": 0.7591278076171875,
"step": 1550
},
{
"epoch": 0.1704842302087057,
"eval_loss": 0.8455641269683838,
"eval_runtime": 1.3309,
"eval_samples_per_second": 75.138,
"eval_steps_per_second": 12.773,
"step": 1550
},
{
"epoch": 0.17598372150576072,
"grad_norm": 4.108503818511963,
"learning_rate": 5.4754044239022776e-05,
"loss": 0.7117195129394531,
"step": 1600
},
{
"epoch": 0.17598372150576072,
"eval_loss": 0.8469740152359009,
"eval_runtime": 1.3312,
"eval_samples_per_second": 75.123,
"eval_steps_per_second": 12.771,
"step": 1600
},
{
"epoch": 0.18148321280281574,
"grad_norm": 4.5479536056518555,
"learning_rate": 5.4588973258501155e-05,
"loss": 0.7624311828613282,
"step": 1650
},
{
"epoch": 0.18148321280281574,
"eval_loss": 0.8670312762260437,
"eval_runtime": 1.3395,
"eval_samples_per_second": 74.652,
"eval_steps_per_second": 12.691,
"step": 1650
},
{
"epoch": 0.18698270409987075,
"grad_norm": 4.809026718139648,
"learning_rate": 5.4423902277979535e-05,
"loss": 0.7137515258789062,
"step": 1700
},
{
"epoch": 0.18698270409987075,
"eval_loss": 0.8062080144882202,
"eval_runtime": 1.3269,
"eval_samples_per_second": 75.364,
"eval_steps_per_second": 12.812,
"step": 1700
},
{
"epoch": 0.1924821953969258,
"grad_norm": 5.400925636291504,
"learning_rate": 5.4258831297457914e-05,
"loss": 0.6972386932373047,
"step": 1750
},
{
"epoch": 0.1924821953969258,
"eval_loss": 0.8285601735115051,
"eval_runtime": 1.3236,
"eval_samples_per_second": 75.551,
"eval_steps_per_second": 12.844,
"step": 1750
},
{
"epoch": 0.1979816866939808,
"grad_norm": 6.0628461837768555,
"learning_rate": 5.409376031693628e-05,
"loss": 0.7547286987304688,
"step": 1800
},
{
"epoch": 0.1979816866939808,
"eval_loss": 0.8063403964042664,
"eval_runtime": 1.3254,
"eval_samples_per_second": 75.448,
"eval_steps_per_second": 12.826,
"step": 1800
},
{
"epoch": 0.20348117799103582,
"grad_norm": 5.176665306091309,
"learning_rate": 5.392868933641466e-05,
"loss": 0.7166018676757813,
"step": 1850
},
{
"epoch": 0.20348117799103582,
"eval_loss": 0.7977473735809326,
"eval_runtime": 1.3331,
"eval_samples_per_second": 75.013,
"eval_steps_per_second": 12.752,
"step": 1850
},
{
"epoch": 0.20898066928809086,
"grad_norm": 5.566205024719238,
"learning_rate": 5.376361835589304e-05,
"loss": 0.7202009582519531,
"step": 1900
},
{
"epoch": 0.20898066928809086,
"eval_loss": 0.7941867709159851,
"eval_runtime": 1.2966,
"eval_samples_per_second": 77.126,
"eval_steps_per_second": 13.112,
"step": 1900
},
{
"epoch": 0.21448016058514588,
"grad_norm": 6.071581840515137,
"learning_rate": 5.359854737537141e-05,
"loss": 0.718297119140625,
"step": 1950
},
{
"epoch": 0.21448016058514588,
"eval_loss": 0.8194384574890137,
"eval_runtime": 1.2884,
"eval_samples_per_second": 77.613,
"eval_steps_per_second": 13.194,
"step": 1950
},
{
"epoch": 0.2199796518822009,
"grad_norm": 5.566873073577881,
"learning_rate": 5.3433476394849786e-05,
"loss": 0.7216673278808594,
"step": 2000
},
{
"epoch": 0.2199796518822009,
"eval_loss": 0.7815269231796265,
"eval_runtime": 1.2875,
"eval_samples_per_second": 77.668,
"eval_steps_per_second": 13.204,
"step": 2000
},
{
"epoch": 0.2254791431792559,
"grad_norm": 5.567185878753662,
"learning_rate": 5.3268405414328165e-05,
"loss": 0.7164375305175781,
"step": 2050
},
{
"epoch": 0.2254791431792559,
"eval_loss": 0.8178561925888062,
"eval_runtime": 1.2891,
"eval_samples_per_second": 77.574,
"eval_steps_per_second": 13.188,
"step": 2050
},
{
"epoch": 0.23097863447631095,
"grad_norm": 4.171028137207031,
"learning_rate": 5.310333443380654e-05,
"loss": 0.6996173095703125,
"step": 2100
},
{
"epoch": 0.23097863447631095,
"eval_loss": 0.791594922542572,
"eval_runtime": 1.287,
"eval_samples_per_second": 77.698,
"eval_steps_per_second": 13.209,
"step": 2100
},
{
"epoch": 0.23647812577336597,
"grad_norm": 4.468926906585693,
"learning_rate": 5.293826345328491e-05,
"loss": 0.685142822265625,
"step": 2150
},
{
"epoch": 0.23647812577336597,
"eval_loss": 0.8206081986427307,
"eval_runtime": 1.2124,
"eval_samples_per_second": 82.479,
"eval_steps_per_second": 14.021,
"step": 2150
},
{
"epoch": 0.24197761707042098,
"grad_norm": 3.9659266471862793,
"learning_rate": 5.277319247276329e-05,
"loss": 0.701788330078125,
"step": 2200
},
{
"epoch": 0.24197761707042098,
"eval_loss": 0.7930644750595093,
"eval_runtime": 1.2014,
"eval_samples_per_second": 83.24,
"eval_steps_per_second": 14.151,
"step": 2200
},
{
"epoch": 0.247477108367476,
"grad_norm": 4.476805686950684,
"learning_rate": 5.2608121492241664e-05,
"loss": 0.710376968383789,
"step": 2250
},
{
"epoch": 0.247477108367476,
"eval_loss": 0.7881377339363098,
"eval_runtime": 1.1999,
"eval_samples_per_second": 83.337,
"eval_steps_per_second": 14.167,
"step": 2250
},
{
"epoch": 0.252976599664531,
"grad_norm": 3.8596489429473877,
"learning_rate": 5.244305051172004e-05,
"loss": 0.7032179260253906,
"step": 2300
},
{
"epoch": 0.252976599664531,
"eval_loss": 0.7591221332550049,
"eval_runtime": 1.2149,
"eval_samples_per_second": 82.31,
"eval_steps_per_second": 13.993,
"step": 2300
},
{
"epoch": 0.2584760909615861,
"grad_norm": 4.368955135345459,
"learning_rate": 5.2277979531198416e-05,
"loss": 0.6489437103271485,
"step": 2350
},
{
"epoch": 0.2584760909615861,
"eval_loss": 0.8142778873443604,
"eval_runtime": 1.2006,
"eval_samples_per_second": 83.294,
"eval_steps_per_second": 14.16,
"step": 2350
},
{
"epoch": 0.2639755822586411,
"grad_norm": 4.408853530883789,
"learning_rate": 5.211290855067679e-05,
"loss": 0.6344734954833985,
"step": 2400
},
{
"epoch": 0.2639755822586411,
"eval_loss": 0.789002001285553,
"eval_runtime": 1.2016,
"eval_samples_per_second": 83.219,
"eval_steps_per_second": 14.147,
"step": 2400
},
{
"epoch": 0.2694750735556961,
"grad_norm": 4.636422157287598,
"learning_rate": 5.194783757015517e-05,
"loss": 0.6603395080566407,
"step": 2450
},
{
"epoch": 0.2694750735556961,
"eval_loss": 0.739583432674408,
"eval_runtime": 1.2017,
"eval_samples_per_second": 83.216,
"eval_steps_per_second": 14.147,
"step": 2450
},
{
"epoch": 0.2749745648527511,
"grad_norm": 4.370145797729492,
"learning_rate": 5.178276658963355e-05,
"loss": 0.6568155670166016,
"step": 2500
},
{
"epoch": 0.2749745648527511,
"eval_loss": 0.8292286396026611,
"eval_runtime": 1.1996,
"eval_samples_per_second": 83.364,
"eval_steps_per_second": 14.172,
"step": 2500
},
{
"epoch": 0.28047405614980614,
"grad_norm": 4.47123384475708,
"learning_rate": 5.1617695609111914e-05,
"loss": 0.6639788055419922,
"step": 2550
},
{
"epoch": 0.28047405614980614,
"eval_loss": 0.820250391960144,
"eval_runtime": 1.2058,
"eval_samples_per_second": 82.933,
"eval_steps_per_second": 14.099,
"step": 2550
},
{
"epoch": 0.28597354744686115,
"grad_norm": 4.769968509674072,
"learning_rate": 5.1452624628590294e-05,
"loss": 0.6434815979003906,
"step": 2600
},
{
"epoch": 0.28597354744686115,
"eval_loss": 0.8330257534980774,
"eval_runtime": 1.2003,
"eval_samples_per_second": 83.313,
"eval_steps_per_second": 14.163,
"step": 2600
},
{
"epoch": 0.29147303874391617,
"grad_norm": 4.403727054595947,
"learning_rate": 5.1287553648068674e-05,
"loss": 0.6872652435302734,
"step": 2650
},
{
"epoch": 0.29147303874391617,
"eval_loss": 0.7691981792449951,
"eval_runtime": 1.1997,
"eval_samples_per_second": 83.351,
"eval_steps_per_second": 14.17,
"step": 2650
},
{
"epoch": 0.2969725300409712,
"grad_norm": 3.7627687454223633,
"learning_rate": 5.1122482667547047e-05,
"loss": 0.625857925415039,
"step": 2700
},
{
"epoch": 0.2969725300409712,
"eval_loss": 0.7727508544921875,
"eval_runtime": 1.2264,
"eval_samples_per_second": 81.538,
"eval_steps_per_second": 13.861,
"step": 2700
},
{
"epoch": 0.30247202133802625,
"grad_norm": 5.441561222076416,
"learning_rate": 5.095741168702542e-05,
"loss": 0.6458732604980468,
"step": 2750
},
{
"epoch": 0.30247202133802625,
"eval_loss": 0.7701953053474426,
"eval_runtime": 1.222,
"eval_samples_per_second": 81.833,
"eval_steps_per_second": 13.912,
"step": 2750
},
{
"epoch": 0.30797151263508127,
"grad_norm": 4.965064525604248,
"learning_rate": 5.07923407065038e-05,
"loss": 0.6677908325195312,
"step": 2800
},
{
"epoch": 0.30797151263508127,
"eval_loss": 0.7164813280105591,
"eval_runtime": 1.2202,
"eval_samples_per_second": 81.956,
"eval_steps_per_second": 13.933,
"step": 2800
},
{
"epoch": 0.3134710039321363,
"grad_norm": 3.931856870651245,
"learning_rate": 5.062726972598217e-05,
"loss": 0.5885476684570312,
"step": 2850
},
{
"epoch": 0.3134710039321363,
"eval_loss": 0.7336059808731079,
"eval_runtime": 1.2203,
"eval_samples_per_second": 81.948,
"eval_steps_per_second": 13.931,
"step": 2850
},
{
"epoch": 0.3189704952291913,
"grad_norm": 4.760177135467529,
"learning_rate": 5.046219874546055e-05,
"loss": 0.6489822387695312,
"step": 2900
},
{
"epoch": 0.3189704952291913,
"eval_loss": 0.7551103830337524,
"eval_runtime": 1.2183,
"eval_samples_per_second": 82.079,
"eval_steps_per_second": 13.953,
"step": 2900
},
{
"epoch": 0.3244699865262463,
"grad_norm": 4.375728130340576,
"learning_rate": 5.0297127764938924e-05,
"loss": 0.6457704162597656,
"step": 2950
},
{
"epoch": 0.3244699865262463,
"eval_loss": 0.7187867164611816,
"eval_runtime": 1.2036,
"eval_samples_per_second": 83.084,
"eval_steps_per_second": 14.124,
"step": 2950
},
{
"epoch": 0.3299694778233013,
"grad_norm": 4.091928005218506,
"learning_rate": 5.0132056784417304e-05,
"loss": 0.6391205596923828,
"step": 3000
},
{
"epoch": 0.3299694778233013,
"eval_loss": 0.7715049982070923,
"eval_runtime": 1.2016,
"eval_samples_per_second": 83.22,
"eval_steps_per_second": 14.147,
"step": 3000
},
{
"epoch": 0.33546896912035634,
"grad_norm": 4.569828510284424,
"learning_rate": 4.996698580389568e-05,
"loss": 0.6714089965820312,
"step": 3050
},
{
"epoch": 0.33546896912035634,
"eval_loss": 0.7370268106460571,
"eval_runtime": 1.2171,
"eval_samples_per_second": 82.162,
"eval_steps_per_second": 13.967,
"step": 3050
},
{
"epoch": 0.3409684604174114,
"grad_norm": 5.741940975189209,
"learning_rate": 4.980191482337405e-05,
"loss": 0.6890049743652343,
"step": 3100
},
{
"epoch": 0.3409684604174114,
"eval_loss": 0.7069912552833557,
"eval_runtime": 1.1974,
"eval_samples_per_second": 83.514,
"eval_steps_per_second": 14.197,
"step": 3100
},
{
"epoch": 0.3464679517144664,
"grad_norm": 4.857932090759277,
"learning_rate": 4.963684384285243e-05,
"loss": 0.5919662475585937,
"step": 3150
},
{
"epoch": 0.3464679517144664,
"eval_loss": 0.7350116968154907,
"eval_runtime": 1.1974,
"eval_samples_per_second": 83.515,
"eval_steps_per_second": 14.198,
"step": 3150
},
{
"epoch": 0.35196744301152144,
"grad_norm": 4.636399745941162,
"learning_rate": 4.94717728623308e-05,
"loss": 0.6361312866210938,
"step": 3200
},
{
"epoch": 0.35196744301152144,
"eval_loss": 0.7743600606918335,
"eval_runtime": 1.271,
"eval_samples_per_second": 78.677,
"eval_steps_per_second": 13.375,
"step": 3200
},
{
"epoch": 0.35746693430857646,
"grad_norm": 5.155900955200195,
"learning_rate": 4.930670188180918e-05,
"loss": 0.602264518737793,
"step": 3250
},
{
"epoch": 0.35746693430857646,
"eval_loss": 0.7555291652679443,
"eval_runtime": 1.2803,
"eval_samples_per_second": 78.105,
"eval_steps_per_second": 13.278,
"step": 3250
},
{
"epoch": 0.36296642560563147,
"grad_norm": 3.4023196697235107,
"learning_rate": 4.9141630901287555e-05,
"loss": 0.5788230133056641,
"step": 3300
},
{
"epoch": 0.36296642560563147,
"eval_loss": 0.7717245221138,
"eval_runtime": 1.3149,
"eval_samples_per_second": 76.053,
"eval_steps_per_second": 12.929,
"step": 3300
},
{
"epoch": 0.3684659169026865,
"grad_norm": 4.329448223114014,
"learning_rate": 4.897655992076593e-05,
"loss": 0.6438528442382813,
"step": 3350
},
{
"epoch": 0.3684659169026865,
"eval_loss": 0.6952827572822571,
"eval_runtime": 1.2957,
"eval_samples_per_second": 77.176,
"eval_steps_per_second": 13.12,
"step": 3350
},
{
"epoch": 0.3739654081997415,
"grad_norm": 3.610276222229004,
"learning_rate": 4.881148894024431e-05,
"loss": 0.6141637802124024,
"step": 3400
},
{
"epoch": 0.3739654081997415,
"eval_loss": 0.6926187872886658,
"eval_runtime": 1.3466,
"eval_samples_per_second": 74.259,
"eval_steps_per_second": 12.624,
"step": 3400
},
{
"epoch": 0.37946489949679657,
"grad_norm": 6.178794860839844,
"learning_rate": 4.864641795972269e-05,
"loss": 0.6356156158447266,
"step": 3450
},
{
"epoch": 0.37946489949679657,
"eval_loss": 0.7247772216796875,
"eval_runtime": 1.3462,
"eval_samples_per_second": 74.281,
"eval_steps_per_second": 12.628,
"step": 3450
},
{
"epoch": 0.3849643907938516,
"grad_norm": 4.9943695068359375,
"learning_rate": 4.848134697920105e-05,
"loss": 0.6148456192016601,
"step": 3500
},
{
"epoch": 0.3849643907938516,
"eval_loss": 0.7180845141410828,
"eval_runtime": 1.3322,
"eval_samples_per_second": 75.061,
"eval_steps_per_second": 12.76,
"step": 3500
},
{
"epoch": 0.3904638820909066,
"grad_norm": 3.8332393169403076,
"learning_rate": 4.831627599867943e-05,
"loss": 0.625141716003418,
"step": 3550
},
{
"epoch": 0.3904638820909066,
"eval_loss": 0.6876647472381592,
"eval_runtime": 1.3382,
"eval_samples_per_second": 74.73,
"eval_steps_per_second": 12.704,
"step": 3550
},
{
"epoch": 0.3959633733879616,
"grad_norm": 4.58771276473999,
"learning_rate": 4.815120501815781e-05,
"loss": 0.6502104187011719,
"step": 3600
},
{
"epoch": 0.3959633733879616,
"eval_loss": 0.690920352935791,
"eval_runtime": 1.343,
"eval_samples_per_second": 74.46,
"eval_steps_per_second": 12.658,
"step": 3600
},
{
"epoch": 0.40146286468501663,
"grad_norm": 4.435539722442627,
"learning_rate": 4.7986134037636185e-05,
"loss": 0.6129857635498047,
"step": 3650
},
{
"epoch": 0.40146286468501663,
"eval_loss": 0.6758005023002625,
"eval_runtime": 1.34,
"eval_samples_per_second": 74.628,
"eval_steps_per_second": 12.687,
"step": 3650
},
{
"epoch": 0.40696235598207164,
"grad_norm": 4.618966102600098,
"learning_rate": 4.782106305711456e-05,
"loss": 0.6234348678588867,
"step": 3700
},
{
"epoch": 0.40696235598207164,
"eval_loss": 0.7179376482963562,
"eval_runtime": 1.3332,
"eval_samples_per_second": 75.01,
"eval_steps_per_second": 12.752,
"step": 3700
},
{
"epoch": 0.41246184727912666,
"grad_norm": 4.0562052726745605,
"learning_rate": 4.765599207659294e-05,
"loss": 0.6168152999877929,
"step": 3750
},
{
"epoch": 0.41246184727912666,
"eval_loss": 0.7127401828765869,
"eval_runtime": 1.3374,
"eval_samples_per_second": 74.769,
"eval_steps_per_second": 12.711,
"step": 3750
},
{
"epoch": 0.41796133857618173,
"grad_norm": 5.699039459228516,
"learning_rate": 4.749092109607131e-05,
"loss": 0.5789441680908203,
"step": 3800
},
{
"epoch": 0.41796133857618173,
"eval_loss": 0.6780041456222534,
"eval_runtime": 1.3483,
"eval_samples_per_second": 74.167,
"eval_steps_per_second": 12.608,
"step": 3800
},
{
"epoch": 0.42346082987323674,
"grad_norm": 3.523623466491699,
"learning_rate": 4.7325850115549684e-05,
"loss": 0.5945124053955078,
"step": 3850
},
{
"epoch": 0.42346082987323674,
"eval_loss": 0.695915699005127,
"eval_runtime": 1.345,
"eval_samples_per_second": 74.351,
"eval_steps_per_second": 12.64,
"step": 3850
},
{
"epoch": 0.42896032117029176,
"grad_norm": 4.008049488067627,
"learning_rate": 4.716077913502806e-05,
"loss": 0.5782461929321289,
"step": 3900
},
{
"epoch": 0.42896032117029176,
"eval_loss": 0.6521520018577576,
"eval_runtime": 1.342,
"eval_samples_per_second": 74.517,
"eval_steps_per_second": 12.668,
"step": 3900
},
{
"epoch": 0.4344598124673468,
"grad_norm": 4.809508323669434,
"learning_rate": 4.6995708154506436e-05,
"loss": 0.5954169464111329,
"step": 3950
},
{
"epoch": 0.4344598124673468,
"eval_loss": 0.6668588519096375,
"eval_runtime": 1.347,
"eval_samples_per_second": 74.241,
"eval_steps_per_second": 12.621,
"step": 3950
},
{
"epoch": 0.4399593037644018,
"grad_norm": 4.741697788238525,
"learning_rate": 4.6830637173984816e-05,
"loss": 0.5780908584594726,
"step": 4000
},
{
"epoch": 0.4399593037644018,
"eval_loss": 0.6712077260017395,
"eval_runtime": 1.3399,
"eval_samples_per_second": 74.63,
"eval_steps_per_second": 12.687,
"step": 4000
},
{
"epoch": 0.4454587950614568,
"grad_norm": 5.006357192993164,
"learning_rate": 4.666556619346319e-05,
"loss": 0.5816222763061524,
"step": 4050
},
{
"epoch": 0.4454587950614568,
"eval_loss": 0.659636378288269,
"eval_runtime": 1.3383,
"eval_samples_per_second": 74.724,
"eval_steps_per_second": 12.703,
"step": 4050
},
{
"epoch": 0.4509582863585118,
"grad_norm": 4.562034606933594,
"learning_rate": 4.650049521294156e-05,
"loss": 0.6115531539916992,
"step": 4100
},
{
"epoch": 0.4509582863585118,
"eval_loss": 0.7120453715324402,
"eval_runtime": 1.3432,
"eval_samples_per_second": 74.446,
"eval_steps_per_second": 12.656,
"step": 4100
},
{
"epoch": 0.4564577776555669,
"grad_norm": 4.5262837409973145,
"learning_rate": 4.633542423241994e-05,
"loss": 0.5980755233764649,
"step": 4150
},
{
"epoch": 0.4564577776555669,
"eval_loss": 0.6733386516571045,
"eval_runtime": 1.3413,
"eval_samples_per_second": 74.555,
"eval_steps_per_second": 12.674,
"step": 4150
},
{
"epoch": 0.4619572689526219,
"grad_norm": 3.8390605449676514,
"learning_rate": 4.617035325189832e-05,
"loss": 0.5741873931884766,
"step": 4200
},
{
"epoch": 0.4619572689526219,
"eval_loss": 0.6623669266700745,
"eval_runtime": 1.341,
"eval_samples_per_second": 74.57,
"eval_steps_per_second": 12.677,
"step": 4200
},
{
"epoch": 0.4674567602496769,
"grad_norm": 4.214045524597168,
"learning_rate": 4.6005282271376694e-05,
"loss": 0.5255369186401367,
"step": 4250
},
{
"epoch": 0.4674567602496769,
"eval_loss": 0.6530551910400391,
"eval_runtime": 1.3425,
"eval_samples_per_second": 74.487,
"eval_steps_per_second": 12.663,
"step": 4250
},
{
"epoch": 0.47295625154673193,
"grad_norm": 4.7830729484558105,
"learning_rate": 4.5840211290855067e-05,
"loss": 0.5830232620239257,
"step": 4300
},
{
"epoch": 0.47295625154673193,
"eval_loss": 0.6643821001052856,
"eval_runtime": 1.344,
"eval_samples_per_second": 74.407,
"eval_steps_per_second": 12.649,
"step": 4300
},
{
"epoch": 0.47845574284378695,
"grad_norm": 4.745019435882568,
"learning_rate": 4.5675140310333446e-05,
"loss": 0.5781446075439454,
"step": 4350
},
{
"epoch": 0.47845574284378695,
"eval_loss": 0.6928694844245911,
"eval_runtime": 1.5854,
"eval_samples_per_second": 63.074,
"eval_steps_per_second": 10.723,
"step": 4350
},
{
"epoch": 0.48395523414084196,
"grad_norm": 4.537078380584717,
"learning_rate": 4.5510069329811826e-05,
"loss": 0.531302490234375,
"step": 4400
},
{
"epoch": 0.48395523414084196,
"eval_loss": 0.6292517185211182,
"eval_runtime": 1.3445,
"eval_samples_per_second": 74.375,
"eval_steps_per_second": 12.644,
"step": 4400
},
{
"epoch": 0.489454725437897,
"grad_norm": 4.4869384765625,
"learning_rate": 4.534499834929019e-05,
"loss": 0.5715638732910157,
"step": 4450
},
{
"epoch": 0.489454725437897,
"eval_loss": 0.6663034558296204,
"eval_runtime": 1.2938,
"eval_samples_per_second": 77.291,
"eval_steps_per_second": 13.14,
"step": 4450
},
{
"epoch": 0.494954216734952,
"grad_norm": 4.644640922546387,
"learning_rate": 4.517992736876857e-05,
"loss": 0.6143413162231446,
"step": 4500
},
{
"epoch": 0.494954216734952,
"eval_loss": 0.6727674007415771,
"eval_runtime": 1.2823,
"eval_samples_per_second": 77.986,
"eval_steps_per_second": 13.258,
"step": 4500
},
{
"epoch": 0.5004537080320071,
"grad_norm": 4.451071262359619,
"learning_rate": 4.501485638824695e-05,
"loss": 0.6003995132446289,
"step": 4550
},
{
"epoch": 0.5004537080320071,
"eval_loss": 0.7084936499595642,
"eval_runtime": 1.292,
"eval_samples_per_second": 77.4,
"eval_steps_per_second": 13.158,
"step": 4550
},
{
"epoch": 0.505953199329062,
"grad_norm": 3.566272020339966,
"learning_rate": 4.4849785407725324e-05,
"loss": 0.5423797607421875,
"step": 4600
},
{
"epoch": 0.505953199329062,
"eval_loss": 0.6627475023269653,
"eval_runtime": 1.2898,
"eval_samples_per_second": 77.531,
"eval_steps_per_second": 13.18,
"step": 4600
},
{
"epoch": 0.5114526906261171,
"grad_norm": 4.810975074768066,
"learning_rate": 4.46847144272037e-05,
"loss": 0.6348634719848633,
"step": 4650
},
{
"epoch": 0.5114526906261171,
"eval_loss": 0.5990252494812012,
"eval_runtime": 1.2836,
"eval_samples_per_second": 77.908,
"eval_steps_per_second": 13.244,
"step": 4650
},
{
"epoch": 0.5169521819231722,
"grad_norm": 4.475234031677246,
"learning_rate": 4.451964344668208e-05,
"loss": 0.5570141220092774,
"step": 4700
},
{
"epoch": 0.5169521819231722,
"eval_loss": 0.6244956254959106,
"eval_runtime": 1.2837,
"eval_samples_per_second": 77.898,
"eval_steps_per_second": 13.243,
"step": 4700
},
{
"epoch": 0.5224516732202271,
"grad_norm": 4.3085103034973145,
"learning_rate": 4.435457246616045e-05,
"loss": 0.55887451171875,
"step": 4750
},
{
"epoch": 0.5224516732202271,
"eval_loss": 0.6636219620704651,
"eval_runtime": 1.2809,
"eval_samples_per_second": 78.068,
"eval_steps_per_second": 13.272,
"step": 4750
},
{
"epoch": 0.5279511645172822,
"grad_norm": 3.598691940307617,
"learning_rate": 4.418950148563882e-05,
"loss": 0.5753656005859376,
"step": 4800
},
{
"epoch": 0.5279511645172822,
"eval_loss": 0.6499161720275879,
"eval_runtime": 1.2822,
"eval_samples_per_second": 77.991,
"eval_steps_per_second": 13.258,
"step": 4800
},
{
"epoch": 0.5334506558143371,
"grad_norm": 4.494378089904785,
"learning_rate": 4.40244305051172e-05,
"loss": 0.5845529174804688,
"step": 4850
},
{
"epoch": 0.5334506558143371,
"eval_loss": 0.629128634929657,
"eval_runtime": 1.5134,
"eval_samples_per_second": 66.078,
"eval_steps_per_second": 11.233,
"step": 4850
},
{
"epoch": 0.5389501471113922,
"grad_norm": 4.149122714996338,
"learning_rate": 4.3859359524595575e-05,
"loss": 0.527508659362793,
"step": 4900
},
{
"epoch": 0.5389501471113922,
"eval_loss": 0.6683360934257507,
"eval_runtime": 1.2806,
"eval_samples_per_second": 78.088,
"eval_steps_per_second": 13.275,
"step": 4900
},
{
"epoch": 0.5444496384084472,
"grad_norm": 4.04086971282959,
"learning_rate": 4.3694288544073955e-05,
"loss": 0.602709732055664,
"step": 4950
},
{
"epoch": 0.5444496384084472,
"eval_loss": 0.646293044090271,
"eval_runtime": 1.2828,
"eval_samples_per_second": 77.952,
"eval_steps_per_second": 13.252,
"step": 4950
},
{
"epoch": 0.5499491297055022,
"grad_norm": 4.0907440185546875,
"learning_rate": 4.352921756355233e-05,
"loss": 0.5631252670288086,
"step": 5000
},
{
"epoch": 0.5499491297055022,
"eval_loss": 0.6324547529220581,
"eval_runtime": 1.2809,
"eval_samples_per_second": 78.07,
"eval_steps_per_second": 13.272,
"step": 5000
},
{
"epoch": 0.5554486210025573,
"grad_norm": 4.2775654792785645,
"learning_rate": 4.33641465830307e-05,
"loss": 0.5570418930053711,
"step": 5050
},
{
"epoch": 0.5554486210025573,
"eval_loss": 0.6621595621109009,
"eval_runtime": 1.2825,
"eval_samples_per_second": 77.971,
"eval_steps_per_second": 13.255,
"step": 5050
},
{
"epoch": 0.5609481122996123,
"grad_norm": 4.414310932159424,
"learning_rate": 4.319907560250908e-05,
"loss": 0.5383467483520508,
"step": 5100
},
{
"epoch": 0.5609481122996123,
"eval_loss": 0.6726260185241699,
"eval_runtime": 1.2823,
"eval_samples_per_second": 77.983,
"eval_steps_per_second": 13.257,
"step": 5100
},
{
"epoch": 0.5664476035966673,
"grad_norm": 3.679974317550659,
"learning_rate": 4.303400462198746e-05,
"loss": 0.5569720840454102,
"step": 5150
},
{
"epoch": 0.5664476035966673,
"eval_loss": 0.6547858715057373,
"eval_runtime": 1.289,
"eval_samples_per_second": 77.579,
"eval_steps_per_second": 13.188,
"step": 5150
},
{
"epoch": 0.5719470948937223,
"grad_norm": 5.782617568969727,
"learning_rate": 4.2868933641465826e-05,
"loss": 0.5539520263671875,
"step": 5200
},
{
"epoch": 0.5719470948937223,
"eval_loss": 0.6701158881187439,
"eval_runtime": 1.2849,
"eval_samples_per_second": 77.825,
"eval_steps_per_second": 13.23,
"step": 5200
},
{
"epoch": 0.5774465861907774,
"grad_norm": 4.194858074188232,
"learning_rate": 4.2703862660944205e-05,
"loss": 0.5348934173583985,
"step": 5250
},
{
"epoch": 0.5774465861907774,
"eval_loss": 0.6580336093902588,
"eval_runtime": 1.2831,
"eval_samples_per_second": 77.938,
"eval_steps_per_second": 13.249,
"step": 5250
},
{
"epoch": 0.5829460774878323,
"grad_norm": 4.302168369293213,
"learning_rate": 4.2538791680422585e-05,
"loss": 0.5106255340576172,
"step": 5300
},
{
"epoch": 0.5829460774878323,
"eval_loss": 0.6552238464355469,
"eval_runtime": 1.2852,
"eval_samples_per_second": 77.81,
"eval_steps_per_second": 13.228,
"step": 5300
},
{
"epoch": 0.5884455687848874,
"grad_norm": 4.042543411254883,
"learning_rate": 4.237372069990096e-05,
"loss": 0.5317581558227539,
"step": 5350
},
{
"epoch": 0.5884455687848874,
"eval_loss": 0.6482524275779724,
"eval_runtime": 1.5001,
"eval_samples_per_second": 66.661,
"eval_steps_per_second": 11.332,
"step": 5350
},
{
"epoch": 0.5939450600819424,
"grad_norm": 4.4569830894470215,
"learning_rate": 4.220864971937933e-05,
"loss": 0.5747990036010742,
"step": 5400
},
{
"epoch": 0.5939450600819424,
"eval_loss": 0.6177729368209839,
"eval_runtime": 1.2798,
"eval_samples_per_second": 78.134,
"eval_steps_per_second": 13.283,
"step": 5400
},
{
"epoch": 0.5994445513789974,
"grad_norm": 4.751041889190674,
"learning_rate": 4.204357873885771e-05,
"loss": 0.5374135971069336,
"step": 5450
},
{
"epoch": 0.5994445513789974,
"eval_loss": 0.6517400145530701,
"eval_runtime": 1.28,
"eval_samples_per_second": 78.128,
"eval_steps_per_second": 13.282,
"step": 5450
},
{
"epoch": 0.6049440426760525,
"grad_norm": 7.24479341506958,
"learning_rate": 4.187850775833609e-05,
"loss": 0.5593222045898437,
"step": 5500
},
{
"epoch": 0.6049440426760525,
"eval_loss": 0.6892206072807312,
"eval_runtime": 1.2818,
"eval_samples_per_second": 78.014,
"eval_steps_per_second": 13.262,
"step": 5500
},
{
"epoch": 0.6104435339731075,
"grad_norm": 4.312963008880615,
"learning_rate": 4.171343677781446e-05,
"loss": 0.5525634002685547,
"step": 5550
},
{
"epoch": 0.6104435339731075,
"eval_loss": 0.6747671365737915,
"eval_runtime": 1.2815,
"eval_samples_per_second": 78.036,
"eval_steps_per_second": 13.266,
"step": 5550
},
{
"epoch": 0.6159430252701625,
"grad_norm": 4.606757164001465,
"learning_rate": 4.1548365797292836e-05,
"loss": 0.5449155807495117,
"step": 5600
},
{
"epoch": 0.6159430252701625,
"eval_loss": 0.6547083854675293,
"eval_runtime": 1.2835,
"eval_samples_per_second": 77.914,
"eval_steps_per_second": 13.245,
"step": 5600
},
{
"epoch": 0.6214425165672175,
"grad_norm": 5.024621486663818,
"learning_rate": 4.1383294816771216e-05,
"loss": 0.6019486618041993,
"step": 5650
},
{
"epoch": 0.6214425165672175,
"eval_loss": 0.6467494964599609,
"eval_runtime": 1.2839,
"eval_samples_per_second": 77.889,
"eval_steps_per_second": 13.241,
"step": 5650
},
{
"epoch": 0.6269420078642726,
"grad_norm": 4.251932144165039,
"learning_rate": 4.121822383624959e-05,
"loss": 0.5073886489868165,
"step": 5700
},
{
"epoch": 0.6269420078642726,
"eval_loss": 0.6638882160186768,
"eval_runtime": 1.2832,
"eval_samples_per_second": 77.932,
"eval_steps_per_second": 13.249,
"step": 5700
},
{
"epoch": 0.6324414991613275,
"grad_norm": 3.3922533988952637,
"learning_rate": 4.105315285572796e-05,
"loss": 0.531150894165039,
"step": 5750
},
{
"epoch": 0.6324414991613275,
"eval_loss": 0.6248385310173035,
"eval_runtime": 1.2919,
"eval_samples_per_second": 77.406,
"eval_steps_per_second": 13.159,
"step": 5750
},
{
"epoch": 0.6379409904583826,
"grad_norm": 4.290137767791748,
"learning_rate": 4.088808187520634e-05,
"loss": 0.5194898986816406,
"step": 5800
},
{
"epoch": 0.6379409904583826,
"eval_loss": 0.6306109428405762,
"eval_runtime": 1.2834,
"eval_samples_per_second": 77.918,
"eval_steps_per_second": 13.246,
"step": 5800
},
{
"epoch": 0.6434404817554377,
"grad_norm": 4.854128837585449,
"learning_rate": 4.0723010894684714e-05,
"loss": 0.5465607833862305,
"step": 5850
},
{
"epoch": 0.6434404817554377,
"eval_loss": 0.6254453063011169,
"eval_runtime": 1.5113,
"eval_samples_per_second": 66.169,
"eval_steps_per_second": 11.249,
"step": 5850
},
{
"epoch": 0.6489399730524926,
"grad_norm": 4.647885799407959,
"learning_rate": 4.0557939914163093e-05,
"loss": 0.5407907104492188,
"step": 5900
},
{
"epoch": 0.6489399730524926,
"eval_loss": 0.6638280749320984,
"eval_runtime": 1.2958,
"eval_samples_per_second": 77.17,
"eval_steps_per_second": 13.119,
"step": 5900
},
{
"epoch": 0.6544394643495477,
"grad_norm": 4.279372215270996,
"learning_rate": 4.0392868933641466e-05,
"loss": 0.5451357269287109,
"step": 5950
},
{
"epoch": 0.6544394643495477,
"eval_loss": 0.6228541731834412,
"eval_runtime": 1.3241,
"eval_samples_per_second": 75.524,
"eval_steps_per_second": 12.839,
"step": 5950
},
{
"epoch": 0.6599389556466027,
"grad_norm": 4.0558247566223145,
"learning_rate": 4.022779795311984e-05,
"loss": 0.5368893814086914,
"step": 6000
},
{
"epoch": 0.6599389556466027,
"eval_loss": 0.6732752323150635,
"eval_runtime": 1.3368,
"eval_samples_per_second": 74.807,
"eval_steps_per_second": 12.717,
"step": 6000
},
{
"epoch": 0.6654384469436577,
"grad_norm": 3.353104591369629,
"learning_rate": 4.006272697259822e-05,
"loss": 0.5184137344360351,
"step": 6050
},
{
"epoch": 0.6654384469436577,
"eval_loss": 0.6266540884971619,
"eval_runtime": 1.3374,
"eval_samples_per_second": 74.773,
"eval_steps_per_second": 12.711,
"step": 6050
},
{
"epoch": 0.6709379382407127,
"grad_norm": 3.8511996269226074,
"learning_rate": 3.98976559920766e-05,
"loss": 0.5407165145874023,
"step": 6100
},
{
"epoch": 0.6709379382407127,
"eval_loss": 0.6703444123268127,
"eval_runtime": 1.3374,
"eval_samples_per_second": 74.77,
"eval_steps_per_second": 12.711,
"step": 6100
},
{
"epoch": 0.6764374295377678,
"grad_norm": 3.9859249591827393,
"learning_rate": 3.9732585011554965e-05,
"loss": 0.4901425552368164,
"step": 6150
},
{
"epoch": 0.6764374295377678,
"eval_loss": 0.6332722902297974,
"eval_runtime": 1.341,
"eval_samples_per_second": 74.569,
"eval_steps_per_second": 12.677,
"step": 6150
},
{
"epoch": 0.6819369208348228,
"grad_norm": 3.666247844696045,
"learning_rate": 3.9567514031033344e-05,
"loss": 0.5188226318359375,
"step": 6200
},
{
"epoch": 0.6819369208348228,
"eval_loss": 0.5851776599884033,
"eval_runtime": 1.3337,
"eval_samples_per_second": 74.982,
"eval_steps_per_second": 12.747,
"step": 6200
},
{
"epoch": 0.6874364121318778,
"grad_norm": 4.355357646942139,
"learning_rate": 3.9402443050511724e-05,
"loss": 0.523404426574707,
"step": 6250
},
{
"epoch": 0.6874364121318778,
"eval_loss": 0.5948991179466248,
"eval_runtime": 1.3477,
"eval_samples_per_second": 74.199,
"eval_steps_per_second": 12.614,
"step": 6250
},
{
"epoch": 0.6929359034289329,
"grad_norm": 4.099778652191162,
"learning_rate": 3.92373720699901e-05,
"loss": 0.5017270278930664,
"step": 6300
},
{
"epoch": 0.6929359034289329,
"eval_loss": 0.6322646737098694,
"eval_runtime": 1.3296,
"eval_samples_per_second": 75.208,
"eval_steps_per_second": 12.785,
"step": 6300
},
{
"epoch": 0.6984353947259878,
"grad_norm": 5.135687351226807,
"learning_rate": 3.907230108946847e-05,
"loss": 0.5303592300415039,
"step": 6350
},
{
"epoch": 0.6984353947259878,
"eval_loss": 0.6268444657325745,
"eval_runtime": 1.5763,
"eval_samples_per_second": 63.442,
"eval_steps_per_second": 10.785,
"step": 6350
},
{
"epoch": 0.7039348860230429,
"grad_norm": 4.834221839904785,
"learning_rate": 3.890723010894685e-05,
"loss": 0.5274005889892578,
"step": 6400
},
{
"epoch": 0.7039348860230429,
"eval_loss": 0.5901980996131897,
"eval_runtime": 1.3333,
"eval_samples_per_second": 75.003,
"eval_steps_per_second": 12.75,
"step": 6400
},
{
"epoch": 0.7094343773200978,
"grad_norm": 5.028069496154785,
"learning_rate": 3.874215912842522e-05,
"loss": 0.5233419799804687,
"step": 6450
},
{
"epoch": 0.7094343773200978,
"eval_loss": 0.6389637589454651,
"eval_runtime": 1.2872,
"eval_samples_per_second": 77.685,
"eval_steps_per_second": 13.206,
"step": 6450
},
{
"epoch": 0.7149338686171529,
"grad_norm": 4.620915412902832,
"learning_rate": 3.85770881479036e-05,
"loss": 0.5316643905639649,
"step": 6500
},
{
"epoch": 0.7149338686171529,
"eval_loss": 0.5779242515563965,
"eval_runtime": 1.2776,
"eval_samples_per_second": 78.271,
"eval_steps_per_second": 13.306,
"step": 6500
},
{
"epoch": 0.720433359914208,
"grad_norm": 3.9142255783081055,
"learning_rate": 3.8412017167381975e-05,
"loss": 0.4801639175415039,
"step": 6550
},
{
"epoch": 0.720433359914208,
"eval_loss": 0.5951541662216187,
"eval_runtime": 1.2302,
"eval_samples_per_second": 81.288,
"eval_steps_per_second": 13.819,
"step": 6550
},
{
"epoch": 0.7259328512112629,
"grad_norm": 4.454485893249512,
"learning_rate": 3.824694618686035e-05,
"loss": 0.5149478912353516,
"step": 6600
},
{
"epoch": 0.7259328512112629,
"eval_loss": 0.5860444903373718,
"eval_runtime": 1.235,
"eval_samples_per_second": 80.974,
"eval_steps_per_second": 13.766,
"step": 6600
},
{
"epoch": 0.731432342508318,
"grad_norm": 4.176424026489258,
"learning_rate": 3.808187520633873e-05,
"loss": 0.543246192932129,
"step": 6650
},
{
"epoch": 0.731432342508318,
"eval_loss": 0.5805695056915283,
"eval_runtime": 1.2369,
"eval_samples_per_second": 80.844,
"eval_steps_per_second": 13.744,
"step": 6650
},
{
"epoch": 0.736931833805373,
"grad_norm": 3.361717462539673,
"learning_rate": 3.79168042258171e-05,
"loss": 0.5410548400878906,
"step": 6700
},
{
"epoch": 0.736931833805373,
"eval_loss": 0.5974660515785217,
"eval_runtime": 1.2286,
"eval_samples_per_second": 81.396,
"eval_steps_per_second": 13.837,
"step": 6700
},
{
"epoch": 0.742431325102428,
"grad_norm": 5.069472312927246,
"learning_rate": 3.775173324529548e-05,
"loss": 0.5026102447509766,
"step": 6750
},
{
"epoch": 0.742431325102428,
"eval_loss": 0.5945417284965515,
"eval_runtime": 1.2116,
"eval_samples_per_second": 82.533,
"eval_steps_per_second": 14.031,
"step": 6750
},
{
"epoch": 0.747930816399483,
"grad_norm": 4.298215389251709,
"learning_rate": 3.758666226477385e-05,
"loss": 0.5604416275024414,
"step": 6800
},
{
"epoch": 0.747930816399483,
"eval_loss": 0.5883623361587524,
"eval_runtime": 1.2141,
"eval_samples_per_second": 82.363,
"eval_steps_per_second": 14.002,
"step": 6800
},
{
"epoch": 0.7534303076965381,
"grad_norm": 3.469435930252075,
"learning_rate": 3.742159128425223e-05,
"loss": 0.5037693023681641,
"step": 6850
},
{
"epoch": 0.7534303076965381,
"eval_loss": 0.5655568838119507,
"eval_runtime": 1.3814,
"eval_samples_per_second": 72.389,
"eval_steps_per_second": 12.306,
"step": 6850
},
{
"epoch": 0.7589297989935931,
"grad_norm": 4.014948844909668,
"learning_rate": 3.7256520303730605e-05,
"loss": 0.5645696258544922,
"step": 6900
},
{
"epoch": 0.7589297989935931,
"eval_loss": 0.6064311265945435,
"eval_runtime": 1.2076,
"eval_samples_per_second": 82.809,
"eval_steps_per_second": 14.078,
"step": 6900
},
{
"epoch": 0.7644292902906481,
"grad_norm": 3.9340033531188965,
"learning_rate": 3.709144932320898e-05,
"loss": 0.5047724914550781,
"step": 6950
},
{
"epoch": 0.7644292902906481,
"eval_loss": 0.5839043259620667,
"eval_runtime": 1.221,
"eval_samples_per_second": 81.901,
"eval_steps_per_second": 13.923,
"step": 6950
},
{
"epoch": 0.7699287815877032,
"grad_norm": 3.939054250717163,
"learning_rate": 3.692637834268736e-05,
"loss": 0.5168508529663086,
"step": 7000
},
{
"epoch": 0.7699287815877032,
"eval_loss": 0.5967159867286682,
"eval_runtime": 1.2228,
"eval_samples_per_second": 81.776,
"eval_steps_per_second": 13.902,
"step": 7000
},
{
"epoch": 0.7754282728847581,
"grad_norm": 4.098312854766846,
"learning_rate": 3.676130736216574e-05,
"loss": 0.49574569702148436,
"step": 7050
},
{
"epoch": 0.7754282728847581,
"eval_loss": 0.6113559603691101,
"eval_runtime": 1.2197,
"eval_samples_per_second": 81.991,
"eval_steps_per_second": 13.938,
"step": 7050
},
{
"epoch": 0.7809277641818132,
"grad_norm": 5.130489826202393,
"learning_rate": 3.6596236381644103e-05,
"loss": 0.5368572235107422,
"step": 7100
},
{
"epoch": 0.7809277641818132,
"eval_loss": 0.5671849250793457,
"eval_runtime": 1.2087,
"eval_samples_per_second": 82.733,
"eval_steps_per_second": 14.065,
"step": 7100
},
{
"epoch": 0.7864272554788682,
"grad_norm": 3.2629666328430176,
"learning_rate": 3.643116540112248e-05,
"loss": 0.5247505569458008,
"step": 7150
},
{
"epoch": 0.7864272554788682,
"eval_loss": 0.5848333835601807,
"eval_runtime": 1.2165,
"eval_samples_per_second": 82.205,
"eval_steps_per_second": 13.975,
"step": 7150
},
{
"epoch": 0.7919267467759232,
"grad_norm": 3.4071853160858154,
"learning_rate": 3.626609442060086e-05,
"loss": 0.5215546417236329,
"step": 7200
},
{
"epoch": 0.7919267467759232,
"eval_loss": 0.5874826312065125,
"eval_runtime": 1.2062,
"eval_samples_per_second": 82.907,
"eval_steps_per_second": 14.094,
"step": 7200
},
{
"epoch": 0.7974262380729783,
"grad_norm": 4.264019966125488,
"learning_rate": 3.6101023440079236e-05,
"loss": 0.48300968170166014,
"step": 7250
},
{
"epoch": 0.7974262380729783,
"eval_loss": 0.6169635057449341,
"eval_runtime": 1.2014,
"eval_samples_per_second": 83.24,
"eval_steps_per_second": 14.151,
"step": 7250
},
{
"epoch": 0.8029257293700333,
"grad_norm": 3.845081090927124,
"learning_rate": 3.593595245955761e-05,
"loss": 0.5431819152832031,
"step": 7300
},
{
"epoch": 0.8029257293700333,
"eval_loss": 0.5864665508270264,
"eval_runtime": 1.1999,
"eval_samples_per_second": 83.339,
"eval_steps_per_second": 14.168,
"step": 7300
},
{
"epoch": 0.8084252206670883,
"grad_norm": 4.696225166320801,
"learning_rate": 3.577088147903599e-05,
"loss": 0.5017805480957032,
"step": 7350
},
{
"epoch": 0.8084252206670883,
"eval_loss": 0.5771105289459229,
"eval_runtime": 1.3868,
"eval_samples_per_second": 72.106,
"eval_steps_per_second": 12.258,
"step": 7350
},
{
"epoch": 0.8139247119641433,
"grad_norm": 3.846862316131592,
"learning_rate": 3.560581049851436e-05,
"loss": 0.4925709915161133,
"step": 7400
},
{
"epoch": 0.8139247119641433,
"eval_loss": 0.5872745513916016,
"eval_runtime": 1.2193,
"eval_samples_per_second": 82.016,
"eval_steps_per_second": 13.943,
"step": 7400
},
{
"epoch": 0.8194242032611984,
"grad_norm": 5.725467681884766,
"learning_rate": 3.544073951799274e-05,
"loss": 0.5305783081054688,
"step": 7450
},
{
"epoch": 0.8194242032611984,
"eval_loss": 0.5858078002929688,
"eval_runtime": 1.209,
"eval_samples_per_second": 82.716,
"eval_steps_per_second": 14.062,
"step": 7450
},
{
"epoch": 0.8249236945582533,
"grad_norm": 5.1305766105651855,
"learning_rate": 3.5275668537471114e-05,
"loss": 0.49862171173095704,
"step": 7500
},
{
"epoch": 0.8249236945582533,
"eval_loss": 0.5829967260360718,
"eval_runtime": 1.2108,
"eval_samples_per_second": 82.588,
"eval_steps_per_second": 14.04,
"step": 7500
},
{
"epoch": 0.8304231858553084,
"grad_norm": 3.6588644981384277,
"learning_rate": 3.5110597556949486e-05,
"loss": 0.47825916290283205,
"step": 7550
},
{
"epoch": 0.8304231858553084,
"eval_loss": 0.6038760542869568,
"eval_runtime": 1.2158,
"eval_samples_per_second": 82.251,
"eval_steps_per_second": 13.983,
"step": 7550
},
{
"epoch": 0.8359226771523635,
"grad_norm": 4.205902576446533,
"learning_rate": 3.4945526576427866e-05,
"loss": 0.49293697357177735,
"step": 7600
},
{
"epoch": 0.8359226771523635,
"eval_loss": 0.5801113843917847,
"eval_runtime": 1.2352,
"eval_samples_per_second": 80.957,
"eval_steps_per_second": 13.763,
"step": 7600
},
{
"epoch": 0.8414221684494184,
"grad_norm": 3.2005882263183594,
"learning_rate": 3.478045559590624e-05,
"loss": 0.4907111740112305,
"step": 7650
},
{
"epoch": 0.8414221684494184,
"eval_loss": 0.5856965184211731,
"eval_runtime": 1.2264,
"eval_samples_per_second": 81.54,
"eval_steps_per_second": 13.862,
"step": 7650
},
{
"epoch": 0.8469216597464735,
"grad_norm": 5.1610636711120605,
"learning_rate": 3.461538461538461e-05,
"loss": 0.5118446731567383,
"step": 7700
},
{
"epoch": 0.8469216597464735,
"eval_loss": 0.5943632125854492,
"eval_runtime": 1.2029,
"eval_samples_per_second": 83.135,
"eval_steps_per_second": 14.133,
"step": 7700
},
{
"epoch": 0.8524211510435284,
"grad_norm": 3.638803482055664,
"learning_rate": 3.445031363486299e-05,
"loss": 0.5173551559448242,
"step": 7750
},
{
"epoch": 0.8524211510435284,
"eval_loss": 0.5883214473724365,
"eval_runtime": 1.2146,
"eval_samples_per_second": 82.334,
"eval_steps_per_second": 13.997,
"step": 7750
},
{
"epoch": 0.8579206423405835,
"grad_norm": 4.749381065368652,
"learning_rate": 3.428524265434137e-05,
"loss": 0.5153055953979492,
"step": 7800
},
{
"epoch": 0.8579206423405835,
"eval_loss": 0.5808895230293274,
"eval_runtime": 1.2469,
"eval_samples_per_second": 80.201,
"eval_steps_per_second": 13.634,
"step": 7800
},
{
"epoch": 0.8634201336376385,
"grad_norm": 4.376150608062744,
"learning_rate": 3.4120171673819744e-05,
"loss": 0.5378147506713867,
"step": 7850
},
{
"epoch": 0.8634201336376385,
"eval_loss": 0.5930312871932983,
"eval_runtime": 1.3832,
"eval_samples_per_second": 72.299,
"eval_steps_per_second": 12.291,
"step": 7850
},
{
"epoch": 0.8689196249346935,
"grad_norm": 4.232579708099365,
"learning_rate": 3.395510069329812e-05,
"loss": 0.505134048461914,
"step": 7900
},
{
"epoch": 0.8689196249346935,
"eval_loss": 0.6020961999893188,
"eval_runtime": 1.2142,
"eval_samples_per_second": 82.356,
"eval_steps_per_second": 14.0,
"step": 7900
},
{
"epoch": 0.8744191162317486,
"grad_norm": 5.355160713195801,
"learning_rate": 3.3790029712776497e-05,
"loss": 0.5102433776855468,
"step": 7950
},
{
"epoch": 0.8744191162317486,
"eval_loss": 0.5917235016822815,
"eval_runtime": 1.206,
"eval_samples_per_second": 82.917,
"eval_steps_per_second": 14.096,
"step": 7950
},
{
"epoch": 0.8799186075288036,
"grad_norm": 3.3613343238830566,
"learning_rate": 3.3624958732254876e-05,
"loss": 0.4822299194335937,
"step": 8000
},
{
"epoch": 0.8799186075288036,
"eval_loss": 0.5934929251670837,
"eval_runtime": 1.2112,
"eval_samples_per_second": 82.566,
"eval_steps_per_second": 14.036,
"step": 8000
},
{
"epoch": 0.8854180988258586,
"grad_norm": 4.434471130371094,
"learning_rate": 3.345988775173324e-05,
"loss": 0.49528308868408205,
"step": 8050
},
{
"epoch": 0.8854180988258586,
"eval_loss": 0.5964680314064026,
"eval_runtime": 1.2137,
"eval_samples_per_second": 82.39,
"eval_steps_per_second": 14.006,
"step": 8050
},
{
"epoch": 0.8909175901229136,
"grad_norm": 4.2046403884887695,
"learning_rate": 3.329481677121162e-05,
"loss": 0.48887725830078127,
"step": 8100
},
{
"epoch": 0.8909175901229136,
"eval_loss": 0.5806313753128052,
"eval_runtime": 1.2203,
"eval_samples_per_second": 81.947,
"eval_steps_per_second": 13.931,
"step": 8100
},
{
"epoch": 0.8964170814199687,
"grad_norm": 4.626391410827637,
"learning_rate": 3.312974579069e-05,
"loss": 0.5233592987060547,
"step": 8150
},
{
"epoch": 0.8964170814199687,
"eval_loss": 0.6079022884368896,
"eval_runtime": 1.216,
"eval_samples_per_second": 82.236,
"eval_steps_per_second": 13.98,
"step": 8150
},
{
"epoch": 0.9019165727170236,
"grad_norm": 4.376235008239746,
"learning_rate": 3.2964674810168374e-05,
"loss": 0.4639776611328125,
"step": 8200
},
{
"epoch": 0.9019165727170236,
"eval_loss": 0.6205313205718994,
"eval_runtime": 1.2055,
"eval_samples_per_second": 82.955,
"eval_steps_per_second": 14.102,
"step": 8200
},
{
"epoch": 0.9074160640140787,
"grad_norm": 3.8218092918395996,
"learning_rate": 3.279960382964675e-05,
"loss": 0.44373504638671873,
"step": 8250
},
{
"epoch": 0.9074160640140787,
"eval_loss": 0.5643773078918457,
"eval_runtime": 1.2145,
"eval_samples_per_second": 82.339,
"eval_steps_per_second": 13.998,
"step": 8250
},
{
"epoch": 0.9129155553111338,
"grad_norm": 3.81736159324646,
"learning_rate": 3.263453284912513e-05,
"loss": 0.48470027923583986,
"step": 8300
},
{
"epoch": 0.9129155553111338,
"eval_loss": 0.5744062066078186,
"eval_runtime": 1.2167,
"eval_samples_per_second": 82.188,
"eval_steps_per_second": 13.972,
"step": 8300
},
{
"epoch": 0.9184150466081887,
"grad_norm": 5.86279296875,
"learning_rate": 3.24694618686035e-05,
"loss": 0.4852021408081055,
"step": 8350
},
{
"epoch": 0.9184150466081887,
"eval_loss": 0.5889118313789368,
"eval_runtime": 1.423,
"eval_samples_per_second": 70.273,
"eval_steps_per_second": 11.946,
"step": 8350
},
{
"epoch": 0.9239145379052438,
"grad_norm": 3.33119535446167,
"learning_rate": 3.230439088808188e-05,
"loss": 0.47623142242431643,
"step": 8400
},
{
"epoch": 0.9239145379052438,
"eval_loss": 0.6064158082008362,
"eval_runtime": 1.204,
"eval_samples_per_second": 83.056,
"eval_steps_per_second": 14.119,
"step": 8400
},
{
"epoch": 0.9294140292022988,
"grad_norm": 2.885103940963745,
"learning_rate": 3.213931990756025e-05,
"loss": 0.49996829986572267,
"step": 8450
},
{
"epoch": 0.9294140292022988,
"eval_loss": 0.5843780040740967,
"eval_runtime": 1.2023,
"eval_samples_per_second": 83.174,
"eval_steps_per_second": 14.14,
"step": 8450
},
{
"epoch": 0.9349135204993538,
"grad_norm": 4.857532978057861,
"learning_rate": 3.1974248927038625e-05,
"loss": 0.47324295043945314,
"step": 8500
},
{
"epoch": 0.9349135204993538,
"eval_loss": 0.6105228662490845,
"eval_runtime": 1.2083,
"eval_samples_per_second": 82.759,
"eval_steps_per_second": 14.069,
"step": 8500
},
{
"epoch": 0.9404130117964088,
"grad_norm": 3.946885108947754,
"learning_rate": 3.1809177946517005e-05,
"loss": 0.49978759765625,
"step": 8550
},
{
"epoch": 0.9404130117964088,
"eval_loss": 0.5941745638847351,
"eval_runtime": 1.2125,
"eval_samples_per_second": 82.477,
"eval_steps_per_second": 14.021,
"step": 8550
},
{
"epoch": 0.9459125030934639,
"grad_norm": 4.021317005157471,
"learning_rate": 3.164410696599538e-05,
"loss": 0.528785514831543,
"step": 8600
},
{
"epoch": 0.9459125030934639,
"eval_loss": 0.6242286562919617,
"eval_runtime": 1.2102,
"eval_samples_per_second": 82.628,
"eval_steps_per_second": 14.047,
"step": 8600
},
{
"epoch": 0.9514119943905188,
"grad_norm": 3.708808183670044,
"learning_rate": 3.147903598547375e-05,
"loss": 0.46576389312744143,
"step": 8650
},
{
"epoch": 0.9514119943905188,
"eval_loss": 0.611571192741394,
"eval_runtime": 1.204,
"eval_samples_per_second": 83.055,
"eval_steps_per_second": 14.119,
"step": 8650
},
{
"epoch": 0.9569114856875739,
"grad_norm": 3.2899420261383057,
"learning_rate": 3.131396500495213e-05,
"loss": 0.46845787048339843,
"step": 8700
},
{
"epoch": 0.9569114856875739,
"eval_loss": 0.6180684566497803,
"eval_runtime": 1.212,
"eval_samples_per_second": 82.506,
"eval_steps_per_second": 14.026,
"step": 8700
},
{
"epoch": 0.962410976984629,
"grad_norm": 5.375493049621582,
"learning_rate": 3.114889402443051e-05,
"loss": 0.4573846435546875,
"step": 8750
},
{
"epoch": 0.962410976984629,
"eval_loss": 0.6240963935852051,
"eval_runtime": 1.2083,
"eval_samples_per_second": 82.759,
"eval_steps_per_second": 14.069,
"step": 8750
},
{
"epoch": 0.9679104682816839,
"grad_norm": 3.9251935482025146,
"learning_rate": 3.0983823043908876e-05,
"loss": 0.4789009094238281,
"step": 8800
},
{
"epoch": 0.9679104682816839,
"eval_loss": 0.6151527762413025,
"eval_runtime": 1.245,
"eval_samples_per_second": 80.322,
"eval_steps_per_second": 13.655,
"step": 8800
},
{
"epoch": 0.973409959578739,
"grad_norm": 4.760181903839111,
"learning_rate": 3.0818752063387256e-05,
"loss": 0.4835487365722656,
"step": 8850
},
{
"epoch": 0.973409959578739,
"eval_loss": 0.6076204776763916,
"eval_runtime": 1.3823,
"eval_samples_per_second": 72.341,
"eval_steps_per_second": 12.298,
"step": 8850
},
{
"epoch": 0.978909450875794,
"grad_norm": 4.721770763397217,
"learning_rate": 3.0653681082865635e-05,
"loss": 0.4760139083862305,
"step": 8900
},
{
"epoch": 0.978909450875794,
"eval_loss": 0.6116940975189209,
"eval_runtime": 1.2074,
"eval_samples_per_second": 82.823,
"eval_steps_per_second": 14.08,
"step": 8900
},
{
"epoch": 0.984408942172849,
"grad_norm": 2.7520203590393066,
"learning_rate": 3.0488610102344005e-05,
"loss": 0.46280517578125,
"step": 8950
},
{
"epoch": 0.984408942172849,
"eval_loss": 0.594266951084137,
"eval_runtime": 1.2134,
"eval_samples_per_second": 82.416,
"eval_steps_per_second": 14.011,
"step": 8950
},
{
"epoch": 0.989908433469904,
"grad_norm": 3.4478979110717773,
"learning_rate": 3.0323539121822385e-05,
"loss": 0.48518154144287107,
"step": 9000
},
{
"epoch": 0.989908433469904,
"eval_loss": 0.6080638766288757,
"eval_runtime": 1.2202,
"eval_samples_per_second": 81.953,
"eval_steps_per_second": 13.932,
"step": 9000
},
{
"epoch": 0.995407924766959,
"grad_norm": 3.8885610103607178,
"learning_rate": 3.015846814130076e-05,
"loss": 0.4918204116821289,
"step": 9050
},
{
"epoch": 0.995407924766959,
"eval_loss": 0.6131730079650879,
"eval_runtime": 1.236,
"eval_samples_per_second": 80.906,
"eval_steps_per_second": 13.754,
"step": 9050
},
{
"epoch": 1.0008799186075288,
"grad_norm": 3.4417338371276855,
"learning_rate": 2.9993397160779137e-05,
"loss": 0.4655106353759766,
"step": 9100
},
{
"epoch": 1.0008799186075288,
"eval_loss": 0.6303781270980835,
"eval_runtime": 1.2182,
"eval_samples_per_second": 82.087,
"eval_steps_per_second": 13.955,
"step": 9100
},
{
"epoch": 1.0063794099045837,
"grad_norm": 4.042264461517334,
"learning_rate": 2.982832618025751e-05,
"loss": 0.4372904968261719,
"step": 9150
},
{
"epoch": 1.0063794099045837,
"eval_loss": 0.6115362048149109,
"eval_runtime": 1.2191,
"eval_samples_per_second": 82.028,
"eval_steps_per_second": 13.945,
"step": 9150
},
{
"epoch": 1.011878901201639,
"grad_norm": 4.3367018699646,
"learning_rate": 2.966325519973589e-05,
"loss": 0.4454679489135742,
"step": 9200
},
{
"epoch": 1.011878901201639,
"eval_loss": 0.598572850227356,
"eval_runtime": 1.2205,
"eval_samples_per_second": 81.932,
"eval_steps_per_second": 13.928,
"step": 9200
},
{
"epoch": 1.0173783924986939,
"grad_norm": 5.504449844360352,
"learning_rate": 2.9498184219214262e-05,
"loss": 0.4694999694824219,
"step": 9250
},
{
"epoch": 1.0173783924986939,
"eval_loss": 0.5946099162101746,
"eval_runtime": 1.2073,
"eval_samples_per_second": 82.832,
"eval_steps_per_second": 14.081,
"step": 9250
},
{
"epoch": 1.0228778837957488,
"grad_norm": 5.267527103424072,
"learning_rate": 2.933311323869264e-05,
"loss": 0.44829036712646486,
"step": 9300
},
{
"epoch": 1.0228778837957488,
"eval_loss": 0.596511960029602,
"eval_runtime": 1.2164,
"eval_samples_per_second": 82.213,
"eval_steps_per_second": 13.976,
"step": 9300
},
{
"epoch": 1.028377375092804,
"grad_norm": 2.8371832370758057,
"learning_rate": 2.9168042258171015e-05,
"loss": 0.4043942642211914,
"step": 9350
},
{
"epoch": 1.028377375092804,
"eval_loss": 0.600749671459198,
"eval_runtime": 1.2377,
"eval_samples_per_second": 80.796,
"eval_steps_per_second": 13.735,
"step": 9350
},
{
"epoch": 1.033876866389859,
"grad_norm": 3.1648924350738525,
"learning_rate": 2.9002971277649388e-05,
"loss": 0.47807037353515625,
"step": 9400
},
{
"epoch": 1.033876866389859,
"eval_loss": 0.6105673909187317,
"eval_runtime": 1.2193,
"eval_samples_per_second": 82.012,
"eval_steps_per_second": 13.942,
"step": 9400
},
{
"epoch": 1.039376357686914,
"grad_norm": 4.341183662414551,
"learning_rate": 2.8837900297127767e-05,
"loss": 0.4305224609375,
"step": 9450
},
{
"epoch": 1.039376357686914,
"eval_loss": 0.5932527184486389,
"eval_runtime": 1.2151,
"eval_samples_per_second": 82.297,
"eval_steps_per_second": 13.991,
"step": 9450
},
{
"epoch": 1.044875848983969,
"grad_norm": 3.4657225608825684,
"learning_rate": 2.867282931660614e-05,
"loss": 0.3872489929199219,
"step": 9500
},
{
"epoch": 1.044875848983969,
"eval_loss": 0.6022618412971497,
"eval_runtime": 1.203,
"eval_samples_per_second": 83.129,
"eval_steps_per_second": 14.132,
"step": 9500
},
{
"epoch": 1.050375340281024,
"grad_norm": 3.8219797611236572,
"learning_rate": 2.8507758336084517e-05,
"loss": 0.44281375885009766,
"step": 9550
},
{
"epoch": 1.050375340281024,
"eval_loss": 0.5904479026794434,
"eval_runtime": 1.1999,
"eval_samples_per_second": 83.343,
"eval_steps_per_second": 14.168,
"step": 9550
},
{
"epoch": 1.055874831578079,
"grad_norm": 3.437319755554199,
"learning_rate": 2.8342687355562893e-05,
"loss": 0.453095703125,
"step": 9600
},
{
"epoch": 1.055874831578079,
"eval_loss": 0.5905536413192749,
"eval_runtime": 1.2019,
"eval_samples_per_second": 83.203,
"eval_steps_per_second": 14.144,
"step": 9600
},
{
"epoch": 1.061374322875134,
"grad_norm": 5.347193241119385,
"learning_rate": 2.817761637504127e-05,
"loss": 0.4297781753540039,
"step": 9650
},
{
"epoch": 1.061374322875134,
"eval_loss": 0.5929006338119507,
"eval_runtime": 1.2006,
"eval_samples_per_second": 83.292,
"eval_steps_per_second": 14.16,
"step": 9650
},
{
"epoch": 1.066873814172189,
"grad_norm": 3.720005750656128,
"learning_rate": 2.8012545394519642e-05,
"loss": 0.42318790435791015,
"step": 9700
},
{
"epoch": 1.066873814172189,
"eval_loss": 0.5905603766441345,
"eval_runtime": 1.2021,
"eval_samples_per_second": 83.187,
"eval_steps_per_second": 14.142,
"step": 9700
},
{
"epoch": 1.0723733054692441,
"grad_norm": 4.219228267669678,
"learning_rate": 2.784747441399802e-05,
"loss": 0.4420646286010742,
"step": 9750
},
{
"epoch": 1.0723733054692441,
"eval_loss": 0.5723536014556885,
"eval_runtime": 1.2102,
"eval_samples_per_second": 82.63,
"eval_steps_per_second": 14.047,
"step": 9750
},
{
"epoch": 1.077872796766299,
"grad_norm": 5.102869987487793,
"learning_rate": 2.7682403433476395e-05,
"loss": 0.44880119323730466,
"step": 9800
},
{
"epoch": 1.077872796766299,
"eval_loss": 0.5921871662139893,
"eval_runtime": 1.2009,
"eval_samples_per_second": 83.271,
"eval_steps_per_second": 14.156,
"step": 9800
},
{
"epoch": 1.083372288063354,
"grad_norm": 4.417986869812012,
"learning_rate": 2.751733245295477e-05,
"loss": 0.43164543151855467,
"step": 9850
},
{
"epoch": 1.083372288063354,
"eval_loss": 0.5745819211006165,
"eval_runtime": 1.199,
"eval_samples_per_second": 83.404,
"eval_steps_per_second": 14.179,
"step": 9850
},
{
"epoch": 1.0888717793604092,
"grad_norm": 4.315613746643066,
"learning_rate": 2.7352261472433147e-05,
"loss": 0.4114876937866211,
"step": 9900
},
{
"epoch": 1.0888717793604092,
"eval_loss": 0.6222988367080688,
"eval_runtime": 1.2039,
"eval_samples_per_second": 83.064,
"eval_steps_per_second": 14.121,
"step": 9900
},
{
"epoch": 1.0943712706574642,
"grad_norm": 3.8662261962890625,
"learning_rate": 2.7187190491911523e-05,
"loss": 0.4395499420166016,
"step": 9950
},
{
"epoch": 1.0943712706574642,
"eval_loss": 0.598095178604126,
"eval_runtime": 1.2065,
"eval_samples_per_second": 82.886,
"eval_steps_per_second": 14.091,
"step": 9950
},
{
"epoch": 1.0998707619545192,
"grad_norm": 4.77580451965332,
"learning_rate": 2.70221195113899e-05,
"loss": 0.4401175308227539,
"step": 10000
},
{
"epoch": 1.0998707619545192,
"eval_loss": 0.6062231659889221,
"eval_runtime": 1.1984,
"eval_samples_per_second": 83.447,
"eval_steps_per_second": 14.186,
"step": 10000
},
{
"epoch": 1.1053702532515741,
"grad_norm": 5.308359146118164,
"learning_rate": 2.6857048530868276e-05,
"loss": 0.38489757537841796,
"step": 10050
},
{
"epoch": 1.1053702532515741,
"eval_loss": 0.574999988079071,
"eval_runtime": 1.1984,
"eval_samples_per_second": 83.444,
"eval_steps_per_second": 14.186,
"step": 10050
},
{
"epoch": 1.1108697445486293,
"grad_norm": 3.92620587348938,
"learning_rate": 2.669197755034665e-05,
"loss": 0.445535888671875,
"step": 10100
},
{
"epoch": 1.1108697445486293,
"eval_loss": 0.5968570113182068,
"eval_runtime": 1.2009,
"eval_samples_per_second": 83.268,
"eval_steps_per_second": 14.156,
"step": 10100
},
{
"epoch": 1.1163692358456843,
"grad_norm": 3.6382229328155518,
"learning_rate": 2.652690656982503e-05,
"loss": 0.43107017517089846,
"step": 10150
},
{
"epoch": 1.1163692358456843,
"eval_loss": 0.6031837463378906,
"eval_runtime": 1.1994,
"eval_samples_per_second": 83.378,
"eval_steps_per_second": 14.174,
"step": 10150
},
{
"epoch": 1.1218687271427392,
"grad_norm": 5.4295148849487305,
"learning_rate": 2.63618355893034e-05,
"loss": 0.44390846252441407,
"step": 10200
},
{
"epoch": 1.1218687271427392,
"eval_loss": 0.5818211436271667,
"eval_runtime": 1.2017,
"eval_samples_per_second": 83.212,
"eval_steps_per_second": 14.146,
"step": 10200
},
{
"epoch": 1.1273682184397944,
"grad_norm": 4.309296607971191,
"learning_rate": 2.6196764608781774e-05,
"loss": 0.45012378692626953,
"step": 10250
},
{
"epoch": 1.1273682184397944,
"eval_loss": 0.5798439979553223,
"eval_runtime": 1.2245,
"eval_samples_per_second": 81.667,
"eval_steps_per_second": 13.883,
"step": 10250
},
{
"epoch": 1.1328677097368494,
"grad_norm": 4.410998821258545,
"learning_rate": 2.6031693628260154e-05,
"loss": 0.4658625411987305,
"step": 10300
},
{
"epoch": 1.1328677097368494,
"eval_loss": 0.5707818865776062,
"eval_runtime": 1.1991,
"eval_samples_per_second": 83.396,
"eval_steps_per_second": 14.177,
"step": 10300
},
{
"epoch": 1.1383672010339043,
"grad_norm": 2.5657384395599365,
"learning_rate": 2.5866622647738527e-05,
"loss": 0.4424343490600586,
"step": 10350
},
{
"epoch": 1.1383672010339043,
"eval_loss": 0.5677274465560913,
"eval_runtime": 1.1985,
"eval_samples_per_second": 83.439,
"eval_steps_per_second": 14.185,
"step": 10350
},
{
"epoch": 1.1438666923309593,
"grad_norm": 4.544326305389404,
"learning_rate": 2.5701551667216903e-05,
"loss": 0.4189057922363281,
"step": 10400
},
{
"epoch": 1.1438666923309593,
"eval_loss": 0.5669907331466675,
"eval_runtime": 1.2023,
"eval_samples_per_second": 83.172,
"eval_steps_per_second": 14.139,
"step": 10400
},
{
"epoch": 1.1493661836280145,
"grad_norm": 4.390478134155273,
"learning_rate": 2.553648068669528e-05,
"loss": 0.44770816802978514,
"step": 10450
},
{
"epoch": 1.1493661836280145,
"eval_loss": 0.5683467388153076,
"eval_runtime": 1.1991,
"eval_samples_per_second": 83.395,
"eval_steps_per_second": 14.177,
"step": 10450
},
{
"epoch": 1.1548656749250694,
"grad_norm": 3.9074809551239014,
"learning_rate": 2.5371409706173655e-05,
"loss": 0.4494611740112305,
"step": 10500
},
{
"epoch": 1.1548656749250694,
"eval_loss": 0.5813124179840088,
"eval_runtime": 1.1995,
"eval_samples_per_second": 83.365,
"eval_steps_per_second": 14.172,
"step": 10500
},
{
"epoch": 1.1603651662221244,
"grad_norm": 3.1746835708618164,
"learning_rate": 2.520633872565203e-05,
"loss": 0.42440425872802734,
"step": 10550
},
{
"epoch": 1.1603651662221244,
"eval_loss": 0.5736593008041382,
"eval_runtime": 1.2009,
"eval_samples_per_second": 83.272,
"eval_steps_per_second": 14.156,
"step": 10550
},
{
"epoch": 1.1658646575191796,
"grad_norm": 5.491518497467041,
"learning_rate": 2.5041267745130408e-05,
"loss": 0.4350612258911133,
"step": 10600
},
{
"epoch": 1.1658646575191796,
"eval_loss": 0.57778000831604,
"eval_runtime": 1.1993,
"eval_samples_per_second": 83.38,
"eval_steps_per_second": 14.175,
"step": 10600
},
{
"epoch": 1.1713641488162345,
"grad_norm": 4.8435468673706055,
"learning_rate": 2.487619676460878e-05,
"loss": 0.4232054901123047,
"step": 10650
},
{
"epoch": 1.1713641488162345,
"eval_loss": 0.5833326578140259,
"eval_runtime": 1.1979,
"eval_samples_per_second": 83.477,
"eval_steps_per_second": 14.191,
"step": 10650
},
{
"epoch": 1.1768636401132895,
"grad_norm": 5.074549674987793,
"learning_rate": 2.471112578408716e-05,
"loss": 0.45191131591796874,
"step": 10700
},
{
"epoch": 1.1768636401132895,
"eval_loss": 0.5973538160324097,
"eval_runtime": 1.2004,
"eval_samples_per_second": 83.305,
"eval_steps_per_second": 14.162,
"step": 10700
},
{
"epoch": 1.1823631314103444,
"grad_norm": 3.509275436401367,
"learning_rate": 2.4546054803565533e-05,
"loss": 0.4495719528198242,
"step": 10750
},
{
"epoch": 1.1823631314103444,
"eval_loss": 0.5876668095588684,
"eval_runtime": 1.2029,
"eval_samples_per_second": 83.13,
"eval_steps_per_second": 14.132,
"step": 10750
},
{
"epoch": 1.1878626227073996,
"grad_norm": 3.4657552242279053,
"learning_rate": 2.438098382304391e-05,
"loss": 0.4320774459838867,
"step": 10800
},
{
"epoch": 1.1878626227073996,
"eval_loss": 0.5911355018615723,
"eval_runtime": 1.2004,
"eval_samples_per_second": 83.303,
"eval_steps_per_second": 14.161,
"step": 10800
},
{
"epoch": 1.1933621140044546,
"grad_norm": 3.424093008041382,
"learning_rate": 2.4215912842522286e-05,
"loss": 0.41817344665527345,
"step": 10850
},
{
"epoch": 1.1933621140044546,
"eval_loss": 0.558462381362915,
"eval_runtime": 1.2044,
"eval_samples_per_second": 83.032,
"eval_steps_per_second": 14.115,
"step": 10850
},
{
"epoch": 1.1988616053015095,
"grad_norm": 5.278721332550049,
"learning_rate": 2.4050841862000662e-05,
"loss": 0.42692329406738283,
"step": 10900
},
{
"epoch": 1.1988616053015095,
"eval_loss": 0.5609988570213318,
"eval_runtime": 1.2061,
"eval_samples_per_second": 82.911,
"eval_steps_per_second": 14.095,
"step": 10900
},
{
"epoch": 1.2043610965985647,
"grad_norm": 4.2132248878479,
"learning_rate": 2.3885770881479035e-05,
"loss": 0.4087539291381836,
"step": 10950
},
{
"epoch": 1.2043610965985647,
"eval_loss": 0.5824187397956848,
"eval_runtime": 1.2378,
"eval_samples_per_second": 80.789,
"eval_steps_per_second": 13.734,
"step": 10950
},
{
"epoch": 1.2098605878956197,
"grad_norm": 4.436295509338379,
"learning_rate": 2.3720699900957415e-05,
"loss": 0.3884201812744141,
"step": 11000
},
{
"epoch": 1.2098605878956197,
"eval_loss": 0.5735225677490234,
"eval_runtime": 1.2641,
"eval_samples_per_second": 79.108,
"eval_steps_per_second": 13.448,
"step": 11000
},
{
"epoch": 1.2153600791926746,
"grad_norm": 4.041130542755127,
"learning_rate": 2.3555628920435788e-05,
"loss": 0.3993444061279297,
"step": 11050
},
{
"epoch": 1.2153600791926746,
"eval_loss": 0.5744249820709229,
"eval_runtime": 1.2074,
"eval_samples_per_second": 82.822,
"eval_steps_per_second": 14.08,
"step": 11050
},
{
"epoch": 1.2208595704897296,
"grad_norm": 4.301640510559082,
"learning_rate": 2.3390557939914164e-05,
"loss": 0.39464141845703127,
"step": 11100
},
{
"epoch": 1.2208595704897296,
"eval_loss": 0.5948730111122131,
"eval_runtime": 1.2581,
"eval_samples_per_second": 79.487,
"eval_steps_per_second": 13.513,
"step": 11100
},
{
"epoch": 1.2263590617867848,
"grad_norm": 5.845645427703857,
"learning_rate": 2.322548695939254e-05,
"loss": 0.4228610610961914,
"step": 11150
},
{
"epoch": 1.2263590617867848,
"eval_loss": 0.5744452476501465,
"eval_runtime": 1.2349,
"eval_samples_per_second": 80.975,
"eval_steps_per_second": 13.766,
"step": 11150
},
{
"epoch": 1.2318585530838397,
"grad_norm": 4.14743185043335,
"learning_rate": 2.3060415978870913e-05,
"loss": 0.43561710357666017,
"step": 11200
},
{
"epoch": 1.2318585530838397,
"eval_loss": 0.5542231798171997,
"eval_runtime": 1.2462,
"eval_samples_per_second": 80.242,
"eval_steps_per_second": 13.641,
"step": 11200
},
{
"epoch": 1.2373580443808947,
"grad_norm": 4.9092607498168945,
"learning_rate": 2.2895344998349293e-05,
"loss": 0.4485149765014648,
"step": 11250
},
{
"epoch": 1.2373580443808947,
"eval_loss": 0.5608264803886414,
"eval_runtime": 1.2042,
"eval_samples_per_second": 83.044,
"eval_steps_per_second": 14.118,
"step": 11250
},
{
"epoch": 1.2428575356779499,
"grad_norm": 4.795513153076172,
"learning_rate": 2.2730274017827665e-05,
"loss": 0.4002879333496094,
"step": 11300
},
{
"epoch": 1.2428575356779499,
"eval_loss": 0.5752193927764893,
"eval_runtime": 1.2005,
"eval_samples_per_second": 83.3,
"eval_steps_per_second": 14.161,
"step": 11300
},
{
"epoch": 1.2483570269750048,
"grad_norm": 4.756551742553711,
"learning_rate": 2.2565203037306042e-05,
"loss": 0.4129877853393555,
"step": 11350
},
{
"epoch": 1.2483570269750048,
"eval_loss": 0.5692643523216248,
"eval_runtime": 1.202,
"eval_samples_per_second": 83.198,
"eval_steps_per_second": 14.144,
"step": 11350
},
{
"epoch": 1.2538565182720598,
"grad_norm": 4.6832051277160645,
"learning_rate": 2.2400132056784418e-05,
"loss": 0.40815105438232424,
"step": 11400
},
{
"epoch": 1.2538565182720598,
"eval_loss": 0.5672106742858887,
"eval_runtime": 1.2026,
"eval_samples_per_second": 83.153,
"eval_steps_per_second": 14.136,
"step": 11400
},
{
"epoch": 1.2593560095691148,
"grad_norm": 4.295003414154053,
"learning_rate": 2.2235061076262794e-05,
"loss": 0.43860099792480467,
"step": 11450
},
{
"epoch": 1.2593560095691148,
"eval_loss": 0.5500693321228027,
"eval_runtime": 1.1996,
"eval_samples_per_second": 83.363,
"eval_steps_per_second": 14.172,
"step": 11450
},
{
"epoch": 1.26485550086617,
"grad_norm": 3.2815680503845215,
"learning_rate": 2.2069990095741167e-05,
"loss": 0.39200534820556643,
"step": 11500
},
{
"epoch": 1.26485550086617,
"eval_loss": 0.5783631801605225,
"eval_runtime": 1.2001,
"eval_samples_per_second": 83.324,
"eval_steps_per_second": 14.165,
"step": 11500
},
{
"epoch": 1.270354992163225,
"grad_norm": 5.105454921722412,
"learning_rate": 2.1904919115219547e-05,
"loss": 0.447188606262207,
"step": 11550
},
{
"epoch": 1.270354992163225,
"eval_loss": 0.5806690454483032,
"eval_runtime": 1.2018,
"eval_samples_per_second": 83.21,
"eval_steps_per_second": 14.146,
"step": 11550
},
{
"epoch": 1.2758544834602799,
"grad_norm": 7.1614580154418945,
"learning_rate": 2.173984813469792e-05,
"loss": 0.4186487579345703,
"step": 11600
},
{
"epoch": 1.2758544834602799,
"eval_loss": 0.5866115689277649,
"eval_runtime": 1.2043,
"eval_samples_per_second": 83.036,
"eval_steps_per_second": 14.116,
"step": 11600
},
{
"epoch": 1.281353974757335,
"grad_norm": 3.8269095420837402,
"learning_rate": 2.1574777154176296e-05,
"loss": 0.38072307586669923,
"step": 11650
},
{
"epoch": 1.281353974757335,
"eval_loss": 0.5898852944374084,
"eval_runtime": 1.2117,
"eval_samples_per_second": 82.525,
"eval_steps_per_second": 14.029,
"step": 11650
},
{
"epoch": 1.28685346605439,
"grad_norm": 4.064493179321289,
"learning_rate": 2.1409706173654672e-05,
"loss": 0.4382596206665039,
"step": 11700
},
{
"epoch": 1.28685346605439,
"eval_loss": 0.5848357677459717,
"eval_runtime": 1.1999,
"eval_samples_per_second": 83.34,
"eval_steps_per_second": 14.168,
"step": 11700
},
{
"epoch": 1.292352957351445,
"grad_norm": 5.449599742889404,
"learning_rate": 2.124463519313305e-05,
"loss": 0.42343997955322266,
"step": 11750
},
{
"epoch": 1.292352957351445,
"eval_loss": 0.5586597323417664,
"eval_runtime": 1.2023,
"eval_samples_per_second": 83.172,
"eval_steps_per_second": 14.139,
"step": 11750
},
{
"epoch": 1.2978524486485,
"grad_norm": 3.673954725265503,
"learning_rate": 2.107956421261142e-05,
"loss": 0.41550613403320313,
"step": 11800
},
{
"epoch": 1.2978524486485,
"eval_loss": 0.5658605694770813,
"eval_runtime": 1.1991,
"eval_samples_per_second": 83.399,
"eval_steps_per_second": 14.178,
"step": 11800
},
{
"epoch": 1.303351939945555,
"grad_norm": 3.6161746978759766,
"learning_rate": 2.09144932320898e-05,
"loss": 0.4265287780761719,
"step": 11850
},
{
"epoch": 1.303351939945555,
"eval_loss": 0.5512486100196838,
"eval_runtime": 1.2044,
"eval_samples_per_second": 83.029,
"eval_steps_per_second": 14.115,
"step": 11850
},
{
"epoch": 1.30885143124261,
"grad_norm": 4.095085620880127,
"learning_rate": 2.0749422251568174e-05,
"loss": 0.44609962463378905,
"step": 11900
},
{
"epoch": 1.30885143124261,
"eval_loss": 0.5730013847351074,
"eval_runtime": 1.2017,
"eval_samples_per_second": 83.215,
"eval_steps_per_second": 14.147,
"step": 11900
},
{
"epoch": 1.314350922539665,
"grad_norm": 4.820618152618408,
"learning_rate": 2.0584351271046554e-05,
"loss": 0.4422262191772461,
"step": 11950
},
{
"epoch": 1.314350922539665,
"eval_loss": 0.5577285289764404,
"eval_runtime": 1.1984,
"eval_samples_per_second": 83.443,
"eval_steps_per_second": 14.185,
"step": 11950
},
{
"epoch": 1.3198504138367202,
"grad_norm": 3.5373456478118896,
"learning_rate": 2.0419280290524926e-05,
"loss": 0.42433460235595705,
"step": 12000
},
{
"epoch": 1.3198504138367202,
"eval_loss": 0.5625931024551392,
"eval_runtime": 1.1987,
"eval_samples_per_second": 83.422,
"eval_steps_per_second": 14.182,
"step": 12000
},
{
"epoch": 1.3253499051337752,
"grad_norm": 4.760179042816162,
"learning_rate": 2.0254209310003303e-05,
"loss": 0.3792121887207031,
"step": 12050
},
{
"epoch": 1.3253499051337752,
"eval_loss": 0.5574110746383667,
"eval_runtime": 1.2015,
"eval_samples_per_second": 83.233,
"eval_steps_per_second": 14.15,
"step": 12050
},
{
"epoch": 1.3308493964308301,
"grad_norm": 5.790397644042969,
"learning_rate": 2.008913832948168e-05,
"loss": 0.4382122039794922,
"step": 12100
},
{
"epoch": 1.3308493964308301,
"eval_loss": 0.5597708225250244,
"eval_runtime": 1.2092,
"eval_samples_per_second": 82.703,
"eval_steps_per_second": 14.059,
"step": 12100
},
{
"epoch": 1.336348887727885,
"grad_norm": 4.420812606811523,
"learning_rate": 1.9924067348960052e-05,
"loss": 0.42329288482666017,
"step": 12150
},
{
"epoch": 1.336348887727885,
"eval_loss": 0.5556257367134094,
"eval_runtime": 1.1986,
"eval_samples_per_second": 83.431,
"eval_steps_per_second": 14.183,
"step": 12150
},
{
"epoch": 1.3418483790249403,
"grad_norm": 4.655048370361328,
"learning_rate": 1.9758996368438428e-05,
"loss": 0.4278908920288086,
"step": 12200
},
{
"epoch": 1.3418483790249403,
"eval_loss": 0.543867290019989,
"eval_runtime": 1.1984,
"eval_samples_per_second": 83.442,
"eval_steps_per_second": 14.185,
"step": 12200
},
{
"epoch": 1.3473478703219952,
"grad_norm": 4.914540767669678,
"learning_rate": 1.9593925387916804e-05,
"loss": 0.42110458374023435,
"step": 12250
},
{
"epoch": 1.3473478703219952,
"eval_loss": 0.5576221346855164,
"eval_runtime": 1.2024,
"eval_samples_per_second": 83.17,
"eval_steps_per_second": 14.139,
"step": 12250
},
{
"epoch": 1.3528473616190502,
"grad_norm": 3.613415002822876,
"learning_rate": 1.942885440739518e-05,
"loss": 0.408565788269043,
"step": 12300
},
{
"epoch": 1.3528473616190502,
"eval_loss": 0.5335881114006042,
"eval_runtime": 1.1993,
"eval_samples_per_second": 83.383,
"eval_steps_per_second": 14.175,
"step": 12300
},
{
"epoch": 1.3583468529161054,
"grad_norm": 4.228052616119385,
"learning_rate": 1.9263783426873553e-05,
"loss": 0.40878799438476565,
"step": 12350
},
{
"epoch": 1.3583468529161054,
"eval_loss": 0.5544968247413635,
"eval_runtime": 1.2063,
"eval_samples_per_second": 82.896,
"eval_steps_per_second": 14.092,
"step": 12350
},
{
"epoch": 1.3638463442131603,
"grad_norm": 3.1512410640716553,
"learning_rate": 1.9098712446351933e-05,
"loss": 0.40386688232421875,
"step": 12400
},
{
"epoch": 1.3638463442131603,
"eval_loss": 0.5391093492507935,
"eval_runtime": 1.206,
"eval_samples_per_second": 82.92,
"eval_steps_per_second": 14.096,
"step": 12400
},
{
"epoch": 1.3693458355102153,
"grad_norm": 4.095332145690918,
"learning_rate": 1.8933641465830306e-05,
"loss": 0.4119942092895508,
"step": 12450
},
{
"epoch": 1.3693458355102153,
"eval_loss": 0.5375053286552429,
"eval_runtime": 1.1993,
"eval_samples_per_second": 83.383,
"eval_steps_per_second": 14.175,
"step": 12450
},
{
"epoch": 1.3748453268072702,
"grad_norm": 4.36025333404541,
"learning_rate": 1.8768570485308686e-05,
"loss": 0.42032379150390625,
"step": 12500
},
{
"epoch": 1.3748453268072702,
"eval_loss": 0.5409677624702454,
"eval_runtime": 1.1988,
"eval_samples_per_second": 83.417,
"eval_steps_per_second": 14.181,
"step": 12500
},
{
"epoch": 1.3803448181043254,
"grad_norm": 3.8784241676330566,
"learning_rate": 1.860349950478706e-05,
"loss": 0.3923546600341797,
"step": 12550
},
{
"epoch": 1.3803448181043254,
"eval_loss": 0.5505947470664978,
"eval_runtime": 1.2002,
"eval_samples_per_second": 83.318,
"eval_steps_per_second": 14.164,
"step": 12550
},
{
"epoch": 1.3858443094013804,
"grad_norm": 4.052207946777344,
"learning_rate": 1.8438428524265435e-05,
"loss": 0.38611976623535155,
"step": 12600
},
{
"epoch": 1.3858443094013804,
"eval_loss": 0.5389760732650757,
"eval_runtime": 1.2026,
"eval_samples_per_second": 83.155,
"eval_steps_per_second": 14.136,
"step": 12600
},
{
"epoch": 1.3913438006984353,
"grad_norm": 5.018970489501953,
"learning_rate": 1.827335754374381e-05,
"loss": 0.4026565933227539,
"step": 12650
},
{
"epoch": 1.3913438006984353,
"eval_loss": 0.5398291945457458,
"eval_runtime": 1.2079,
"eval_samples_per_second": 82.791,
"eval_steps_per_second": 14.074,
"step": 12650
},
{
"epoch": 1.3968432919954905,
"grad_norm": 3.710087537765503,
"learning_rate": 1.8108286563222187e-05,
"loss": 0.4165144729614258,
"step": 12700
},
{
"epoch": 1.3968432919954905,
"eval_loss": 0.5442482233047485,
"eval_runtime": 1.2705,
"eval_samples_per_second": 78.709,
"eval_steps_per_second": 13.381,
"step": 12700
},
{
"epoch": 1.4023427832925455,
"grad_norm": 4.182759761810303,
"learning_rate": 1.794321558270056e-05,
"loss": 0.3919545745849609,
"step": 12750
},
{
"epoch": 1.4023427832925455,
"eval_loss": 0.5415162444114685,
"eval_runtime": 1.2788,
"eval_samples_per_second": 78.199,
"eval_steps_per_second": 13.294,
"step": 12750
},
{
"epoch": 1.4078422745896004,
"grad_norm": 4.3373870849609375,
"learning_rate": 1.777814460217894e-05,
"loss": 0.40383522033691405,
"step": 12800
},
{
"epoch": 1.4078422745896004,
"eval_loss": 0.5278663635253906,
"eval_runtime": 1.2779,
"eval_samples_per_second": 78.256,
"eval_steps_per_second": 13.304,
"step": 12800
},
{
"epoch": 1.4133417658866554,
"grad_norm": 3.619389533996582,
"learning_rate": 1.7613073621657313e-05,
"loss": 0.44847320556640624,
"step": 12850
},
{
"epoch": 1.4133417658866554,
"eval_loss": 0.5374107360839844,
"eval_runtime": 1.2797,
"eval_samples_per_second": 78.145,
"eval_steps_per_second": 13.285,
"step": 12850
},
{
"epoch": 1.4188412571837106,
"grad_norm": 3.119107246398926,
"learning_rate": 1.744800264113569e-05,
"loss": 0.39309986114501955,
"step": 12900
},
{
"epoch": 1.4188412571837106,
"eval_loss": 0.5523837804794312,
"eval_runtime": 1.278,
"eval_samples_per_second": 78.245,
"eval_steps_per_second": 13.302,
"step": 12900
},
{
"epoch": 1.4243407484807655,
"grad_norm": 3.7152740955352783,
"learning_rate": 1.7282931660614065e-05,
"loss": 0.42365001678466796,
"step": 12950
},
{
"epoch": 1.4243407484807655,
"eval_loss": 0.5404840707778931,
"eval_runtime": 1.2774,
"eval_samples_per_second": 78.282,
"eval_steps_per_second": 13.308,
"step": 12950
},
{
"epoch": 1.4298402397778205,
"grad_norm": 4.347856521606445,
"learning_rate": 1.7117860680092438e-05,
"loss": 0.39466506958007813,
"step": 13000
},
{
"epoch": 1.4298402397778205,
"eval_loss": 0.5432237386703491,
"eval_runtime": 1.2709,
"eval_samples_per_second": 78.687,
"eval_steps_per_second": 13.377,
"step": 13000
},
{
"epoch": 1.4353397310748757,
"grad_norm": 4.440253257751465,
"learning_rate": 1.6952789699570814e-05,
"loss": 0.4289556121826172,
"step": 13050
},
{
"epoch": 1.4353397310748757,
"eval_loss": 0.5323364734649658,
"eval_runtime": 1.1995,
"eval_samples_per_second": 83.369,
"eval_steps_per_second": 14.173,
"step": 13050
},
{
"epoch": 1.4408392223719306,
"grad_norm": 4.130159854888916,
"learning_rate": 1.678771871904919e-05,
"loss": 0.4275970458984375,
"step": 13100
},
{
"epoch": 1.4408392223719306,
"eval_loss": 0.5353785157203674,
"eval_runtime": 1.2118,
"eval_samples_per_second": 82.52,
"eval_steps_per_second": 14.028,
"step": 13100
},
{
"epoch": 1.4463387136689856,
"grad_norm": 3.5807628631591797,
"learning_rate": 1.6622647738527567e-05,
"loss": 0.414808464050293,
"step": 13150
},
{
"epoch": 1.4463387136689856,
"eval_loss": 0.5167968273162842,
"eval_runtime": 1.2016,
"eval_samples_per_second": 83.223,
"eval_steps_per_second": 14.148,
"step": 13150
},
{
"epoch": 1.4518382049660405,
"grad_norm": 3.19081449508667,
"learning_rate": 1.6457576758005943e-05,
"loss": 0.4333197021484375,
"step": 13200
},
{
"epoch": 1.4518382049660405,
"eval_loss": 0.5306875109672546,
"eval_runtime": 1.2826,
"eval_samples_per_second": 77.965,
"eval_steps_per_second": 13.254,
"step": 13200
},
{
"epoch": 1.4573376962630957,
"grad_norm": 3.25466251373291,
"learning_rate": 1.629250577748432e-05,
"loss": 0.39129966735839844,
"step": 13250
},
{
"epoch": 1.4573376962630957,
"eval_loss": 0.5385807752609253,
"eval_runtime": 1.282,
"eval_samples_per_second": 78.006,
"eval_steps_per_second": 13.261,
"step": 13250
},
{
"epoch": 1.4628371875601507,
"grad_norm": 3.3677966594696045,
"learning_rate": 1.6127434796962692e-05,
"loss": 0.40751338958740235,
"step": 13300
},
{
"epoch": 1.4628371875601507,
"eval_loss": 0.516380250453949,
"eval_runtime": 1.2802,
"eval_samples_per_second": 78.112,
"eval_steps_per_second": 13.279,
"step": 13300
},
{
"epoch": 1.4683366788572056,
"grad_norm": 3.450413465499878,
"learning_rate": 1.5962363816441072e-05,
"loss": 0.40498565673828124,
"step": 13350
},
{
"epoch": 1.4683366788572056,
"eval_loss": 0.5298721194267273,
"eval_runtime": 1.2815,
"eval_samples_per_second": 78.034,
"eval_steps_per_second": 13.266,
"step": 13350
},
{
"epoch": 1.4738361701542608,
"grad_norm": 3.3262946605682373,
"learning_rate": 1.5797292835919445e-05,
"loss": 0.3863627243041992,
"step": 13400
},
{
"epoch": 1.4738361701542608,
"eval_loss": 0.516625165939331,
"eval_runtime": 1.2809,
"eval_samples_per_second": 78.067,
"eval_steps_per_second": 13.271,
"step": 13400
},
{
"epoch": 1.4793356614513158,
"grad_norm": 3.365875720977783,
"learning_rate": 1.563222185539782e-05,
"loss": 0.4204134750366211,
"step": 13450
},
{
"epoch": 1.4793356614513158,
"eval_loss": 0.5206517577171326,
"eval_runtime": 1.2817,
"eval_samples_per_second": 78.02,
"eval_steps_per_second": 13.263,
"step": 13450
},
{
"epoch": 1.4848351527483707,
"grad_norm": 3.2131149768829346,
"learning_rate": 1.5467150874876197e-05,
"loss": 0.40632450103759765,
"step": 13500
},
{
"epoch": 1.4848351527483707,
"eval_loss": 0.5308406949043274,
"eval_runtime": 1.2811,
"eval_samples_per_second": 78.057,
"eval_steps_per_second": 13.27,
"step": 13500
},
{
"epoch": 1.4903346440454257,
"grad_norm": 3.364225387573242,
"learning_rate": 1.5302079894354574e-05,
"loss": 0.4048501205444336,
"step": 13550
},
{
"epoch": 1.4903346440454257,
"eval_loss": 0.52863609790802,
"eval_runtime": 1.2813,
"eval_samples_per_second": 78.044,
"eval_steps_per_second": 13.268,
"step": 13550
},
{
"epoch": 1.4958341353424809,
"grad_norm": 3.1679489612579346,
"learning_rate": 1.5137008913832946e-05,
"loss": 0.4006618881225586,
"step": 13600
},
{
"epoch": 1.4958341353424809,
"eval_loss": 0.517315149307251,
"eval_runtime": 1.2806,
"eval_samples_per_second": 78.087,
"eval_steps_per_second": 13.275,
"step": 13600
},
{
"epoch": 1.5013336266395358,
"grad_norm": 4.6463518142700195,
"learning_rate": 1.4971937933311324e-05,
"loss": 0.4259402847290039,
"step": 13650
},
{
"epoch": 1.5013336266395358,
"eval_loss": 0.5239192843437195,
"eval_runtime": 1.2834,
"eval_samples_per_second": 77.921,
"eval_steps_per_second": 13.246,
"step": 13650
},
{
"epoch": 1.506833117936591,
"grad_norm": 3.8338677883148193,
"learning_rate": 1.4806866952789699e-05,
"loss": 0.45359893798828127,
"step": 13700
},
{
"epoch": 1.506833117936591,
"eval_loss": 0.5376471877098083,
"eval_runtime": 1.1985,
"eval_samples_per_second": 83.437,
"eval_steps_per_second": 14.184,
"step": 13700
},
{
"epoch": 1.512332609233646,
"grad_norm": 4.828174114227295,
"learning_rate": 1.4641795972268075e-05,
"loss": 0.4245915985107422,
"step": 13750
},
{
"epoch": 1.512332609233646,
"eval_loss": 0.545063853263855,
"eval_runtime": 1.2015,
"eval_samples_per_second": 83.226,
"eval_steps_per_second": 14.148,
"step": 13750
},
{
"epoch": 1.517832100530701,
"grad_norm": 4.063199996948242,
"learning_rate": 1.4476724991746452e-05,
"loss": 0.42612323760986326,
"step": 13800
},
{
"epoch": 1.517832100530701,
"eval_loss": 0.5337764620780945,
"eval_runtime": 1.2015,
"eval_samples_per_second": 83.227,
"eval_steps_per_second": 14.149,
"step": 13800
},
{
"epoch": 1.523331591827756,
"grad_norm": 4.409724235534668,
"learning_rate": 1.4311654011224828e-05,
"loss": 0.4229386138916016,
"step": 13850
},
{
"epoch": 1.523331591827756,
"eval_loss": 0.5254413485527039,
"eval_runtime": 1.2114,
"eval_samples_per_second": 82.546,
"eval_steps_per_second": 14.033,
"step": 13850
},
{
"epoch": 1.5288310831248109,
"grad_norm": 4.604098320007324,
"learning_rate": 1.4146583030703202e-05,
"loss": 0.4207559967041016,
"step": 13900
},
{
"epoch": 1.5288310831248109,
"eval_loss": 0.5319836139678955,
"eval_runtime": 1.2009,
"eval_samples_per_second": 83.273,
"eval_steps_per_second": 14.156,
"step": 13900
},
{
"epoch": 1.5343305744218658,
"grad_norm": 3.5800247192382812,
"learning_rate": 1.3981512050181579e-05,
"loss": 0.4052052307128906,
"step": 13950
},
{
"epoch": 1.5343305744218658,
"eval_loss": 0.5325583815574646,
"eval_runtime": 1.2085,
"eval_samples_per_second": 82.747,
"eval_steps_per_second": 14.067,
"step": 13950
},
{
"epoch": 1.539830065718921,
"grad_norm": 4.180997371673584,
"learning_rate": 1.3816441069659955e-05,
"loss": 0.41810825347900393,
"step": 14000
},
{
"epoch": 1.539830065718921,
"eval_loss": 0.5244957804679871,
"eval_runtime": 1.1981,
"eval_samples_per_second": 83.464,
"eval_steps_per_second": 14.189,
"step": 14000
},
{
"epoch": 1.5453295570159762,
"grad_norm": 4.035894393920898,
"learning_rate": 1.365137008913833e-05,
"loss": 0.4168061065673828,
"step": 14050
},
{
"epoch": 1.5453295570159762,
"eval_loss": 0.5245411396026611,
"eval_runtime": 1.1978,
"eval_samples_per_second": 83.485,
"eval_steps_per_second": 14.192,
"step": 14050
},
{
"epoch": 1.5508290483130311,
"grad_norm": 2.8827695846557617,
"learning_rate": 1.3486299108616706e-05,
"loss": 0.40900135040283203,
"step": 14100
},
{
"epoch": 1.5508290483130311,
"eval_loss": 0.5175855755805969,
"eval_runtime": 1.2709,
"eval_samples_per_second": 78.686,
"eval_steps_per_second": 13.377,
"step": 14100
},
{
"epoch": 1.556328539610086,
"grad_norm": 4.7631516456604,
"learning_rate": 1.3321228128095082e-05,
"loss": 0.4275320434570313,
"step": 14150
},
{
"epoch": 1.556328539610086,
"eval_loss": 0.5145242214202881,
"eval_runtime": 1.2206,
"eval_samples_per_second": 81.93,
"eval_steps_per_second": 13.928,
"step": 14150
},
{
"epoch": 1.561828030907141,
"grad_norm": 4.559270858764648,
"learning_rate": 1.3156157147573458e-05,
"loss": 0.3759859848022461,
"step": 14200
},
{
"epoch": 1.561828030907141,
"eval_loss": 0.5150010585784912,
"eval_runtime": 1.1982,
"eval_samples_per_second": 83.457,
"eval_steps_per_second": 14.188,
"step": 14200
},
{
"epoch": 1.567327522204196,
"grad_norm": 3.3630456924438477,
"learning_rate": 1.2991086167051833e-05,
"loss": 0.39138256072998046,
"step": 14250
},
{
"epoch": 1.567327522204196,
"eval_loss": 0.5457283854484558,
"eval_runtime": 1.2043,
"eval_samples_per_second": 83.038,
"eval_steps_per_second": 14.116,
"step": 14250
},
{
"epoch": 1.572827013501251,
"grad_norm": 3.256690740585327,
"learning_rate": 1.2826015186530209e-05,
"loss": 0.3982016372680664,
"step": 14300
},
{
"epoch": 1.572827013501251,
"eval_loss": 0.5194215774536133,
"eval_runtime": 1.2004,
"eval_samples_per_second": 83.303,
"eval_steps_per_second": 14.161,
"step": 14300
},
{
"epoch": 1.5783265047983062,
"grad_norm": 4.9264020919799805,
"learning_rate": 1.2660944206008584e-05,
"loss": 0.37310329437255857,
"step": 14350
},
{
"epoch": 1.5783265047983062,
"eval_loss": 0.537217915058136,
"eval_runtime": 1.2037,
"eval_samples_per_second": 83.077,
"eval_steps_per_second": 14.123,
"step": 14350
},
{
"epoch": 1.5838259960953613,
"grad_norm": 3.917881965637207,
"learning_rate": 1.2495873225486958e-05,
"loss": 0.40028915405273435,
"step": 14400
},
{
"epoch": 1.5838259960953613,
"eval_loss": 0.5212844014167786,
"eval_runtime": 1.2024,
"eval_samples_per_second": 83.166,
"eval_steps_per_second": 14.138,
"step": 14400
},
{
"epoch": 1.5893254873924163,
"grad_norm": 3.8361563682556152,
"learning_rate": 1.2330802244965334e-05,
"loss": 0.40108360290527345,
"step": 14450
},
{
"epoch": 1.5893254873924163,
"eval_loss": 0.5083942413330078,
"eval_runtime": 1.2046,
"eval_samples_per_second": 83.018,
"eval_steps_per_second": 14.113,
"step": 14450
},
{
"epoch": 1.5948249786894713,
"grad_norm": 3.184602737426758,
"learning_rate": 1.216573126444371e-05,
"loss": 0.4339041519165039,
"step": 14500
},
{
"epoch": 1.5948249786894713,
"eval_loss": 0.5342686176300049,
"eval_runtime": 1.2031,
"eval_samples_per_second": 83.12,
"eval_steps_per_second": 14.13,
"step": 14500
},
{
"epoch": 1.6003244699865262,
"grad_norm": 4.491968154907227,
"learning_rate": 1.2000660283922087e-05,
"loss": 0.3967703628540039,
"step": 14550
},
{
"epoch": 1.6003244699865262,
"eval_loss": 0.520110547542572,
"eval_runtime": 1.2023,
"eval_samples_per_second": 83.17,
"eval_steps_per_second": 14.139,
"step": 14550
},
{
"epoch": 1.6058239612835812,
"grad_norm": 3.78524112701416,
"learning_rate": 1.1835589303400462e-05,
"loss": 0.3790835189819336,
"step": 14600
},
{
"epoch": 1.6058239612835812,
"eval_loss": 0.5195483565330505,
"eval_runtime": 1.2016,
"eval_samples_per_second": 83.223,
"eval_steps_per_second": 14.148,
"step": 14600
},
{
"epoch": 1.6113234525806361,
"grad_norm": 4.135509014129639,
"learning_rate": 1.1670518322878838e-05,
"loss": 0.40242374420166016,
"step": 14650
},
{
"epoch": 1.6113234525806361,
"eval_loss": 0.516440212726593,
"eval_runtime": 1.2033,
"eval_samples_per_second": 83.105,
"eval_steps_per_second": 14.128,
"step": 14650
},
{
"epoch": 1.6168229438776913,
"grad_norm": 4.210612773895264,
"learning_rate": 1.1505447342357214e-05,
"loss": 0.4028606414794922,
"step": 14700
},
{
"epoch": 1.6168229438776913,
"eval_loss": 0.5266108512878418,
"eval_runtime": 1.2087,
"eval_samples_per_second": 82.733,
"eval_steps_per_second": 14.065,
"step": 14700
},
{
"epoch": 1.6223224351747465,
"grad_norm": 5.338522911071777,
"learning_rate": 1.1340376361835589e-05,
"loss": 0.39550567626953126,
"step": 14750
},
{
"epoch": 1.6223224351747465,
"eval_loss": 0.5249260663986206,
"eval_runtime": 1.2038,
"eval_samples_per_second": 83.073,
"eval_steps_per_second": 14.122,
"step": 14750
},
{
"epoch": 1.6278219264718015,
"grad_norm": 2.723923921585083,
"learning_rate": 1.1175305381313965e-05,
"loss": 0.41064441680908204,
"step": 14800
},
{
"epoch": 1.6278219264718015,
"eval_loss": 0.520072877407074,
"eval_runtime": 1.2005,
"eval_samples_per_second": 83.302,
"eval_steps_per_second": 14.161,
"step": 14800
},
{
"epoch": 1.6333214177688564,
"grad_norm": 3.793158531188965,
"learning_rate": 1.1010234400792341e-05,
"loss": 0.38922351837158203,
"step": 14850
},
{
"epoch": 1.6333214177688564,
"eval_loss": 0.5236958861351013,
"eval_runtime": 1.2009,
"eval_samples_per_second": 83.269,
"eval_steps_per_second": 14.156,
"step": 14850
},
{
"epoch": 1.6388209090659114,
"grad_norm": 5.206042766571045,
"learning_rate": 1.0845163420270717e-05,
"loss": 0.3783760070800781,
"step": 14900
},
{
"epoch": 1.6388209090659114,
"eval_loss": 0.5220252871513367,
"eval_runtime": 1.2755,
"eval_samples_per_second": 78.399,
"eval_steps_per_second": 13.328,
"step": 14900
},
{
"epoch": 1.6443204003629663,
"grad_norm": 3.5335276126861572,
"learning_rate": 1.0680092439749092e-05,
"loss": 0.36626754760742186,
"step": 14950
},
{
"epoch": 1.6443204003629663,
"eval_loss": 0.5257189869880676,
"eval_runtime": 1.2584,
"eval_samples_per_second": 79.467,
"eval_steps_per_second": 13.509,
"step": 14950
},
{
"epoch": 1.6498198916600213,
"grad_norm": 5.903299331665039,
"learning_rate": 1.0515021459227468e-05,
"loss": 0.4300186538696289,
"step": 15000
},
{
"epoch": 1.6498198916600213,
"eval_loss": 0.5119779109954834,
"eval_runtime": 1.2824,
"eval_samples_per_second": 77.977,
"eval_steps_per_second": 13.256,
"step": 15000
},
{
"epoch": 1.6553193829570765,
"grad_norm": 4.042174339294434,
"learning_rate": 1.0349950478705845e-05,
"loss": 0.4231399154663086,
"step": 15050
},
{
"epoch": 1.6553193829570765,
"eval_loss": 0.5127305388450623,
"eval_runtime": 1.2793,
"eval_samples_per_second": 78.169,
"eval_steps_per_second": 13.289,
"step": 15050
},
{
"epoch": 1.6608188742541314,
"grad_norm": 4.595501899719238,
"learning_rate": 1.018487949818422e-05,
"loss": 0.3916609573364258,
"step": 15100
},
{
"epoch": 1.6608188742541314,
"eval_loss": 0.5223040580749512,
"eval_runtime": 1.2795,
"eval_samples_per_second": 78.156,
"eval_steps_per_second": 13.286,
"step": 15100
},
{
"epoch": 1.6663183655511866,
"grad_norm": 4.4538798332214355,
"learning_rate": 1.0019808517662595e-05,
"loss": 0.4184587860107422,
"step": 15150
},
{
"epoch": 1.6663183655511866,
"eval_loss": 0.534669041633606,
"eval_runtime": 1.2782,
"eval_samples_per_second": 78.233,
"eval_steps_per_second": 13.3,
"step": 15150
},
{
"epoch": 1.6718178568482416,
"grad_norm": 3.8044581413269043,
"learning_rate": 9.854737537140972e-06,
"loss": 0.39158470153808594,
"step": 15200
},
{
"epoch": 1.6718178568482416,
"eval_loss": 0.5418866872787476,
"eval_runtime": 1.2799,
"eval_samples_per_second": 78.131,
"eval_steps_per_second": 13.282,
"step": 15200
},
{
"epoch": 1.6773173481452965,
"grad_norm": 2.9677321910858154,
"learning_rate": 9.689666556619348e-06,
"loss": 0.43468849182128905,
"step": 15250
},
{
"epoch": 1.6773173481452965,
"eval_loss": 0.526294469833374,
"eval_runtime": 1.2805,
"eval_samples_per_second": 78.096,
"eval_steps_per_second": 13.276,
"step": 15250
},
{
"epoch": 1.6828168394423515,
"grad_norm": 3.6569182872772217,
"learning_rate": 9.52459557609772e-06,
"loss": 0.4084419631958008,
"step": 15300
},
{
"epoch": 1.6828168394423515,
"eval_loss": 0.5179707407951355,
"eval_runtime": 1.2802,
"eval_samples_per_second": 78.114,
"eval_steps_per_second": 13.279,
"step": 15300
},
{
"epoch": 1.6883163307394065,
"grad_norm": 4.213144302368164,
"learning_rate": 9.359524595576097e-06,
"loss": 0.40570945739746095,
"step": 15350
},
{
"epoch": 1.6883163307394065,
"eval_loss": 0.523230791091919,
"eval_runtime": 1.2787,
"eval_samples_per_second": 78.203,
"eval_steps_per_second": 13.294,
"step": 15350
},
{
"epoch": 1.6938158220364616,
"grad_norm": 4.362399578094482,
"learning_rate": 9.194453615054473e-06,
"loss": 0.40546306610107424,
"step": 15400
},
{
"epoch": 1.6938158220364616,
"eval_loss": 0.5279385447502136,
"eval_runtime": 1.2871,
"eval_samples_per_second": 77.697,
"eval_steps_per_second": 13.208,
"step": 15400
},
{
"epoch": 1.6993153133335166,
"grad_norm": 5.424959182739258,
"learning_rate": 9.02938263453285e-06,
"loss": 0.39811588287353517,
"step": 15450
},
{
"epoch": 1.6993153133335166,
"eval_loss": 0.538982093334198,
"eval_runtime": 1.3011,
"eval_samples_per_second": 76.856,
"eval_steps_per_second": 13.065,
"step": 15450
},
{
"epoch": 1.7048148046305718,
"grad_norm": 3.6755897998809814,
"learning_rate": 8.864311654011224e-06,
"loss": 0.4292662811279297,
"step": 15500
},
{
"epoch": 1.7048148046305718,
"eval_loss": 0.5277052521705627,
"eval_runtime": 1.2769,
"eval_samples_per_second": 78.312,
"eval_steps_per_second": 13.313,
"step": 15500
},
{
"epoch": 1.7103142959276267,
"grad_norm": 3.7990050315856934,
"learning_rate": 8.6992406734896e-06,
"loss": 0.38744674682617186,
"step": 15550
},
{
"epoch": 1.7103142959276267,
"eval_loss": 0.5234823226928711,
"eval_runtime": 1.2814,
"eval_samples_per_second": 78.04,
"eval_steps_per_second": 13.267,
"step": 15550
},
{
"epoch": 1.7158137872246817,
"grad_norm": 5.55524206161499,
"learning_rate": 8.534169692967977e-06,
"loss": 0.39183277130126953,
"step": 15600
},
{
"epoch": 1.7158137872246817,
"eval_loss": 0.5209484100341797,
"eval_runtime": 1.2795,
"eval_samples_per_second": 78.157,
"eval_steps_per_second": 13.287,
"step": 15600
},
{
"epoch": 1.7213132785217367,
"grad_norm": 4.018246173858643,
"learning_rate": 8.369098712446351e-06,
"loss": 0.4041017532348633,
"step": 15650
},
{
"epoch": 1.7213132785217367,
"eval_loss": 0.526258111000061,
"eval_runtime": 1.2793,
"eval_samples_per_second": 78.17,
"eval_steps_per_second": 13.289,
"step": 15650
},
{
"epoch": 1.7268127698187916,
"grad_norm": 4.710935592651367,
"learning_rate": 8.204027731924728e-06,
"loss": 0.3836952209472656,
"step": 15700
},
{
"epoch": 1.7268127698187916,
"eval_loss": 0.5209237933158875,
"eval_runtime": 1.279,
"eval_samples_per_second": 78.187,
"eval_steps_per_second": 13.292,
"step": 15700
},
{
"epoch": 1.7323122611158468,
"grad_norm": 3.7639029026031494,
"learning_rate": 8.038956751403104e-06,
"loss": 0.3907876968383789,
"step": 15750
},
{
"epoch": 1.7323122611158468,
"eval_loss": 0.5245873928070068,
"eval_runtime": 1.2785,
"eval_samples_per_second": 78.214,
"eval_steps_per_second": 13.296,
"step": 15750
},
{
"epoch": 1.7378117524129018,
"grad_norm": 3.944993257522583,
"learning_rate": 7.87388577088148e-06,
"loss": 0.3886819839477539,
"step": 15800
},
{
"epoch": 1.7378117524129018,
"eval_loss": 0.5302055478096008,
"eval_runtime": 1.2805,
"eval_samples_per_second": 78.095,
"eval_steps_per_second": 13.276,
"step": 15800
},
{
"epoch": 1.743311243709957,
"grad_norm": 3.7543132305145264,
"learning_rate": 7.708814790359855e-06,
"loss": 0.4201182174682617,
"step": 15850
},
{
"epoch": 1.743311243709957,
"eval_loss": 0.5063754320144653,
"eval_runtime": 1.2803,
"eval_samples_per_second": 78.105,
"eval_steps_per_second": 13.278,
"step": 15850
},
{
"epoch": 1.748810735007012,
"grad_norm": 2.934755325317383,
"learning_rate": 7.543743809838231e-06,
"loss": 0.3904559326171875,
"step": 15900
},
{
"epoch": 1.748810735007012,
"eval_loss": 0.5102057456970215,
"eval_runtime": 1.2789,
"eval_samples_per_second": 78.19,
"eval_steps_per_second": 13.292,
"step": 15900
},
{
"epoch": 1.7543102263040669,
"grad_norm": 4.1210246086120605,
"learning_rate": 7.378672829316606e-06,
"loss": 0.3794166946411133,
"step": 15950
},
{
"epoch": 1.7543102263040669,
"eval_loss": 0.5126526355743408,
"eval_runtime": 1.2826,
"eval_samples_per_second": 77.967,
"eval_steps_per_second": 13.254,
"step": 15950
},
{
"epoch": 1.7598097176011218,
"grad_norm": 3.7067854404449463,
"learning_rate": 7.213601848794982e-06,
"loss": 0.3692531967163086,
"step": 16000
},
{
"epoch": 1.7598097176011218,
"eval_loss": 0.5274832248687744,
"eval_runtime": 1.2797,
"eval_samples_per_second": 78.143,
"eval_steps_per_second": 13.284,
"step": 16000
},
{
"epoch": 1.7653092088981768,
"grad_norm": 3.6420602798461914,
"learning_rate": 7.048530868273357e-06,
"loss": 0.3824466705322266,
"step": 16050
},
{
"epoch": 1.7653092088981768,
"eval_loss": 0.5196187496185303,
"eval_runtime": 1.2795,
"eval_samples_per_second": 78.158,
"eval_steps_per_second": 13.287,
"step": 16050
},
{
"epoch": 1.770808700195232,
"grad_norm": 4.638594150543213,
"learning_rate": 6.883459887751733e-06,
"loss": 0.4514438629150391,
"step": 16100
},
{
"epoch": 1.770808700195232,
"eval_loss": 0.5215907096862793,
"eval_runtime": 1.2805,
"eval_samples_per_second": 78.097,
"eval_steps_per_second": 13.277,
"step": 16100
},
{
"epoch": 1.776308191492287,
"grad_norm": 3.9953904151916504,
"learning_rate": 6.718388907230109e-06,
"loss": 0.387623176574707,
"step": 16150
},
{
"epoch": 1.776308191492287,
"eval_loss": 0.5224502682685852,
"eval_runtime": 1.2817,
"eval_samples_per_second": 78.022,
"eval_steps_per_second": 13.264,
"step": 16150
},
{
"epoch": 1.781807682789342,
"grad_norm": 4.487403869628906,
"learning_rate": 6.553317926708485e-06,
"loss": 0.4063478088378906,
"step": 16200
},
{
"epoch": 1.781807682789342,
"eval_loss": 0.5166334509849548,
"eval_runtime": 1.277,
"eval_samples_per_second": 78.307,
"eval_steps_per_second": 13.312,
"step": 16200
},
{
"epoch": 1.787307174086397,
"grad_norm": 3.7964556217193604,
"learning_rate": 6.3882469461868605e-06,
"loss": 0.3855398559570313,
"step": 16250
},
{
"epoch": 1.787307174086397,
"eval_loss": 0.5154201984405518,
"eval_runtime": 1.2833,
"eval_samples_per_second": 77.926,
"eval_steps_per_second": 13.247,
"step": 16250
},
{
"epoch": 1.792806665383452,
"grad_norm": 4.513696193695068,
"learning_rate": 6.223175965665237e-06,
"loss": 0.3669796371459961,
"step": 16300
},
{
"epoch": 1.792806665383452,
"eval_loss": 0.5084086656570435,
"eval_runtime": 1.28,
"eval_samples_per_second": 78.125,
"eval_steps_per_second": 13.281,
"step": 16300
},
{
"epoch": 1.798306156680507,
"grad_norm": 3.982877254486084,
"learning_rate": 6.058104985143612e-06,
"loss": 0.38849113464355467,
"step": 16350
},
{
"epoch": 1.798306156680507,
"eval_loss": 0.5200368762016296,
"eval_runtime": 1.2802,
"eval_samples_per_second": 78.112,
"eval_steps_per_second": 13.279,
"step": 16350
},
{
"epoch": 1.803805647977562,
"grad_norm": 3.997793436050415,
"learning_rate": 5.8930340046219876e-06,
"loss": 0.39702865600585935,
"step": 16400
},
{
"epoch": 1.803805647977562,
"eval_loss": 0.5119373798370361,
"eval_runtime": 1.283,
"eval_samples_per_second": 77.941,
"eval_steps_per_second": 13.25,
"step": 16400
},
{
"epoch": 1.8093051392746171,
"grad_norm": 3.6325302124023438,
"learning_rate": 5.727963024100363e-06,
"loss": 0.37990386962890627,
"step": 16450
},
{
"epoch": 1.8093051392746171,
"eval_loss": 0.5215651988983154,
"eval_runtime": 1.2798,
"eval_samples_per_second": 78.139,
"eval_steps_per_second": 13.284,
"step": 16450
},
{
"epoch": 1.814804630571672,
"grad_norm": 4.198485374450684,
"learning_rate": 5.562892043578738e-06,
"loss": 0.412078857421875,
"step": 16500
},
{
"epoch": 1.814804630571672,
"eval_loss": 0.5170506238937378,
"eval_runtime": 1.2894,
"eval_samples_per_second": 77.558,
"eval_steps_per_second": 13.185,
"step": 16500
},
{
"epoch": 1.8203041218687273,
"grad_norm": 4.591159820556641,
"learning_rate": 5.397821063057115e-06,
"loss": 0.37816055297851564,
"step": 16550
},
{
"epoch": 1.8203041218687273,
"eval_loss": 0.5147603750228882,
"eval_runtime": 1.2799,
"eval_samples_per_second": 78.134,
"eval_steps_per_second": 13.283,
"step": 16550
},
{
"epoch": 1.8258036131657822,
"grad_norm": 4.216943264007568,
"learning_rate": 5.23275008253549e-06,
"loss": 0.39028087615966794,
"step": 16600
},
{
"epoch": 1.8258036131657822,
"eval_loss": 0.5204047560691833,
"eval_runtime": 1.2795,
"eval_samples_per_second": 78.156,
"eval_steps_per_second": 13.286,
"step": 16600
},
{
"epoch": 1.8313031044628372,
"grad_norm": 4.006322383880615,
"learning_rate": 5.067679102013866e-06,
"loss": 0.38647769927978515,
"step": 16650
},
{
"epoch": 1.8313031044628372,
"eval_loss": 0.5153352618217468,
"eval_runtime": 1.279,
"eval_samples_per_second": 78.184,
"eval_steps_per_second": 13.291,
"step": 16650
},
{
"epoch": 1.8368025957598921,
"grad_norm": 4.710324287414551,
"learning_rate": 4.902608121492242e-06,
"loss": 0.356781005859375,
"step": 16700
},
{
"epoch": 1.8368025957598921,
"eval_loss": 0.5207862257957458,
"eval_runtime": 1.2799,
"eval_samples_per_second": 78.134,
"eval_steps_per_second": 13.283,
"step": 16700
},
{
"epoch": 1.842302087056947,
"grad_norm": 4.920437812805176,
"learning_rate": 4.737537140970618e-06,
"loss": 0.37074081420898436,
"step": 16750
},
{
"epoch": 1.842302087056947,
"eval_loss": 0.5112919807434082,
"eval_runtime": 1.2801,
"eval_samples_per_second": 78.118,
"eval_steps_per_second": 13.28,
"step": 16750
},
{
"epoch": 1.8478015783540023,
"grad_norm": 4.515045166015625,
"learning_rate": 4.5724661604489934e-06,
"loss": 0.4274590301513672,
"step": 16800
},
{
"epoch": 1.8478015783540023,
"eval_loss": 0.5242478847503662,
"eval_runtime": 1.279,
"eval_samples_per_second": 78.188,
"eval_steps_per_second": 13.292,
"step": 16800
},
{
"epoch": 1.8533010696510572,
"grad_norm": 3.6244614124298096,
"learning_rate": 4.40739517992737e-06,
"loss": 0.3897795867919922,
"step": 16850
},
{
"epoch": 1.8533010696510572,
"eval_loss": 0.5210970044136047,
"eval_runtime": 1.2792,
"eval_samples_per_second": 78.176,
"eval_steps_per_second": 13.29,
"step": 16850
},
{
"epoch": 1.8588005609481124,
"grad_norm": 4.448500633239746,
"learning_rate": 4.242324199405744e-06,
"loss": 0.43310935974121095,
"step": 16900
},
{
"epoch": 1.8588005609481124,
"eval_loss": 0.5130022764205933,
"eval_runtime": 1.2867,
"eval_samples_per_second": 77.716,
"eval_steps_per_second": 13.212,
"step": 16900
},
{
"epoch": 1.8643000522451674,
"grad_norm": 5.259810924530029,
"learning_rate": 4.07725321888412e-06,
"loss": 0.4260225677490234,
"step": 16950
},
{
"epoch": 1.8643000522451674,
"eval_loss": 0.5134211778640747,
"eval_runtime": 1.2967,
"eval_samples_per_second": 77.117,
"eval_steps_per_second": 13.11,
"step": 16950
},
{
"epoch": 1.8697995435422223,
"grad_norm": 4.863224983215332,
"learning_rate": 3.912182238362496e-06,
"loss": 0.3758648681640625,
"step": 17000
},
{
"epoch": 1.8697995435422223,
"eval_loss": 0.5177444219589233,
"eval_runtime": 1.28,
"eval_samples_per_second": 78.125,
"eval_steps_per_second": 13.281,
"step": 17000
},
{
"epoch": 1.8752990348392773,
"grad_norm": 4.33119535446167,
"learning_rate": 3.747111257840872e-06,
"loss": 0.3959685516357422,
"step": 17050
},
{
"epoch": 1.8752990348392773,
"eval_loss": 0.5147886872291565,
"eval_runtime": 1.2779,
"eval_samples_per_second": 78.252,
"eval_steps_per_second": 13.303,
"step": 17050
},
{
"epoch": 1.8807985261363322,
"grad_norm": 4.343754768371582,
"learning_rate": 3.582040277319247e-06,
"loss": 0.3876182556152344,
"step": 17100
},
{
"epoch": 1.8807985261363322,
"eval_loss": 0.5101519227027893,
"eval_runtime": 1.2814,
"eval_samples_per_second": 78.041,
"eval_steps_per_second": 13.267,
"step": 17100
},
{
"epoch": 1.8862980174333874,
"grad_norm": 4.579135894775391,
"learning_rate": 3.416969296797623e-06,
"loss": 0.3915593338012695,
"step": 17150
},
{
"epoch": 1.8862980174333874,
"eval_loss": 0.5131881833076477,
"eval_runtime": 1.3052,
"eval_samples_per_second": 76.615,
"eval_steps_per_second": 13.025,
"step": 17150
},
{
"epoch": 1.8917975087304424,
"grad_norm": 4.940543174743652,
"learning_rate": 3.251898316275999e-06,
"loss": 0.38781646728515623,
"step": 17200
},
{
"epoch": 1.8917975087304424,
"eval_loss": 0.514817476272583,
"eval_runtime": 1.2836,
"eval_samples_per_second": 77.907,
"eval_steps_per_second": 13.244,
"step": 17200
},
{
"epoch": 1.8972970000274976,
"grad_norm": 5.684414386749268,
"learning_rate": 3.0868273357543743e-06,
"loss": 0.40284725189208986,
"step": 17250
},
{
"epoch": 1.8972970000274976,
"eval_loss": 0.5099514126777649,
"eval_runtime": 1.3521,
"eval_samples_per_second": 73.959,
"eval_steps_per_second": 12.573,
"step": 17250
},
{
"epoch": 1.9027964913245525,
"grad_norm": 4.87332820892334,
"learning_rate": 2.92175635523275e-06,
"loss": 0.40561714172363283,
"step": 17300
},
{
"epoch": 1.9027964913245525,
"eval_loss": 0.5140570402145386,
"eval_runtime": 1.2856,
"eval_samples_per_second": 77.787,
"eval_steps_per_second": 13.224,
"step": 17300
},
{
"epoch": 1.9082959826216075,
"grad_norm": 4.406585216522217,
"learning_rate": 2.756685374711126e-06,
"loss": 0.4014255523681641,
"step": 17350
},
{
"epoch": 1.9082959826216075,
"eval_loss": 0.5200029611587524,
"eval_runtime": 1.2949,
"eval_samples_per_second": 77.224,
"eval_steps_per_second": 13.128,
"step": 17350
},
{
"epoch": 1.9137954739186624,
"grad_norm": 3.8450374603271484,
"learning_rate": 2.591614394189502e-06,
"loss": 0.3946284103393555,
"step": 17400
},
{
"epoch": 1.9137954739186624,
"eval_loss": 0.5157837867736816,
"eval_runtime": 1.2818,
"eval_samples_per_second": 78.013,
"eval_steps_per_second": 13.262,
"step": 17400
},
{
"epoch": 1.9192949652157174,
"grad_norm": 2.9785866737365723,
"learning_rate": 2.4265434136678772e-06,
"loss": 0.38735130310058596,
"step": 17450
},
{
"epoch": 1.9192949652157174,
"eval_loss": 0.5129509568214417,
"eval_runtime": 1.2915,
"eval_samples_per_second": 77.427,
"eval_steps_per_second": 13.163,
"step": 17450
},
{
"epoch": 1.9247944565127726,
"grad_norm": 4.774247646331787,
"learning_rate": 2.2614724331462527e-06,
"loss": 0.3915607452392578,
"step": 17500
},
{
"epoch": 1.9247944565127726,
"eval_loss": 0.512159526348114,
"eval_runtime": 1.3529,
"eval_samples_per_second": 73.915,
"eval_steps_per_second": 12.566,
"step": 17500
},
{
"epoch": 1.9302939478098275,
"grad_norm": 3.1161727905273438,
"learning_rate": 2.0964014526246285e-06,
"loss": 0.3839557647705078,
"step": 17550
},
{
"epoch": 1.9302939478098275,
"eval_loss": 0.5124543905258179,
"eval_runtime": 1.3002,
"eval_samples_per_second": 76.909,
"eval_steps_per_second": 13.075,
"step": 17550
},
{
"epoch": 1.9357934391068827,
"grad_norm": 4.420716762542725,
"learning_rate": 1.9313304721030043e-06,
"loss": 0.4010445022583008,
"step": 17600
},
{
"epoch": 1.9357934391068827,
"eval_loss": 0.5172660946846008,
"eval_runtime": 1.2925,
"eval_samples_per_second": 77.37,
"eval_steps_per_second": 13.153,
"step": 17600
},
{
"epoch": 1.9412929304039377,
"grad_norm": 4.979782581329346,
"learning_rate": 1.76625949158138e-06,
"loss": 0.3870741653442383,
"step": 17650
},
{
"epoch": 1.9412929304039377,
"eval_loss": 0.5163105130195618,
"eval_runtime": 1.2824,
"eval_samples_per_second": 77.978,
"eval_steps_per_second": 13.256,
"step": 17650
},
{
"epoch": 1.9467924217009926,
"grad_norm": 5.315701484680176,
"learning_rate": 1.6011885110597558e-06,
"loss": 0.3857357406616211,
"step": 17700
},
{
"epoch": 1.9467924217009926,
"eval_loss": 0.5164580345153809,
"eval_runtime": 1.2821,
"eval_samples_per_second": 77.995,
"eval_steps_per_second": 13.259,
"step": 17700
},
{
"epoch": 1.9522919129980476,
"grad_norm": 3.6524667739868164,
"learning_rate": 1.4361175305381314e-06,
"loss": 0.42781547546386717,
"step": 17750
},
{
"epoch": 1.9522919129980476,
"eval_loss": 0.5149794816970825,
"eval_runtime": 1.3408,
"eval_samples_per_second": 74.583,
"eval_steps_per_second": 12.679,
"step": 17750
},
{
"epoch": 1.9577914042951026,
"grad_norm": 4.06256103515625,
"learning_rate": 1.2710465500165073e-06,
"loss": 0.380059700012207,
"step": 17800
},
{
"epoch": 1.9577914042951026,
"eval_loss": 0.5115500688552856,
"eval_runtime": 1.3186,
"eval_samples_per_second": 75.841,
"eval_steps_per_second": 12.893,
"step": 17800
},
{
"epoch": 1.9632908955921577,
"grad_norm": 3.9045357704162598,
"learning_rate": 1.1059755694948827e-06,
"loss": 0.38892536163330077,
"step": 17850
},
{
"epoch": 1.9632908955921577,
"eval_loss": 0.5084894895553589,
"eval_runtime": 1.2809,
"eval_samples_per_second": 78.07,
"eval_steps_per_second": 13.272,
"step": 17850
},
{
"epoch": 1.9687903868892127,
"grad_norm": 4.216691970825195,
"learning_rate": 9.409045889732585e-07,
"loss": 0.40333850860595705,
"step": 17900
},
{
"epoch": 1.9687903868892127,
"eval_loss": 0.5091243982315063,
"eval_runtime": 1.3023,
"eval_samples_per_second": 76.788,
"eval_steps_per_second": 13.054,
"step": 17900
},
{
"epoch": 1.9742898781862679,
"grad_norm": 4.339031219482422,
"learning_rate": 7.758336084516343e-07,
"loss": 0.41892166137695314,
"step": 17950
},
{
"epoch": 1.9742898781862679,
"eval_loss": 0.5089672207832336,
"eval_runtime": 1.3698,
"eval_samples_per_second": 73.001,
"eval_steps_per_second": 12.41,
"step": 17950
},
{
"epoch": 1.9797893694833228,
"grad_norm": 5.501232147216797,
"learning_rate": 6.107626279300099e-07,
"loss": 0.38524158477783205,
"step": 18000
},
{
"epoch": 1.9797893694833228,
"eval_loss": 0.5088917016983032,
"eval_runtime": 1.3056,
"eval_samples_per_second": 76.593,
"eval_steps_per_second": 13.021,
"step": 18000
},
{
"epoch": 1.9852888607803778,
"grad_norm": 4.044425010681152,
"learning_rate": 4.456916474083856e-07,
"loss": 0.36035297393798826,
"step": 18050
},
{
"epoch": 1.9852888607803778,
"eval_loss": 0.50870680809021,
"eval_runtime": 1.2937,
"eval_samples_per_second": 77.298,
"eval_steps_per_second": 13.141,
"step": 18050
},
{
"epoch": 1.9907883520774328,
"grad_norm": 3.8273727893829346,
"learning_rate": 2.8062066688676135e-07,
"loss": 0.3866265869140625,
"step": 18100
},
{
"epoch": 1.9907883520774328,
"eval_loss": 0.5090622901916504,
"eval_runtime": 1.2874,
"eval_samples_per_second": 77.679,
"eval_steps_per_second": 13.205,
"step": 18100
},
{
"epoch": 1.9962878433744877,
"grad_norm": 5.9300537109375,
"learning_rate": 1.15549686365137e-07,
"loss": 0.3838529586791992,
"step": 18150
},
{
"epoch": 1.9962878433744877,
"eval_loss": 0.5087066292762756,
"eval_runtime": 1.2885,
"eval_samples_per_second": 77.61,
"eval_steps_per_second": 13.194,
"step": 18150
}
],
"logging_steps": 50,
"max_steps": 18184,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.6375279506569626e+17,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}