Image-Text-to-Text
Transformers
Safetensors
ocr
vision-language
lightonocr
document-understanding
catmus
manuscript
medieval
multilingual
conversational
Instructions to use wjbmattingly/LightOnOCR-2-1B-catmus with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use wjbmattingly/LightOnOCR-2-1B-catmus with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("image-text-to-text", model="wjbmattingly/LightOnOCR-2-1B-catmus") messages = [ { "role": "user", "content": [ {"type": "image", "url": "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/p-blog/candy.JPG"}, {"type": "text", "text": "What animal is on the candy?"} ] }, ] pipe(text=messages)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("wjbmattingly/LightOnOCR-2-1B-catmus", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use wjbmattingly/LightOnOCR-2-1B-catmus with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "wjbmattingly/LightOnOCR-2-1B-catmus" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "wjbmattingly/LightOnOCR-2-1B-catmus", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Describe this image in one sentence." }, { "type": "image_url", "image_url": { "url": "https://cdn.britannica.com/61/93061-050-99147DCE/Statue-of-Liberty-Island-New-York-Bay.jpg" } } ] } ] }'Use Docker
docker model run hf.co/wjbmattingly/LightOnOCR-2-1B-catmus
- SGLang
How to use wjbmattingly/LightOnOCR-2-1B-catmus with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "wjbmattingly/LightOnOCR-2-1B-catmus" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "wjbmattingly/LightOnOCR-2-1B-catmus", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Describe this image in one sentence." }, { "type": "image_url", "image_url": { "url": "https://cdn.britannica.com/61/93061-050-99147DCE/Statue-of-Liberty-Island-New-York-Bay.jpg" } } ] } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "wjbmattingly/LightOnOCR-2-1B-catmus" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "wjbmattingly/LightOnOCR-2-1B-catmus", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Describe this image in one sentence." }, { "type": "image_url", "image_url": { "url": "https://cdn.britannica.com/61/93061-050-99147DCE/Statue-of-Liberty-Island-New-York-Bay.jpg" } } ] } ] }' - Docker Model Runner
How to use wjbmattingly/LightOnOCR-2-1B-catmus with Docker Model Runner:
docker model run hf.co/wjbmattingly/LightOnOCR-2-1B-catmus
| { | |
| "best_global_step": 15850, | |
| "best_metric": 0.5063754320144653, | |
| "best_model_checkpoint": "output/LightOnOCR-ft-catmus/checkpoint-6500", | |
| "epoch": 2.0, | |
| "eval_steps": 50, | |
| "global_step": 18184, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.0054994912970550225, | |
| "grad_norm": 1.7269556522369385, | |
| "learning_rate": 5.9871244635193135e-05, | |
| "loss": 3.2000225830078124, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.0054994912970550225, | |
| "eval_loss": 2.544747829437256, | |
| "eval_runtime": 1.22, | |
| "eval_samples_per_second": 81.966, | |
| "eval_steps_per_second": 13.934, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.010998982594110045, | |
| "grad_norm": 2.1817049980163574, | |
| "learning_rate": 5.970617365467151e-05, | |
| "loss": 2.204842987060547, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.010998982594110045, | |
| "eval_loss": 1.9304633140563965, | |
| "eval_runtime": 1.2142, | |
| "eval_samples_per_second": 82.358, | |
| "eval_steps_per_second": 14.001, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.01649847389116507, | |
| "grad_norm": 2.861886739730835, | |
| "learning_rate": 5.954110267414989e-05, | |
| "loss": 1.7260311889648436, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.01649847389116507, | |
| "eval_loss": 1.7684886455535889, | |
| "eval_runtime": 1.2169, | |
| "eval_samples_per_second": 82.178, | |
| "eval_steps_per_second": 13.97, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.02199796518822009, | |
| "grad_norm": 2.9910781383514404, | |
| "learning_rate": 5.937603169362826e-05, | |
| "loss": 1.5795289611816405, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.02199796518822009, | |
| "eval_loss": 1.5510659217834473, | |
| "eval_runtime": 1.2158, | |
| "eval_samples_per_second": 82.249, | |
| "eval_steps_per_second": 13.982, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.027497456485275112, | |
| "grad_norm": 3.234337329864502, | |
| "learning_rate": 5.921096071310663e-05, | |
| "loss": 1.4427146911621094, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.027497456485275112, | |
| "eval_loss": 1.4127395153045654, | |
| "eval_runtime": 1.2374, | |
| "eval_samples_per_second": 80.816, | |
| "eval_steps_per_second": 13.739, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.03299694778233014, | |
| "grad_norm": 3.6628358364105225, | |
| "learning_rate": 5.904588973258501e-05, | |
| "loss": 1.3803778076171875, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.03299694778233014, | |
| "eval_loss": 1.3498808145523071, | |
| "eval_runtime": 1.2372, | |
| "eval_samples_per_second": 80.827, | |
| "eval_steps_per_second": 13.741, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.03849643907938516, | |
| "grad_norm": 3.2028181552886963, | |
| "learning_rate": 5.8880818752063386e-05, | |
| "loss": 1.2370665740966797, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.03849643907938516, | |
| "eval_loss": 1.3298417329788208, | |
| "eval_runtime": 1.2864, | |
| "eval_samples_per_second": 77.736, | |
| "eval_steps_per_second": 13.215, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.04399593037644018, | |
| "grad_norm": 3.344433307647705, | |
| "learning_rate": 5.8715747771541766e-05, | |
| "loss": 1.1885470581054687, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.04399593037644018, | |
| "eval_loss": 1.296607494354248, | |
| "eval_runtime": 1.2337, | |
| "eval_samples_per_second": 81.058, | |
| "eval_steps_per_second": 13.78, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.0494954216734952, | |
| "grad_norm": 3.601663827896118, | |
| "learning_rate": 5.855067679102014e-05, | |
| "loss": 1.149856185913086, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 0.0494954216734952, | |
| "eval_loss": 1.264522910118103, | |
| "eval_runtime": 1.2178, | |
| "eval_samples_per_second": 82.114, | |
| "eval_steps_per_second": 13.959, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 0.054994912970550223, | |
| "grad_norm": 4.889139175415039, | |
| "learning_rate": 5.838560581049852e-05, | |
| "loss": 1.0299188232421874, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.054994912970550223, | |
| "eval_loss": 1.2139334678649902, | |
| "eval_runtime": 1.2138, | |
| "eval_samples_per_second": 82.388, | |
| "eval_steps_per_second": 14.006, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.060494404267605245, | |
| "grad_norm": 4.471691608428955, | |
| "learning_rate": 5.822053482997689e-05, | |
| "loss": 1.063873519897461, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 0.060494404267605245, | |
| "eval_loss": 1.1947441101074219, | |
| "eval_runtime": 1.2397, | |
| "eval_samples_per_second": 80.663, | |
| "eval_steps_per_second": 13.713, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 0.06599389556466027, | |
| "grad_norm": 5.005523204803467, | |
| "learning_rate": 5.805546384945527e-05, | |
| "loss": 1.0306187438964844, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.06599389556466027, | |
| "eval_loss": 1.1054185628890991, | |
| "eval_runtime": 1.2867, | |
| "eval_samples_per_second": 77.72, | |
| "eval_steps_per_second": 13.212, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.07149338686171529, | |
| "grad_norm": 5.433160781860352, | |
| "learning_rate": 5.7890392868933643e-05, | |
| "loss": 0.9948115539550781, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 0.07149338686171529, | |
| "eval_loss": 1.118335247039795, | |
| "eval_runtime": 1.2905, | |
| "eval_samples_per_second": 77.488, | |
| "eval_steps_per_second": 13.173, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 0.07699287815877032, | |
| "grad_norm": 4.089204788208008, | |
| "learning_rate": 5.7725321888412016e-05, | |
| "loss": 0.9623870086669922, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.07699287815877032, | |
| "eval_loss": 1.1011381149291992, | |
| "eval_runtime": 1.2137, | |
| "eval_samples_per_second": 82.396, | |
| "eval_steps_per_second": 14.007, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.08249236945582533, | |
| "grad_norm": 4.5177459716796875, | |
| "learning_rate": 5.7560250907890396e-05, | |
| "loss": 0.9822674560546875, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 0.08249236945582533, | |
| "eval_loss": 1.0355230569839478, | |
| "eval_runtime": 1.2185, | |
| "eval_samples_per_second": 82.066, | |
| "eval_steps_per_second": 13.951, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 0.08799186075288036, | |
| "grad_norm": 5.314192295074463, | |
| "learning_rate": 5.7395179927368776e-05, | |
| "loss": 0.9478108978271484, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.08799186075288036, | |
| "eval_loss": 1.026939868927002, | |
| "eval_runtime": 1.2207, | |
| "eval_samples_per_second": 81.923, | |
| "eval_steps_per_second": 13.927, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.09349135204993538, | |
| "grad_norm": 4.419743061065674, | |
| "learning_rate": 5.723010894684714e-05, | |
| "loss": 0.9230728149414062, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 0.09349135204993538, | |
| "eval_loss": 1.0253421068191528, | |
| "eval_runtime": 1.2215, | |
| "eval_samples_per_second": 81.867, | |
| "eval_steps_per_second": 13.917, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 0.0989908433469904, | |
| "grad_norm": 4.689808368682861, | |
| "learning_rate": 5.706503796632552e-05, | |
| "loss": 0.9336647033691406, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 0.0989908433469904, | |
| "eval_loss": 0.9888076782226562, | |
| "eval_runtime": 1.2198, | |
| "eval_samples_per_second": 81.981, | |
| "eval_steps_per_second": 13.937, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 0.10449033464404543, | |
| "grad_norm": 4.178891181945801, | |
| "learning_rate": 5.68999669858039e-05, | |
| "loss": 0.8509888458251953, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 0.10449033464404543, | |
| "eval_loss": 0.9283347129821777, | |
| "eval_runtime": 1.2217, | |
| "eval_samples_per_second": 81.854, | |
| "eval_steps_per_second": 13.915, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 0.10998982594110045, | |
| "grad_norm": 4.549170017242432, | |
| "learning_rate": 5.6734896005282274e-05, | |
| "loss": 0.8530999755859375, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.10998982594110045, | |
| "eval_loss": 0.9180505871772766, | |
| "eval_runtime": 1.2178, | |
| "eval_samples_per_second": 82.114, | |
| "eval_steps_per_second": 13.959, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.11548931723815548, | |
| "grad_norm": 5.8048095703125, | |
| "learning_rate": 5.656982502476065e-05, | |
| "loss": 0.8161511993408204, | |
| "step": 1050 | |
| }, | |
| { | |
| "epoch": 0.11548931723815548, | |
| "eval_loss": 0.9668211936950684, | |
| "eval_runtime": 1.2152, | |
| "eval_samples_per_second": 82.292, | |
| "eval_steps_per_second": 13.99, | |
| "step": 1050 | |
| }, | |
| { | |
| "epoch": 0.12098880853521049, | |
| "grad_norm": 4.776002883911133, | |
| "learning_rate": 5.6404754044239026e-05, | |
| "loss": 0.8362539672851562, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 0.12098880853521049, | |
| "eval_loss": 0.9686654806137085, | |
| "eval_runtime": 1.21, | |
| "eval_samples_per_second": 82.647, | |
| "eval_steps_per_second": 14.05, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 0.1264882998322655, | |
| "grad_norm": 4.652673721313477, | |
| "learning_rate": 5.62396830637174e-05, | |
| "loss": 0.8160650634765625, | |
| "step": 1150 | |
| }, | |
| { | |
| "epoch": 0.1264882998322655, | |
| "eval_loss": 0.9779856204986572, | |
| "eval_runtime": 1.2121, | |
| "eval_samples_per_second": 82.5, | |
| "eval_steps_per_second": 14.025, | |
| "step": 1150 | |
| }, | |
| { | |
| "epoch": 0.13198779112932055, | |
| "grad_norm": 4.988180160522461, | |
| "learning_rate": 5.607461208319577e-05, | |
| "loss": 0.8510865020751953, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 0.13198779112932055, | |
| "eval_loss": 0.9197137951850891, | |
| "eval_runtime": 1.2363, | |
| "eval_samples_per_second": 80.884, | |
| "eval_steps_per_second": 13.75, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 0.13748728242637556, | |
| "grad_norm": 5.33247709274292, | |
| "learning_rate": 5.590954110267415e-05, | |
| "loss": 0.8393131256103515, | |
| "step": 1250 | |
| }, | |
| { | |
| "epoch": 0.13748728242637556, | |
| "eval_loss": 0.9012404084205627, | |
| "eval_runtime": 1.2371, | |
| "eval_samples_per_second": 80.834, | |
| "eval_steps_per_second": 13.742, | |
| "step": 1250 | |
| }, | |
| { | |
| "epoch": 0.14298677372343058, | |
| "grad_norm": 4.81198787689209, | |
| "learning_rate": 5.5744470122152525e-05, | |
| "loss": 0.7720973205566406, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 0.14298677372343058, | |
| "eval_loss": 0.8723539710044861, | |
| "eval_runtime": 1.2195, | |
| "eval_samples_per_second": 81.999, | |
| "eval_steps_per_second": 13.94, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 0.1484862650204856, | |
| "grad_norm": 4.492185115814209, | |
| "learning_rate": 5.5579399141630904e-05, | |
| "loss": 0.8052091217041015, | |
| "step": 1350 | |
| }, | |
| { | |
| "epoch": 0.1484862650204856, | |
| "eval_loss": 0.8542118668556213, | |
| "eval_runtime": 1.2288, | |
| "eval_samples_per_second": 81.379, | |
| "eval_steps_per_second": 13.834, | |
| "step": 1350 | |
| }, | |
| { | |
| "epoch": 0.15398575631754063, | |
| "grad_norm": 3.353337287902832, | |
| "learning_rate": 5.541432816110928e-05, | |
| "loss": 0.7565326690673828, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 0.15398575631754063, | |
| "eval_loss": 0.8505687117576599, | |
| "eval_runtime": 1.2947, | |
| "eval_samples_per_second": 77.24, | |
| "eval_steps_per_second": 13.131, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 0.15948524761459565, | |
| "grad_norm": 4.658541202545166, | |
| "learning_rate": 5.524925718058765e-05, | |
| "loss": 0.7905632781982422, | |
| "step": 1450 | |
| }, | |
| { | |
| "epoch": 0.15948524761459565, | |
| "eval_loss": 0.8416154980659485, | |
| "eval_runtime": 1.3011, | |
| "eval_samples_per_second": 76.857, | |
| "eval_steps_per_second": 13.066, | |
| "step": 1450 | |
| }, | |
| { | |
| "epoch": 0.16498473891165066, | |
| "grad_norm": 4.894554615020752, | |
| "learning_rate": 5.508418620006603e-05, | |
| "loss": 0.7522599029541016, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.16498473891165066, | |
| "eval_loss": 0.8781094551086426, | |
| "eval_runtime": 1.3077, | |
| "eval_samples_per_second": 76.472, | |
| "eval_steps_per_second": 13.0, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.1704842302087057, | |
| "grad_norm": 5.099001407623291, | |
| "learning_rate": 5.491911521954441e-05, | |
| "loss": 0.7591278076171875, | |
| "step": 1550 | |
| }, | |
| { | |
| "epoch": 0.1704842302087057, | |
| "eval_loss": 0.8455641269683838, | |
| "eval_runtime": 1.3309, | |
| "eval_samples_per_second": 75.138, | |
| "eval_steps_per_second": 12.773, | |
| "step": 1550 | |
| }, | |
| { | |
| "epoch": 0.17598372150576072, | |
| "grad_norm": 4.108503818511963, | |
| "learning_rate": 5.4754044239022776e-05, | |
| "loss": 0.7117195129394531, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 0.17598372150576072, | |
| "eval_loss": 0.8469740152359009, | |
| "eval_runtime": 1.3312, | |
| "eval_samples_per_second": 75.123, | |
| "eval_steps_per_second": 12.771, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 0.18148321280281574, | |
| "grad_norm": 4.5479536056518555, | |
| "learning_rate": 5.4588973258501155e-05, | |
| "loss": 0.7624311828613282, | |
| "step": 1650 | |
| }, | |
| { | |
| "epoch": 0.18148321280281574, | |
| "eval_loss": 0.8670312762260437, | |
| "eval_runtime": 1.3395, | |
| "eval_samples_per_second": 74.652, | |
| "eval_steps_per_second": 12.691, | |
| "step": 1650 | |
| }, | |
| { | |
| "epoch": 0.18698270409987075, | |
| "grad_norm": 4.809026718139648, | |
| "learning_rate": 5.4423902277979535e-05, | |
| "loss": 0.7137515258789062, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 0.18698270409987075, | |
| "eval_loss": 0.8062080144882202, | |
| "eval_runtime": 1.3269, | |
| "eval_samples_per_second": 75.364, | |
| "eval_steps_per_second": 12.812, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 0.1924821953969258, | |
| "grad_norm": 5.400925636291504, | |
| "learning_rate": 5.4258831297457914e-05, | |
| "loss": 0.6972386932373047, | |
| "step": 1750 | |
| }, | |
| { | |
| "epoch": 0.1924821953969258, | |
| "eval_loss": 0.8285601735115051, | |
| "eval_runtime": 1.3236, | |
| "eval_samples_per_second": 75.551, | |
| "eval_steps_per_second": 12.844, | |
| "step": 1750 | |
| }, | |
| { | |
| "epoch": 0.1979816866939808, | |
| "grad_norm": 6.0628461837768555, | |
| "learning_rate": 5.409376031693628e-05, | |
| "loss": 0.7547286987304688, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 0.1979816866939808, | |
| "eval_loss": 0.8063403964042664, | |
| "eval_runtime": 1.3254, | |
| "eval_samples_per_second": 75.448, | |
| "eval_steps_per_second": 12.826, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 0.20348117799103582, | |
| "grad_norm": 5.176665306091309, | |
| "learning_rate": 5.392868933641466e-05, | |
| "loss": 0.7166018676757813, | |
| "step": 1850 | |
| }, | |
| { | |
| "epoch": 0.20348117799103582, | |
| "eval_loss": 0.7977473735809326, | |
| "eval_runtime": 1.3331, | |
| "eval_samples_per_second": 75.013, | |
| "eval_steps_per_second": 12.752, | |
| "step": 1850 | |
| }, | |
| { | |
| "epoch": 0.20898066928809086, | |
| "grad_norm": 5.566205024719238, | |
| "learning_rate": 5.376361835589304e-05, | |
| "loss": 0.7202009582519531, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 0.20898066928809086, | |
| "eval_loss": 0.7941867709159851, | |
| "eval_runtime": 1.2966, | |
| "eval_samples_per_second": 77.126, | |
| "eval_steps_per_second": 13.112, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 0.21448016058514588, | |
| "grad_norm": 6.071581840515137, | |
| "learning_rate": 5.359854737537141e-05, | |
| "loss": 0.718297119140625, | |
| "step": 1950 | |
| }, | |
| { | |
| "epoch": 0.21448016058514588, | |
| "eval_loss": 0.8194384574890137, | |
| "eval_runtime": 1.2884, | |
| "eval_samples_per_second": 77.613, | |
| "eval_steps_per_second": 13.194, | |
| "step": 1950 | |
| }, | |
| { | |
| "epoch": 0.2199796518822009, | |
| "grad_norm": 5.566873073577881, | |
| "learning_rate": 5.3433476394849786e-05, | |
| "loss": 0.7216673278808594, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 0.2199796518822009, | |
| "eval_loss": 0.7815269231796265, | |
| "eval_runtime": 1.2875, | |
| "eval_samples_per_second": 77.668, | |
| "eval_steps_per_second": 13.204, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 0.2254791431792559, | |
| "grad_norm": 5.567185878753662, | |
| "learning_rate": 5.3268405414328165e-05, | |
| "loss": 0.7164375305175781, | |
| "step": 2050 | |
| }, | |
| { | |
| "epoch": 0.2254791431792559, | |
| "eval_loss": 0.8178561925888062, | |
| "eval_runtime": 1.2891, | |
| "eval_samples_per_second": 77.574, | |
| "eval_steps_per_second": 13.188, | |
| "step": 2050 | |
| }, | |
| { | |
| "epoch": 0.23097863447631095, | |
| "grad_norm": 4.171028137207031, | |
| "learning_rate": 5.310333443380654e-05, | |
| "loss": 0.6996173095703125, | |
| "step": 2100 | |
| }, | |
| { | |
| "epoch": 0.23097863447631095, | |
| "eval_loss": 0.791594922542572, | |
| "eval_runtime": 1.287, | |
| "eval_samples_per_second": 77.698, | |
| "eval_steps_per_second": 13.209, | |
| "step": 2100 | |
| }, | |
| { | |
| "epoch": 0.23647812577336597, | |
| "grad_norm": 4.468926906585693, | |
| "learning_rate": 5.293826345328491e-05, | |
| "loss": 0.685142822265625, | |
| "step": 2150 | |
| }, | |
| { | |
| "epoch": 0.23647812577336597, | |
| "eval_loss": 0.8206081986427307, | |
| "eval_runtime": 1.2124, | |
| "eval_samples_per_second": 82.479, | |
| "eval_steps_per_second": 14.021, | |
| "step": 2150 | |
| }, | |
| { | |
| "epoch": 0.24197761707042098, | |
| "grad_norm": 3.9659266471862793, | |
| "learning_rate": 5.277319247276329e-05, | |
| "loss": 0.701788330078125, | |
| "step": 2200 | |
| }, | |
| { | |
| "epoch": 0.24197761707042098, | |
| "eval_loss": 0.7930644750595093, | |
| "eval_runtime": 1.2014, | |
| "eval_samples_per_second": 83.24, | |
| "eval_steps_per_second": 14.151, | |
| "step": 2200 | |
| }, | |
| { | |
| "epoch": 0.247477108367476, | |
| "grad_norm": 4.476805686950684, | |
| "learning_rate": 5.2608121492241664e-05, | |
| "loss": 0.710376968383789, | |
| "step": 2250 | |
| }, | |
| { | |
| "epoch": 0.247477108367476, | |
| "eval_loss": 0.7881377339363098, | |
| "eval_runtime": 1.1999, | |
| "eval_samples_per_second": 83.337, | |
| "eval_steps_per_second": 14.167, | |
| "step": 2250 | |
| }, | |
| { | |
| "epoch": 0.252976599664531, | |
| "grad_norm": 3.8596489429473877, | |
| "learning_rate": 5.244305051172004e-05, | |
| "loss": 0.7032179260253906, | |
| "step": 2300 | |
| }, | |
| { | |
| "epoch": 0.252976599664531, | |
| "eval_loss": 0.7591221332550049, | |
| "eval_runtime": 1.2149, | |
| "eval_samples_per_second": 82.31, | |
| "eval_steps_per_second": 13.993, | |
| "step": 2300 | |
| }, | |
| { | |
| "epoch": 0.2584760909615861, | |
| "grad_norm": 4.368955135345459, | |
| "learning_rate": 5.2277979531198416e-05, | |
| "loss": 0.6489437103271485, | |
| "step": 2350 | |
| }, | |
| { | |
| "epoch": 0.2584760909615861, | |
| "eval_loss": 0.8142778873443604, | |
| "eval_runtime": 1.2006, | |
| "eval_samples_per_second": 83.294, | |
| "eval_steps_per_second": 14.16, | |
| "step": 2350 | |
| }, | |
| { | |
| "epoch": 0.2639755822586411, | |
| "grad_norm": 4.408853530883789, | |
| "learning_rate": 5.211290855067679e-05, | |
| "loss": 0.6344734954833985, | |
| "step": 2400 | |
| }, | |
| { | |
| "epoch": 0.2639755822586411, | |
| "eval_loss": 0.789002001285553, | |
| "eval_runtime": 1.2016, | |
| "eval_samples_per_second": 83.219, | |
| "eval_steps_per_second": 14.147, | |
| "step": 2400 | |
| }, | |
| { | |
| "epoch": 0.2694750735556961, | |
| "grad_norm": 4.636422157287598, | |
| "learning_rate": 5.194783757015517e-05, | |
| "loss": 0.6603395080566407, | |
| "step": 2450 | |
| }, | |
| { | |
| "epoch": 0.2694750735556961, | |
| "eval_loss": 0.739583432674408, | |
| "eval_runtime": 1.2017, | |
| "eval_samples_per_second": 83.216, | |
| "eval_steps_per_second": 14.147, | |
| "step": 2450 | |
| }, | |
| { | |
| "epoch": 0.2749745648527511, | |
| "grad_norm": 4.370145797729492, | |
| "learning_rate": 5.178276658963355e-05, | |
| "loss": 0.6568155670166016, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 0.2749745648527511, | |
| "eval_loss": 0.8292286396026611, | |
| "eval_runtime": 1.1996, | |
| "eval_samples_per_second": 83.364, | |
| "eval_steps_per_second": 14.172, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 0.28047405614980614, | |
| "grad_norm": 4.47123384475708, | |
| "learning_rate": 5.1617695609111914e-05, | |
| "loss": 0.6639788055419922, | |
| "step": 2550 | |
| }, | |
| { | |
| "epoch": 0.28047405614980614, | |
| "eval_loss": 0.820250391960144, | |
| "eval_runtime": 1.2058, | |
| "eval_samples_per_second": 82.933, | |
| "eval_steps_per_second": 14.099, | |
| "step": 2550 | |
| }, | |
| { | |
| "epoch": 0.28597354744686115, | |
| "grad_norm": 4.769968509674072, | |
| "learning_rate": 5.1452624628590294e-05, | |
| "loss": 0.6434815979003906, | |
| "step": 2600 | |
| }, | |
| { | |
| "epoch": 0.28597354744686115, | |
| "eval_loss": 0.8330257534980774, | |
| "eval_runtime": 1.2003, | |
| "eval_samples_per_second": 83.313, | |
| "eval_steps_per_second": 14.163, | |
| "step": 2600 | |
| }, | |
| { | |
| "epoch": 0.29147303874391617, | |
| "grad_norm": 4.403727054595947, | |
| "learning_rate": 5.1287553648068674e-05, | |
| "loss": 0.6872652435302734, | |
| "step": 2650 | |
| }, | |
| { | |
| "epoch": 0.29147303874391617, | |
| "eval_loss": 0.7691981792449951, | |
| "eval_runtime": 1.1997, | |
| "eval_samples_per_second": 83.351, | |
| "eval_steps_per_second": 14.17, | |
| "step": 2650 | |
| }, | |
| { | |
| "epoch": 0.2969725300409712, | |
| "grad_norm": 3.7627687454223633, | |
| "learning_rate": 5.1122482667547047e-05, | |
| "loss": 0.625857925415039, | |
| "step": 2700 | |
| }, | |
| { | |
| "epoch": 0.2969725300409712, | |
| "eval_loss": 0.7727508544921875, | |
| "eval_runtime": 1.2264, | |
| "eval_samples_per_second": 81.538, | |
| "eval_steps_per_second": 13.861, | |
| "step": 2700 | |
| }, | |
| { | |
| "epoch": 0.30247202133802625, | |
| "grad_norm": 5.441561222076416, | |
| "learning_rate": 5.095741168702542e-05, | |
| "loss": 0.6458732604980468, | |
| "step": 2750 | |
| }, | |
| { | |
| "epoch": 0.30247202133802625, | |
| "eval_loss": 0.7701953053474426, | |
| "eval_runtime": 1.222, | |
| "eval_samples_per_second": 81.833, | |
| "eval_steps_per_second": 13.912, | |
| "step": 2750 | |
| }, | |
| { | |
| "epoch": 0.30797151263508127, | |
| "grad_norm": 4.965064525604248, | |
| "learning_rate": 5.07923407065038e-05, | |
| "loss": 0.6677908325195312, | |
| "step": 2800 | |
| }, | |
| { | |
| "epoch": 0.30797151263508127, | |
| "eval_loss": 0.7164813280105591, | |
| "eval_runtime": 1.2202, | |
| "eval_samples_per_second": 81.956, | |
| "eval_steps_per_second": 13.933, | |
| "step": 2800 | |
| }, | |
| { | |
| "epoch": 0.3134710039321363, | |
| "grad_norm": 3.931856870651245, | |
| "learning_rate": 5.062726972598217e-05, | |
| "loss": 0.5885476684570312, | |
| "step": 2850 | |
| }, | |
| { | |
| "epoch": 0.3134710039321363, | |
| "eval_loss": 0.7336059808731079, | |
| "eval_runtime": 1.2203, | |
| "eval_samples_per_second": 81.948, | |
| "eval_steps_per_second": 13.931, | |
| "step": 2850 | |
| }, | |
| { | |
| "epoch": 0.3189704952291913, | |
| "grad_norm": 4.760177135467529, | |
| "learning_rate": 5.046219874546055e-05, | |
| "loss": 0.6489822387695312, | |
| "step": 2900 | |
| }, | |
| { | |
| "epoch": 0.3189704952291913, | |
| "eval_loss": 0.7551103830337524, | |
| "eval_runtime": 1.2183, | |
| "eval_samples_per_second": 82.079, | |
| "eval_steps_per_second": 13.953, | |
| "step": 2900 | |
| }, | |
| { | |
| "epoch": 0.3244699865262463, | |
| "grad_norm": 4.375728130340576, | |
| "learning_rate": 5.0297127764938924e-05, | |
| "loss": 0.6457704162597656, | |
| "step": 2950 | |
| }, | |
| { | |
| "epoch": 0.3244699865262463, | |
| "eval_loss": 0.7187867164611816, | |
| "eval_runtime": 1.2036, | |
| "eval_samples_per_second": 83.084, | |
| "eval_steps_per_second": 14.124, | |
| "step": 2950 | |
| }, | |
| { | |
| "epoch": 0.3299694778233013, | |
| "grad_norm": 4.091928005218506, | |
| "learning_rate": 5.0132056784417304e-05, | |
| "loss": 0.6391205596923828, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 0.3299694778233013, | |
| "eval_loss": 0.7715049982070923, | |
| "eval_runtime": 1.2016, | |
| "eval_samples_per_second": 83.22, | |
| "eval_steps_per_second": 14.147, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 0.33546896912035634, | |
| "grad_norm": 4.569828510284424, | |
| "learning_rate": 4.996698580389568e-05, | |
| "loss": 0.6714089965820312, | |
| "step": 3050 | |
| }, | |
| { | |
| "epoch": 0.33546896912035634, | |
| "eval_loss": 0.7370268106460571, | |
| "eval_runtime": 1.2171, | |
| "eval_samples_per_second": 82.162, | |
| "eval_steps_per_second": 13.967, | |
| "step": 3050 | |
| }, | |
| { | |
| "epoch": 0.3409684604174114, | |
| "grad_norm": 5.741940975189209, | |
| "learning_rate": 4.980191482337405e-05, | |
| "loss": 0.6890049743652343, | |
| "step": 3100 | |
| }, | |
| { | |
| "epoch": 0.3409684604174114, | |
| "eval_loss": 0.7069912552833557, | |
| "eval_runtime": 1.1974, | |
| "eval_samples_per_second": 83.514, | |
| "eval_steps_per_second": 14.197, | |
| "step": 3100 | |
| }, | |
| { | |
| "epoch": 0.3464679517144664, | |
| "grad_norm": 4.857932090759277, | |
| "learning_rate": 4.963684384285243e-05, | |
| "loss": 0.5919662475585937, | |
| "step": 3150 | |
| }, | |
| { | |
| "epoch": 0.3464679517144664, | |
| "eval_loss": 0.7350116968154907, | |
| "eval_runtime": 1.1974, | |
| "eval_samples_per_second": 83.515, | |
| "eval_steps_per_second": 14.198, | |
| "step": 3150 | |
| }, | |
| { | |
| "epoch": 0.35196744301152144, | |
| "grad_norm": 4.636399745941162, | |
| "learning_rate": 4.94717728623308e-05, | |
| "loss": 0.6361312866210938, | |
| "step": 3200 | |
| }, | |
| { | |
| "epoch": 0.35196744301152144, | |
| "eval_loss": 0.7743600606918335, | |
| "eval_runtime": 1.271, | |
| "eval_samples_per_second": 78.677, | |
| "eval_steps_per_second": 13.375, | |
| "step": 3200 | |
| }, | |
| { | |
| "epoch": 0.35746693430857646, | |
| "grad_norm": 5.155900955200195, | |
| "learning_rate": 4.930670188180918e-05, | |
| "loss": 0.602264518737793, | |
| "step": 3250 | |
| }, | |
| { | |
| "epoch": 0.35746693430857646, | |
| "eval_loss": 0.7555291652679443, | |
| "eval_runtime": 1.2803, | |
| "eval_samples_per_second": 78.105, | |
| "eval_steps_per_second": 13.278, | |
| "step": 3250 | |
| }, | |
| { | |
| "epoch": 0.36296642560563147, | |
| "grad_norm": 3.4023196697235107, | |
| "learning_rate": 4.9141630901287555e-05, | |
| "loss": 0.5788230133056641, | |
| "step": 3300 | |
| }, | |
| { | |
| "epoch": 0.36296642560563147, | |
| "eval_loss": 0.7717245221138, | |
| "eval_runtime": 1.3149, | |
| "eval_samples_per_second": 76.053, | |
| "eval_steps_per_second": 12.929, | |
| "step": 3300 | |
| }, | |
| { | |
| "epoch": 0.3684659169026865, | |
| "grad_norm": 4.329448223114014, | |
| "learning_rate": 4.897655992076593e-05, | |
| "loss": 0.6438528442382813, | |
| "step": 3350 | |
| }, | |
| { | |
| "epoch": 0.3684659169026865, | |
| "eval_loss": 0.6952827572822571, | |
| "eval_runtime": 1.2957, | |
| "eval_samples_per_second": 77.176, | |
| "eval_steps_per_second": 13.12, | |
| "step": 3350 | |
| }, | |
| { | |
| "epoch": 0.3739654081997415, | |
| "grad_norm": 3.610276222229004, | |
| "learning_rate": 4.881148894024431e-05, | |
| "loss": 0.6141637802124024, | |
| "step": 3400 | |
| }, | |
| { | |
| "epoch": 0.3739654081997415, | |
| "eval_loss": 0.6926187872886658, | |
| "eval_runtime": 1.3466, | |
| "eval_samples_per_second": 74.259, | |
| "eval_steps_per_second": 12.624, | |
| "step": 3400 | |
| }, | |
| { | |
| "epoch": 0.37946489949679657, | |
| "grad_norm": 6.178794860839844, | |
| "learning_rate": 4.864641795972269e-05, | |
| "loss": 0.6356156158447266, | |
| "step": 3450 | |
| }, | |
| { | |
| "epoch": 0.37946489949679657, | |
| "eval_loss": 0.7247772216796875, | |
| "eval_runtime": 1.3462, | |
| "eval_samples_per_second": 74.281, | |
| "eval_steps_per_second": 12.628, | |
| "step": 3450 | |
| }, | |
| { | |
| "epoch": 0.3849643907938516, | |
| "grad_norm": 4.9943695068359375, | |
| "learning_rate": 4.848134697920105e-05, | |
| "loss": 0.6148456192016601, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 0.3849643907938516, | |
| "eval_loss": 0.7180845141410828, | |
| "eval_runtime": 1.3322, | |
| "eval_samples_per_second": 75.061, | |
| "eval_steps_per_second": 12.76, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 0.3904638820909066, | |
| "grad_norm": 3.8332393169403076, | |
| "learning_rate": 4.831627599867943e-05, | |
| "loss": 0.625141716003418, | |
| "step": 3550 | |
| }, | |
| { | |
| "epoch": 0.3904638820909066, | |
| "eval_loss": 0.6876647472381592, | |
| "eval_runtime": 1.3382, | |
| "eval_samples_per_second": 74.73, | |
| "eval_steps_per_second": 12.704, | |
| "step": 3550 | |
| }, | |
| { | |
| "epoch": 0.3959633733879616, | |
| "grad_norm": 4.58771276473999, | |
| "learning_rate": 4.815120501815781e-05, | |
| "loss": 0.6502104187011719, | |
| "step": 3600 | |
| }, | |
| { | |
| "epoch": 0.3959633733879616, | |
| "eval_loss": 0.690920352935791, | |
| "eval_runtime": 1.343, | |
| "eval_samples_per_second": 74.46, | |
| "eval_steps_per_second": 12.658, | |
| "step": 3600 | |
| }, | |
| { | |
| "epoch": 0.40146286468501663, | |
| "grad_norm": 4.435539722442627, | |
| "learning_rate": 4.7986134037636185e-05, | |
| "loss": 0.6129857635498047, | |
| "step": 3650 | |
| }, | |
| { | |
| "epoch": 0.40146286468501663, | |
| "eval_loss": 0.6758005023002625, | |
| "eval_runtime": 1.34, | |
| "eval_samples_per_second": 74.628, | |
| "eval_steps_per_second": 12.687, | |
| "step": 3650 | |
| }, | |
| { | |
| "epoch": 0.40696235598207164, | |
| "grad_norm": 4.618966102600098, | |
| "learning_rate": 4.782106305711456e-05, | |
| "loss": 0.6234348678588867, | |
| "step": 3700 | |
| }, | |
| { | |
| "epoch": 0.40696235598207164, | |
| "eval_loss": 0.7179376482963562, | |
| "eval_runtime": 1.3332, | |
| "eval_samples_per_second": 75.01, | |
| "eval_steps_per_second": 12.752, | |
| "step": 3700 | |
| }, | |
| { | |
| "epoch": 0.41246184727912666, | |
| "grad_norm": 4.0562052726745605, | |
| "learning_rate": 4.765599207659294e-05, | |
| "loss": 0.6168152999877929, | |
| "step": 3750 | |
| }, | |
| { | |
| "epoch": 0.41246184727912666, | |
| "eval_loss": 0.7127401828765869, | |
| "eval_runtime": 1.3374, | |
| "eval_samples_per_second": 74.769, | |
| "eval_steps_per_second": 12.711, | |
| "step": 3750 | |
| }, | |
| { | |
| "epoch": 0.41796133857618173, | |
| "grad_norm": 5.699039459228516, | |
| "learning_rate": 4.749092109607131e-05, | |
| "loss": 0.5789441680908203, | |
| "step": 3800 | |
| }, | |
| { | |
| "epoch": 0.41796133857618173, | |
| "eval_loss": 0.6780041456222534, | |
| "eval_runtime": 1.3483, | |
| "eval_samples_per_second": 74.167, | |
| "eval_steps_per_second": 12.608, | |
| "step": 3800 | |
| }, | |
| { | |
| "epoch": 0.42346082987323674, | |
| "grad_norm": 3.523623466491699, | |
| "learning_rate": 4.7325850115549684e-05, | |
| "loss": 0.5945124053955078, | |
| "step": 3850 | |
| }, | |
| { | |
| "epoch": 0.42346082987323674, | |
| "eval_loss": 0.695915699005127, | |
| "eval_runtime": 1.345, | |
| "eval_samples_per_second": 74.351, | |
| "eval_steps_per_second": 12.64, | |
| "step": 3850 | |
| }, | |
| { | |
| "epoch": 0.42896032117029176, | |
| "grad_norm": 4.008049488067627, | |
| "learning_rate": 4.716077913502806e-05, | |
| "loss": 0.5782461929321289, | |
| "step": 3900 | |
| }, | |
| { | |
| "epoch": 0.42896032117029176, | |
| "eval_loss": 0.6521520018577576, | |
| "eval_runtime": 1.342, | |
| "eval_samples_per_second": 74.517, | |
| "eval_steps_per_second": 12.668, | |
| "step": 3900 | |
| }, | |
| { | |
| "epoch": 0.4344598124673468, | |
| "grad_norm": 4.809508323669434, | |
| "learning_rate": 4.6995708154506436e-05, | |
| "loss": 0.5954169464111329, | |
| "step": 3950 | |
| }, | |
| { | |
| "epoch": 0.4344598124673468, | |
| "eval_loss": 0.6668588519096375, | |
| "eval_runtime": 1.347, | |
| "eval_samples_per_second": 74.241, | |
| "eval_steps_per_second": 12.621, | |
| "step": 3950 | |
| }, | |
| { | |
| "epoch": 0.4399593037644018, | |
| "grad_norm": 4.741697788238525, | |
| "learning_rate": 4.6830637173984816e-05, | |
| "loss": 0.5780908584594726, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 0.4399593037644018, | |
| "eval_loss": 0.6712077260017395, | |
| "eval_runtime": 1.3399, | |
| "eval_samples_per_second": 74.63, | |
| "eval_steps_per_second": 12.687, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 0.4454587950614568, | |
| "grad_norm": 5.006357192993164, | |
| "learning_rate": 4.666556619346319e-05, | |
| "loss": 0.5816222763061524, | |
| "step": 4050 | |
| }, | |
| { | |
| "epoch": 0.4454587950614568, | |
| "eval_loss": 0.659636378288269, | |
| "eval_runtime": 1.3383, | |
| "eval_samples_per_second": 74.724, | |
| "eval_steps_per_second": 12.703, | |
| "step": 4050 | |
| }, | |
| { | |
| "epoch": 0.4509582863585118, | |
| "grad_norm": 4.562034606933594, | |
| "learning_rate": 4.650049521294156e-05, | |
| "loss": 0.6115531539916992, | |
| "step": 4100 | |
| }, | |
| { | |
| "epoch": 0.4509582863585118, | |
| "eval_loss": 0.7120453715324402, | |
| "eval_runtime": 1.3432, | |
| "eval_samples_per_second": 74.446, | |
| "eval_steps_per_second": 12.656, | |
| "step": 4100 | |
| }, | |
| { | |
| "epoch": 0.4564577776555669, | |
| "grad_norm": 4.5262837409973145, | |
| "learning_rate": 4.633542423241994e-05, | |
| "loss": 0.5980755233764649, | |
| "step": 4150 | |
| }, | |
| { | |
| "epoch": 0.4564577776555669, | |
| "eval_loss": 0.6733386516571045, | |
| "eval_runtime": 1.3413, | |
| "eval_samples_per_second": 74.555, | |
| "eval_steps_per_second": 12.674, | |
| "step": 4150 | |
| }, | |
| { | |
| "epoch": 0.4619572689526219, | |
| "grad_norm": 3.8390605449676514, | |
| "learning_rate": 4.617035325189832e-05, | |
| "loss": 0.5741873931884766, | |
| "step": 4200 | |
| }, | |
| { | |
| "epoch": 0.4619572689526219, | |
| "eval_loss": 0.6623669266700745, | |
| "eval_runtime": 1.341, | |
| "eval_samples_per_second": 74.57, | |
| "eval_steps_per_second": 12.677, | |
| "step": 4200 | |
| }, | |
| { | |
| "epoch": 0.4674567602496769, | |
| "grad_norm": 4.214045524597168, | |
| "learning_rate": 4.6005282271376694e-05, | |
| "loss": 0.5255369186401367, | |
| "step": 4250 | |
| }, | |
| { | |
| "epoch": 0.4674567602496769, | |
| "eval_loss": 0.6530551910400391, | |
| "eval_runtime": 1.3425, | |
| "eval_samples_per_second": 74.487, | |
| "eval_steps_per_second": 12.663, | |
| "step": 4250 | |
| }, | |
| { | |
| "epoch": 0.47295625154673193, | |
| "grad_norm": 4.7830729484558105, | |
| "learning_rate": 4.5840211290855067e-05, | |
| "loss": 0.5830232620239257, | |
| "step": 4300 | |
| }, | |
| { | |
| "epoch": 0.47295625154673193, | |
| "eval_loss": 0.6643821001052856, | |
| "eval_runtime": 1.344, | |
| "eval_samples_per_second": 74.407, | |
| "eval_steps_per_second": 12.649, | |
| "step": 4300 | |
| }, | |
| { | |
| "epoch": 0.47845574284378695, | |
| "grad_norm": 4.745019435882568, | |
| "learning_rate": 4.5675140310333446e-05, | |
| "loss": 0.5781446075439454, | |
| "step": 4350 | |
| }, | |
| { | |
| "epoch": 0.47845574284378695, | |
| "eval_loss": 0.6928694844245911, | |
| "eval_runtime": 1.5854, | |
| "eval_samples_per_second": 63.074, | |
| "eval_steps_per_second": 10.723, | |
| "step": 4350 | |
| }, | |
| { | |
| "epoch": 0.48395523414084196, | |
| "grad_norm": 4.537078380584717, | |
| "learning_rate": 4.5510069329811826e-05, | |
| "loss": 0.531302490234375, | |
| "step": 4400 | |
| }, | |
| { | |
| "epoch": 0.48395523414084196, | |
| "eval_loss": 0.6292517185211182, | |
| "eval_runtime": 1.3445, | |
| "eval_samples_per_second": 74.375, | |
| "eval_steps_per_second": 12.644, | |
| "step": 4400 | |
| }, | |
| { | |
| "epoch": 0.489454725437897, | |
| "grad_norm": 4.4869384765625, | |
| "learning_rate": 4.534499834929019e-05, | |
| "loss": 0.5715638732910157, | |
| "step": 4450 | |
| }, | |
| { | |
| "epoch": 0.489454725437897, | |
| "eval_loss": 0.6663034558296204, | |
| "eval_runtime": 1.2938, | |
| "eval_samples_per_second": 77.291, | |
| "eval_steps_per_second": 13.14, | |
| "step": 4450 | |
| }, | |
| { | |
| "epoch": 0.494954216734952, | |
| "grad_norm": 4.644640922546387, | |
| "learning_rate": 4.517992736876857e-05, | |
| "loss": 0.6143413162231446, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 0.494954216734952, | |
| "eval_loss": 0.6727674007415771, | |
| "eval_runtime": 1.2823, | |
| "eval_samples_per_second": 77.986, | |
| "eval_steps_per_second": 13.258, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 0.5004537080320071, | |
| "grad_norm": 4.451071262359619, | |
| "learning_rate": 4.501485638824695e-05, | |
| "loss": 0.6003995132446289, | |
| "step": 4550 | |
| }, | |
| { | |
| "epoch": 0.5004537080320071, | |
| "eval_loss": 0.7084936499595642, | |
| "eval_runtime": 1.292, | |
| "eval_samples_per_second": 77.4, | |
| "eval_steps_per_second": 13.158, | |
| "step": 4550 | |
| }, | |
| { | |
| "epoch": 0.505953199329062, | |
| "grad_norm": 3.566272020339966, | |
| "learning_rate": 4.4849785407725324e-05, | |
| "loss": 0.5423797607421875, | |
| "step": 4600 | |
| }, | |
| { | |
| "epoch": 0.505953199329062, | |
| "eval_loss": 0.6627475023269653, | |
| "eval_runtime": 1.2898, | |
| "eval_samples_per_second": 77.531, | |
| "eval_steps_per_second": 13.18, | |
| "step": 4600 | |
| }, | |
| { | |
| "epoch": 0.5114526906261171, | |
| "grad_norm": 4.810975074768066, | |
| "learning_rate": 4.46847144272037e-05, | |
| "loss": 0.6348634719848633, | |
| "step": 4650 | |
| }, | |
| { | |
| "epoch": 0.5114526906261171, | |
| "eval_loss": 0.5990252494812012, | |
| "eval_runtime": 1.2836, | |
| "eval_samples_per_second": 77.908, | |
| "eval_steps_per_second": 13.244, | |
| "step": 4650 | |
| }, | |
| { | |
| "epoch": 0.5169521819231722, | |
| "grad_norm": 4.475234031677246, | |
| "learning_rate": 4.451964344668208e-05, | |
| "loss": 0.5570141220092774, | |
| "step": 4700 | |
| }, | |
| { | |
| "epoch": 0.5169521819231722, | |
| "eval_loss": 0.6244956254959106, | |
| "eval_runtime": 1.2837, | |
| "eval_samples_per_second": 77.898, | |
| "eval_steps_per_second": 13.243, | |
| "step": 4700 | |
| }, | |
| { | |
| "epoch": 0.5224516732202271, | |
| "grad_norm": 4.3085103034973145, | |
| "learning_rate": 4.435457246616045e-05, | |
| "loss": 0.55887451171875, | |
| "step": 4750 | |
| }, | |
| { | |
| "epoch": 0.5224516732202271, | |
| "eval_loss": 0.6636219620704651, | |
| "eval_runtime": 1.2809, | |
| "eval_samples_per_second": 78.068, | |
| "eval_steps_per_second": 13.272, | |
| "step": 4750 | |
| }, | |
| { | |
| "epoch": 0.5279511645172822, | |
| "grad_norm": 3.598691940307617, | |
| "learning_rate": 4.418950148563882e-05, | |
| "loss": 0.5753656005859376, | |
| "step": 4800 | |
| }, | |
| { | |
| "epoch": 0.5279511645172822, | |
| "eval_loss": 0.6499161720275879, | |
| "eval_runtime": 1.2822, | |
| "eval_samples_per_second": 77.991, | |
| "eval_steps_per_second": 13.258, | |
| "step": 4800 | |
| }, | |
| { | |
| "epoch": 0.5334506558143371, | |
| "grad_norm": 4.494378089904785, | |
| "learning_rate": 4.40244305051172e-05, | |
| "loss": 0.5845529174804688, | |
| "step": 4850 | |
| }, | |
| { | |
| "epoch": 0.5334506558143371, | |
| "eval_loss": 0.629128634929657, | |
| "eval_runtime": 1.5134, | |
| "eval_samples_per_second": 66.078, | |
| "eval_steps_per_second": 11.233, | |
| "step": 4850 | |
| }, | |
| { | |
| "epoch": 0.5389501471113922, | |
| "grad_norm": 4.149122714996338, | |
| "learning_rate": 4.3859359524595575e-05, | |
| "loss": 0.527508659362793, | |
| "step": 4900 | |
| }, | |
| { | |
| "epoch": 0.5389501471113922, | |
| "eval_loss": 0.6683360934257507, | |
| "eval_runtime": 1.2806, | |
| "eval_samples_per_second": 78.088, | |
| "eval_steps_per_second": 13.275, | |
| "step": 4900 | |
| }, | |
| { | |
| "epoch": 0.5444496384084472, | |
| "grad_norm": 4.04086971282959, | |
| "learning_rate": 4.3694288544073955e-05, | |
| "loss": 0.602709732055664, | |
| "step": 4950 | |
| }, | |
| { | |
| "epoch": 0.5444496384084472, | |
| "eval_loss": 0.646293044090271, | |
| "eval_runtime": 1.2828, | |
| "eval_samples_per_second": 77.952, | |
| "eval_steps_per_second": 13.252, | |
| "step": 4950 | |
| }, | |
| { | |
| "epoch": 0.5499491297055022, | |
| "grad_norm": 4.0907440185546875, | |
| "learning_rate": 4.352921756355233e-05, | |
| "loss": 0.5631252670288086, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 0.5499491297055022, | |
| "eval_loss": 0.6324547529220581, | |
| "eval_runtime": 1.2809, | |
| "eval_samples_per_second": 78.07, | |
| "eval_steps_per_second": 13.272, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 0.5554486210025573, | |
| "grad_norm": 4.2775654792785645, | |
| "learning_rate": 4.33641465830307e-05, | |
| "loss": 0.5570418930053711, | |
| "step": 5050 | |
| }, | |
| { | |
| "epoch": 0.5554486210025573, | |
| "eval_loss": 0.6621595621109009, | |
| "eval_runtime": 1.2825, | |
| "eval_samples_per_second": 77.971, | |
| "eval_steps_per_second": 13.255, | |
| "step": 5050 | |
| }, | |
| { | |
| "epoch": 0.5609481122996123, | |
| "grad_norm": 4.414310932159424, | |
| "learning_rate": 4.319907560250908e-05, | |
| "loss": 0.5383467483520508, | |
| "step": 5100 | |
| }, | |
| { | |
| "epoch": 0.5609481122996123, | |
| "eval_loss": 0.6726260185241699, | |
| "eval_runtime": 1.2823, | |
| "eval_samples_per_second": 77.983, | |
| "eval_steps_per_second": 13.257, | |
| "step": 5100 | |
| }, | |
| { | |
| "epoch": 0.5664476035966673, | |
| "grad_norm": 3.679974317550659, | |
| "learning_rate": 4.303400462198746e-05, | |
| "loss": 0.5569720840454102, | |
| "step": 5150 | |
| }, | |
| { | |
| "epoch": 0.5664476035966673, | |
| "eval_loss": 0.6547858715057373, | |
| "eval_runtime": 1.289, | |
| "eval_samples_per_second": 77.579, | |
| "eval_steps_per_second": 13.188, | |
| "step": 5150 | |
| }, | |
| { | |
| "epoch": 0.5719470948937223, | |
| "grad_norm": 5.782617568969727, | |
| "learning_rate": 4.2868933641465826e-05, | |
| "loss": 0.5539520263671875, | |
| "step": 5200 | |
| }, | |
| { | |
| "epoch": 0.5719470948937223, | |
| "eval_loss": 0.6701158881187439, | |
| "eval_runtime": 1.2849, | |
| "eval_samples_per_second": 77.825, | |
| "eval_steps_per_second": 13.23, | |
| "step": 5200 | |
| }, | |
| { | |
| "epoch": 0.5774465861907774, | |
| "grad_norm": 4.194858074188232, | |
| "learning_rate": 4.2703862660944205e-05, | |
| "loss": 0.5348934173583985, | |
| "step": 5250 | |
| }, | |
| { | |
| "epoch": 0.5774465861907774, | |
| "eval_loss": 0.6580336093902588, | |
| "eval_runtime": 1.2831, | |
| "eval_samples_per_second": 77.938, | |
| "eval_steps_per_second": 13.249, | |
| "step": 5250 | |
| }, | |
| { | |
| "epoch": 0.5829460774878323, | |
| "grad_norm": 4.302168369293213, | |
| "learning_rate": 4.2538791680422585e-05, | |
| "loss": 0.5106255340576172, | |
| "step": 5300 | |
| }, | |
| { | |
| "epoch": 0.5829460774878323, | |
| "eval_loss": 0.6552238464355469, | |
| "eval_runtime": 1.2852, | |
| "eval_samples_per_second": 77.81, | |
| "eval_steps_per_second": 13.228, | |
| "step": 5300 | |
| }, | |
| { | |
| "epoch": 0.5884455687848874, | |
| "grad_norm": 4.042543411254883, | |
| "learning_rate": 4.237372069990096e-05, | |
| "loss": 0.5317581558227539, | |
| "step": 5350 | |
| }, | |
| { | |
| "epoch": 0.5884455687848874, | |
| "eval_loss": 0.6482524275779724, | |
| "eval_runtime": 1.5001, | |
| "eval_samples_per_second": 66.661, | |
| "eval_steps_per_second": 11.332, | |
| "step": 5350 | |
| }, | |
| { | |
| "epoch": 0.5939450600819424, | |
| "grad_norm": 4.4569830894470215, | |
| "learning_rate": 4.220864971937933e-05, | |
| "loss": 0.5747990036010742, | |
| "step": 5400 | |
| }, | |
| { | |
| "epoch": 0.5939450600819424, | |
| "eval_loss": 0.6177729368209839, | |
| "eval_runtime": 1.2798, | |
| "eval_samples_per_second": 78.134, | |
| "eval_steps_per_second": 13.283, | |
| "step": 5400 | |
| }, | |
| { | |
| "epoch": 0.5994445513789974, | |
| "grad_norm": 4.751041889190674, | |
| "learning_rate": 4.204357873885771e-05, | |
| "loss": 0.5374135971069336, | |
| "step": 5450 | |
| }, | |
| { | |
| "epoch": 0.5994445513789974, | |
| "eval_loss": 0.6517400145530701, | |
| "eval_runtime": 1.28, | |
| "eval_samples_per_second": 78.128, | |
| "eval_steps_per_second": 13.282, | |
| "step": 5450 | |
| }, | |
| { | |
| "epoch": 0.6049440426760525, | |
| "grad_norm": 7.24479341506958, | |
| "learning_rate": 4.187850775833609e-05, | |
| "loss": 0.5593222045898437, | |
| "step": 5500 | |
| }, | |
| { | |
| "epoch": 0.6049440426760525, | |
| "eval_loss": 0.6892206072807312, | |
| "eval_runtime": 1.2818, | |
| "eval_samples_per_second": 78.014, | |
| "eval_steps_per_second": 13.262, | |
| "step": 5500 | |
| }, | |
| { | |
| "epoch": 0.6104435339731075, | |
| "grad_norm": 4.312963008880615, | |
| "learning_rate": 4.171343677781446e-05, | |
| "loss": 0.5525634002685547, | |
| "step": 5550 | |
| }, | |
| { | |
| "epoch": 0.6104435339731075, | |
| "eval_loss": 0.6747671365737915, | |
| "eval_runtime": 1.2815, | |
| "eval_samples_per_second": 78.036, | |
| "eval_steps_per_second": 13.266, | |
| "step": 5550 | |
| }, | |
| { | |
| "epoch": 0.6159430252701625, | |
| "grad_norm": 4.606757164001465, | |
| "learning_rate": 4.1548365797292836e-05, | |
| "loss": 0.5449155807495117, | |
| "step": 5600 | |
| }, | |
| { | |
| "epoch": 0.6159430252701625, | |
| "eval_loss": 0.6547083854675293, | |
| "eval_runtime": 1.2835, | |
| "eval_samples_per_second": 77.914, | |
| "eval_steps_per_second": 13.245, | |
| "step": 5600 | |
| }, | |
| { | |
| "epoch": 0.6214425165672175, | |
| "grad_norm": 5.024621486663818, | |
| "learning_rate": 4.1383294816771216e-05, | |
| "loss": 0.6019486618041993, | |
| "step": 5650 | |
| }, | |
| { | |
| "epoch": 0.6214425165672175, | |
| "eval_loss": 0.6467494964599609, | |
| "eval_runtime": 1.2839, | |
| "eval_samples_per_second": 77.889, | |
| "eval_steps_per_second": 13.241, | |
| "step": 5650 | |
| }, | |
| { | |
| "epoch": 0.6269420078642726, | |
| "grad_norm": 4.251932144165039, | |
| "learning_rate": 4.121822383624959e-05, | |
| "loss": 0.5073886489868165, | |
| "step": 5700 | |
| }, | |
| { | |
| "epoch": 0.6269420078642726, | |
| "eval_loss": 0.6638882160186768, | |
| "eval_runtime": 1.2832, | |
| "eval_samples_per_second": 77.932, | |
| "eval_steps_per_second": 13.249, | |
| "step": 5700 | |
| }, | |
| { | |
| "epoch": 0.6324414991613275, | |
| "grad_norm": 3.3922533988952637, | |
| "learning_rate": 4.105315285572796e-05, | |
| "loss": 0.531150894165039, | |
| "step": 5750 | |
| }, | |
| { | |
| "epoch": 0.6324414991613275, | |
| "eval_loss": 0.6248385310173035, | |
| "eval_runtime": 1.2919, | |
| "eval_samples_per_second": 77.406, | |
| "eval_steps_per_second": 13.159, | |
| "step": 5750 | |
| }, | |
| { | |
| "epoch": 0.6379409904583826, | |
| "grad_norm": 4.290137767791748, | |
| "learning_rate": 4.088808187520634e-05, | |
| "loss": 0.5194898986816406, | |
| "step": 5800 | |
| }, | |
| { | |
| "epoch": 0.6379409904583826, | |
| "eval_loss": 0.6306109428405762, | |
| "eval_runtime": 1.2834, | |
| "eval_samples_per_second": 77.918, | |
| "eval_steps_per_second": 13.246, | |
| "step": 5800 | |
| }, | |
| { | |
| "epoch": 0.6434404817554377, | |
| "grad_norm": 4.854128837585449, | |
| "learning_rate": 4.0723010894684714e-05, | |
| "loss": 0.5465607833862305, | |
| "step": 5850 | |
| }, | |
| { | |
| "epoch": 0.6434404817554377, | |
| "eval_loss": 0.6254453063011169, | |
| "eval_runtime": 1.5113, | |
| "eval_samples_per_second": 66.169, | |
| "eval_steps_per_second": 11.249, | |
| "step": 5850 | |
| }, | |
| { | |
| "epoch": 0.6489399730524926, | |
| "grad_norm": 4.647885799407959, | |
| "learning_rate": 4.0557939914163093e-05, | |
| "loss": 0.5407907104492188, | |
| "step": 5900 | |
| }, | |
| { | |
| "epoch": 0.6489399730524926, | |
| "eval_loss": 0.6638280749320984, | |
| "eval_runtime": 1.2958, | |
| "eval_samples_per_second": 77.17, | |
| "eval_steps_per_second": 13.119, | |
| "step": 5900 | |
| }, | |
| { | |
| "epoch": 0.6544394643495477, | |
| "grad_norm": 4.279372215270996, | |
| "learning_rate": 4.0392868933641466e-05, | |
| "loss": 0.5451357269287109, | |
| "step": 5950 | |
| }, | |
| { | |
| "epoch": 0.6544394643495477, | |
| "eval_loss": 0.6228541731834412, | |
| "eval_runtime": 1.3241, | |
| "eval_samples_per_second": 75.524, | |
| "eval_steps_per_second": 12.839, | |
| "step": 5950 | |
| }, | |
| { | |
| "epoch": 0.6599389556466027, | |
| "grad_norm": 4.0558247566223145, | |
| "learning_rate": 4.022779795311984e-05, | |
| "loss": 0.5368893814086914, | |
| "step": 6000 | |
| }, | |
| { | |
| "epoch": 0.6599389556466027, | |
| "eval_loss": 0.6732752323150635, | |
| "eval_runtime": 1.3368, | |
| "eval_samples_per_second": 74.807, | |
| "eval_steps_per_second": 12.717, | |
| "step": 6000 | |
| }, | |
| { | |
| "epoch": 0.6654384469436577, | |
| "grad_norm": 3.353104591369629, | |
| "learning_rate": 4.006272697259822e-05, | |
| "loss": 0.5184137344360351, | |
| "step": 6050 | |
| }, | |
| { | |
| "epoch": 0.6654384469436577, | |
| "eval_loss": 0.6266540884971619, | |
| "eval_runtime": 1.3374, | |
| "eval_samples_per_second": 74.773, | |
| "eval_steps_per_second": 12.711, | |
| "step": 6050 | |
| }, | |
| { | |
| "epoch": 0.6709379382407127, | |
| "grad_norm": 3.8511996269226074, | |
| "learning_rate": 3.98976559920766e-05, | |
| "loss": 0.5407165145874023, | |
| "step": 6100 | |
| }, | |
| { | |
| "epoch": 0.6709379382407127, | |
| "eval_loss": 0.6703444123268127, | |
| "eval_runtime": 1.3374, | |
| "eval_samples_per_second": 74.77, | |
| "eval_steps_per_second": 12.711, | |
| "step": 6100 | |
| }, | |
| { | |
| "epoch": 0.6764374295377678, | |
| "grad_norm": 3.9859249591827393, | |
| "learning_rate": 3.9732585011554965e-05, | |
| "loss": 0.4901425552368164, | |
| "step": 6150 | |
| }, | |
| { | |
| "epoch": 0.6764374295377678, | |
| "eval_loss": 0.6332722902297974, | |
| "eval_runtime": 1.341, | |
| "eval_samples_per_second": 74.569, | |
| "eval_steps_per_second": 12.677, | |
| "step": 6150 | |
| }, | |
| { | |
| "epoch": 0.6819369208348228, | |
| "grad_norm": 3.666247844696045, | |
| "learning_rate": 3.9567514031033344e-05, | |
| "loss": 0.5188226318359375, | |
| "step": 6200 | |
| }, | |
| { | |
| "epoch": 0.6819369208348228, | |
| "eval_loss": 0.5851776599884033, | |
| "eval_runtime": 1.3337, | |
| "eval_samples_per_second": 74.982, | |
| "eval_steps_per_second": 12.747, | |
| "step": 6200 | |
| }, | |
| { | |
| "epoch": 0.6874364121318778, | |
| "grad_norm": 4.355357646942139, | |
| "learning_rate": 3.9402443050511724e-05, | |
| "loss": 0.523404426574707, | |
| "step": 6250 | |
| }, | |
| { | |
| "epoch": 0.6874364121318778, | |
| "eval_loss": 0.5948991179466248, | |
| "eval_runtime": 1.3477, | |
| "eval_samples_per_second": 74.199, | |
| "eval_steps_per_second": 12.614, | |
| "step": 6250 | |
| }, | |
| { | |
| "epoch": 0.6929359034289329, | |
| "grad_norm": 4.099778652191162, | |
| "learning_rate": 3.92373720699901e-05, | |
| "loss": 0.5017270278930664, | |
| "step": 6300 | |
| }, | |
| { | |
| "epoch": 0.6929359034289329, | |
| "eval_loss": 0.6322646737098694, | |
| "eval_runtime": 1.3296, | |
| "eval_samples_per_second": 75.208, | |
| "eval_steps_per_second": 12.785, | |
| "step": 6300 | |
| }, | |
| { | |
| "epoch": 0.6984353947259878, | |
| "grad_norm": 5.135687351226807, | |
| "learning_rate": 3.907230108946847e-05, | |
| "loss": 0.5303592300415039, | |
| "step": 6350 | |
| }, | |
| { | |
| "epoch": 0.6984353947259878, | |
| "eval_loss": 0.6268444657325745, | |
| "eval_runtime": 1.5763, | |
| "eval_samples_per_second": 63.442, | |
| "eval_steps_per_second": 10.785, | |
| "step": 6350 | |
| }, | |
| { | |
| "epoch": 0.7039348860230429, | |
| "grad_norm": 4.834221839904785, | |
| "learning_rate": 3.890723010894685e-05, | |
| "loss": 0.5274005889892578, | |
| "step": 6400 | |
| }, | |
| { | |
| "epoch": 0.7039348860230429, | |
| "eval_loss": 0.5901980996131897, | |
| "eval_runtime": 1.3333, | |
| "eval_samples_per_second": 75.003, | |
| "eval_steps_per_second": 12.75, | |
| "step": 6400 | |
| }, | |
| { | |
| "epoch": 0.7094343773200978, | |
| "grad_norm": 5.028069496154785, | |
| "learning_rate": 3.874215912842522e-05, | |
| "loss": 0.5233419799804687, | |
| "step": 6450 | |
| }, | |
| { | |
| "epoch": 0.7094343773200978, | |
| "eval_loss": 0.6389637589454651, | |
| "eval_runtime": 1.2872, | |
| "eval_samples_per_second": 77.685, | |
| "eval_steps_per_second": 13.206, | |
| "step": 6450 | |
| }, | |
| { | |
| "epoch": 0.7149338686171529, | |
| "grad_norm": 4.620915412902832, | |
| "learning_rate": 3.85770881479036e-05, | |
| "loss": 0.5316643905639649, | |
| "step": 6500 | |
| }, | |
| { | |
| "epoch": 0.7149338686171529, | |
| "eval_loss": 0.5779242515563965, | |
| "eval_runtime": 1.2776, | |
| "eval_samples_per_second": 78.271, | |
| "eval_steps_per_second": 13.306, | |
| "step": 6500 | |
| }, | |
| { | |
| "epoch": 0.720433359914208, | |
| "grad_norm": 3.9142255783081055, | |
| "learning_rate": 3.8412017167381975e-05, | |
| "loss": 0.4801639175415039, | |
| "step": 6550 | |
| }, | |
| { | |
| "epoch": 0.720433359914208, | |
| "eval_loss": 0.5951541662216187, | |
| "eval_runtime": 1.2302, | |
| "eval_samples_per_second": 81.288, | |
| "eval_steps_per_second": 13.819, | |
| "step": 6550 | |
| }, | |
| { | |
| "epoch": 0.7259328512112629, | |
| "grad_norm": 4.454485893249512, | |
| "learning_rate": 3.824694618686035e-05, | |
| "loss": 0.5149478912353516, | |
| "step": 6600 | |
| }, | |
| { | |
| "epoch": 0.7259328512112629, | |
| "eval_loss": 0.5860444903373718, | |
| "eval_runtime": 1.235, | |
| "eval_samples_per_second": 80.974, | |
| "eval_steps_per_second": 13.766, | |
| "step": 6600 | |
| }, | |
| { | |
| "epoch": 0.731432342508318, | |
| "grad_norm": 4.176424026489258, | |
| "learning_rate": 3.808187520633873e-05, | |
| "loss": 0.543246192932129, | |
| "step": 6650 | |
| }, | |
| { | |
| "epoch": 0.731432342508318, | |
| "eval_loss": 0.5805695056915283, | |
| "eval_runtime": 1.2369, | |
| "eval_samples_per_second": 80.844, | |
| "eval_steps_per_second": 13.744, | |
| "step": 6650 | |
| }, | |
| { | |
| "epoch": 0.736931833805373, | |
| "grad_norm": 3.361717462539673, | |
| "learning_rate": 3.79168042258171e-05, | |
| "loss": 0.5410548400878906, | |
| "step": 6700 | |
| }, | |
| { | |
| "epoch": 0.736931833805373, | |
| "eval_loss": 0.5974660515785217, | |
| "eval_runtime": 1.2286, | |
| "eval_samples_per_second": 81.396, | |
| "eval_steps_per_second": 13.837, | |
| "step": 6700 | |
| }, | |
| { | |
| "epoch": 0.742431325102428, | |
| "grad_norm": 5.069472312927246, | |
| "learning_rate": 3.775173324529548e-05, | |
| "loss": 0.5026102447509766, | |
| "step": 6750 | |
| }, | |
| { | |
| "epoch": 0.742431325102428, | |
| "eval_loss": 0.5945417284965515, | |
| "eval_runtime": 1.2116, | |
| "eval_samples_per_second": 82.533, | |
| "eval_steps_per_second": 14.031, | |
| "step": 6750 | |
| }, | |
| { | |
| "epoch": 0.747930816399483, | |
| "grad_norm": 4.298215389251709, | |
| "learning_rate": 3.758666226477385e-05, | |
| "loss": 0.5604416275024414, | |
| "step": 6800 | |
| }, | |
| { | |
| "epoch": 0.747930816399483, | |
| "eval_loss": 0.5883623361587524, | |
| "eval_runtime": 1.2141, | |
| "eval_samples_per_second": 82.363, | |
| "eval_steps_per_second": 14.002, | |
| "step": 6800 | |
| }, | |
| { | |
| "epoch": 0.7534303076965381, | |
| "grad_norm": 3.469435930252075, | |
| "learning_rate": 3.742159128425223e-05, | |
| "loss": 0.5037693023681641, | |
| "step": 6850 | |
| }, | |
| { | |
| "epoch": 0.7534303076965381, | |
| "eval_loss": 0.5655568838119507, | |
| "eval_runtime": 1.3814, | |
| "eval_samples_per_second": 72.389, | |
| "eval_steps_per_second": 12.306, | |
| "step": 6850 | |
| }, | |
| { | |
| "epoch": 0.7589297989935931, | |
| "grad_norm": 4.014948844909668, | |
| "learning_rate": 3.7256520303730605e-05, | |
| "loss": 0.5645696258544922, | |
| "step": 6900 | |
| }, | |
| { | |
| "epoch": 0.7589297989935931, | |
| "eval_loss": 0.6064311265945435, | |
| "eval_runtime": 1.2076, | |
| "eval_samples_per_second": 82.809, | |
| "eval_steps_per_second": 14.078, | |
| "step": 6900 | |
| }, | |
| { | |
| "epoch": 0.7644292902906481, | |
| "grad_norm": 3.9340033531188965, | |
| "learning_rate": 3.709144932320898e-05, | |
| "loss": 0.5047724914550781, | |
| "step": 6950 | |
| }, | |
| { | |
| "epoch": 0.7644292902906481, | |
| "eval_loss": 0.5839043259620667, | |
| "eval_runtime": 1.221, | |
| "eval_samples_per_second": 81.901, | |
| "eval_steps_per_second": 13.923, | |
| "step": 6950 | |
| }, | |
| { | |
| "epoch": 0.7699287815877032, | |
| "grad_norm": 3.939054250717163, | |
| "learning_rate": 3.692637834268736e-05, | |
| "loss": 0.5168508529663086, | |
| "step": 7000 | |
| }, | |
| { | |
| "epoch": 0.7699287815877032, | |
| "eval_loss": 0.5967159867286682, | |
| "eval_runtime": 1.2228, | |
| "eval_samples_per_second": 81.776, | |
| "eval_steps_per_second": 13.902, | |
| "step": 7000 | |
| }, | |
| { | |
| "epoch": 0.7754282728847581, | |
| "grad_norm": 4.098312854766846, | |
| "learning_rate": 3.676130736216574e-05, | |
| "loss": 0.49574569702148436, | |
| "step": 7050 | |
| }, | |
| { | |
| "epoch": 0.7754282728847581, | |
| "eval_loss": 0.6113559603691101, | |
| "eval_runtime": 1.2197, | |
| "eval_samples_per_second": 81.991, | |
| "eval_steps_per_second": 13.938, | |
| "step": 7050 | |
| }, | |
| { | |
| "epoch": 0.7809277641818132, | |
| "grad_norm": 5.130489826202393, | |
| "learning_rate": 3.6596236381644103e-05, | |
| "loss": 0.5368572235107422, | |
| "step": 7100 | |
| }, | |
| { | |
| "epoch": 0.7809277641818132, | |
| "eval_loss": 0.5671849250793457, | |
| "eval_runtime": 1.2087, | |
| "eval_samples_per_second": 82.733, | |
| "eval_steps_per_second": 14.065, | |
| "step": 7100 | |
| }, | |
| { | |
| "epoch": 0.7864272554788682, | |
| "grad_norm": 3.2629666328430176, | |
| "learning_rate": 3.643116540112248e-05, | |
| "loss": 0.5247505569458008, | |
| "step": 7150 | |
| }, | |
| { | |
| "epoch": 0.7864272554788682, | |
| "eval_loss": 0.5848333835601807, | |
| "eval_runtime": 1.2165, | |
| "eval_samples_per_second": 82.205, | |
| "eval_steps_per_second": 13.975, | |
| "step": 7150 | |
| }, | |
| { | |
| "epoch": 0.7919267467759232, | |
| "grad_norm": 3.4071853160858154, | |
| "learning_rate": 3.626609442060086e-05, | |
| "loss": 0.5215546417236329, | |
| "step": 7200 | |
| }, | |
| { | |
| "epoch": 0.7919267467759232, | |
| "eval_loss": 0.5874826312065125, | |
| "eval_runtime": 1.2062, | |
| "eval_samples_per_second": 82.907, | |
| "eval_steps_per_second": 14.094, | |
| "step": 7200 | |
| }, | |
| { | |
| "epoch": 0.7974262380729783, | |
| "grad_norm": 4.264019966125488, | |
| "learning_rate": 3.6101023440079236e-05, | |
| "loss": 0.48300968170166014, | |
| "step": 7250 | |
| }, | |
| { | |
| "epoch": 0.7974262380729783, | |
| "eval_loss": 0.6169635057449341, | |
| "eval_runtime": 1.2014, | |
| "eval_samples_per_second": 83.24, | |
| "eval_steps_per_second": 14.151, | |
| "step": 7250 | |
| }, | |
| { | |
| "epoch": 0.8029257293700333, | |
| "grad_norm": 3.845081090927124, | |
| "learning_rate": 3.593595245955761e-05, | |
| "loss": 0.5431819152832031, | |
| "step": 7300 | |
| }, | |
| { | |
| "epoch": 0.8029257293700333, | |
| "eval_loss": 0.5864665508270264, | |
| "eval_runtime": 1.1999, | |
| "eval_samples_per_second": 83.339, | |
| "eval_steps_per_second": 14.168, | |
| "step": 7300 | |
| }, | |
| { | |
| "epoch": 0.8084252206670883, | |
| "grad_norm": 4.696225166320801, | |
| "learning_rate": 3.577088147903599e-05, | |
| "loss": 0.5017805480957032, | |
| "step": 7350 | |
| }, | |
| { | |
| "epoch": 0.8084252206670883, | |
| "eval_loss": 0.5771105289459229, | |
| "eval_runtime": 1.3868, | |
| "eval_samples_per_second": 72.106, | |
| "eval_steps_per_second": 12.258, | |
| "step": 7350 | |
| }, | |
| { | |
| "epoch": 0.8139247119641433, | |
| "grad_norm": 3.846862316131592, | |
| "learning_rate": 3.560581049851436e-05, | |
| "loss": 0.4925709915161133, | |
| "step": 7400 | |
| }, | |
| { | |
| "epoch": 0.8139247119641433, | |
| "eval_loss": 0.5872745513916016, | |
| "eval_runtime": 1.2193, | |
| "eval_samples_per_second": 82.016, | |
| "eval_steps_per_second": 13.943, | |
| "step": 7400 | |
| }, | |
| { | |
| "epoch": 0.8194242032611984, | |
| "grad_norm": 5.725467681884766, | |
| "learning_rate": 3.544073951799274e-05, | |
| "loss": 0.5305783081054688, | |
| "step": 7450 | |
| }, | |
| { | |
| "epoch": 0.8194242032611984, | |
| "eval_loss": 0.5858078002929688, | |
| "eval_runtime": 1.209, | |
| "eval_samples_per_second": 82.716, | |
| "eval_steps_per_second": 14.062, | |
| "step": 7450 | |
| }, | |
| { | |
| "epoch": 0.8249236945582533, | |
| "grad_norm": 5.1305766105651855, | |
| "learning_rate": 3.5275668537471114e-05, | |
| "loss": 0.49862171173095704, | |
| "step": 7500 | |
| }, | |
| { | |
| "epoch": 0.8249236945582533, | |
| "eval_loss": 0.5829967260360718, | |
| "eval_runtime": 1.2108, | |
| "eval_samples_per_second": 82.588, | |
| "eval_steps_per_second": 14.04, | |
| "step": 7500 | |
| }, | |
| { | |
| "epoch": 0.8304231858553084, | |
| "grad_norm": 3.6588644981384277, | |
| "learning_rate": 3.5110597556949486e-05, | |
| "loss": 0.47825916290283205, | |
| "step": 7550 | |
| }, | |
| { | |
| "epoch": 0.8304231858553084, | |
| "eval_loss": 0.6038760542869568, | |
| "eval_runtime": 1.2158, | |
| "eval_samples_per_second": 82.251, | |
| "eval_steps_per_second": 13.983, | |
| "step": 7550 | |
| }, | |
| { | |
| "epoch": 0.8359226771523635, | |
| "grad_norm": 4.205902576446533, | |
| "learning_rate": 3.4945526576427866e-05, | |
| "loss": 0.49293697357177735, | |
| "step": 7600 | |
| }, | |
| { | |
| "epoch": 0.8359226771523635, | |
| "eval_loss": 0.5801113843917847, | |
| "eval_runtime": 1.2352, | |
| "eval_samples_per_second": 80.957, | |
| "eval_steps_per_second": 13.763, | |
| "step": 7600 | |
| }, | |
| { | |
| "epoch": 0.8414221684494184, | |
| "grad_norm": 3.2005882263183594, | |
| "learning_rate": 3.478045559590624e-05, | |
| "loss": 0.4907111740112305, | |
| "step": 7650 | |
| }, | |
| { | |
| "epoch": 0.8414221684494184, | |
| "eval_loss": 0.5856965184211731, | |
| "eval_runtime": 1.2264, | |
| "eval_samples_per_second": 81.54, | |
| "eval_steps_per_second": 13.862, | |
| "step": 7650 | |
| }, | |
| { | |
| "epoch": 0.8469216597464735, | |
| "grad_norm": 5.1610636711120605, | |
| "learning_rate": 3.461538461538461e-05, | |
| "loss": 0.5118446731567383, | |
| "step": 7700 | |
| }, | |
| { | |
| "epoch": 0.8469216597464735, | |
| "eval_loss": 0.5943632125854492, | |
| "eval_runtime": 1.2029, | |
| "eval_samples_per_second": 83.135, | |
| "eval_steps_per_second": 14.133, | |
| "step": 7700 | |
| }, | |
| { | |
| "epoch": 0.8524211510435284, | |
| "grad_norm": 3.638803482055664, | |
| "learning_rate": 3.445031363486299e-05, | |
| "loss": 0.5173551559448242, | |
| "step": 7750 | |
| }, | |
| { | |
| "epoch": 0.8524211510435284, | |
| "eval_loss": 0.5883214473724365, | |
| "eval_runtime": 1.2146, | |
| "eval_samples_per_second": 82.334, | |
| "eval_steps_per_second": 13.997, | |
| "step": 7750 | |
| }, | |
| { | |
| "epoch": 0.8579206423405835, | |
| "grad_norm": 4.749381065368652, | |
| "learning_rate": 3.428524265434137e-05, | |
| "loss": 0.5153055953979492, | |
| "step": 7800 | |
| }, | |
| { | |
| "epoch": 0.8579206423405835, | |
| "eval_loss": 0.5808895230293274, | |
| "eval_runtime": 1.2469, | |
| "eval_samples_per_second": 80.201, | |
| "eval_steps_per_second": 13.634, | |
| "step": 7800 | |
| }, | |
| { | |
| "epoch": 0.8634201336376385, | |
| "grad_norm": 4.376150608062744, | |
| "learning_rate": 3.4120171673819744e-05, | |
| "loss": 0.5378147506713867, | |
| "step": 7850 | |
| }, | |
| { | |
| "epoch": 0.8634201336376385, | |
| "eval_loss": 0.5930312871932983, | |
| "eval_runtime": 1.3832, | |
| "eval_samples_per_second": 72.299, | |
| "eval_steps_per_second": 12.291, | |
| "step": 7850 | |
| }, | |
| { | |
| "epoch": 0.8689196249346935, | |
| "grad_norm": 4.232579708099365, | |
| "learning_rate": 3.395510069329812e-05, | |
| "loss": 0.505134048461914, | |
| "step": 7900 | |
| }, | |
| { | |
| "epoch": 0.8689196249346935, | |
| "eval_loss": 0.6020961999893188, | |
| "eval_runtime": 1.2142, | |
| "eval_samples_per_second": 82.356, | |
| "eval_steps_per_second": 14.0, | |
| "step": 7900 | |
| }, | |
| { | |
| "epoch": 0.8744191162317486, | |
| "grad_norm": 5.355160713195801, | |
| "learning_rate": 3.3790029712776497e-05, | |
| "loss": 0.5102433776855468, | |
| "step": 7950 | |
| }, | |
| { | |
| "epoch": 0.8744191162317486, | |
| "eval_loss": 0.5917235016822815, | |
| "eval_runtime": 1.206, | |
| "eval_samples_per_second": 82.917, | |
| "eval_steps_per_second": 14.096, | |
| "step": 7950 | |
| }, | |
| { | |
| "epoch": 0.8799186075288036, | |
| "grad_norm": 3.3613343238830566, | |
| "learning_rate": 3.3624958732254876e-05, | |
| "loss": 0.4822299194335937, | |
| "step": 8000 | |
| }, | |
| { | |
| "epoch": 0.8799186075288036, | |
| "eval_loss": 0.5934929251670837, | |
| "eval_runtime": 1.2112, | |
| "eval_samples_per_second": 82.566, | |
| "eval_steps_per_second": 14.036, | |
| "step": 8000 | |
| }, | |
| { | |
| "epoch": 0.8854180988258586, | |
| "grad_norm": 4.434471130371094, | |
| "learning_rate": 3.345988775173324e-05, | |
| "loss": 0.49528308868408205, | |
| "step": 8050 | |
| }, | |
| { | |
| "epoch": 0.8854180988258586, | |
| "eval_loss": 0.5964680314064026, | |
| "eval_runtime": 1.2137, | |
| "eval_samples_per_second": 82.39, | |
| "eval_steps_per_second": 14.006, | |
| "step": 8050 | |
| }, | |
| { | |
| "epoch": 0.8909175901229136, | |
| "grad_norm": 4.2046403884887695, | |
| "learning_rate": 3.329481677121162e-05, | |
| "loss": 0.48887725830078127, | |
| "step": 8100 | |
| }, | |
| { | |
| "epoch": 0.8909175901229136, | |
| "eval_loss": 0.5806313753128052, | |
| "eval_runtime": 1.2203, | |
| "eval_samples_per_second": 81.947, | |
| "eval_steps_per_second": 13.931, | |
| "step": 8100 | |
| }, | |
| { | |
| "epoch": 0.8964170814199687, | |
| "grad_norm": 4.626391410827637, | |
| "learning_rate": 3.312974579069e-05, | |
| "loss": 0.5233592987060547, | |
| "step": 8150 | |
| }, | |
| { | |
| "epoch": 0.8964170814199687, | |
| "eval_loss": 0.6079022884368896, | |
| "eval_runtime": 1.216, | |
| "eval_samples_per_second": 82.236, | |
| "eval_steps_per_second": 13.98, | |
| "step": 8150 | |
| }, | |
| { | |
| "epoch": 0.9019165727170236, | |
| "grad_norm": 4.376235008239746, | |
| "learning_rate": 3.2964674810168374e-05, | |
| "loss": 0.4639776611328125, | |
| "step": 8200 | |
| }, | |
| { | |
| "epoch": 0.9019165727170236, | |
| "eval_loss": 0.6205313205718994, | |
| "eval_runtime": 1.2055, | |
| "eval_samples_per_second": 82.955, | |
| "eval_steps_per_second": 14.102, | |
| "step": 8200 | |
| }, | |
| { | |
| "epoch": 0.9074160640140787, | |
| "grad_norm": 3.8218092918395996, | |
| "learning_rate": 3.279960382964675e-05, | |
| "loss": 0.44373504638671873, | |
| "step": 8250 | |
| }, | |
| { | |
| "epoch": 0.9074160640140787, | |
| "eval_loss": 0.5643773078918457, | |
| "eval_runtime": 1.2145, | |
| "eval_samples_per_second": 82.339, | |
| "eval_steps_per_second": 13.998, | |
| "step": 8250 | |
| }, | |
| { | |
| "epoch": 0.9129155553111338, | |
| "grad_norm": 3.81736159324646, | |
| "learning_rate": 3.263453284912513e-05, | |
| "loss": 0.48470027923583986, | |
| "step": 8300 | |
| }, | |
| { | |
| "epoch": 0.9129155553111338, | |
| "eval_loss": 0.5744062066078186, | |
| "eval_runtime": 1.2167, | |
| "eval_samples_per_second": 82.188, | |
| "eval_steps_per_second": 13.972, | |
| "step": 8300 | |
| }, | |
| { | |
| "epoch": 0.9184150466081887, | |
| "grad_norm": 5.86279296875, | |
| "learning_rate": 3.24694618686035e-05, | |
| "loss": 0.4852021408081055, | |
| "step": 8350 | |
| }, | |
| { | |
| "epoch": 0.9184150466081887, | |
| "eval_loss": 0.5889118313789368, | |
| "eval_runtime": 1.423, | |
| "eval_samples_per_second": 70.273, | |
| "eval_steps_per_second": 11.946, | |
| "step": 8350 | |
| }, | |
| { | |
| "epoch": 0.9239145379052438, | |
| "grad_norm": 3.33119535446167, | |
| "learning_rate": 3.230439088808188e-05, | |
| "loss": 0.47623142242431643, | |
| "step": 8400 | |
| }, | |
| { | |
| "epoch": 0.9239145379052438, | |
| "eval_loss": 0.6064158082008362, | |
| "eval_runtime": 1.204, | |
| "eval_samples_per_second": 83.056, | |
| "eval_steps_per_second": 14.119, | |
| "step": 8400 | |
| }, | |
| { | |
| "epoch": 0.9294140292022988, | |
| "grad_norm": 2.885103940963745, | |
| "learning_rate": 3.213931990756025e-05, | |
| "loss": 0.49996829986572267, | |
| "step": 8450 | |
| }, | |
| { | |
| "epoch": 0.9294140292022988, | |
| "eval_loss": 0.5843780040740967, | |
| "eval_runtime": 1.2023, | |
| "eval_samples_per_second": 83.174, | |
| "eval_steps_per_second": 14.14, | |
| "step": 8450 | |
| }, | |
| { | |
| "epoch": 0.9349135204993538, | |
| "grad_norm": 4.857532978057861, | |
| "learning_rate": 3.1974248927038625e-05, | |
| "loss": 0.47324295043945314, | |
| "step": 8500 | |
| }, | |
| { | |
| "epoch": 0.9349135204993538, | |
| "eval_loss": 0.6105228662490845, | |
| "eval_runtime": 1.2083, | |
| "eval_samples_per_second": 82.759, | |
| "eval_steps_per_second": 14.069, | |
| "step": 8500 | |
| }, | |
| { | |
| "epoch": 0.9404130117964088, | |
| "grad_norm": 3.946885108947754, | |
| "learning_rate": 3.1809177946517005e-05, | |
| "loss": 0.49978759765625, | |
| "step": 8550 | |
| }, | |
| { | |
| "epoch": 0.9404130117964088, | |
| "eval_loss": 0.5941745638847351, | |
| "eval_runtime": 1.2125, | |
| "eval_samples_per_second": 82.477, | |
| "eval_steps_per_second": 14.021, | |
| "step": 8550 | |
| }, | |
| { | |
| "epoch": 0.9459125030934639, | |
| "grad_norm": 4.021317005157471, | |
| "learning_rate": 3.164410696599538e-05, | |
| "loss": 0.528785514831543, | |
| "step": 8600 | |
| }, | |
| { | |
| "epoch": 0.9459125030934639, | |
| "eval_loss": 0.6242286562919617, | |
| "eval_runtime": 1.2102, | |
| "eval_samples_per_second": 82.628, | |
| "eval_steps_per_second": 14.047, | |
| "step": 8600 | |
| }, | |
| { | |
| "epoch": 0.9514119943905188, | |
| "grad_norm": 3.708808183670044, | |
| "learning_rate": 3.147903598547375e-05, | |
| "loss": 0.46576389312744143, | |
| "step": 8650 | |
| }, | |
| { | |
| "epoch": 0.9514119943905188, | |
| "eval_loss": 0.611571192741394, | |
| "eval_runtime": 1.204, | |
| "eval_samples_per_second": 83.055, | |
| "eval_steps_per_second": 14.119, | |
| "step": 8650 | |
| }, | |
| { | |
| "epoch": 0.9569114856875739, | |
| "grad_norm": 3.2899420261383057, | |
| "learning_rate": 3.131396500495213e-05, | |
| "loss": 0.46845787048339843, | |
| "step": 8700 | |
| }, | |
| { | |
| "epoch": 0.9569114856875739, | |
| "eval_loss": 0.6180684566497803, | |
| "eval_runtime": 1.212, | |
| "eval_samples_per_second": 82.506, | |
| "eval_steps_per_second": 14.026, | |
| "step": 8700 | |
| }, | |
| { | |
| "epoch": 0.962410976984629, | |
| "grad_norm": 5.375493049621582, | |
| "learning_rate": 3.114889402443051e-05, | |
| "loss": 0.4573846435546875, | |
| "step": 8750 | |
| }, | |
| { | |
| "epoch": 0.962410976984629, | |
| "eval_loss": 0.6240963935852051, | |
| "eval_runtime": 1.2083, | |
| "eval_samples_per_second": 82.759, | |
| "eval_steps_per_second": 14.069, | |
| "step": 8750 | |
| }, | |
| { | |
| "epoch": 0.9679104682816839, | |
| "grad_norm": 3.9251935482025146, | |
| "learning_rate": 3.0983823043908876e-05, | |
| "loss": 0.4789009094238281, | |
| "step": 8800 | |
| }, | |
| { | |
| "epoch": 0.9679104682816839, | |
| "eval_loss": 0.6151527762413025, | |
| "eval_runtime": 1.245, | |
| "eval_samples_per_second": 80.322, | |
| "eval_steps_per_second": 13.655, | |
| "step": 8800 | |
| }, | |
| { | |
| "epoch": 0.973409959578739, | |
| "grad_norm": 4.760181903839111, | |
| "learning_rate": 3.0818752063387256e-05, | |
| "loss": 0.4835487365722656, | |
| "step": 8850 | |
| }, | |
| { | |
| "epoch": 0.973409959578739, | |
| "eval_loss": 0.6076204776763916, | |
| "eval_runtime": 1.3823, | |
| "eval_samples_per_second": 72.341, | |
| "eval_steps_per_second": 12.298, | |
| "step": 8850 | |
| }, | |
| { | |
| "epoch": 0.978909450875794, | |
| "grad_norm": 4.721770763397217, | |
| "learning_rate": 3.0653681082865635e-05, | |
| "loss": 0.4760139083862305, | |
| "step": 8900 | |
| }, | |
| { | |
| "epoch": 0.978909450875794, | |
| "eval_loss": 0.6116940975189209, | |
| "eval_runtime": 1.2074, | |
| "eval_samples_per_second": 82.823, | |
| "eval_steps_per_second": 14.08, | |
| "step": 8900 | |
| }, | |
| { | |
| "epoch": 0.984408942172849, | |
| "grad_norm": 2.7520203590393066, | |
| "learning_rate": 3.0488610102344005e-05, | |
| "loss": 0.46280517578125, | |
| "step": 8950 | |
| }, | |
| { | |
| "epoch": 0.984408942172849, | |
| "eval_loss": 0.594266951084137, | |
| "eval_runtime": 1.2134, | |
| "eval_samples_per_second": 82.416, | |
| "eval_steps_per_second": 14.011, | |
| "step": 8950 | |
| }, | |
| { | |
| "epoch": 0.989908433469904, | |
| "grad_norm": 3.4478979110717773, | |
| "learning_rate": 3.0323539121822385e-05, | |
| "loss": 0.48518154144287107, | |
| "step": 9000 | |
| }, | |
| { | |
| "epoch": 0.989908433469904, | |
| "eval_loss": 0.6080638766288757, | |
| "eval_runtime": 1.2202, | |
| "eval_samples_per_second": 81.953, | |
| "eval_steps_per_second": 13.932, | |
| "step": 9000 | |
| }, | |
| { | |
| "epoch": 0.995407924766959, | |
| "grad_norm": 3.8885610103607178, | |
| "learning_rate": 3.015846814130076e-05, | |
| "loss": 0.4918204116821289, | |
| "step": 9050 | |
| }, | |
| { | |
| "epoch": 0.995407924766959, | |
| "eval_loss": 0.6131730079650879, | |
| "eval_runtime": 1.236, | |
| "eval_samples_per_second": 80.906, | |
| "eval_steps_per_second": 13.754, | |
| "step": 9050 | |
| }, | |
| { | |
| "epoch": 1.0008799186075288, | |
| "grad_norm": 3.4417338371276855, | |
| "learning_rate": 2.9993397160779137e-05, | |
| "loss": 0.4655106353759766, | |
| "step": 9100 | |
| }, | |
| { | |
| "epoch": 1.0008799186075288, | |
| "eval_loss": 0.6303781270980835, | |
| "eval_runtime": 1.2182, | |
| "eval_samples_per_second": 82.087, | |
| "eval_steps_per_second": 13.955, | |
| "step": 9100 | |
| }, | |
| { | |
| "epoch": 1.0063794099045837, | |
| "grad_norm": 4.042264461517334, | |
| "learning_rate": 2.982832618025751e-05, | |
| "loss": 0.4372904968261719, | |
| "step": 9150 | |
| }, | |
| { | |
| "epoch": 1.0063794099045837, | |
| "eval_loss": 0.6115362048149109, | |
| "eval_runtime": 1.2191, | |
| "eval_samples_per_second": 82.028, | |
| "eval_steps_per_second": 13.945, | |
| "step": 9150 | |
| }, | |
| { | |
| "epoch": 1.011878901201639, | |
| "grad_norm": 4.3367018699646, | |
| "learning_rate": 2.966325519973589e-05, | |
| "loss": 0.4454679489135742, | |
| "step": 9200 | |
| }, | |
| { | |
| "epoch": 1.011878901201639, | |
| "eval_loss": 0.598572850227356, | |
| "eval_runtime": 1.2205, | |
| "eval_samples_per_second": 81.932, | |
| "eval_steps_per_second": 13.928, | |
| "step": 9200 | |
| }, | |
| { | |
| "epoch": 1.0173783924986939, | |
| "grad_norm": 5.504449844360352, | |
| "learning_rate": 2.9498184219214262e-05, | |
| "loss": 0.4694999694824219, | |
| "step": 9250 | |
| }, | |
| { | |
| "epoch": 1.0173783924986939, | |
| "eval_loss": 0.5946099162101746, | |
| "eval_runtime": 1.2073, | |
| "eval_samples_per_second": 82.832, | |
| "eval_steps_per_second": 14.081, | |
| "step": 9250 | |
| }, | |
| { | |
| "epoch": 1.0228778837957488, | |
| "grad_norm": 5.267527103424072, | |
| "learning_rate": 2.933311323869264e-05, | |
| "loss": 0.44829036712646486, | |
| "step": 9300 | |
| }, | |
| { | |
| "epoch": 1.0228778837957488, | |
| "eval_loss": 0.596511960029602, | |
| "eval_runtime": 1.2164, | |
| "eval_samples_per_second": 82.213, | |
| "eval_steps_per_second": 13.976, | |
| "step": 9300 | |
| }, | |
| { | |
| "epoch": 1.028377375092804, | |
| "grad_norm": 2.8371832370758057, | |
| "learning_rate": 2.9168042258171015e-05, | |
| "loss": 0.4043942642211914, | |
| "step": 9350 | |
| }, | |
| { | |
| "epoch": 1.028377375092804, | |
| "eval_loss": 0.600749671459198, | |
| "eval_runtime": 1.2377, | |
| "eval_samples_per_second": 80.796, | |
| "eval_steps_per_second": 13.735, | |
| "step": 9350 | |
| }, | |
| { | |
| "epoch": 1.033876866389859, | |
| "grad_norm": 3.1648924350738525, | |
| "learning_rate": 2.9002971277649388e-05, | |
| "loss": 0.47807037353515625, | |
| "step": 9400 | |
| }, | |
| { | |
| "epoch": 1.033876866389859, | |
| "eval_loss": 0.6105673909187317, | |
| "eval_runtime": 1.2193, | |
| "eval_samples_per_second": 82.012, | |
| "eval_steps_per_second": 13.942, | |
| "step": 9400 | |
| }, | |
| { | |
| "epoch": 1.039376357686914, | |
| "grad_norm": 4.341183662414551, | |
| "learning_rate": 2.8837900297127767e-05, | |
| "loss": 0.4305224609375, | |
| "step": 9450 | |
| }, | |
| { | |
| "epoch": 1.039376357686914, | |
| "eval_loss": 0.5932527184486389, | |
| "eval_runtime": 1.2151, | |
| "eval_samples_per_second": 82.297, | |
| "eval_steps_per_second": 13.991, | |
| "step": 9450 | |
| }, | |
| { | |
| "epoch": 1.044875848983969, | |
| "grad_norm": 3.4657225608825684, | |
| "learning_rate": 2.867282931660614e-05, | |
| "loss": 0.3872489929199219, | |
| "step": 9500 | |
| }, | |
| { | |
| "epoch": 1.044875848983969, | |
| "eval_loss": 0.6022618412971497, | |
| "eval_runtime": 1.203, | |
| "eval_samples_per_second": 83.129, | |
| "eval_steps_per_second": 14.132, | |
| "step": 9500 | |
| }, | |
| { | |
| "epoch": 1.050375340281024, | |
| "grad_norm": 3.8219797611236572, | |
| "learning_rate": 2.8507758336084517e-05, | |
| "loss": 0.44281375885009766, | |
| "step": 9550 | |
| }, | |
| { | |
| "epoch": 1.050375340281024, | |
| "eval_loss": 0.5904479026794434, | |
| "eval_runtime": 1.1999, | |
| "eval_samples_per_second": 83.343, | |
| "eval_steps_per_second": 14.168, | |
| "step": 9550 | |
| }, | |
| { | |
| "epoch": 1.055874831578079, | |
| "grad_norm": 3.437319755554199, | |
| "learning_rate": 2.8342687355562893e-05, | |
| "loss": 0.453095703125, | |
| "step": 9600 | |
| }, | |
| { | |
| "epoch": 1.055874831578079, | |
| "eval_loss": 0.5905536413192749, | |
| "eval_runtime": 1.2019, | |
| "eval_samples_per_second": 83.203, | |
| "eval_steps_per_second": 14.144, | |
| "step": 9600 | |
| }, | |
| { | |
| "epoch": 1.061374322875134, | |
| "grad_norm": 5.347193241119385, | |
| "learning_rate": 2.817761637504127e-05, | |
| "loss": 0.4297781753540039, | |
| "step": 9650 | |
| }, | |
| { | |
| "epoch": 1.061374322875134, | |
| "eval_loss": 0.5929006338119507, | |
| "eval_runtime": 1.2006, | |
| "eval_samples_per_second": 83.292, | |
| "eval_steps_per_second": 14.16, | |
| "step": 9650 | |
| }, | |
| { | |
| "epoch": 1.066873814172189, | |
| "grad_norm": 3.720005750656128, | |
| "learning_rate": 2.8012545394519642e-05, | |
| "loss": 0.42318790435791015, | |
| "step": 9700 | |
| }, | |
| { | |
| "epoch": 1.066873814172189, | |
| "eval_loss": 0.5905603766441345, | |
| "eval_runtime": 1.2021, | |
| "eval_samples_per_second": 83.187, | |
| "eval_steps_per_second": 14.142, | |
| "step": 9700 | |
| }, | |
| { | |
| "epoch": 1.0723733054692441, | |
| "grad_norm": 4.219228267669678, | |
| "learning_rate": 2.784747441399802e-05, | |
| "loss": 0.4420646286010742, | |
| "step": 9750 | |
| }, | |
| { | |
| "epoch": 1.0723733054692441, | |
| "eval_loss": 0.5723536014556885, | |
| "eval_runtime": 1.2102, | |
| "eval_samples_per_second": 82.63, | |
| "eval_steps_per_second": 14.047, | |
| "step": 9750 | |
| }, | |
| { | |
| "epoch": 1.077872796766299, | |
| "grad_norm": 5.102869987487793, | |
| "learning_rate": 2.7682403433476395e-05, | |
| "loss": 0.44880119323730466, | |
| "step": 9800 | |
| }, | |
| { | |
| "epoch": 1.077872796766299, | |
| "eval_loss": 0.5921871662139893, | |
| "eval_runtime": 1.2009, | |
| "eval_samples_per_second": 83.271, | |
| "eval_steps_per_second": 14.156, | |
| "step": 9800 | |
| }, | |
| { | |
| "epoch": 1.083372288063354, | |
| "grad_norm": 4.417986869812012, | |
| "learning_rate": 2.751733245295477e-05, | |
| "loss": 0.43164543151855467, | |
| "step": 9850 | |
| }, | |
| { | |
| "epoch": 1.083372288063354, | |
| "eval_loss": 0.5745819211006165, | |
| "eval_runtime": 1.199, | |
| "eval_samples_per_second": 83.404, | |
| "eval_steps_per_second": 14.179, | |
| "step": 9850 | |
| }, | |
| { | |
| "epoch": 1.0888717793604092, | |
| "grad_norm": 4.315613746643066, | |
| "learning_rate": 2.7352261472433147e-05, | |
| "loss": 0.4114876937866211, | |
| "step": 9900 | |
| }, | |
| { | |
| "epoch": 1.0888717793604092, | |
| "eval_loss": 0.6222988367080688, | |
| "eval_runtime": 1.2039, | |
| "eval_samples_per_second": 83.064, | |
| "eval_steps_per_second": 14.121, | |
| "step": 9900 | |
| }, | |
| { | |
| "epoch": 1.0943712706574642, | |
| "grad_norm": 3.8662261962890625, | |
| "learning_rate": 2.7187190491911523e-05, | |
| "loss": 0.4395499420166016, | |
| "step": 9950 | |
| }, | |
| { | |
| "epoch": 1.0943712706574642, | |
| "eval_loss": 0.598095178604126, | |
| "eval_runtime": 1.2065, | |
| "eval_samples_per_second": 82.886, | |
| "eval_steps_per_second": 14.091, | |
| "step": 9950 | |
| }, | |
| { | |
| "epoch": 1.0998707619545192, | |
| "grad_norm": 4.77580451965332, | |
| "learning_rate": 2.70221195113899e-05, | |
| "loss": 0.4401175308227539, | |
| "step": 10000 | |
| }, | |
| { | |
| "epoch": 1.0998707619545192, | |
| "eval_loss": 0.6062231659889221, | |
| "eval_runtime": 1.1984, | |
| "eval_samples_per_second": 83.447, | |
| "eval_steps_per_second": 14.186, | |
| "step": 10000 | |
| }, | |
| { | |
| "epoch": 1.1053702532515741, | |
| "grad_norm": 5.308359146118164, | |
| "learning_rate": 2.6857048530868276e-05, | |
| "loss": 0.38489757537841796, | |
| "step": 10050 | |
| }, | |
| { | |
| "epoch": 1.1053702532515741, | |
| "eval_loss": 0.574999988079071, | |
| "eval_runtime": 1.1984, | |
| "eval_samples_per_second": 83.444, | |
| "eval_steps_per_second": 14.186, | |
| "step": 10050 | |
| }, | |
| { | |
| "epoch": 1.1108697445486293, | |
| "grad_norm": 3.92620587348938, | |
| "learning_rate": 2.669197755034665e-05, | |
| "loss": 0.445535888671875, | |
| "step": 10100 | |
| }, | |
| { | |
| "epoch": 1.1108697445486293, | |
| "eval_loss": 0.5968570113182068, | |
| "eval_runtime": 1.2009, | |
| "eval_samples_per_second": 83.268, | |
| "eval_steps_per_second": 14.156, | |
| "step": 10100 | |
| }, | |
| { | |
| "epoch": 1.1163692358456843, | |
| "grad_norm": 3.6382229328155518, | |
| "learning_rate": 2.652690656982503e-05, | |
| "loss": 0.43107017517089846, | |
| "step": 10150 | |
| }, | |
| { | |
| "epoch": 1.1163692358456843, | |
| "eval_loss": 0.6031837463378906, | |
| "eval_runtime": 1.1994, | |
| "eval_samples_per_second": 83.378, | |
| "eval_steps_per_second": 14.174, | |
| "step": 10150 | |
| }, | |
| { | |
| "epoch": 1.1218687271427392, | |
| "grad_norm": 5.4295148849487305, | |
| "learning_rate": 2.63618355893034e-05, | |
| "loss": 0.44390846252441407, | |
| "step": 10200 | |
| }, | |
| { | |
| "epoch": 1.1218687271427392, | |
| "eval_loss": 0.5818211436271667, | |
| "eval_runtime": 1.2017, | |
| "eval_samples_per_second": 83.212, | |
| "eval_steps_per_second": 14.146, | |
| "step": 10200 | |
| }, | |
| { | |
| "epoch": 1.1273682184397944, | |
| "grad_norm": 4.309296607971191, | |
| "learning_rate": 2.6196764608781774e-05, | |
| "loss": 0.45012378692626953, | |
| "step": 10250 | |
| }, | |
| { | |
| "epoch": 1.1273682184397944, | |
| "eval_loss": 0.5798439979553223, | |
| "eval_runtime": 1.2245, | |
| "eval_samples_per_second": 81.667, | |
| "eval_steps_per_second": 13.883, | |
| "step": 10250 | |
| }, | |
| { | |
| "epoch": 1.1328677097368494, | |
| "grad_norm": 4.410998821258545, | |
| "learning_rate": 2.6031693628260154e-05, | |
| "loss": 0.4658625411987305, | |
| "step": 10300 | |
| }, | |
| { | |
| "epoch": 1.1328677097368494, | |
| "eval_loss": 0.5707818865776062, | |
| "eval_runtime": 1.1991, | |
| "eval_samples_per_second": 83.396, | |
| "eval_steps_per_second": 14.177, | |
| "step": 10300 | |
| }, | |
| { | |
| "epoch": 1.1383672010339043, | |
| "grad_norm": 2.5657384395599365, | |
| "learning_rate": 2.5866622647738527e-05, | |
| "loss": 0.4424343490600586, | |
| "step": 10350 | |
| }, | |
| { | |
| "epoch": 1.1383672010339043, | |
| "eval_loss": 0.5677274465560913, | |
| "eval_runtime": 1.1985, | |
| "eval_samples_per_second": 83.439, | |
| "eval_steps_per_second": 14.185, | |
| "step": 10350 | |
| }, | |
| { | |
| "epoch": 1.1438666923309593, | |
| "grad_norm": 4.544326305389404, | |
| "learning_rate": 2.5701551667216903e-05, | |
| "loss": 0.4189057922363281, | |
| "step": 10400 | |
| }, | |
| { | |
| "epoch": 1.1438666923309593, | |
| "eval_loss": 0.5669907331466675, | |
| "eval_runtime": 1.2023, | |
| "eval_samples_per_second": 83.172, | |
| "eval_steps_per_second": 14.139, | |
| "step": 10400 | |
| }, | |
| { | |
| "epoch": 1.1493661836280145, | |
| "grad_norm": 4.390478134155273, | |
| "learning_rate": 2.553648068669528e-05, | |
| "loss": 0.44770816802978514, | |
| "step": 10450 | |
| }, | |
| { | |
| "epoch": 1.1493661836280145, | |
| "eval_loss": 0.5683467388153076, | |
| "eval_runtime": 1.1991, | |
| "eval_samples_per_second": 83.395, | |
| "eval_steps_per_second": 14.177, | |
| "step": 10450 | |
| }, | |
| { | |
| "epoch": 1.1548656749250694, | |
| "grad_norm": 3.9074809551239014, | |
| "learning_rate": 2.5371409706173655e-05, | |
| "loss": 0.4494611740112305, | |
| "step": 10500 | |
| }, | |
| { | |
| "epoch": 1.1548656749250694, | |
| "eval_loss": 0.5813124179840088, | |
| "eval_runtime": 1.1995, | |
| "eval_samples_per_second": 83.365, | |
| "eval_steps_per_second": 14.172, | |
| "step": 10500 | |
| }, | |
| { | |
| "epoch": 1.1603651662221244, | |
| "grad_norm": 3.1746835708618164, | |
| "learning_rate": 2.520633872565203e-05, | |
| "loss": 0.42440425872802734, | |
| "step": 10550 | |
| }, | |
| { | |
| "epoch": 1.1603651662221244, | |
| "eval_loss": 0.5736593008041382, | |
| "eval_runtime": 1.2009, | |
| "eval_samples_per_second": 83.272, | |
| "eval_steps_per_second": 14.156, | |
| "step": 10550 | |
| }, | |
| { | |
| "epoch": 1.1658646575191796, | |
| "grad_norm": 5.491518497467041, | |
| "learning_rate": 2.5041267745130408e-05, | |
| "loss": 0.4350612258911133, | |
| "step": 10600 | |
| }, | |
| { | |
| "epoch": 1.1658646575191796, | |
| "eval_loss": 0.57778000831604, | |
| "eval_runtime": 1.1993, | |
| "eval_samples_per_second": 83.38, | |
| "eval_steps_per_second": 14.175, | |
| "step": 10600 | |
| }, | |
| { | |
| "epoch": 1.1713641488162345, | |
| "grad_norm": 4.8435468673706055, | |
| "learning_rate": 2.487619676460878e-05, | |
| "loss": 0.4232054901123047, | |
| "step": 10650 | |
| }, | |
| { | |
| "epoch": 1.1713641488162345, | |
| "eval_loss": 0.5833326578140259, | |
| "eval_runtime": 1.1979, | |
| "eval_samples_per_second": 83.477, | |
| "eval_steps_per_second": 14.191, | |
| "step": 10650 | |
| }, | |
| { | |
| "epoch": 1.1768636401132895, | |
| "grad_norm": 5.074549674987793, | |
| "learning_rate": 2.471112578408716e-05, | |
| "loss": 0.45191131591796874, | |
| "step": 10700 | |
| }, | |
| { | |
| "epoch": 1.1768636401132895, | |
| "eval_loss": 0.5973538160324097, | |
| "eval_runtime": 1.2004, | |
| "eval_samples_per_second": 83.305, | |
| "eval_steps_per_second": 14.162, | |
| "step": 10700 | |
| }, | |
| { | |
| "epoch": 1.1823631314103444, | |
| "grad_norm": 3.509275436401367, | |
| "learning_rate": 2.4546054803565533e-05, | |
| "loss": 0.4495719528198242, | |
| "step": 10750 | |
| }, | |
| { | |
| "epoch": 1.1823631314103444, | |
| "eval_loss": 0.5876668095588684, | |
| "eval_runtime": 1.2029, | |
| "eval_samples_per_second": 83.13, | |
| "eval_steps_per_second": 14.132, | |
| "step": 10750 | |
| }, | |
| { | |
| "epoch": 1.1878626227073996, | |
| "grad_norm": 3.4657552242279053, | |
| "learning_rate": 2.438098382304391e-05, | |
| "loss": 0.4320774459838867, | |
| "step": 10800 | |
| }, | |
| { | |
| "epoch": 1.1878626227073996, | |
| "eval_loss": 0.5911355018615723, | |
| "eval_runtime": 1.2004, | |
| "eval_samples_per_second": 83.303, | |
| "eval_steps_per_second": 14.161, | |
| "step": 10800 | |
| }, | |
| { | |
| "epoch": 1.1933621140044546, | |
| "grad_norm": 3.424093008041382, | |
| "learning_rate": 2.4215912842522286e-05, | |
| "loss": 0.41817344665527345, | |
| "step": 10850 | |
| }, | |
| { | |
| "epoch": 1.1933621140044546, | |
| "eval_loss": 0.558462381362915, | |
| "eval_runtime": 1.2044, | |
| "eval_samples_per_second": 83.032, | |
| "eval_steps_per_second": 14.115, | |
| "step": 10850 | |
| }, | |
| { | |
| "epoch": 1.1988616053015095, | |
| "grad_norm": 5.278721332550049, | |
| "learning_rate": 2.4050841862000662e-05, | |
| "loss": 0.42692329406738283, | |
| "step": 10900 | |
| }, | |
| { | |
| "epoch": 1.1988616053015095, | |
| "eval_loss": 0.5609988570213318, | |
| "eval_runtime": 1.2061, | |
| "eval_samples_per_second": 82.911, | |
| "eval_steps_per_second": 14.095, | |
| "step": 10900 | |
| }, | |
| { | |
| "epoch": 1.2043610965985647, | |
| "grad_norm": 4.2132248878479, | |
| "learning_rate": 2.3885770881479035e-05, | |
| "loss": 0.4087539291381836, | |
| "step": 10950 | |
| }, | |
| { | |
| "epoch": 1.2043610965985647, | |
| "eval_loss": 0.5824187397956848, | |
| "eval_runtime": 1.2378, | |
| "eval_samples_per_second": 80.789, | |
| "eval_steps_per_second": 13.734, | |
| "step": 10950 | |
| }, | |
| { | |
| "epoch": 1.2098605878956197, | |
| "grad_norm": 4.436295509338379, | |
| "learning_rate": 2.3720699900957415e-05, | |
| "loss": 0.3884201812744141, | |
| "step": 11000 | |
| }, | |
| { | |
| "epoch": 1.2098605878956197, | |
| "eval_loss": 0.5735225677490234, | |
| "eval_runtime": 1.2641, | |
| "eval_samples_per_second": 79.108, | |
| "eval_steps_per_second": 13.448, | |
| "step": 11000 | |
| }, | |
| { | |
| "epoch": 1.2153600791926746, | |
| "grad_norm": 4.041130542755127, | |
| "learning_rate": 2.3555628920435788e-05, | |
| "loss": 0.3993444061279297, | |
| "step": 11050 | |
| }, | |
| { | |
| "epoch": 1.2153600791926746, | |
| "eval_loss": 0.5744249820709229, | |
| "eval_runtime": 1.2074, | |
| "eval_samples_per_second": 82.822, | |
| "eval_steps_per_second": 14.08, | |
| "step": 11050 | |
| }, | |
| { | |
| "epoch": 1.2208595704897296, | |
| "grad_norm": 4.301640510559082, | |
| "learning_rate": 2.3390557939914164e-05, | |
| "loss": 0.39464141845703127, | |
| "step": 11100 | |
| }, | |
| { | |
| "epoch": 1.2208595704897296, | |
| "eval_loss": 0.5948730111122131, | |
| "eval_runtime": 1.2581, | |
| "eval_samples_per_second": 79.487, | |
| "eval_steps_per_second": 13.513, | |
| "step": 11100 | |
| }, | |
| { | |
| "epoch": 1.2263590617867848, | |
| "grad_norm": 5.845645427703857, | |
| "learning_rate": 2.322548695939254e-05, | |
| "loss": 0.4228610610961914, | |
| "step": 11150 | |
| }, | |
| { | |
| "epoch": 1.2263590617867848, | |
| "eval_loss": 0.5744452476501465, | |
| "eval_runtime": 1.2349, | |
| "eval_samples_per_second": 80.975, | |
| "eval_steps_per_second": 13.766, | |
| "step": 11150 | |
| }, | |
| { | |
| "epoch": 1.2318585530838397, | |
| "grad_norm": 4.14743185043335, | |
| "learning_rate": 2.3060415978870913e-05, | |
| "loss": 0.43561710357666017, | |
| "step": 11200 | |
| }, | |
| { | |
| "epoch": 1.2318585530838397, | |
| "eval_loss": 0.5542231798171997, | |
| "eval_runtime": 1.2462, | |
| "eval_samples_per_second": 80.242, | |
| "eval_steps_per_second": 13.641, | |
| "step": 11200 | |
| }, | |
| { | |
| "epoch": 1.2373580443808947, | |
| "grad_norm": 4.9092607498168945, | |
| "learning_rate": 2.2895344998349293e-05, | |
| "loss": 0.4485149765014648, | |
| "step": 11250 | |
| }, | |
| { | |
| "epoch": 1.2373580443808947, | |
| "eval_loss": 0.5608264803886414, | |
| "eval_runtime": 1.2042, | |
| "eval_samples_per_second": 83.044, | |
| "eval_steps_per_second": 14.118, | |
| "step": 11250 | |
| }, | |
| { | |
| "epoch": 1.2428575356779499, | |
| "grad_norm": 4.795513153076172, | |
| "learning_rate": 2.2730274017827665e-05, | |
| "loss": 0.4002879333496094, | |
| "step": 11300 | |
| }, | |
| { | |
| "epoch": 1.2428575356779499, | |
| "eval_loss": 0.5752193927764893, | |
| "eval_runtime": 1.2005, | |
| "eval_samples_per_second": 83.3, | |
| "eval_steps_per_second": 14.161, | |
| "step": 11300 | |
| }, | |
| { | |
| "epoch": 1.2483570269750048, | |
| "grad_norm": 4.756551742553711, | |
| "learning_rate": 2.2565203037306042e-05, | |
| "loss": 0.4129877853393555, | |
| "step": 11350 | |
| }, | |
| { | |
| "epoch": 1.2483570269750048, | |
| "eval_loss": 0.5692643523216248, | |
| "eval_runtime": 1.202, | |
| "eval_samples_per_second": 83.198, | |
| "eval_steps_per_second": 14.144, | |
| "step": 11350 | |
| }, | |
| { | |
| "epoch": 1.2538565182720598, | |
| "grad_norm": 4.6832051277160645, | |
| "learning_rate": 2.2400132056784418e-05, | |
| "loss": 0.40815105438232424, | |
| "step": 11400 | |
| }, | |
| { | |
| "epoch": 1.2538565182720598, | |
| "eval_loss": 0.5672106742858887, | |
| "eval_runtime": 1.2026, | |
| "eval_samples_per_second": 83.153, | |
| "eval_steps_per_second": 14.136, | |
| "step": 11400 | |
| }, | |
| { | |
| "epoch": 1.2593560095691148, | |
| "grad_norm": 4.295003414154053, | |
| "learning_rate": 2.2235061076262794e-05, | |
| "loss": 0.43860099792480467, | |
| "step": 11450 | |
| }, | |
| { | |
| "epoch": 1.2593560095691148, | |
| "eval_loss": 0.5500693321228027, | |
| "eval_runtime": 1.1996, | |
| "eval_samples_per_second": 83.363, | |
| "eval_steps_per_second": 14.172, | |
| "step": 11450 | |
| }, | |
| { | |
| "epoch": 1.26485550086617, | |
| "grad_norm": 3.2815680503845215, | |
| "learning_rate": 2.2069990095741167e-05, | |
| "loss": 0.39200534820556643, | |
| "step": 11500 | |
| }, | |
| { | |
| "epoch": 1.26485550086617, | |
| "eval_loss": 0.5783631801605225, | |
| "eval_runtime": 1.2001, | |
| "eval_samples_per_second": 83.324, | |
| "eval_steps_per_second": 14.165, | |
| "step": 11500 | |
| }, | |
| { | |
| "epoch": 1.270354992163225, | |
| "grad_norm": 5.105454921722412, | |
| "learning_rate": 2.1904919115219547e-05, | |
| "loss": 0.447188606262207, | |
| "step": 11550 | |
| }, | |
| { | |
| "epoch": 1.270354992163225, | |
| "eval_loss": 0.5806690454483032, | |
| "eval_runtime": 1.2018, | |
| "eval_samples_per_second": 83.21, | |
| "eval_steps_per_second": 14.146, | |
| "step": 11550 | |
| }, | |
| { | |
| "epoch": 1.2758544834602799, | |
| "grad_norm": 7.1614580154418945, | |
| "learning_rate": 2.173984813469792e-05, | |
| "loss": 0.4186487579345703, | |
| "step": 11600 | |
| }, | |
| { | |
| "epoch": 1.2758544834602799, | |
| "eval_loss": 0.5866115689277649, | |
| "eval_runtime": 1.2043, | |
| "eval_samples_per_second": 83.036, | |
| "eval_steps_per_second": 14.116, | |
| "step": 11600 | |
| }, | |
| { | |
| "epoch": 1.281353974757335, | |
| "grad_norm": 3.8269095420837402, | |
| "learning_rate": 2.1574777154176296e-05, | |
| "loss": 0.38072307586669923, | |
| "step": 11650 | |
| }, | |
| { | |
| "epoch": 1.281353974757335, | |
| "eval_loss": 0.5898852944374084, | |
| "eval_runtime": 1.2117, | |
| "eval_samples_per_second": 82.525, | |
| "eval_steps_per_second": 14.029, | |
| "step": 11650 | |
| }, | |
| { | |
| "epoch": 1.28685346605439, | |
| "grad_norm": 4.064493179321289, | |
| "learning_rate": 2.1409706173654672e-05, | |
| "loss": 0.4382596206665039, | |
| "step": 11700 | |
| }, | |
| { | |
| "epoch": 1.28685346605439, | |
| "eval_loss": 0.5848357677459717, | |
| "eval_runtime": 1.1999, | |
| "eval_samples_per_second": 83.34, | |
| "eval_steps_per_second": 14.168, | |
| "step": 11700 | |
| }, | |
| { | |
| "epoch": 1.292352957351445, | |
| "grad_norm": 5.449599742889404, | |
| "learning_rate": 2.124463519313305e-05, | |
| "loss": 0.42343997955322266, | |
| "step": 11750 | |
| }, | |
| { | |
| "epoch": 1.292352957351445, | |
| "eval_loss": 0.5586597323417664, | |
| "eval_runtime": 1.2023, | |
| "eval_samples_per_second": 83.172, | |
| "eval_steps_per_second": 14.139, | |
| "step": 11750 | |
| }, | |
| { | |
| "epoch": 1.2978524486485, | |
| "grad_norm": 3.673954725265503, | |
| "learning_rate": 2.107956421261142e-05, | |
| "loss": 0.41550613403320313, | |
| "step": 11800 | |
| }, | |
| { | |
| "epoch": 1.2978524486485, | |
| "eval_loss": 0.5658605694770813, | |
| "eval_runtime": 1.1991, | |
| "eval_samples_per_second": 83.399, | |
| "eval_steps_per_second": 14.178, | |
| "step": 11800 | |
| }, | |
| { | |
| "epoch": 1.303351939945555, | |
| "grad_norm": 3.6161746978759766, | |
| "learning_rate": 2.09144932320898e-05, | |
| "loss": 0.4265287780761719, | |
| "step": 11850 | |
| }, | |
| { | |
| "epoch": 1.303351939945555, | |
| "eval_loss": 0.5512486100196838, | |
| "eval_runtime": 1.2044, | |
| "eval_samples_per_second": 83.029, | |
| "eval_steps_per_second": 14.115, | |
| "step": 11850 | |
| }, | |
| { | |
| "epoch": 1.30885143124261, | |
| "grad_norm": 4.095085620880127, | |
| "learning_rate": 2.0749422251568174e-05, | |
| "loss": 0.44609962463378905, | |
| "step": 11900 | |
| }, | |
| { | |
| "epoch": 1.30885143124261, | |
| "eval_loss": 0.5730013847351074, | |
| "eval_runtime": 1.2017, | |
| "eval_samples_per_second": 83.215, | |
| "eval_steps_per_second": 14.147, | |
| "step": 11900 | |
| }, | |
| { | |
| "epoch": 1.314350922539665, | |
| "grad_norm": 4.820618152618408, | |
| "learning_rate": 2.0584351271046554e-05, | |
| "loss": 0.4422262191772461, | |
| "step": 11950 | |
| }, | |
| { | |
| "epoch": 1.314350922539665, | |
| "eval_loss": 0.5577285289764404, | |
| "eval_runtime": 1.1984, | |
| "eval_samples_per_second": 83.443, | |
| "eval_steps_per_second": 14.185, | |
| "step": 11950 | |
| }, | |
| { | |
| "epoch": 1.3198504138367202, | |
| "grad_norm": 3.5373456478118896, | |
| "learning_rate": 2.0419280290524926e-05, | |
| "loss": 0.42433460235595705, | |
| "step": 12000 | |
| }, | |
| { | |
| "epoch": 1.3198504138367202, | |
| "eval_loss": 0.5625931024551392, | |
| "eval_runtime": 1.1987, | |
| "eval_samples_per_second": 83.422, | |
| "eval_steps_per_second": 14.182, | |
| "step": 12000 | |
| }, | |
| { | |
| "epoch": 1.3253499051337752, | |
| "grad_norm": 4.760179042816162, | |
| "learning_rate": 2.0254209310003303e-05, | |
| "loss": 0.3792121887207031, | |
| "step": 12050 | |
| }, | |
| { | |
| "epoch": 1.3253499051337752, | |
| "eval_loss": 0.5574110746383667, | |
| "eval_runtime": 1.2015, | |
| "eval_samples_per_second": 83.233, | |
| "eval_steps_per_second": 14.15, | |
| "step": 12050 | |
| }, | |
| { | |
| "epoch": 1.3308493964308301, | |
| "grad_norm": 5.790397644042969, | |
| "learning_rate": 2.008913832948168e-05, | |
| "loss": 0.4382122039794922, | |
| "step": 12100 | |
| }, | |
| { | |
| "epoch": 1.3308493964308301, | |
| "eval_loss": 0.5597708225250244, | |
| "eval_runtime": 1.2092, | |
| "eval_samples_per_second": 82.703, | |
| "eval_steps_per_second": 14.059, | |
| "step": 12100 | |
| }, | |
| { | |
| "epoch": 1.336348887727885, | |
| "grad_norm": 4.420812606811523, | |
| "learning_rate": 1.9924067348960052e-05, | |
| "loss": 0.42329288482666017, | |
| "step": 12150 | |
| }, | |
| { | |
| "epoch": 1.336348887727885, | |
| "eval_loss": 0.5556257367134094, | |
| "eval_runtime": 1.1986, | |
| "eval_samples_per_second": 83.431, | |
| "eval_steps_per_second": 14.183, | |
| "step": 12150 | |
| }, | |
| { | |
| "epoch": 1.3418483790249403, | |
| "grad_norm": 4.655048370361328, | |
| "learning_rate": 1.9758996368438428e-05, | |
| "loss": 0.4278908920288086, | |
| "step": 12200 | |
| }, | |
| { | |
| "epoch": 1.3418483790249403, | |
| "eval_loss": 0.543867290019989, | |
| "eval_runtime": 1.1984, | |
| "eval_samples_per_second": 83.442, | |
| "eval_steps_per_second": 14.185, | |
| "step": 12200 | |
| }, | |
| { | |
| "epoch": 1.3473478703219952, | |
| "grad_norm": 4.914540767669678, | |
| "learning_rate": 1.9593925387916804e-05, | |
| "loss": 0.42110458374023435, | |
| "step": 12250 | |
| }, | |
| { | |
| "epoch": 1.3473478703219952, | |
| "eval_loss": 0.5576221346855164, | |
| "eval_runtime": 1.2024, | |
| "eval_samples_per_second": 83.17, | |
| "eval_steps_per_second": 14.139, | |
| "step": 12250 | |
| }, | |
| { | |
| "epoch": 1.3528473616190502, | |
| "grad_norm": 3.613415002822876, | |
| "learning_rate": 1.942885440739518e-05, | |
| "loss": 0.408565788269043, | |
| "step": 12300 | |
| }, | |
| { | |
| "epoch": 1.3528473616190502, | |
| "eval_loss": 0.5335881114006042, | |
| "eval_runtime": 1.1993, | |
| "eval_samples_per_second": 83.383, | |
| "eval_steps_per_second": 14.175, | |
| "step": 12300 | |
| }, | |
| { | |
| "epoch": 1.3583468529161054, | |
| "grad_norm": 4.228052616119385, | |
| "learning_rate": 1.9263783426873553e-05, | |
| "loss": 0.40878799438476565, | |
| "step": 12350 | |
| }, | |
| { | |
| "epoch": 1.3583468529161054, | |
| "eval_loss": 0.5544968247413635, | |
| "eval_runtime": 1.2063, | |
| "eval_samples_per_second": 82.896, | |
| "eval_steps_per_second": 14.092, | |
| "step": 12350 | |
| }, | |
| { | |
| "epoch": 1.3638463442131603, | |
| "grad_norm": 3.1512410640716553, | |
| "learning_rate": 1.9098712446351933e-05, | |
| "loss": 0.40386688232421875, | |
| "step": 12400 | |
| }, | |
| { | |
| "epoch": 1.3638463442131603, | |
| "eval_loss": 0.5391093492507935, | |
| "eval_runtime": 1.206, | |
| "eval_samples_per_second": 82.92, | |
| "eval_steps_per_second": 14.096, | |
| "step": 12400 | |
| }, | |
| { | |
| "epoch": 1.3693458355102153, | |
| "grad_norm": 4.095332145690918, | |
| "learning_rate": 1.8933641465830306e-05, | |
| "loss": 0.4119942092895508, | |
| "step": 12450 | |
| }, | |
| { | |
| "epoch": 1.3693458355102153, | |
| "eval_loss": 0.5375053286552429, | |
| "eval_runtime": 1.1993, | |
| "eval_samples_per_second": 83.383, | |
| "eval_steps_per_second": 14.175, | |
| "step": 12450 | |
| }, | |
| { | |
| "epoch": 1.3748453268072702, | |
| "grad_norm": 4.36025333404541, | |
| "learning_rate": 1.8768570485308686e-05, | |
| "loss": 0.42032379150390625, | |
| "step": 12500 | |
| }, | |
| { | |
| "epoch": 1.3748453268072702, | |
| "eval_loss": 0.5409677624702454, | |
| "eval_runtime": 1.1988, | |
| "eval_samples_per_second": 83.417, | |
| "eval_steps_per_second": 14.181, | |
| "step": 12500 | |
| }, | |
| { | |
| "epoch": 1.3803448181043254, | |
| "grad_norm": 3.8784241676330566, | |
| "learning_rate": 1.860349950478706e-05, | |
| "loss": 0.3923546600341797, | |
| "step": 12550 | |
| }, | |
| { | |
| "epoch": 1.3803448181043254, | |
| "eval_loss": 0.5505947470664978, | |
| "eval_runtime": 1.2002, | |
| "eval_samples_per_second": 83.318, | |
| "eval_steps_per_second": 14.164, | |
| "step": 12550 | |
| }, | |
| { | |
| "epoch": 1.3858443094013804, | |
| "grad_norm": 4.052207946777344, | |
| "learning_rate": 1.8438428524265435e-05, | |
| "loss": 0.38611976623535155, | |
| "step": 12600 | |
| }, | |
| { | |
| "epoch": 1.3858443094013804, | |
| "eval_loss": 0.5389760732650757, | |
| "eval_runtime": 1.2026, | |
| "eval_samples_per_second": 83.155, | |
| "eval_steps_per_second": 14.136, | |
| "step": 12600 | |
| }, | |
| { | |
| "epoch": 1.3913438006984353, | |
| "grad_norm": 5.018970489501953, | |
| "learning_rate": 1.827335754374381e-05, | |
| "loss": 0.4026565933227539, | |
| "step": 12650 | |
| }, | |
| { | |
| "epoch": 1.3913438006984353, | |
| "eval_loss": 0.5398291945457458, | |
| "eval_runtime": 1.2079, | |
| "eval_samples_per_second": 82.791, | |
| "eval_steps_per_second": 14.074, | |
| "step": 12650 | |
| }, | |
| { | |
| "epoch": 1.3968432919954905, | |
| "grad_norm": 3.710087537765503, | |
| "learning_rate": 1.8108286563222187e-05, | |
| "loss": 0.4165144729614258, | |
| "step": 12700 | |
| }, | |
| { | |
| "epoch": 1.3968432919954905, | |
| "eval_loss": 0.5442482233047485, | |
| "eval_runtime": 1.2705, | |
| "eval_samples_per_second": 78.709, | |
| "eval_steps_per_second": 13.381, | |
| "step": 12700 | |
| }, | |
| { | |
| "epoch": 1.4023427832925455, | |
| "grad_norm": 4.182759761810303, | |
| "learning_rate": 1.794321558270056e-05, | |
| "loss": 0.3919545745849609, | |
| "step": 12750 | |
| }, | |
| { | |
| "epoch": 1.4023427832925455, | |
| "eval_loss": 0.5415162444114685, | |
| "eval_runtime": 1.2788, | |
| "eval_samples_per_second": 78.199, | |
| "eval_steps_per_second": 13.294, | |
| "step": 12750 | |
| }, | |
| { | |
| "epoch": 1.4078422745896004, | |
| "grad_norm": 4.3373870849609375, | |
| "learning_rate": 1.777814460217894e-05, | |
| "loss": 0.40383522033691405, | |
| "step": 12800 | |
| }, | |
| { | |
| "epoch": 1.4078422745896004, | |
| "eval_loss": 0.5278663635253906, | |
| "eval_runtime": 1.2779, | |
| "eval_samples_per_second": 78.256, | |
| "eval_steps_per_second": 13.304, | |
| "step": 12800 | |
| }, | |
| { | |
| "epoch": 1.4133417658866554, | |
| "grad_norm": 3.619389533996582, | |
| "learning_rate": 1.7613073621657313e-05, | |
| "loss": 0.44847320556640624, | |
| "step": 12850 | |
| }, | |
| { | |
| "epoch": 1.4133417658866554, | |
| "eval_loss": 0.5374107360839844, | |
| "eval_runtime": 1.2797, | |
| "eval_samples_per_second": 78.145, | |
| "eval_steps_per_second": 13.285, | |
| "step": 12850 | |
| }, | |
| { | |
| "epoch": 1.4188412571837106, | |
| "grad_norm": 3.119107246398926, | |
| "learning_rate": 1.744800264113569e-05, | |
| "loss": 0.39309986114501955, | |
| "step": 12900 | |
| }, | |
| { | |
| "epoch": 1.4188412571837106, | |
| "eval_loss": 0.5523837804794312, | |
| "eval_runtime": 1.278, | |
| "eval_samples_per_second": 78.245, | |
| "eval_steps_per_second": 13.302, | |
| "step": 12900 | |
| }, | |
| { | |
| "epoch": 1.4243407484807655, | |
| "grad_norm": 3.7152740955352783, | |
| "learning_rate": 1.7282931660614065e-05, | |
| "loss": 0.42365001678466796, | |
| "step": 12950 | |
| }, | |
| { | |
| "epoch": 1.4243407484807655, | |
| "eval_loss": 0.5404840707778931, | |
| "eval_runtime": 1.2774, | |
| "eval_samples_per_second": 78.282, | |
| "eval_steps_per_second": 13.308, | |
| "step": 12950 | |
| }, | |
| { | |
| "epoch": 1.4298402397778205, | |
| "grad_norm": 4.347856521606445, | |
| "learning_rate": 1.7117860680092438e-05, | |
| "loss": 0.39466506958007813, | |
| "step": 13000 | |
| }, | |
| { | |
| "epoch": 1.4298402397778205, | |
| "eval_loss": 0.5432237386703491, | |
| "eval_runtime": 1.2709, | |
| "eval_samples_per_second": 78.687, | |
| "eval_steps_per_second": 13.377, | |
| "step": 13000 | |
| }, | |
| { | |
| "epoch": 1.4353397310748757, | |
| "grad_norm": 4.440253257751465, | |
| "learning_rate": 1.6952789699570814e-05, | |
| "loss": 0.4289556121826172, | |
| "step": 13050 | |
| }, | |
| { | |
| "epoch": 1.4353397310748757, | |
| "eval_loss": 0.5323364734649658, | |
| "eval_runtime": 1.1995, | |
| "eval_samples_per_second": 83.369, | |
| "eval_steps_per_second": 14.173, | |
| "step": 13050 | |
| }, | |
| { | |
| "epoch": 1.4408392223719306, | |
| "grad_norm": 4.130159854888916, | |
| "learning_rate": 1.678771871904919e-05, | |
| "loss": 0.4275970458984375, | |
| "step": 13100 | |
| }, | |
| { | |
| "epoch": 1.4408392223719306, | |
| "eval_loss": 0.5353785157203674, | |
| "eval_runtime": 1.2118, | |
| "eval_samples_per_second": 82.52, | |
| "eval_steps_per_second": 14.028, | |
| "step": 13100 | |
| }, | |
| { | |
| "epoch": 1.4463387136689856, | |
| "grad_norm": 3.5807628631591797, | |
| "learning_rate": 1.6622647738527567e-05, | |
| "loss": 0.414808464050293, | |
| "step": 13150 | |
| }, | |
| { | |
| "epoch": 1.4463387136689856, | |
| "eval_loss": 0.5167968273162842, | |
| "eval_runtime": 1.2016, | |
| "eval_samples_per_second": 83.223, | |
| "eval_steps_per_second": 14.148, | |
| "step": 13150 | |
| }, | |
| { | |
| "epoch": 1.4518382049660405, | |
| "grad_norm": 3.19081449508667, | |
| "learning_rate": 1.6457576758005943e-05, | |
| "loss": 0.4333197021484375, | |
| "step": 13200 | |
| }, | |
| { | |
| "epoch": 1.4518382049660405, | |
| "eval_loss": 0.5306875109672546, | |
| "eval_runtime": 1.2826, | |
| "eval_samples_per_second": 77.965, | |
| "eval_steps_per_second": 13.254, | |
| "step": 13200 | |
| }, | |
| { | |
| "epoch": 1.4573376962630957, | |
| "grad_norm": 3.25466251373291, | |
| "learning_rate": 1.629250577748432e-05, | |
| "loss": 0.39129966735839844, | |
| "step": 13250 | |
| }, | |
| { | |
| "epoch": 1.4573376962630957, | |
| "eval_loss": 0.5385807752609253, | |
| "eval_runtime": 1.282, | |
| "eval_samples_per_second": 78.006, | |
| "eval_steps_per_second": 13.261, | |
| "step": 13250 | |
| }, | |
| { | |
| "epoch": 1.4628371875601507, | |
| "grad_norm": 3.3677966594696045, | |
| "learning_rate": 1.6127434796962692e-05, | |
| "loss": 0.40751338958740235, | |
| "step": 13300 | |
| }, | |
| { | |
| "epoch": 1.4628371875601507, | |
| "eval_loss": 0.516380250453949, | |
| "eval_runtime": 1.2802, | |
| "eval_samples_per_second": 78.112, | |
| "eval_steps_per_second": 13.279, | |
| "step": 13300 | |
| }, | |
| { | |
| "epoch": 1.4683366788572056, | |
| "grad_norm": 3.450413465499878, | |
| "learning_rate": 1.5962363816441072e-05, | |
| "loss": 0.40498565673828124, | |
| "step": 13350 | |
| }, | |
| { | |
| "epoch": 1.4683366788572056, | |
| "eval_loss": 0.5298721194267273, | |
| "eval_runtime": 1.2815, | |
| "eval_samples_per_second": 78.034, | |
| "eval_steps_per_second": 13.266, | |
| "step": 13350 | |
| }, | |
| { | |
| "epoch": 1.4738361701542608, | |
| "grad_norm": 3.3262946605682373, | |
| "learning_rate": 1.5797292835919445e-05, | |
| "loss": 0.3863627243041992, | |
| "step": 13400 | |
| }, | |
| { | |
| "epoch": 1.4738361701542608, | |
| "eval_loss": 0.516625165939331, | |
| "eval_runtime": 1.2809, | |
| "eval_samples_per_second": 78.067, | |
| "eval_steps_per_second": 13.271, | |
| "step": 13400 | |
| }, | |
| { | |
| "epoch": 1.4793356614513158, | |
| "grad_norm": 3.365875720977783, | |
| "learning_rate": 1.563222185539782e-05, | |
| "loss": 0.4204134750366211, | |
| "step": 13450 | |
| }, | |
| { | |
| "epoch": 1.4793356614513158, | |
| "eval_loss": 0.5206517577171326, | |
| "eval_runtime": 1.2817, | |
| "eval_samples_per_second": 78.02, | |
| "eval_steps_per_second": 13.263, | |
| "step": 13450 | |
| }, | |
| { | |
| "epoch": 1.4848351527483707, | |
| "grad_norm": 3.2131149768829346, | |
| "learning_rate": 1.5467150874876197e-05, | |
| "loss": 0.40632450103759765, | |
| "step": 13500 | |
| }, | |
| { | |
| "epoch": 1.4848351527483707, | |
| "eval_loss": 0.5308406949043274, | |
| "eval_runtime": 1.2811, | |
| "eval_samples_per_second": 78.057, | |
| "eval_steps_per_second": 13.27, | |
| "step": 13500 | |
| }, | |
| { | |
| "epoch": 1.4903346440454257, | |
| "grad_norm": 3.364225387573242, | |
| "learning_rate": 1.5302079894354574e-05, | |
| "loss": 0.4048501205444336, | |
| "step": 13550 | |
| }, | |
| { | |
| "epoch": 1.4903346440454257, | |
| "eval_loss": 0.52863609790802, | |
| "eval_runtime": 1.2813, | |
| "eval_samples_per_second": 78.044, | |
| "eval_steps_per_second": 13.268, | |
| "step": 13550 | |
| }, | |
| { | |
| "epoch": 1.4958341353424809, | |
| "grad_norm": 3.1679489612579346, | |
| "learning_rate": 1.5137008913832946e-05, | |
| "loss": 0.4006618881225586, | |
| "step": 13600 | |
| }, | |
| { | |
| "epoch": 1.4958341353424809, | |
| "eval_loss": 0.517315149307251, | |
| "eval_runtime": 1.2806, | |
| "eval_samples_per_second": 78.087, | |
| "eval_steps_per_second": 13.275, | |
| "step": 13600 | |
| }, | |
| { | |
| "epoch": 1.5013336266395358, | |
| "grad_norm": 4.6463518142700195, | |
| "learning_rate": 1.4971937933311324e-05, | |
| "loss": 0.4259402847290039, | |
| "step": 13650 | |
| }, | |
| { | |
| "epoch": 1.5013336266395358, | |
| "eval_loss": 0.5239192843437195, | |
| "eval_runtime": 1.2834, | |
| "eval_samples_per_second": 77.921, | |
| "eval_steps_per_second": 13.246, | |
| "step": 13650 | |
| }, | |
| { | |
| "epoch": 1.506833117936591, | |
| "grad_norm": 3.8338677883148193, | |
| "learning_rate": 1.4806866952789699e-05, | |
| "loss": 0.45359893798828127, | |
| "step": 13700 | |
| }, | |
| { | |
| "epoch": 1.506833117936591, | |
| "eval_loss": 0.5376471877098083, | |
| "eval_runtime": 1.1985, | |
| "eval_samples_per_second": 83.437, | |
| "eval_steps_per_second": 14.184, | |
| "step": 13700 | |
| }, | |
| { | |
| "epoch": 1.512332609233646, | |
| "grad_norm": 4.828174114227295, | |
| "learning_rate": 1.4641795972268075e-05, | |
| "loss": 0.4245915985107422, | |
| "step": 13750 | |
| }, | |
| { | |
| "epoch": 1.512332609233646, | |
| "eval_loss": 0.545063853263855, | |
| "eval_runtime": 1.2015, | |
| "eval_samples_per_second": 83.226, | |
| "eval_steps_per_second": 14.148, | |
| "step": 13750 | |
| }, | |
| { | |
| "epoch": 1.517832100530701, | |
| "grad_norm": 4.063199996948242, | |
| "learning_rate": 1.4476724991746452e-05, | |
| "loss": 0.42612323760986326, | |
| "step": 13800 | |
| }, | |
| { | |
| "epoch": 1.517832100530701, | |
| "eval_loss": 0.5337764620780945, | |
| "eval_runtime": 1.2015, | |
| "eval_samples_per_second": 83.227, | |
| "eval_steps_per_second": 14.149, | |
| "step": 13800 | |
| }, | |
| { | |
| "epoch": 1.523331591827756, | |
| "grad_norm": 4.409724235534668, | |
| "learning_rate": 1.4311654011224828e-05, | |
| "loss": 0.4229386138916016, | |
| "step": 13850 | |
| }, | |
| { | |
| "epoch": 1.523331591827756, | |
| "eval_loss": 0.5254413485527039, | |
| "eval_runtime": 1.2114, | |
| "eval_samples_per_second": 82.546, | |
| "eval_steps_per_second": 14.033, | |
| "step": 13850 | |
| }, | |
| { | |
| "epoch": 1.5288310831248109, | |
| "grad_norm": 4.604098320007324, | |
| "learning_rate": 1.4146583030703202e-05, | |
| "loss": 0.4207559967041016, | |
| "step": 13900 | |
| }, | |
| { | |
| "epoch": 1.5288310831248109, | |
| "eval_loss": 0.5319836139678955, | |
| "eval_runtime": 1.2009, | |
| "eval_samples_per_second": 83.273, | |
| "eval_steps_per_second": 14.156, | |
| "step": 13900 | |
| }, | |
| { | |
| "epoch": 1.5343305744218658, | |
| "grad_norm": 3.5800247192382812, | |
| "learning_rate": 1.3981512050181579e-05, | |
| "loss": 0.4052052307128906, | |
| "step": 13950 | |
| }, | |
| { | |
| "epoch": 1.5343305744218658, | |
| "eval_loss": 0.5325583815574646, | |
| "eval_runtime": 1.2085, | |
| "eval_samples_per_second": 82.747, | |
| "eval_steps_per_second": 14.067, | |
| "step": 13950 | |
| }, | |
| { | |
| "epoch": 1.539830065718921, | |
| "grad_norm": 4.180997371673584, | |
| "learning_rate": 1.3816441069659955e-05, | |
| "loss": 0.41810825347900393, | |
| "step": 14000 | |
| }, | |
| { | |
| "epoch": 1.539830065718921, | |
| "eval_loss": 0.5244957804679871, | |
| "eval_runtime": 1.1981, | |
| "eval_samples_per_second": 83.464, | |
| "eval_steps_per_second": 14.189, | |
| "step": 14000 | |
| }, | |
| { | |
| "epoch": 1.5453295570159762, | |
| "grad_norm": 4.035894393920898, | |
| "learning_rate": 1.365137008913833e-05, | |
| "loss": 0.4168061065673828, | |
| "step": 14050 | |
| }, | |
| { | |
| "epoch": 1.5453295570159762, | |
| "eval_loss": 0.5245411396026611, | |
| "eval_runtime": 1.1978, | |
| "eval_samples_per_second": 83.485, | |
| "eval_steps_per_second": 14.192, | |
| "step": 14050 | |
| }, | |
| { | |
| "epoch": 1.5508290483130311, | |
| "grad_norm": 2.8827695846557617, | |
| "learning_rate": 1.3486299108616706e-05, | |
| "loss": 0.40900135040283203, | |
| "step": 14100 | |
| }, | |
| { | |
| "epoch": 1.5508290483130311, | |
| "eval_loss": 0.5175855755805969, | |
| "eval_runtime": 1.2709, | |
| "eval_samples_per_second": 78.686, | |
| "eval_steps_per_second": 13.377, | |
| "step": 14100 | |
| }, | |
| { | |
| "epoch": 1.556328539610086, | |
| "grad_norm": 4.7631516456604, | |
| "learning_rate": 1.3321228128095082e-05, | |
| "loss": 0.4275320434570313, | |
| "step": 14150 | |
| }, | |
| { | |
| "epoch": 1.556328539610086, | |
| "eval_loss": 0.5145242214202881, | |
| "eval_runtime": 1.2206, | |
| "eval_samples_per_second": 81.93, | |
| "eval_steps_per_second": 13.928, | |
| "step": 14150 | |
| }, | |
| { | |
| "epoch": 1.561828030907141, | |
| "grad_norm": 4.559270858764648, | |
| "learning_rate": 1.3156157147573458e-05, | |
| "loss": 0.3759859848022461, | |
| "step": 14200 | |
| }, | |
| { | |
| "epoch": 1.561828030907141, | |
| "eval_loss": 0.5150010585784912, | |
| "eval_runtime": 1.1982, | |
| "eval_samples_per_second": 83.457, | |
| "eval_steps_per_second": 14.188, | |
| "step": 14200 | |
| }, | |
| { | |
| "epoch": 1.567327522204196, | |
| "grad_norm": 3.3630456924438477, | |
| "learning_rate": 1.2991086167051833e-05, | |
| "loss": 0.39138256072998046, | |
| "step": 14250 | |
| }, | |
| { | |
| "epoch": 1.567327522204196, | |
| "eval_loss": 0.5457283854484558, | |
| "eval_runtime": 1.2043, | |
| "eval_samples_per_second": 83.038, | |
| "eval_steps_per_second": 14.116, | |
| "step": 14250 | |
| }, | |
| { | |
| "epoch": 1.572827013501251, | |
| "grad_norm": 3.256690740585327, | |
| "learning_rate": 1.2826015186530209e-05, | |
| "loss": 0.3982016372680664, | |
| "step": 14300 | |
| }, | |
| { | |
| "epoch": 1.572827013501251, | |
| "eval_loss": 0.5194215774536133, | |
| "eval_runtime": 1.2004, | |
| "eval_samples_per_second": 83.303, | |
| "eval_steps_per_second": 14.161, | |
| "step": 14300 | |
| }, | |
| { | |
| "epoch": 1.5783265047983062, | |
| "grad_norm": 4.9264020919799805, | |
| "learning_rate": 1.2660944206008584e-05, | |
| "loss": 0.37310329437255857, | |
| "step": 14350 | |
| }, | |
| { | |
| "epoch": 1.5783265047983062, | |
| "eval_loss": 0.537217915058136, | |
| "eval_runtime": 1.2037, | |
| "eval_samples_per_second": 83.077, | |
| "eval_steps_per_second": 14.123, | |
| "step": 14350 | |
| }, | |
| { | |
| "epoch": 1.5838259960953613, | |
| "grad_norm": 3.917881965637207, | |
| "learning_rate": 1.2495873225486958e-05, | |
| "loss": 0.40028915405273435, | |
| "step": 14400 | |
| }, | |
| { | |
| "epoch": 1.5838259960953613, | |
| "eval_loss": 0.5212844014167786, | |
| "eval_runtime": 1.2024, | |
| "eval_samples_per_second": 83.166, | |
| "eval_steps_per_second": 14.138, | |
| "step": 14400 | |
| }, | |
| { | |
| "epoch": 1.5893254873924163, | |
| "grad_norm": 3.8361563682556152, | |
| "learning_rate": 1.2330802244965334e-05, | |
| "loss": 0.40108360290527345, | |
| "step": 14450 | |
| }, | |
| { | |
| "epoch": 1.5893254873924163, | |
| "eval_loss": 0.5083942413330078, | |
| "eval_runtime": 1.2046, | |
| "eval_samples_per_second": 83.018, | |
| "eval_steps_per_second": 14.113, | |
| "step": 14450 | |
| }, | |
| { | |
| "epoch": 1.5948249786894713, | |
| "grad_norm": 3.184602737426758, | |
| "learning_rate": 1.216573126444371e-05, | |
| "loss": 0.4339041519165039, | |
| "step": 14500 | |
| }, | |
| { | |
| "epoch": 1.5948249786894713, | |
| "eval_loss": 0.5342686176300049, | |
| "eval_runtime": 1.2031, | |
| "eval_samples_per_second": 83.12, | |
| "eval_steps_per_second": 14.13, | |
| "step": 14500 | |
| }, | |
| { | |
| "epoch": 1.6003244699865262, | |
| "grad_norm": 4.491968154907227, | |
| "learning_rate": 1.2000660283922087e-05, | |
| "loss": 0.3967703628540039, | |
| "step": 14550 | |
| }, | |
| { | |
| "epoch": 1.6003244699865262, | |
| "eval_loss": 0.520110547542572, | |
| "eval_runtime": 1.2023, | |
| "eval_samples_per_second": 83.17, | |
| "eval_steps_per_second": 14.139, | |
| "step": 14550 | |
| }, | |
| { | |
| "epoch": 1.6058239612835812, | |
| "grad_norm": 3.78524112701416, | |
| "learning_rate": 1.1835589303400462e-05, | |
| "loss": 0.3790835189819336, | |
| "step": 14600 | |
| }, | |
| { | |
| "epoch": 1.6058239612835812, | |
| "eval_loss": 0.5195483565330505, | |
| "eval_runtime": 1.2016, | |
| "eval_samples_per_second": 83.223, | |
| "eval_steps_per_second": 14.148, | |
| "step": 14600 | |
| }, | |
| { | |
| "epoch": 1.6113234525806361, | |
| "grad_norm": 4.135509014129639, | |
| "learning_rate": 1.1670518322878838e-05, | |
| "loss": 0.40242374420166016, | |
| "step": 14650 | |
| }, | |
| { | |
| "epoch": 1.6113234525806361, | |
| "eval_loss": 0.516440212726593, | |
| "eval_runtime": 1.2033, | |
| "eval_samples_per_second": 83.105, | |
| "eval_steps_per_second": 14.128, | |
| "step": 14650 | |
| }, | |
| { | |
| "epoch": 1.6168229438776913, | |
| "grad_norm": 4.210612773895264, | |
| "learning_rate": 1.1505447342357214e-05, | |
| "loss": 0.4028606414794922, | |
| "step": 14700 | |
| }, | |
| { | |
| "epoch": 1.6168229438776913, | |
| "eval_loss": 0.5266108512878418, | |
| "eval_runtime": 1.2087, | |
| "eval_samples_per_second": 82.733, | |
| "eval_steps_per_second": 14.065, | |
| "step": 14700 | |
| }, | |
| { | |
| "epoch": 1.6223224351747465, | |
| "grad_norm": 5.338522911071777, | |
| "learning_rate": 1.1340376361835589e-05, | |
| "loss": 0.39550567626953126, | |
| "step": 14750 | |
| }, | |
| { | |
| "epoch": 1.6223224351747465, | |
| "eval_loss": 0.5249260663986206, | |
| "eval_runtime": 1.2038, | |
| "eval_samples_per_second": 83.073, | |
| "eval_steps_per_second": 14.122, | |
| "step": 14750 | |
| }, | |
| { | |
| "epoch": 1.6278219264718015, | |
| "grad_norm": 2.723923921585083, | |
| "learning_rate": 1.1175305381313965e-05, | |
| "loss": 0.41064441680908204, | |
| "step": 14800 | |
| }, | |
| { | |
| "epoch": 1.6278219264718015, | |
| "eval_loss": 0.520072877407074, | |
| "eval_runtime": 1.2005, | |
| "eval_samples_per_second": 83.302, | |
| "eval_steps_per_second": 14.161, | |
| "step": 14800 | |
| }, | |
| { | |
| "epoch": 1.6333214177688564, | |
| "grad_norm": 3.793158531188965, | |
| "learning_rate": 1.1010234400792341e-05, | |
| "loss": 0.38922351837158203, | |
| "step": 14850 | |
| }, | |
| { | |
| "epoch": 1.6333214177688564, | |
| "eval_loss": 0.5236958861351013, | |
| "eval_runtime": 1.2009, | |
| "eval_samples_per_second": 83.269, | |
| "eval_steps_per_second": 14.156, | |
| "step": 14850 | |
| }, | |
| { | |
| "epoch": 1.6388209090659114, | |
| "grad_norm": 5.206042766571045, | |
| "learning_rate": 1.0845163420270717e-05, | |
| "loss": 0.3783760070800781, | |
| "step": 14900 | |
| }, | |
| { | |
| "epoch": 1.6388209090659114, | |
| "eval_loss": 0.5220252871513367, | |
| "eval_runtime": 1.2755, | |
| "eval_samples_per_second": 78.399, | |
| "eval_steps_per_second": 13.328, | |
| "step": 14900 | |
| }, | |
| { | |
| "epoch": 1.6443204003629663, | |
| "grad_norm": 3.5335276126861572, | |
| "learning_rate": 1.0680092439749092e-05, | |
| "loss": 0.36626754760742186, | |
| "step": 14950 | |
| }, | |
| { | |
| "epoch": 1.6443204003629663, | |
| "eval_loss": 0.5257189869880676, | |
| "eval_runtime": 1.2584, | |
| "eval_samples_per_second": 79.467, | |
| "eval_steps_per_second": 13.509, | |
| "step": 14950 | |
| }, | |
| { | |
| "epoch": 1.6498198916600213, | |
| "grad_norm": 5.903299331665039, | |
| "learning_rate": 1.0515021459227468e-05, | |
| "loss": 0.4300186538696289, | |
| "step": 15000 | |
| }, | |
| { | |
| "epoch": 1.6498198916600213, | |
| "eval_loss": 0.5119779109954834, | |
| "eval_runtime": 1.2824, | |
| "eval_samples_per_second": 77.977, | |
| "eval_steps_per_second": 13.256, | |
| "step": 15000 | |
| }, | |
| { | |
| "epoch": 1.6553193829570765, | |
| "grad_norm": 4.042174339294434, | |
| "learning_rate": 1.0349950478705845e-05, | |
| "loss": 0.4231399154663086, | |
| "step": 15050 | |
| }, | |
| { | |
| "epoch": 1.6553193829570765, | |
| "eval_loss": 0.5127305388450623, | |
| "eval_runtime": 1.2793, | |
| "eval_samples_per_second": 78.169, | |
| "eval_steps_per_second": 13.289, | |
| "step": 15050 | |
| }, | |
| { | |
| "epoch": 1.6608188742541314, | |
| "grad_norm": 4.595501899719238, | |
| "learning_rate": 1.018487949818422e-05, | |
| "loss": 0.3916609573364258, | |
| "step": 15100 | |
| }, | |
| { | |
| "epoch": 1.6608188742541314, | |
| "eval_loss": 0.5223040580749512, | |
| "eval_runtime": 1.2795, | |
| "eval_samples_per_second": 78.156, | |
| "eval_steps_per_second": 13.286, | |
| "step": 15100 | |
| }, | |
| { | |
| "epoch": 1.6663183655511866, | |
| "grad_norm": 4.4538798332214355, | |
| "learning_rate": 1.0019808517662595e-05, | |
| "loss": 0.4184587860107422, | |
| "step": 15150 | |
| }, | |
| { | |
| "epoch": 1.6663183655511866, | |
| "eval_loss": 0.534669041633606, | |
| "eval_runtime": 1.2782, | |
| "eval_samples_per_second": 78.233, | |
| "eval_steps_per_second": 13.3, | |
| "step": 15150 | |
| }, | |
| { | |
| "epoch": 1.6718178568482416, | |
| "grad_norm": 3.8044581413269043, | |
| "learning_rate": 9.854737537140972e-06, | |
| "loss": 0.39158470153808594, | |
| "step": 15200 | |
| }, | |
| { | |
| "epoch": 1.6718178568482416, | |
| "eval_loss": 0.5418866872787476, | |
| "eval_runtime": 1.2799, | |
| "eval_samples_per_second": 78.131, | |
| "eval_steps_per_second": 13.282, | |
| "step": 15200 | |
| }, | |
| { | |
| "epoch": 1.6773173481452965, | |
| "grad_norm": 2.9677321910858154, | |
| "learning_rate": 9.689666556619348e-06, | |
| "loss": 0.43468849182128905, | |
| "step": 15250 | |
| }, | |
| { | |
| "epoch": 1.6773173481452965, | |
| "eval_loss": 0.526294469833374, | |
| "eval_runtime": 1.2805, | |
| "eval_samples_per_second": 78.096, | |
| "eval_steps_per_second": 13.276, | |
| "step": 15250 | |
| }, | |
| { | |
| "epoch": 1.6828168394423515, | |
| "grad_norm": 3.6569182872772217, | |
| "learning_rate": 9.52459557609772e-06, | |
| "loss": 0.4084419631958008, | |
| "step": 15300 | |
| }, | |
| { | |
| "epoch": 1.6828168394423515, | |
| "eval_loss": 0.5179707407951355, | |
| "eval_runtime": 1.2802, | |
| "eval_samples_per_second": 78.114, | |
| "eval_steps_per_second": 13.279, | |
| "step": 15300 | |
| }, | |
| { | |
| "epoch": 1.6883163307394065, | |
| "grad_norm": 4.213144302368164, | |
| "learning_rate": 9.359524595576097e-06, | |
| "loss": 0.40570945739746095, | |
| "step": 15350 | |
| }, | |
| { | |
| "epoch": 1.6883163307394065, | |
| "eval_loss": 0.523230791091919, | |
| "eval_runtime": 1.2787, | |
| "eval_samples_per_second": 78.203, | |
| "eval_steps_per_second": 13.294, | |
| "step": 15350 | |
| }, | |
| { | |
| "epoch": 1.6938158220364616, | |
| "grad_norm": 4.362399578094482, | |
| "learning_rate": 9.194453615054473e-06, | |
| "loss": 0.40546306610107424, | |
| "step": 15400 | |
| }, | |
| { | |
| "epoch": 1.6938158220364616, | |
| "eval_loss": 0.5279385447502136, | |
| "eval_runtime": 1.2871, | |
| "eval_samples_per_second": 77.697, | |
| "eval_steps_per_second": 13.208, | |
| "step": 15400 | |
| }, | |
| { | |
| "epoch": 1.6993153133335166, | |
| "grad_norm": 5.424959182739258, | |
| "learning_rate": 9.02938263453285e-06, | |
| "loss": 0.39811588287353517, | |
| "step": 15450 | |
| }, | |
| { | |
| "epoch": 1.6993153133335166, | |
| "eval_loss": 0.538982093334198, | |
| "eval_runtime": 1.3011, | |
| "eval_samples_per_second": 76.856, | |
| "eval_steps_per_second": 13.065, | |
| "step": 15450 | |
| }, | |
| { | |
| "epoch": 1.7048148046305718, | |
| "grad_norm": 3.6755897998809814, | |
| "learning_rate": 8.864311654011224e-06, | |
| "loss": 0.4292662811279297, | |
| "step": 15500 | |
| }, | |
| { | |
| "epoch": 1.7048148046305718, | |
| "eval_loss": 0.5277052521705627, | |
| "eval_runtime": 1.2769, | |
| "eval_samples_per_second": 78.312, | |
| "eval_steps_per_second": 13.313, | |
| "step": 15500 | |
| }, | |
| { | |
| "epoch": 1.7103142959276267, | |
| "grad_norm": 3.7990050315856934, | |
| "learning_rate": 8.6992406734896e-06, | |
| "loss": 0.38744674682617186, | |
| "step": 15550 | |
| }, | |
| { | |
| "epoch": 1.7103142959276267, | |
| "eval_loss": 0.5234823226928711, | |
| "eval_runtime": 1.2814, | |
| "eval_samples_per_second": 78.04, | |
| "eval_steps_per_second": 13.267, | |
| "step": 15550 | |
| }, | |
| { | |
| "epoch": 1.7158137872246817, | |
| "grad_norm": 5.55524206161499, | |
| "learning_rate": 8.534169692967977e-06, | |
| "loss": 0.39183277130126953, | |
| "step": 15600 | |
| }, | |
| { | |
| "epoch": 1.7158137872246817, | |
| "eval_loss": 0.5209484100341797, | |
| "eval_runtime": 1.2795, | |
| "eval_samples_per_second": 78.157, | |
| "eval_steps_per_second": 13.287, | |
| "step": 15600 | |
| }, | |
| { | |
| "epoch": 1.7213132785217367, | |
| "grad_norm": 4.018246173858643, | |
| "learning_rate": 8.369098712446351e-06, | |
| "loss": 0.4041017532348633, | |
| "step": 15650 | |
| }, | |
| { | |
| "epoch": 1.7213132785217367, | |
| "eval_loss": 0.526258111000061, | |
| "eval_runtime": 1.2793, | |
| "eval_samples_per_second": 78.17, | |
| "eval_steps_per_second": 13.289, | |
| "step": 15650 | |
| }, | |
| { | |
| "epoch": 1.7268127698187916, | |
| "grad_norm": 4.710935592651367, | |
| "learning_rate": 8.204027731924728e-06, | |
| "loss": 0.3836952209472656, | |
| "step": 15700 | |
| }, | |
| { | |
| "epoch": 1.7268127698187916, | |
| "eval_loss": 0.5209237933158875, | |
| "eval_runtime": 1.279, | |
| "eval_samples_per_second": 78.187, | |
| "eval_steps_per_second": 13.292, | |
| "step": 15700 | |
| }, | |
| { | |
| "epoch": 1.7323122611158468, | |
| "grad_norm": 3.7639029026031494, | |
| "learning_rate": 8.038956751403104e-06, | |
| "loss": 0.3907876968383789, | |
| "step": 15750 | |
| }, | |
| { | |
| "epoch": 1.7323122611158468, | |
| "eval_loss": 0.5245873928070068, | |
| "eval_runtime": 1.2785, | |
| "eval_samples_per_second": 78.214, | |
| "eval_steps_per_second": 13.296, | |
| "step": 15750 | |
| }, | |
| { | |
| "epoch": 1.7378117524129018, | |
| "grad_norm": 3.944993257522583, | |
| "learning_rate": 7.87388577088148e-06, | |
| "loss": 0.3886819839477539, | |
| "step": 15800 | |
| }, | |
| { | |
| "epoch": 1.7378117524129018, | |
| "eval_loss": 0.5302055478096008, | |
| "eval_runtime": 1.2805, | |
| "eval_samples_per_second": 78.095, | |
| "eval_steps_per_second": 13.276, | |
| "step": 15800 | |
| }, | |
| { | |
| "epoch": 1.743311243709957, | |
| "grad_norm": 3.7543132305145264, | |
| "learning_rate": 7.708814790359855e-06, | |
| "loss": 0.4201182174682617, | |
| "step": 15850 | |
| }, | |
| { | |
| "epoch": 1.743311243709957, | |
| "eval_loss": 0.5063754320144653, | |
| "eval_runtime": 1.2803, | |
| "eval_samples_per_second": 78.105, | |
| "eval_steps_per_second": 13.278, | |
| "step": 15850 | |
| }, | |
| { | |
| "epoch": 1.748810735007012, | |
| "grad_norm": 2.934755325317383, | |
| "learning_rate": 7.543743809838231e-06, | |
| "loss": 0.3904559326171875, | |
| "step": 15900 | |
| }, | |
| { | |
| "epoch": 1.748810735007012, | |
| "eval_loss": 0.5102057456970215, | |
| "eval_runtime": 1.2789, | |
| "eval_samples_per_second": 78.19, | |
| "eval_steps_per_second": 13.292, | |
| "step": 15900 | |
| }, | |
| { | |
| "epoch": 1.7543102263040669, | |
| "grad_norm": 4.1210246086120605, | |
| "learning_rate": 7.378672829316606e-06, | |
| "loss": 0.3794166946411133, | |
| "step": 15950 | |
| }, | |
| { | |
| "epoch": 1.7543102263040669, | |
| "eval_loss": 0.5126526355743408, | |
| "eval_runtime": 1.2826, | |
| "eval_samples_per_second": 77.967, | |
| "eval_steps_per_second": 13.254, | |
| "step": 15950 | |
| }, | |
| { | |
| "epoch": 1.7598097176011218, | |
| "grad_norm": 3.7067854404449463, | |
| "learning_rate": 7.213601848794982e-06, | |
| "loss": 0.3692531967163086, | |
| "step": 16000 | |
| }, | |
| { | |
| "epoch": 1.7598097176011218, | |
| "eval_loss": 0.5274832248687744, | |
| "eval_runtime": 1.2797, | |
| "eval_samples_per_second": 78.143, | |
| "eval_steps_per_second": 13.284, | |
| "step": 16000 | |
| }, | |
| { | |
| "epoch": 1.7653092088981768, | |
| "grad_norm": 3.6420602798461914, | |
| "learning_rate": 7.048530868273357e-06, | |
| "loss": 0.3824466705322266, | |
| "step": 16050 | |
| }, | |
| { | |
| "epoch": 1.7653092088981768, | |
| "eval_loss": 0.5196187496185303, | |
| "eval_runtime": 1.2795, | |
| "eval_samples_per_second": 78.158, | |
| "eval_steps_per_second": 13.287, | |
| "step": 16050 | |
| }, | |
| { | |
| "epoch": 1.770808700195232, | |
| "grad_norm": 4.638594150543213, | |
| "learning_rate": 6.883459887751733e-06, | |
| "loss": 0.4514438629150391, | |
| "step": 16100 | |
| }, | |
| { | |
| "epoch": 1.770808700195232, | |
| "eval_loss": 0.5215907096862793, | |
| "eval_runtime": 1.2805, | |
| "eval_samples_per_second": 78.097, | |
| "eval_steps_per_second": 13.277, | |
| "step": 16100 | |
| }, | |
| { | |
| "epoch": 1.776308191492287, | |
| "grad_norm": 3.9953904151916504, | |
| "learning_rate": 6.718388907230109e-06, | |
| "loss": 0.387623176574707, | |
| "step": 16150 | |
| }, | |
| { | |
| "epoch": 1.776308191492287, | |
| "eval_loss": 0.5224502682685852, | |
| "eval_runtime": 1.2817, | |
| "eval_samples_per_second": 78.022, | |
| "eval_steps_per_second": 13.264, | |
| "step": 16150 | |
| }, | |
| { | |
| "epoch": 1.781807682789342, | |
| "grad_norm": 4.487403869628906, | |
| "learning_rate": 6.553317926708485e-06, | |
| "loss": 0.4063478088378906, | |
| "step": 16200 | |
| }, | |
| { | |
| "epoch": 1.781807682789342, | |
| "eval_loss": 0.5166334509849548, | |
| "eval_runtime": 1.277, | |
| "eval_samples_per_second": 78.307, | |
| "eval_steps_per_second": 13.312, | |
| "step": 16200 | |
| }, | |
| { | |
| "epoch": 1.787307174086397, | |
| "grad_norm": 3.7964556217193604, | |
| "learning_rate": 6.3882469461868605e-06, | |
| "loss": 0.3855398559570313, | |
| "step": 16250 | |
| }, | |
| { | |
| "epoch": 1.787307174086397, | |
| "eval_loss": 0.5154201984405518, | |
| "eval_runtime": 1.2833, | |
| "eval_samples_per_second": 77.926, | |
| "eval_steps_per_second": 13.247, | |
| "step": 16250 | |
| }, | |
| { | |
| "epoch": 1.792806665383452, | |
| "grad_norm": 4.513696193695068, | |
| "learning_rate": 6.223175965665237e-06, | |
| "loss": 0.3669796371459961, | |
| "step": 16300 | |
| }, | |
| { | |
| "epoch": 1.792806665383452, | |
| "eval_loss": 0.5084086656570435, | |
| "eval_runtime": 1.28, | |
| "eval_samples_per_second": 78.125, | |
| "eval_steps_per_second": 13.281, | |
| "step": 16300 | |
| }, | |
| { | |
| "epoch": 1.798306156680507, | |
| "grad_norm": 3.982877254486084, | |
| "learning_rate": 6.058104985143612e-06, | |
| "loss": 0.38849113464355467, | |
| "step": 16350 | |
| }, | |
| { | |
| "epoch": 1.798306156680507, | |
| "eval_loss": 0.5200368762016296, | |
| "eval_runtime": 1.2802, | |
| "eval_samples_per_second": 78.112, | |
| "eval_steps_per_second": 13.279, | |
| "step": 16350 | |
| }, | |
| { | |
| "epoch": 1.803805647977562, | |
| "grad_norm": 3.997793436050415, | |
| "learning_rate": 5.8930340046219876e-06, | |
| "loss": 0.39702865600585935, | |
| "step": 16400 | |
| }, | |
| { | |
| "epoch": 1.803805647977562, | |
| "eval_loss": 0.5119373798370361, | |
| "eval_runtime": 1.283, | |
| "eval_samples_per_second": 77.941, | |
| "eval_steps_per_second": 13.25, | |
| "step": 16400 | |
| }, | |
| { | |
| "epoch": 1.8093051392746171, | |
| "grad_norm": 3.6325302124023438, | |
| "learning_rate": 5.727963024100363e-06, | |
| "loss": 0.37990386962890627, | |
| "step": 16450 | |
| }, | |
| { | |
| "epoch": 1.8093051392746171, | |
| "eval_loss": 0.5215651988983154, | |
| "eval_runtime": 1.2798, | |
| "eval_samples_per_second": 78.139, | |
| "eval_steps_per_second": 13.284, | |
| "step": 16450 | |
| }, | |
| { | |
| "epoch": 1.814804630571672, | |
| "grad_norm": 4.198485374450684, | |
| "learning_rate": 5.562892043578738e-06, | |
| "loss": 0.412078857421875, | |
| "step": 16500 | |
| }, | |
| { | |
| "epoch": 1.814804630571672, | |
| "eval_loss": 0.5170506238937378, | |
| "eval_runtime": 1.2894, | |
| "eval_samples_per_second": 77.558, | |
| "eval_steps_per_second": 13.185, | |
| "step": 16500 | |
| }, | |
| { | |
| "epoch": 1.8203041218687273, | |
| "grad_norm": 4.591159820556641, | |
| "learning_rate": 5.397821063057115e-06, | |
| "loss": 0.37816055297851564, | |
| "step": 16550 | |
| }, | |
| { | |
| "epoch": 1.8203041218687273, | |
| "eval_loss": 0.5147603750228882, | |
| "eval_runtime": 1.2799, | |
| "eval_samples_per_second": 78.134, | |
| "eval_steps_per_second": 13.283, | |
| "step": 16550 | |
| }, | |
| { | |
| "epoch": 1.8258036131657822, | |
| "grad_norm": 4.216943264007568, | |
| "learning_rate": 5.23275008253549e-06, | |
| "loss": 0.39028087615966794, | |
| "step": 16600 | |
| }, | |
| { | |
| "epoch": 1.8258036131657822, | |
| "eval_loss": 0.5204047560691833, | |
| "eval_runtime": 1.2795, | |
| "eval_samples_per_second": 78.156, | |
| "eval_steps_per_second": 13.286, | |
| "step": 16600 | |
| }, | |
| { | |
| "epoch": 1.8313031044628372, | |
| "grad_norm": 4.006322383880615, | |
| "learning_rate": 5.067679102013866e-06, | |
| "loss": 0.38647769927978515, | |
| "step": 16650 | |
| }, | |
| { | |
| "epoch": 1.8313031044628372, | |
| "eval_loss": 0.5153352618217468, | |
| "eval_runtime": 1.279, | |
| "eval_samples_per_second": 78.184, | |
| "eval_steps_per_second": 13.291, | |
| "step": 16650 | |
| }, | |
| { | |
| "epoch": 1.8368025957598921, | |
| "grad_norm": 4.710324287414551, | |
| "learning_rate": 4.902608121492242e-06, | |
| "loss": 0.356781005859375, | |
| "step": 16700 | |
| }, | |
| { | |
| "epoch": 1.8368025957598921, | |
| "eval_loss": 0.5207862257957458, | |
| "eval_runtime": 1.2799, | |
| "eval_samples_per_second": 78.134, | |
| "eval_steps_per_second": 13.283, | |
| "step": 16700 | |
| }, | |
| { | |
| "epoch": 1.842302087056947, | |
| "grad_norm": 4.920437812805176, | |
| "learning_rate": 4.737537140970618e-06, | |
| "loss": 0.37074081420898436, | |
| "step": 16750 | |
| }, | |
| { | |
| "epoch": 1.842302087056947, | |
| "eval_loss": 0.5112919807434082, | |
| "eval_runtime": 1.2801, | |
| "eval_samples_per_second": 78.118, | |
| "eval_steps_per_second": 13.28, | |
| "step": 16750 | |
| }, | |
| { | |
| "epoch": 1.8478015783540023, | |
| "grad_norm": 4.515045166015625, | |
| "learning_rate": 4.5724661604489934e-06, | |
| "loss": 0.4274590301513672, | |
| "step": 16800 | |
| }, | |
| { | |
| "epoch": 1.8478015783540023, | |
| "eval_loss": 0.5242478847503662, | |
| "eval_runtime": 1.279, | |
| "eval_samples_per_second": 78.188, | |
| "eval_steps_per_second": 13.292, | |
| "step": 16800 | |
| }, | |
| { | |
| "epoch": 1.8533010696510572, | |
| "grad_norm": 3.6244614124298096, | |
| "learning_rate": 4.40739517992737e-06, | |
| "loss": 0.3897795867919922, | |
| "step": 16850 | |
| }, | |
| { | |
| "epoch": 1.8533010696510572, | |
| "eval_loss": 0.5210970044136047, | |
| "eval_runtime": 1.2792, | |
| "eval_samples_per_second": 78.176, | |
| "eval_steps_per_second": 13.29, | |
| "step": 16850 | |
| }, | |
| { | |
| "epoch": 1.8588005609481124, | |
| "grad_norm": 4.448500633239746, | |
| "learning_rate": 4.242324199405744e-06, | |
| "loss": 0.43310935974121095, | |
| "step": 16900 | |
| }, | |
| { | |
| "epoch": 1.8588005609481124, | |
| "eval_loss": 0.5130022764205933, | |
| "eval_runtime": 1.2867, | |
| "eval_samples_per_second": 77.716, | |
| "eval_steps_per_second": 13.212, | |
| "step": 16900 | |
| }, | |
| { | |
| "epoch": 1.8643000522451674, | |
| "grad_norm": 5.259810924530029, | |
| "learning_rate": 4.07725321888412e-06, | |
| "loss": 0.4260225677490234, | |
| "step": 16950 | |
| }, | |
| { | |
| "epoch": 1.8643000522451674, | |
| "eval_loss": 0.5134211778640747, | |
| "eval_runtime": 1.2967, | |
| "eval_samples_per_second": 77.117, | |
| "eval_steps_per_second": 13.11, | |
| "step": 16950 | |
| }, | |
| { | |
| "epoch": 1.8697995435422223, | |
| "grad_norm": 4.863224983215332, | |
| "learning_rate": 3.912182238362496e-06, | |
| "loss": 0.3758648681640625, | |
| "step": 17000 | |
| }, | |
| { | |
| "epoch": 1.8697995435422223, | |
| "eval_loss": 0.5177444219589233, | |
| "eval_runtime": 1.28, | |
| "eval_samples_per_second": 78.125, | |
| "eval_steps_per_second": 13.281, | |
| "step": 17000 | |
| }, | |
| { | |
| "epoch": 1.8752990348392773, | |
| "grad_norm": 4.33119535446167, | |
| "learning_rate": 3.747111257840872e-06, | |
| "loss": 0.3959685516357422, | |
| "step": 17050 | |
| }, | |
| { | |
| "epoch": 1.8752990348392773, | |
| "eval_loss": 0.5147886872291565, | |
| "eval_runtime": 1.2779, | |
| "eval_samples_per_second": 78.252, | |
| "eval_steps_per_second": 13.303, | |
| "step": 17050 | |
| }, | |
| { | |
| "epoch": 1.8807985261363322, | |
| "grad_norm": 4.343754768371582, | |
| "learning_rate": 3.582040277319247e-06, | |
| "loss": 0.3876182556152344, | |
| "step": 17100 | |
| }, | |
| { | |
| "epoch": 1.8807985261363322, | |
| "eval_loss": 0.5101519227027893, | |
| "eval_runtime": 1.2814, | |
| "eval_samples_per_second": 78.041, | |
| "eval_steps_per_second": 13.267, | |
| "step": 17100 | |
| }, | |
| { | |
| "epoch": 1.8862980174333874, | |
| "grad_norm": 4.579135894775391, | |
| "learning_rate": 3.416969296797623e-06, | |
| "loss": 0.3915593338012695, | |
| "step": 17150 | |
| }, | |
| { | |
| "epoch": 1.8862980174333874, | |
| "eval_loss": 0.5131881833076477, | |
| "eval_runtime": 1.3052, | |
| "eval_samples_per_second": 76.615, | |
| "eval_steps_per_second": 13.025, | |
| "step": 17150 | |
| }, | |
| { | |
| "epoch": 1.8917975087304424, | |
| "grad_norm": 4.940543174743652, | |
| "learning_rate": 3.251898316275999e-06, | |
| "loss": 0.38781646728515623, | |
| "step": 17200 | |
| }, | |
| { | |
| "epoch": 1.8917975087304424, | |
| "eval_loss": 0.514817476272583, | |
| "eval_runtime": 1.2836, | |
| "eval_samples_per_second": 77.907, | |
| "eval_steps_per_second": 13.244, | |
| "step": 17200 | |
| }, | |
| { | |
| "epoch": 1.8972970000274976, | |
| "grad_norm": 5.684414386749268, | |
| "learning_rate": 3.0868273357543743e-06, | |
| "loss": 0.40284725189208986, | |
| "step": 17250 | |
| }, | |
| { | |
| "epoch": 1.8972970000274976, | |
| "eval_loss": 0.5099514126777649, | |
| "eval_runtime": 1.3521, | |
| "eval_samples_per_second": 73.959, | |
| "eval_steps_per_second": 12.573, | |
| "step": 17250 | |
| }, | |
| { | |
| "epoch": 1.9027964913245525, | |
| "grad_norm": 4.87332820892334, | |
| "learning_rate": 2.92175635523275e-06, | |
| "loss": 0.40561714172363283, | |
| "step": 17300 | |
| }, | |
| { | |
| "epoch": 1.9027964913245525, | |
| "eval_loss": 0.5140570402145386, | |
| "eval_runtime": 1.2856, | |
| "eval_samples_per_second": 77.787, | |
| "eval_steps_per_second": 13.224, | |
| "step": 17300 | |
| }, | |
| { | |
| "epoch": 1.9082959826216075, | |
| "grad_norm": 4.406585216522217, | |
| "learning_rate": 2.756685374711126e-06, | |
| "loss": 0.4014255523681641, | |
| "step": 17350 | |
| }, | |
| { | |
| "epoch": 1.9082959826216075, | |
| "eval_loss": 0.5200029611587524, | |
| "eval_runtime": 1.2949, | |
| "eval_samples_per_second": 77.224, | |
| "eval_steps_per_second": 13.128, | |
| "step": 17350 | |
| }, | |
| { | |
| "epoch": 1.9137954739186624, | |
| "grad_norm": 3.8450374603271484, | |
| "learning_rate": 2.591614394189502e-06, | |
| "loss": 0.3946284103393555, | |
| "step": 17400 | |
| }, | |
| { | |
| "epoch": 1.9137954739186624, | |
| "eval_loss": 0.5157837867736816, | |
| "eval_runtime": 1.2818, | |
| "eval_samples_per_second": 78.013, | |
| "eval_steps_per_second": 13.262, | |
| "step": 17400 | |
| }, | |
| { | |
| "epoch": 1.9192949652157174, | |
| "grad_norm": 2.9785866737365723, | |
| "learning_rate": 2.4265434136678772e-06, | |
| "loss": 0.38735130310058596, | |
| "step": 17450 | |
| }, | |
| { | |
| "epoch": 1.9192949652157174, | |
| "eval_loss": 0.5129509568214417, | |
| "eval_runtime": 1.2915, | |
| "eval_samples_per_second": 77.427, | |
| "eval_steps_per_second": 13.163, | |
| "step": 17450 | |
| }, | |
| { | |
| "epoch": 1.9247944565127726, | |
| "grad_norm": 4.774247646331787, | |
| "learning_rate": 2.2614724331462527e-06, | |
| "loss": 0.3915607452392578, | |
| "step": 17500 | |
| }, | |
| { | |
| "epoch": 1.9247944565127726, | |
| "eval_loss": 0.512159526348114, | |
| "eval_runtime": 1.3529, | |
| "eval_samples_per_second": 73.915, | |
| "eval_steps_per_second": 12.566, | |
| "step": 17500 | |
| }, | |
| { | |
| "epoch": 1.9302939478098275, | |
| "grad_norm": 3.1161727905273438, | |
| "learning_rate": 2.0964014526246285e-06, | |
| "loss": 0.3839557647705078, | |
| "step": 17550 | |
| }, | |
| { | |
| "epoch": 1.9302939478098275, | |
| "eval_loss": 0.5124543905258179, | |
| "eval_runtime": 1.3002, | |
| "eval_samples_per_second": 76.909, | |
| "eval_steps_per_second": 13.075, | |
| "step": 17550 | |
| }, | |
| { | |
| "epoch": 1.9357934391068827, | |
| "grad_norm": 4.420716762542725, | |
| "learning_rate": 1.9313304721030043e-06, | |
| "loss": 0.4010445022583008, | |
| "step": 17600 | |
| }, | |
| { | |
| "epoch": 1.9357934391068827, | |
| "eval_loss": 0.5172660946846008, | |
| "eval_runtime": 1.2925, | |
| "eval_samples_per_second": 77.37, | |
| "eval_steps_per_second": 13.153, | |
| "step": 17600 | |
| }, | |
| { | |
| "epoch": 1.9412929304039377, | |
| "grad_norm": 4.979782581329346, | |
| "learning_rate": 1.76625949158138e-06, | |
| "loss": 0.3870741653442383, | |
| "step": 17650 | |
| }, | |
| { | |
| "epoch": 1.9412929304039377, | |
| "eval_loss": 0.5163105130195618, | |
| "eval_runtime": 1.2824, | |
| "eval_samples_per_second": 77.978, | |
| "eval_steps_per_second": 13.256, | |
| "step": 17650 | |
| }, | |
| { | |
| "epoch": 1.9467924217009926, | |
| "grad_norm": 5.315701484680176, | |
| "learning_rate": 1.6011885110597558e-06, | |
| "loss": 0.3857357406616211, | |
| "step": 17700 | |
| }, | |
| { | |
| "epoch": 1.9467924217009926, | |
| "eval_loss": 0.5164580345153809, | |
| "eval_runtime": 1.2821, | |
| "eval_samples_per_second": 77.995, | |
| "eval_steps_per_second": 13.259, | |
| "step": 17700 | |
| }, | |
| { | |
| "epoch": 1.9522919129980476, | |
| "grad_norm": 3.6524667739868164, | |
| "learning_rate": 1.4361175305381314e-06, | |
| "loss": 0.42781547546386717, | |
| "step": 17750 | |
| }, | |
| { | |
| "epoch": 1.9522919129980476, | |
| "eval_loss": 0.5149794816970825, | |
| "eval_runtime": 1.3408, | |
| "eval_samples_per_second": 74.583, | |
| "eval_steps_per_second": 12.679, | |
| "step": 17750 | |
| }, | |
| { | |
| "epoch": 1.9577914042951026, | |
| "grad_norm": 4.06256103515625, | |
| "learning_rate": 1.2710465500165073e-06, | |
| "loss": 0.380059700012207, | |
| "step": 17800 | |
| }, | |
| { | |
| "epoch": 1.9577914042951026, | |
| "eval_loss": 0.5115500688552856, | |
| "eval_runtime": 1.3186, | |
| "eval_samples_per_second": 75.841, | |
| "eval_steps_per_second": 12.893, | |
| "step": 17800 | |
| }, | |
| { | |
| "epoch": 1.9632908955921577, | |
| "grad_norm": 3.9045357704162598, | |
| "learning_rate": 1.1059755694948827e-06, | |
| "loss": 0.38892536163330077, | |
| "step": 17850 | |
| }, | |
| { | |
| "epoch": 1.9632908955921577, | |
| "eval_loss": 0.5084894895553589, | |
| "eval_runtime": 1.2809, | |
| "eval_samples_per_second": 78.07, | |
| "eval_steps_per_second": 13.272, | |
| "step": 17850 | |
| }, | |
| { | |
| "epoch": 1.9687903868892127, | |
| "grad_norm": 4.216691970825195, | |
| "learning_rate": 9.409045889732585e-07, | |
| "loss": 0.40333850860595705, | |
| "step": 17900 | |
| }, | |
| { | |
| "epoch": 1.9687903868892127, | |
| "eval_loss": 0.5091243982315063, | |
| "eval_runtime": 1.3023, | |
| "eval_samples_per_second": 76.788, | |
| "eval_steps_per_second": 13.054, | |
| "step": 17900 | |
| }, | |
| { | |
| "epoch": 1.9742898781862679, | |
| "grad_norm": 4.339031219482422, | |
| "learning_rate": 7.758336084516343e-07, | |
| "loss": 0.41892166137695314, | |
| "step": 17950 | |
| }, | |
| { | |
| "epoch": 1.9742898781862679, | |
| "eval_loss": 0.5089672207832336, | |
| "eval_runtime": 1.3698, | |
| "eval_samples_per_second": 73.001, | |
| "eval_steps_per_second": 12.41, | |
| "step": 17950 | |
| }, | |
| { | |
| "epoch": 1.9797893694833228, | |
| "grad_norm": 5.501232147216797, | |
| "learning_rate": 6.107626279300099e-07, | |
| "loss": 0.38524158477783205, | |
| "step": 18000 | |
| }, | |
| { | |
| "epoch": 1.9797893694833228, | |
| "eval_loss": 0.5088917016983032, | |
| "eval_runtime": 1.3056, | |
| "eval_samples_per_second": 76.593, | |
| "eval_steps_per_second": 13.021, | |
| "step": 18000 | |
| }, | |
| { | |
| "epoch": 1.9852888607803778, | |
| "grad_norm": 4.044425010681152, | |
| "learning_rate": 4.456916474083856e-07, | |
| "loss": 0.36035297393798826, | |
| "step": 18050 | |
| }, | |
| { | |
| "epoch": 1.9852888607803778, | |
| "eval_loss": 0.50870680809021, | |
| "eval_runtime": 1.2937, | |
| "eval_samples_per_second": 77.298, | |
| "eval_steps_per_second": 13.141, | |
| "step": 18050 | |
| }, | |
| { | |
| "epoch": 1.9907883520774328, | |
| "grad_norm": 3.8273727893829346, | |
| "learning_rate": 2.8062066688676135e-07, | |
| "loss": 0.3866265869140625, | |
| "step": 18100 | |
| }, | |
| { | |
| "epoch": 1.9907883520774328, | |
| "eval_loss": 0.5090622901916504, | |
| "eval_runtime": 1.2874, | |
| "eval_samples_per_second": 77.679, | |
| "eval_steps_per_second": 13.205, | |
| "step": 18100 | |
| }, | |
| { | |
| "epoch": 1.9962878433744877, | |
| "grad_norm": 5.9300537109375, | |
| "learning_rate": 1.15549686365137e-07, | |
| "loss": 0.3838529586791992, | |
| "step": 18150 | |
| }, | |
| { | |
| "epoch": 1.9962878433744877, | |
| "eval_loss": 0.5087066292762756, | |
| "eval_runtime": 1.2885, | |
| "eval_samples_per_second": 77.61, | |
| "eval_steps_per_second": 13.194, | |
| "step": 18150 | |
| } | |
| ], | |
| "logging_steps": 50, | |
| "max_steps": 18184, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 2, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.6375279506569626e+17, | |
| "train_batch_size": 4, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |