Training in progress, step 1400, checkpoint

Files changed (9) hide show

last-checkpoint/README.md CHANGED Viewed

@@ -201,18 +201,6 @@ Carbon emissions can be estimated using the [Machine Learning Impact calculator]
 ## Training procedure
-The following `bitsandbytes` quantization config was used during training:
-- quant_method: bitsandbytes
-- load_in_8bit: False
-- load_in_4bit: True
-- llm_int8_threshold: 6.0
-- llm_int8_skip_modules: None
-- llm_int8_enable_fp32_cpu_offload: False
-- llm_int8_has_fp16_weight: False
-- bnb_4bit_quant_type: nf4
-- bnb_4bit_use_double_quant: True
-- bnb_4bit_compute_dtype: float16
 ### Framework versions

last-checkpoint/adapter_model.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:cfe68bb85d3b885ea16a3a4edf42e142af71a569576fc8d42fbea5987dfac9e2
 size 50338848

 version https://git-lfs.github.com/spec/v1
+oid sha256:99c21249785ef7e6e4552a0ae643a39e07fce9a53609d606c103117185976fb8
 size 50338848

last-checkpoint/optimizer.pt CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:28f8585dc54188d220a469a599d21bb72b0b894236d57f1b8ced70c49177a369
-size 100693001

 version https://git-lfs.github.com/spec/v1
+oid sha256:c9024574af3c880d2f51faa02b5f241c69b38141a1bc48a7567edf95ef9ab608
+size 100691721

last-checkpoint/rng_state.pth CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:2bce8ad87f00a02b0d2a3d827e73ac036f343d9552caa13a5ae85d423ed6d4b0
 size 14575

 version https://git-lfs.github.com/spec/v1
+oid sha256:6d9abb419b80aead609e3d25aa188a530b509237800785868036d93ad22750d1
 size 14575

last-checkpoint/scheduler.pt CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:60fe2b14e82d752da652953a5bae182d24c7ff34775d2753b9c2e6fa092203d0
 size 627

 version https://git-lfs.github.com/spec/v1
+oid sha256:7e41ec466e37d3e777474b32690d472b15b70497f93b8ea178e488be3afc4f79
 size 627

last-checkpoint/special_tokens_map.json CHANGED Viewed

@@ -1,6 +1,24 @@
 {
-  "bos_token": "<|endoftext|>",
-  "eos_token": "<|endoftext|>",
   "pad_token": "<|endoftext|>",
-  "unk_token": "<|endoftext|>"
 }

 {
+  "bos_token": {
+    "content": "<|endoftext|>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "eos_token": {
+    "content": "<|endoftext|>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
   "pad_token": "<|endoftext|>",
+  "unk_token": {
+    "content": "<|endoftext|>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  }
 }

last-checkpoint/tokenizer_config.json CHANGED Viewed

@@ -13,8 +13,12 @@
   "bos_token": "<|endoftext|>",
   "clean_up_tokenization_spaces": true,
   "eos_token": "<|endoftext|>",
   "model_max_length": 1024,
   "pad_token": "<|endoftext|>",
   "tokenizer_class": "GPT2Tokenizer",
   "unk_token": "<|endoftext|>"
 }

   "bos_token": "<|endoftext|>",
   "clean_up_tokenization_spaces": true,
   "eos_token": "<|endoftext|>",
+  "max_length": 512,
   "model_max_length": 1024,
   "pad_token": "<|endoftext|>",
+  "stride": 0,
   "tokenizer_class": "GPT2Tokenizer",
+  "truncation_side": "right",
+  "truncation_strategy": "longest_first",
   "unk_token": "<|endoftext|>"
 }

last-checkpoint/trainer_state.json CHANGED Viewed

@@ -1,9 +1,9 @@
 {
-  "best_metric": 1.72101891040802,
-  "best_model_checkpoint": "./outputs/checkpoint-1200",
-  "epoch": 0.8743169398907104,
   "eval_steps": 100,
-  "global_step": 1200,
   "is_hyper_param_search": false,
   "is_local_process_zero": true,
   "is_world_process_zero": true,
@@ -175,13 +175,41 @@
       "eval_samples_per_second": 43.611,
       "eval_steps_per_second": 5.457,
       "step": 1200
     }
   ],
   "logging_steps": 100,
   "max_steps": 4116,
   "num_train_epochs": 3,
   "save_steps": 100,
-  "total_flos": 7.145822849964442e+16,
   "trial_name": null,
   "trial_params": null
 }

 {
+  "best_metric": 1.6939107179641724,
+  "best_model_checkpoint": "./outputs/checkpoint-1400",
+  "epoch": 1.0200364298724955,
   "eval_steps": 100,
+  "global_step": 1400,
   "is_hyper_param_search": false,
   "is_local_process_zero": true,
   "is_world_process_zero": true,
       "eval_samples_per_second": 43.611,
       "eval_steps_per_second": 5.457,
       "step": 1200
+    },
+    {
+      "epoch": 0.95,
+      "learning_rate": 0.0002,
+      "loss": 1.7282,
+      "step": 1300
+    },
+    {
+      "epoch": 0.95,
+      "eval_loss": 1.6993989944458008,
+      "eval_runtime": 143.9159,
+      "eval_samples_per_second": 43.595,
+      "eval_steps_per_second": 5.455,
+      "step": 1300
+    },
+    {
+      "epoch": 1.02,
+      "learning_rate": 0.0002,
+      "loss": 1.7077,
+      "step": 1400
+    },
+    {
+      "epoch": 1.02,
+      "eval_loss": 1.6939107179641724,
+      "eval_runtime": 132.967,
+      "eval_samples_per_second": 47.185,
+      "eval_steps_per_second": 5.904,
+      "step": 1400
     }
   ],
   "logging_steps": 100,
   "max_steps": 4116,
   "num_train_epochs": 3,
   "save_steps": 100,
+  "total_flos": 8.337729485790413e+16,
   "trial_name": null,
   "trial_params": null
 }

last-checkpoint/training_args.bin CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:155afbfe76aee38b40cefbe9ac141cafa2613d5a2d500e346b58fc281400fbd7
 size 4219

 version https://git-lfs.github.com/spec/v1
+oid sha256:33604dab3077b6665a2e7200deca0f62ee7786dcab0d4b4b7e8aa9f973422a89
 size 4219