Upload folder using huggingface_hub

Browse files

Files changed (12) hide show

training_checkpoints/checkpoint-6720/added_tokens.json +3 -0
training_checkpoints/checkpoint-6720/config.json +38 -0
training_checkpoints/checkpoint-6720/model.safetensors +3 -0
training_checkpoints/checkpoint-6720/optimizer.pt +3 -0
training_checkpoints/checkpoint-6720/rng_state.pth +3 -0
training_checkpoints/checkpoint-6720/scheduler.pt +3 -0
training_checkpoints/checkpoint-6720/special_tokens_map.json +13 -0
training_checkpoints/checkpoint-6720/tokenizer.json +0 -0
training_checkpoints/checkpoint-6720/tokenizer_config.json +63 -0
training_checkpoints/checkpoint-6720/trainer_state.json +772 -0
training_checkpoints/checkpoint-6720/training_args.bin +3 -0
training_checkpoints/checkpoint-6720/vocab.txt +0 -0

training_checkpoints/checkpoint-6720/added_tokens.json ADDED Viewed

	@@ -0,0 +1,3 @@

+{
+  "<pad>": 28996
+}

training_checkpoints/checkpoint-6720/config.json ADDED Viewed

	@@ -0,0 +1,38 @@

+{
+  "_name_or_path": "distilbert/distilbert-base-cased",
+  "activation": "gelu",
+  "architectures": [
+    "DistilBertForSequenceClassification"
+  ],
+  "attention_dropout": 0.1,
+  "dim": 768,
+  "dropout": 0.1,
+  "hidden_dim": 3072,
+  "id2label": {
+    "0": "positive",
+    "1": "negative",
+    "2": "neutral",
+    "3": "rel_by_party"
+  },
+  "initializer_range": 0.02,
+  "label2id": {
+    "negative": 1,
+    "neutral": 2,
+    "positive": 0,
+    "rel_by_party": 3
+  },
+  "max_position_embeddings": 512,
+  "model_type": "distilbert",
+  "n_heads": 12,
+  "n_layers": 6,
+  "output_past": true,
+  "pad_token_id": 28996,
+  "problem_type": "single_label_classification",
+  "qa_dropout": 0.1,
+  "seq_classif_dropout": 0.2,
+  "sinusoidal_pos_embds": false,
+  "tie_weights_": true,
+  "torch_dtype": "float32",
+  "transformers_version": "4.40.2",
+  "vocab_size": 28997
+}

training_checkpoints/checkpoint-6720/model.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:68271a1ef827109598a8cb79efd8402f7f1d5698f6ed37c2e4090afe7a983fca
+size 263153912

training_checkpoints/checkpoint-6720/optimizer.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:f84355e8f35dcc029aefa1cbd13c8ecbd4b1dadfdb2958e66e4b7a55fe8bea69
+size 526369978

training_checkpoints/checkpoint-6720/rng_state.pth ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:d23c69272f07789ac9c35351f04b8cc9a74ee6f210b27375437077d43ce4b926
+size 14244

training_checkpoints/checkpoint-6720/scheduler.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:fea6b06751fd544073018c634bf5756f794d308adb01dc2a1f8783d100304f96
+size 1064

training_checkpoints/checkpoint-6720/special_tokens_map.json ADDED Viewed

	@@ -0,0 +1,13 @@

+{
+  "cls_token": "[CLS]",
+  "mask_token": "[MASK]",
+  "pad_token": {
+    "content": "<pad>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "sep_token": "[SEP]",
+  "unk_token": "[UNK]"
+}

training_checkpoints/checkpoint-6720/tokenizer.json ADDED Viewed

The diff for this file is too large to render. See raw diff

training_checkpoints/checkpoint-6720/tokenizer_config.json ADDED Viewed

	@@ -0,0 +1,63 @@

+{
+  "added_tokens_decoder": {
+    "0": {
+      "content": "[PAD]",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "100": {
+      "content": "[UNK]",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "101": {
+      "content": "[CLS]",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "102": {
+      "content": "[SEP]",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "103": {
+      "content": "[MASK]",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "28996": {
+      "content": "<pad>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    }
+  },
+  "clean_up_tokenization_spaces": true,
+  "cls_token": "[CLS]",
+  "do_lower_case": false,
+  "mask_token": "[MASK]",
+  "model_max_length": 512,
+  "pad_token": "<pad>",
+  "sep_token": "[SEP]",
+  "strip_accents": null,
+  "tokenize_chinese_chars": true,
+  "tokenizer_class": "DistilBertTokenizer",
+  "unk_token": "[UNK]"
+}

training_checkpoints/checkpoint-6720/trainer_state.json ADDED Viewed

	@@ -0,0 +1,772 @@

+{
+  "best_metric": 0.6478205036835734,
+  "best_model_checkpoint": "case-analysis-distilbert-base-cased/checkpoint-3584",
+  "epoch": 30.0,
+  "eval_steps": 500,
+  "global_step": 6720,
+  "is_hyper_param_search": false,
+  "is_local_process_zero": true,
+  "is_world_process_zero": true,
+  "log_history": [
+    {
+      "epoch": 1.0,
+      "eval_accuracy": 0.7661469933184856,
+      "eval_f1_macro": 0.5270352134866867,
+      "eval_f1_micro": 0.7661469933184856,
+      "eval_f1_weighted": 0.7333313004442764,
+      "eval_loss": 0.7000867128372192,
+      "eval_macro_fpr": 0.1330263157894737,
+      "eval_macro_sensitivity": 0.5137440725676019,
+      "eval_macro_specificity": 0.8818942592408516,
+      "eval_precision": 0.7310834070149471,
+      "eval_precision_macro": 0.5790641299401408,
+      "eval_recall": 0.7661469933184856,
+      "eval_recall_macro": 0.5137440725676019,
+      "eval_runtime": 5.4998,
+      "eval_samples_per_second": 81.639,
+      "eval_steps_per_second": 10.364,
+      "eval_weighted_fpr": 0.09234828496042216,
+      "eval_weighted_sensitivity": 0.7661469933184856,
+      "eval_weighted_specificity": 0.761430043644921,
+      "step": 224
+    },
+    {
+      "epoch": 2.0,
+      "eval_accuracy": 0.7750556792873051,
+      "eval_f1_macro": 0.5486718521990608,
+      "eval_f1_micro": 0.775055679287305,
+      "eval_f1_weighted": 0.7492575717498114,
+      "eval_loss": 0.7387592792510986,
+      "eval_macro_fpr": 0.12078200823200373,
+      "eval_macro_sensitivity": 0.5464266787796199,
+      "eval_macro_specificity": 0.8914743027952345,
+      "eval_precision": 0.7315284458297402,
+      "eval_precision_macro": 0.5585311316366537,
+      "eval_recall": 0.7750556792873051,
+      "eval_recall_macro": 0.5464266787796199,
+      "eval_runtime": 23.5227,
+      "eval_samples_per_second": 19.088,
+      "eval_steps_per_second": 2.423,
+      "eval_weighted_fpr": 0.08820960698689956,
+      "eval_weighted_sensitivity": 0.7750556792873051,
+      "eval_weighted_specificity": 0.7908415318936333,
+      "step": 448
+    },
+    {
+      "epoch": 2.232142857142857,
+      "grad_norm": 22.91168785095215,
+      "learning_rate": 4.629464285714286e-05,
+      "loss": 0.7066,
+      "step": 500
+    },
+    {
+      "epoch": 3.0,
+      "eval_accuracy": 0.8017817371937639,
+      "eval_f1_macro": 0.576677451756589,
+      "eval_f1_micro": 0.8017817371937639,
+      "eval_f1_weighted": 0.7759761601356532,
+      "eval_loss": 0.7228724956512451,
+      "eval_macro_fpr": 0.10757194512338594,
+      "eval_macro_sensitivity": 0.5707859310800487,
+      "eval_macro_specificity": 0.9026901603449184,
+      "eval_precision": 0.7604834726234316,
+      "eval_precision_macro": 0.5932281353135314,
+      "eval_recall": 0.8017817371937639,
+      "eval_recall_macro": 0.5707859310800487,
+      "eval_runtime": 17.5142,
+      "eval_samples_per_second": 25.636,
+      "eval_steps_per_second": 3.254,
+      "eval_weighted_fpr": 0.07613344739093242,
+      "eval_weighted_sensitivity": 0.8017817371937639,
+      "eval_weighted_specificity": 0.8089789041859096,
+      "step": 672
+    },
+    {
+      "epoch": 4.0,
+      "eval_accuracy": 0.8062360801781737,
+      "eval_f1_macro": 0.6301119928151375,
+      "eval_f1_micro": 0.8062360801781738,
+      "eval_f1_weighted": 0.7933630533945198,
+      "eval_loss": 0.8331468105316162,
+      "eval_macro_fpr": 0.10175133159747105,
+      "eval_macro_sensitivity": 0.6114882070764424,
+      "eval_macro_specificity": 0.9069973738423197,
+      "eval_precision": 0.7896315051078991,
+      "eval_precision_macro": 0.6674639062867935,
+      "eval_recall": 0.8062360801781737,
+      "eval_recall_macro": 0.6114882070764424,
+      "eval_runtime": 17.9901,
+      "eval_samples_per_second": 24.958,
+      "eval_steps_per_second": 3.168,
+      "eval_weighted_fpr": 0.0741687979539642,
+      "eval_weighted_sensitivity": 0.8062360801781737,
+      "eval_weighted_specificity": 0.8217534151911048,
+      "step": 896
+    },
+    {
+      "epoch": 4.464285714285714,
+      "grad_norm": 0.23617026209831238,
+      "learning_rate": 4.258184523809524e-05,
+      "loss": 0.3654,
+      "step": 1000
+    },
+    {
+      "epoch": 5.0,
+      "eval_accuracy": 0.7683741648106904,
+      "eval_f1_macro": 0.5896043825978781,
+      "eval_f1_micro": 0.7683741648106904,
+      "eval_f1_weighted": 0.7610828501277613,
+      "eval_loss": 1.2299734354019165,
+      "eval_macro_fpr": 0.10662840460883276,
+      "eval_macro_sensitivity": 0.6130556645262528,
+      "eval_macro_specificity": 0.9056447032260023,
+      "eval_precision": 0.7698582566254396,
+      "eval_precision_macro": 0.6085394130060126,
+      "eval_recall": 0.7683741648106904,
+      "eval_recall_macro": 0.6130556645262528,
+      "eval_runtime": 19.5517,
+      "eval_samples_per_second": 22.965,
+      "eval_steps_per_second": 2.915,
+      "eval_weighted_fpr": 0.0913081650570676,
+      "eval_weighted_sensitivity": 0.7683741648106904,
+      "eval_weighted_specificity": 0.8542046480933186,
+      "step": 1120
+    },
+    {
+      "epoch": 6.0,
+      "eval_accuracy": 0.8129175946547884,
+      "eval_f1_macro": 0.6299577384875399,
+      "eval_f1_micro": 0.8129175946547884,
+      "eval_f1_weighted": 0.7972266629935387,
+      "eval_loss": 1.0698440074920654,
+      "eval_macro_fpr": 0.09572659519735909,
+      "eval_macro_sensitivity": 0.6152769461592991,
+      "eval_macro_specificity": 0.9133810019905357,
+      "eval_precision": 0.7940368363876591,
+      "eval_precision_macro": 0.6863588955891834,
+      "eval_recall": 0.8129175946547884,
+      "eval_recall_macro": 0.6152769461592991,
+      "eval_runtime": 21.7346,
+      "eval_samples_per_second": 20.658,
+      "eval_steps_per_second": 2.623,
+      "eval_weighted_fpr": 0.07124681933842239,
+      "eval_weighted_sensitivity": 0.8129175946547884,
+      "eval_weighted_specificity": 0.8406064133073544,
+      "step": 1344
+    },
+    {
+      "epoch": 6.696428571428571,
+      "grad_norm": 0.6412457823753357,
+      "learning_rate": 3.8869047619047625e-05,
+      "loss": 0.2047,
+      "step": 1500
+    },
+    {
+      "epoch": 7.0,
+      "eval_accuracy": 0.7884187082405345,
+      "eval_f1_macro": 0.6141215790585401,
+      "eval_f1_micro": 0.7884187082405345,
+      "eval_f1_weighted": 0.7892035783447391,
+      "eval_loss": 1.3299829959869385,
+      "eval_macro_fpr": 0.10442766929340637,
+      "eval_macro_sensitivity": 0.5958936400112871,
+      "eval_macro_specificity": 0.9076274830150074,
+      "eval_precision": 0.7959953084611945,
+      "eval_precision_macro": 0.6412251711254097,
+      "eval_recall": 0.7884187082405345,
+      "eval_recall_macro": 0.5958936400112871,
+      "eval_runtime": 19.4013,
+      "eval_samples_per_second": 23.143,
+      "eval_steps_per_second": 2.938,
+      "eval_weighted_fpr": 0.08210890233362143,
+      "eval_weighted_sensitivity": 0.7884187082405345,
+      "eval_weighted_specificity": 0.842091223819495,
+      "step": 1568
+    },
+    {
+      "epoch": 8.0,
+      "eval_accuracy": 0.8106904231625836,
+      "eval_f1_macro": 0.6163443598585857,
+      "eval_f1_micro": 0.8106904231625834,
+      "eval_f1_weighted": 0.7947158089605988,
+      "eval_loss": 1.3869845867156982,
+      "eval_macro_fpr": 0.09827643474073441,
+      "eval_macro_sensitivity": 0.6062894445247387,
+      "eval_macro_specificity": 0.9106173671247473,
+      "eval_precision": 0.7860704056527595,
+      "eval_precision_macro": 0.6466819479006202,
+      "eval_recall": 0.8106904231625836,
+      "eval_recall_macro": 0.6062894445247387,
+      "eval_runtime": 24.9242,
+      "eval_samples_per_second": 18.015,
+      "eval_steps_per_second": 2.287,
+      "eval_weighted_fpr": 0.07221750212404418,
+      "eval_weighted_sensitivity": 0.8106904231625836,
+      "eval_weighted_specificity": 0.8317790453364052,
+      "step": 1792
+    },
+    {
+      "epoch": 8.928571428571429,
+      "grad_norm": 0.009310582652688026,
+      "learning_rate": 3.5156250000000004e-05,
+      "loss": 0.0795,
+      "step": 2000
+    },
+    {
+      "epoch": 9.0,
+      "eval_accuracy": 0.7951002227171492,
+      "eval_f1_macro": 0.6036078586352096,
+      "eval_f1_micro": 0.7951002227171492,
+      "eval_f1_weighted": 0.7803481654390761,
+      "eval_loss": 1.5031198263168335,
+      "eval_macro_fpr": 0.10395014224349126,
+      "eval_macro_sensitivity": 0.596858890976538,
+      "eval_macro_specificity": 0.9067643380561508,
+      "eval_precision": 0.7719081858839341,
+      "eval_precision_macro": 0.6275149499476224,
+      "eval_recall": 0.7951002227171492,
+      "eval_recall_macro": 0.596858890976538,
+      "eval_runtime": 19.5528,
+      "eval_samples_per_second": 22.964,
+      "eval_steps_per_second": 2.915,
+      "eval_weighted_fpr": 0.07910576096302666,
+      "eval_weighted_sensitivity": 0.7951002227171492,
+      "eval_weighted_specificity": 0.8319571295074538,
+      "step": 2016
+    },
+    {
+      "epoch": 10.0,
+      "eval_accuracy": 0.7728285077951003,
+      "eval_f1_macro": 0.6196001194983027,
+      "eval_f1_micro": 0.7728285077951002,
+      "eval_f1_weighted": 0.7758603070332255,
+      "eval_loss": 1.6303768157958984,
+      "eval_macro_fpr": 0.10604441860615665,
+      "eval_macro_sensitivity": 0.6233043585984762,
+      "eval_macro_specificity": 0.9072269655447398,
+      "eval_precision": 0.7796278998362599,
+      "eval_precision_macro": 0.6171087696246884,
+      "eval_recall": 0.7728285077951003,
+      "eval_recall_macro": 0.6233043585984762,
+      "eval_runtime": 17.8727,
+      "eval_samples_per_second": 25.122,
+      "eval_steps_per_second": 3.189,
+      "eval_weighted_fpr": 0.08923884514435695,
+      "eval_weighted_sensitivity": 0.7728285077951003,
+      "eval_weighted_specificity": 0.8560793543838588,
+      "step": 2240
+    },
+    {
+      "epoch": 11.0,
+      "eval_accuracy": 0.8040089086859689,
+      "eval_f1_macro": 0.60971035256129,
+      "eval_f1_micro": 0.8040089086859689,
+      "eval_f1_weighted": 0.7884103774950618,
+      "eval_loss": 1.6553305387496948,
+      "eval_macro_fpr": 0.10029712404712406,
+      "eval_macro_sensitivity": 0.6047305900247076,
+      "eval_macro_specificity": 0.9093226487010472,
+      "eval_precision": 0.7801791198576906,
+      "eval_precision_macro": 0.6404694360494954,
+      "eval_recall": 0.8040089086859689,
+      "eval_recall_macro": 0.6047305900247076,
+      "eval_runtime": 18.7706,
+      "eval_samples_per_second": 23.92,
+      "eval_steps_per_second": 3.037,
+      "eval_weighted_fpr": 0.07514944491887275,
+      "eval_weighted_sensitivity": 0.8040089086859689,
+      "eval_weighted_specificity": 0.83328168611822,
+      "step": 2464
+    },
+    {
+      "epoch": 11.160714285714286,
+      "grad_norm": 0.003156836610287428,
+      "learning_rate": 3.143601190476191e-05,
+      "loss": 0.0309,
+      "step": 2500
+    },
+    {
+      "epoch": 12.0,
+      "eval_accuracy": 0.799554565701559,
+      "eval_f1_macro": 0.6072980420599631,
+      "eval_f1_micro": 0.799554565701559,
+      "eval_f1_weighted": 0.7860582530348104,
+      "eval_loss": 1.6668155193328857,
+      "eval_macro_fpr": 0.09988889279594411,
+      "eval_macro_sensitivity": 0.6084453437394614,
+      "eval_macro_specificity": 0.9106688993495651,
+      "eval_precision": 0.777569146196374,
+      "eval_precision_macro": 0.6247320881812615,
+      "eval_recall": 0.799554565701559,
+      "eval_recall_macro": 0.6084453437394614,
+      "eval_runtime": 17.8921,
+      "eval_samples_per_second": 25.095,
+      "eval_steps_per_second": 3.186,
+      "eval_weighted_fpr": 0.07712082262210797,
+      "eval_weighted_sensitivity": 0.799554565701559,
+      "eval_weighted_specificity": 0.8431210316967014,
+      "step": 2688
+    },
+    {
+      "epoch": 13.0,
+      "eval_accuracy": 0.8040089086859689,
+      "eval_f1_macro": 0.5912164538573286,
+      "eval_f1_micro": 0.8040089086859689,
+      "eval_f1_weighted": 0.7845547674905504,
+      "eval_loss": 1.7547632455825806,
+      "eval_macro_fpr": 0.10303078503610634,
+      "eval_macro_sensitivity": 0.5846762537939009,
+      "eval_macro_specificity": 0.9063991203807322,
+      "eval_precision": 0.7724328584664579,
+      "eval_precision_macro": 0.6059236646315017,
+      "eval_recall": 0.8040089086859689,
+      "eval_recall_macro": 0.5846762537939009,
+      "eval_runtime": 18.8418,
+      "eval_samples_per_second": 23.83,
+      "eval_steps_per_second": 3.025,
+      "eval_weighted_fpr": 0.07514944491887275,
+      "eval_weighted_sensitivity": 0.8040089086859689,
+      "eval_weighted_specificity": 0.8215875728369607,
+      "step": 2912
+    },
+    {
+      "epoch": 13.392857142857142,
+      "grad_norm": 0.007099219132214785,
+      "learning_rate": 2.771577380952381e-05,
+      "loss": 0.0225,
+      "step": 3000
+    },
+    {
+      "epoch": 14.0,
+      "eval_accuracy": 0.8106904231625836,
+      "eval_f1_macro": 0.59981866562268,
+      "eval_f1_micro": 0.8106904231625834,
+      "eval_f1_weighted": 0.7909009860593438,
+      "eval_loss": 1.669065237045288,
+      "eval_macro_fpr": 0.09738592200890205,
+      "eval_macro_sensitivity": 0.6043589425942367,
+      "eval_macro_specificity": 0.9110786308220206,
+      "eval_precision": 0.7736492429702276,
+      "eval_precision_macro": 0.5965496612268181,
+      "eval_recall": 0.8106904231625836,
+      "eval_recall_macro": 0.6043589425942367,
+      "eval_runtime": 18.7407,
+      "eval_samples_per_second": 23.959,
+      "eval_steps_per_second": 3.042,
+      "eval_weighted_fpr": 0.07221750212404418,
+      "eval_weighted_sensitivity": 0.8106904231625836,
+      "eval_weighted_specificity": 0.8336241001254988,
+      "step": 3136
+    },
+    {
+      "epoch": 15.0,
+      "eval_accuracy": 0.8040089086859689,
+      "eval_f1_macro": 0.6250733662143111,
+      "eval_f1_micro": 0.8040089086859689,
+      "eval_f1_weighted": 0.7938662667450653,
+      "eval_loss": 1.8750598430633545,
+      "eval_macro_fpr": 0.10070785070785071,
+      "eval_macro_sensitivity": 0.6081468213821154,
+      "eval_macro_specificity": 0.9090627111057672,
+      "eval_precision": 0.7897150103102598,
+      "eval_precision_macro": 0.6516313389003527,
+      "eval_recall": 0.8040089086859689,
+      "eval_recall_macro": 0.6081468213821154,
+      "eval_runtime": 19.5585,
+      "eval_samples_per_second": 22.957,
+      "eval_steps_per_second": 2.914,
+      "eval_weighted_fpr": 0.07514944491887275,
+      "eval_weighted_sensitivity": 0.8040089086859689,
+      "eval_weighted_specificity": 0.8322419357371,
+      "step": 3360
+    },
+    {
+      "epoch": 15.625,
+      "grad_norm": 0.000986579223535955,
+      "learning_rate": 2.3995535714285717e-05,
+      "loss": 0.0048,
+      "step": 3500
+    },
+    {
+      "epoch": 16.0,
+      "eval_accuracy": 0.8084632516703786,
+      "eval_f1_macro": 0.6478205036835734,
+      "eval_f1_micro": 0.8084632516703786,
+      "eval_f1_weighted": 0.8017713075570686,
+      "eval_loss": 1.8402190208435059,
+      "eval_macro_fpr": 0.09346528346528347,
+      "eval_macro_sensitivity": 0.6429079002608414,
+      "eval_macro_specificity": 0.9158084751306171,
+      "eval_precision": 0.7982655513136719,
+      "eval_precision_macro": 0.6608466128926487,
+      "eval_recall": 0.8084632516703786,
+      "eval_recall_macro": 0.6429079002608414,
+      "eval_runtime": 20.8557,
+      "eval_samples_per_second": 21.529,
+      "eval_steps_per_second": 2.733,
+      "eval_weighted_fpr": 0.07319148936170213,
+      "eval_weighted_sensitivity": 0.8084632516703786,
+      "eval_weighted_specificity": 0.8547706488520901,
+      "step": 3584
+    },
+    {
+      "epoch": 17.0,
+      "eval_accuracy": 0.7951002227171492,
+      "eval_f1_macro": 0.6250080665059693,
+      "eval_f1_micro": 0.7951002227171492,
+      "eval_f1_weighted": 0.7890988211833133,
+      "eval_loss": 1.9123594760894775,
+      "eval_macro_fpr": 0.10009209120981923,
+      "eval_macro_sensitivity": 0.6237465502171384,
+      "eval_macro_specificity": 0.9101728441693318,
+      "eval_precision": 0.7871349497482736,
+      "eval_precision_macro": 0.6331039915966387,
+      "eval_recall": 0.7951002227171492,
+      "eval_recall_macro": 0.6237465502171384,
+      "eval_runtime": 22.3885,
+      "eval_samples_per_second": 20.055,
+      "eval_steps_per_second": 2.546,
+      "eval_weighted_fpr": 0.07910576096302666,
+      "eval_weighted_sensitivity": 0.7951002227171492,
+      "eval_weighted_specificity": 0.8455911539601776,
+      "step": 3808
+    },
+    {
+      "epoch": 17.857142857142858,
+      "grad_norm": 0.0016844779020175338,
+      "learning_rate": 2.027529761904762e-05,
+      "loss": 0.0069,
+      "step": 4000
+    },
+    {
+      "epoch": 18.0,
+      "eval_accuracy": 0.7973273942093542,
+      "eval_f1_macro": 0.6062346830120622,
+      "eval_f1_micro": 0.7973273942093542,
+      "eval_f1_weighted": 0.7846722241151323,
+      "eval_loss": 1.8856843709945679,
+      "eval_macro_fpr": 0.1047864019411268,
+      "eval_macro_sensitivity": 0.5972288178170531,
+      "eval_macro_specificity": 0.9053198759071074,
+      "eval_precision": 0.7793901437600238,
+      "eval_precision_macro": 0.6267606864492677,
+      "eval_recall": 0.7973273942093542,
+      "eval_recall_macro": 0.5972288178170531,
+      "eval_runtime": 21.6525,
+      "eval_samples_per_second": 20.737,
+      "eval_steps_per_second": 2.632,
+      "eval_weighted_fpr": 0.07811158798283262,
+      "eval_weighted_sensitivity": 0.7973273942093542,
+      "eval_weighted_specificity": 0.8239521094190755,
+      "step": 4032
+    },
+    {
+      "epoch": 19.0,
+      "eval_accuracy": 0.8062360801781737,
+      "eval_f1_macro": 0.610672303898802,
+      "eval_f1_micro": 0.8062360801781738,
+      "eval_f1_weighted": 0.7895499021324558,
+      "eval_loss": 1.9492371082305908,
+      "eval_macro_fpr": 0.10059121982105523,
+      "eval_macro_sensitivity": 0.6015363147716088,
+      "eval_macro_specificity": 0.9085815747160192,
+      "eval_precision": 0.7813193080487297,
+      "eval_precision_macro": 0.6466954430951133,
+      "eval_recall": 0.8062360801781737,
+      "eval_recall_macro": 0.6015363147716088,
+      "eval_runtime": 18.7319,
+      "eval_samples_per_second": 23.97,
+      "eval_steps_per_second": 3.043,
+      "eval_weighted_fpr": 0.0741687979539642,
+      "eval_weighted_sensitivity": 0.8062360801781737,
+      "eval_weighted_specificity": 0.828090218685903,
+      "step": 4256
+    },
+    {
+      "epoch": 20.0,
+      "eval_accuracy": 0.8084632516703786,
+      "eval_f1_macro": 0.6144369196694778,
+      "eval_f1_micro": 0.8084632516703786,
+      "eval_f1_weighted": 0.7932213847166972,
+      "eval_loss": 1.899397850036621,
+      "eval_macro_fpr": 0.09880130869572286,
+      "eval_macro_sensitivity": 0.6066610919552096,
+      "eval_macro_specificity": 0.9101677843526085,
+      "eval_precision": 0.784920953393948,
+      "eval_precision_macro": 0.6417378517103144,
+      "eval_recall": 0.8084632516703786,
+      "eval_recall_macro": 0.6066610919552096,
+      "eval_runtime": 18.8499,
+      "eval_samples_per_second": 23.82,
+      "eval_steps_per_second": 3.024,
+      "eval_weighted_fpr": 0.07319148936170213,
+      "eval_weighted_sensitivity": 0.8084632516703786,
+      "eval_weighted_specificity": 0.8322078857400554,
+      "step": 4480
+    },
+    {
+      "epoch": 20.089285714285715,
+      "grad_norm": 0.0006921566091477871,
+      "learning_rate": 1.65625e-05,
+      "loss": 0.0034,
+      "step": 4500
+    },
+    {
+      "epoch": 21.0,
+      "eval_accuracy": 0.8040089086859689,
+      "eval_f1_macro": 0.6428743743483731,
+      "eval_f1_micro": 0.8040089086859689,
+      "eval_f1_weighted": 0.794199107090719,
+      "eval_loss": 1.981939435005188,
+      "eval_macro_fpr": 0.09763565524435089,
+      "eval_macro_sensitivity": 0.632509514862456,
+      "eval_macro_specificity": 0.9119739242182288,
+      "eval_precision": 0.7898236252959594,
+      "eval_precision_macro": 0.6747722186700768,
+      "eval_recall": 0.8040089086859689,
+      "eval_recall_macro": 0.632509514862456,
+      "eval_runtime": 18.6464,
+      "eval_samples_per_second": 24.08,
+      "eval_steps_per_second": 3.057,
+      "eval_weighted_fpr": 0.07514944491887275,
+      "eval_weighted_sensitivity": 0.8040089086859689,
+      "eval_weighted_specificity": 0.8438867881869458,
+      "step": 4704
+    },
+    {
+      "epoch": 22.0,
+      "eval_accuracy": 0.8062360801781737,
+      "eval_f1_macro": 0.6293220930410561,
+      "eval_f1_micro": 0.8062360801781738,
+      "eval_f1_weighted": 0.7929649161864832,
+      "eval_loss": 2.0180749893188477,
+      "eval_macro_fpr": 0.09769081016323067,
+      "eval_macro_sensitivity": 0.6204025836378777,
+      "eval_macro_specificity": 0.9117613753511575,
+      "eval_precision": 0.7879578221269433,
+      "eval_precision_macro": 0.6735832268090333,
+      "eval_recall": 0.8062360801781737,
+      "eval_recall_macro": 0.6204025836378777,
+      "eval_runtime": 21.6029,
+      "eval_samples_per_second": 20.784,
+      "eval_steps_per_second": 2.639,
+      "eval_weighted_fpr": 0.0741687979539642,
+      "eval_weighted_sensitivity": 0.8062360801781737,
+      "eval_weighted_specificity": 0.8408094212264563,
+      "step": 4928
+    },
+    {
+      "epoch": 22.321428571428573,
+      "grad_norm": 0.0017632667440921068,
+      "learning_rate": 1.2842261904761904e-05,
+      "loss": 0.0001,
+      "step": 5000
+    },
+    {
+      "epoch": 23.0,
+      "eval_accuracy": 0.8062360801781737,
+      "eval_f1_macro": 0.6293220930410561,
+      "eval_f1_micro": 0.8062360801781738,
+      "eval_f1_weighted": 0.7929649161864832,
+      "eval_loss": 2.0305473804473877,
+      "eval_macro_fpr": 0.09769081016323067,
+      "eval_macro_sensitivity": 0.6204025836378777,
+      "eval_macro_specificity": 0.9117613753511575,
+      "eval_precision": 0.7879578221269433,
+      "eval_precision_macro": 0.6735832268090333,
+      "eval_recall": 0.8062360801781737,
+      "eval_recall_macro": 0.6204025836378777,
+      "eval_runtime": 19.9323,
+      "eval_samples_per_second": 22.526,
+      "eval_steps_per_second": 2.86,
+      "eval_weighted_fpr": 0.0741687979539642,
+      "eval_weighted_sensitivity": 0.8062360801781737,
+      "eval_weighted_specificity": 0.8408094212264563,
+      "step": 5152
+    },
+    {
+      "epoch": 24.0,
+      "eval_accuracy": 0.8040089086859689,
+      "eval_f1_macro": 0.6091984969950299,
+      "eval_f1_micro": 0.8040089086859689,
+      "eval_f1_weighted": 0.7876978416949642,
+      "eval_loss": 2.0248725414276123,
+      "eval_macro_fpr": 0.10186804925610897,
+      "eval_macro_sensitivity": 0.6004222327751739,
+      "eval_macro_specificity": 0.9074012244038161,
+      "eval_precision": 0.7801376277130834,
+      "eval_precision_macro": 0.6448022472746214,
+      "eval_recall": 0.8040089086859689,
+      "eval_recall_macro": 0.6004222327751739,
+      "eval_runtime": 22.5428,
+      "eval_samples_per_second": 19.918,
+      "eval_steps_per_second": 2.529,
+      "eval_weighted_fpr": 0.07514944491887275,
+      "eval_weighted_sensitivity": 0.8040089086859689,
+      "eval_weighted_specificity": 0.8255959889292954,
+      "step": 5376
+    },
+    {
+      "epoch": 24.553571428571427,
+      "grad_norm": 0.00044994684867560863,
+      "learning_rate": 9.122023809523809e-06,
+      "loss": 0.0,
+      "step": 5500
+    },
+    {
+      "epoch": 25.0,
+      "eval_accuracy": 0.8017817371937639,
+      "eval_f1_macro": 0.6271799288322751,
+      "eval_f1_micro": 0.8017817371937639,
+      "eval_f1_weighted": 0.7907670941735037,
+      "eval_loss": 2.0139310359954834,
+      "eval_macro_fpr": 0.09838717278837039,
+      "eval_macro_sensitivity": 0.6226316079257256,
+      "eval_macro_specificity": 0.9113889022846089,
+      "eval_precision": 0.7848002776733288,
+      "eval_precision_macro": 0.6513528138528139,
+      "eval_recall": 0.8017817371937639,
+      "eval_recall_macro": 0.6226316079257256,
+      "eval_runtime": 17.4233,
+      "eval_samples_per_second": 25.77,
+      "eval_steps_per_second": 3.271,
+      "eval_weighted_fpr": 0.07613344739093242,
+      "eval_weighted_sensitivity": 0.8017817371937639,
+      "eval_weighted_specificity": 0.8437738719446717,
+      "step": 5600
+    },
+    {
+      "epoch": 26.0,
+      "eval_accuracy": 0.8040089086859689,
+      "eval_f1_macro": 0.6304811840155711,
+      "eval_f1_micro": 0.8040089086859689,
+      "eval_f1_weighted": 0.7925820064518235,
+      "eval_loss": 2.0075461864471436,
+      "eval_macro_fpr": 0.09613422453907529,
+      "eval_macro_sensitivity": 0.6280540471716942,
+      "eval_macro_specificity": 0.9131650391354523,
+      "eval_precision": 0.7867899740794329,
+      "eval_precision_macro": 0.6586347907326314,
+      "eval_recall": 0.8040089086859689,
+      "eval_recall_macro": 0.6280540471716942,
+      "eval_runtime": 19.888,
+      "eval_samples_per_second": 22.576,
+      "eval_steps_per_second": 2.866,
+      "eval_weighted_fpr": 0.07514944491887275,
+      "eval_weighted_sensitivity": 0.8040089086859689,
+      "eval_weighted_specificity": 0.8486512478558408,
+      "step": 5824
+    },
+    {
+      "epoch": 26.785714285714285,
+      "grad_norm": 0.00030680475174449384,
+      "learning_rate": 5.4017857142857145e-06,
+      "loss": 0.0026,
+      "step": 6000
+    },
+    {
+      "epoch": 27.0,
+      "eval_accuracy": 0.8040089086859689,
+      "eval_f1_macro": 0.6304811840155711,
+      "eval_f1_micro": 0.8040089086859689,
+      "eval_f1_weighted": 0.7925820064518235,
+      "eval_loss": 2.015469551086426,
+      "eval_macro_fpr": 0.09613422453907529,
+      "eval_macro_sensitivity": 0.6280540471716942,
+      "eval_macro_specificity": 0.9131650391354523,
+      "eval_precision": 0.7867899740794329,
+      "eval_precision_macro": 0.6586347907326314,
+      "eval_recall": 0.8040089086859689,
+      "eval_recall_macro": 0.6280540471716942,
+      "eval_runtime": 18.2129,
+      "eval_samples_per_second": 24.653,
+      "eval_steps_per_second": 3.13,
+      "eval_weighted_fpr": 0.07514944491887275,
+      "eval_weighted_sensitivity": 0.8040089086859689,
+      "eval_weighted_specificity": 0.8486512478558408,
+      "step": 6048
+    },
+    {
+      "epoch": 28.0,
+      "eval_accuracy": 0.8040089086859689,
+      "eval_f1_macro": 0.6282967821034426,
+      "eval_f1_micro": 0.8040089086859689,
+      "eval_f1_weighted": 0.7922964886726178,
+      "eval_loss": 2.019129753112793,
+      "eval_macro_fpr": 0.09701836451836453,
+      "eval_macro_sensitivity": 0.6237456899221605,
+      "eval_macro_specificity": 0.9125697107568691,
+      "eval_precision": 0.7864940838168837,
+      "eval_precision_macro": 0.6586431481702824,
+      "eval_recall": 0.8040089086859689,
+      "eval_recall_macro": 0.6237456899221605,
+      "eval_runtime": 20.937,
+      "eval_samples_per_second": 21.445,
+      "eval_steps_per_second": 2.722,
+      "eval_weighted_fpr": 0.07514944491887275,
+      "eval_weighted_sensitivity": 0.8040089086859689,
+      "eval_weighted_specificity": 0.8462699343415074,
+      "step": 6272
+    },
+    {
+      "epoch": 29.0,
+      "eval_accuracy": 0.8040089086859689,
+      "eval_f1_macro": 0.6282967821034426,
+      "eval_f1_micro": 0.8040089086859689,
+      "eval_f1_weighted": 0.7922964886726178,
+      "eval_loss": 2.0224666595458984,
+      "eval_macro_fpr": 0.09701836451836453,
+      "eval_macro_sensitivity": 0.6237456899221605,
+      "eval_macro_specificity": 0.9125697107568691,
+      "eval_precision": 0.7864940838168837,
+      "eval_precision_macro": 0.6586431481702824,
+      "eval_recall": 0.8040089086859689,
+      "eval_recall_macro": 0.6237456899221605,
+      "eval_runtime": 17.6785,
+      "eval_samples_per_second": 25.398,
+      "eval_steps_per_second": 3.224,
+      "eval_weighted_fpr": 0.07514944491887275,
+      "eval_weighted_sensitivity": 0.8040089086859689,
+      "eval_weighted_specificity": 0.8462699343415074,
+      "step": 6496
+    },
+    {
+      "epoch": 29.017857142857142,
+      "grad_norm": 0.00021328784350771457,
+      "learning_rate": 1.681547619047619e-06,
+      "loss": 0.0,
+      "step": 6500
+    },
+    {
+      "epoch": 30.0,
+      "eval_accuracy": 0.799554565701559,
+      "eval_f1_macro": 0.6244721903798025,
+      "eval_f1_micro": 0.799554565701559,
+      "eval_f1_weighted": 0.7887095002776057,
+      "eval_loss": 2.034322500228882,
+      "eval_macro_fpr": 0.09842820376592175,
+      "eval_macro_sensitivity": 0.6218151879916586,
+      "eval_macro_specificity": 0.9118590979466747,
+      "eval_precision": 0.782121296142182,
+      "eval_precision_macro": 0.6460922554232,
+      "eval_recall": 0.799554565701559,
+      "eval_recall_macro": 0.6218151879916586,
+      "eval_runtime": 19.6458,
+      "eval_samples_per_second": 22.855,
+      "eval_steps_per_second": 2.901,
+      "eval_weighted_fpr": 0.07712082262210797,
+      "eval_weighted_sensitivity": 0.799554565701559,
+      "eval_weighted_specificity": 0.8478818260851398,
+      "step": 6720
+    }
+  ],
+  "logging_steps": 500,
+  "max_steps": 6720,
+  "num_input_tokens_seen": 0,
+  "num_train_epochs": 30,
+  "save_steps": 500,
+  "total_flos": 7121701353553920.0,
+  "train_batch_size": 8,
+  "trial_name": null,
+  "trial_params": null
+}

training_checkpoints/checkpoint-6720/training_args.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:3168244efe16c0aeafe631cea29ca8c9c2bbb665a169c0d40c2e4d22eaca40d9
+size 5048

training_checkpoints/checkpoint-6720/vocab.txt ADDED Viewed

The diff for this file is too large to render. See raw diff