shyamieee commited on Jun 27, 2024

Commit

9148da1

verified ·

1 Parent(s): a5c2acb

Upload folder using huggingface_hub

Browse files

Files changed (22) hide show

README.md +38 -0
config.json +28 -0
mergekit_config.yml +10 -0
model-00001-of-00016.safetensors +3 -0
model-00002-of-00016.safetensors +3 -0
model-00003-of-00016.safetensors +3 -0
model-00004-of-00016.safetensors +3 -0
model-00005-of-00016.safetensors +3 -0
model-00006-of-00016.safetensors +3 -0
model-00007-of-00016.safetensors +3 -0
model-00008-of-00016.safetensors +3 -0
model-00009-of-00016.safetensors +3 -0
model-00010-of-00016.safetensors +3 -0
model-00011-of-00016.safetensors +3 -0
model-00012-of-00016.safetensors +3 -0
model-00013-of-00016.safetensors +3 -0
model-00014-of-00016.safetensors +3 -0
model-00015-of-00016.safetensors +3 -0
model-00016-of-00016.safetensors +3 -0
model.safetensors.index.json +1 -0
tokenizer.json +0 -0
tokenizer_config.json +40 -0

README.md ADDED Viewed

	@@ -0,0 +1,38 @@

+---
+base_model: []
+library_name: transformers
+tags:
+- mergekit
+- merge
+---
+# padma_v8_folder
+This is a merge of pre-trained language models created using [mergekit](https://github.com/cg123/mergekit).
+## Merge Details
+### Merge Method
+This model was merged using the [task arithmetic](https://arxiv.org/abs/2212.04089) merge method using models/Qwen2-7B as a base.
+### Models Merged
+The following models were included in the merge:
+* models/Qwen2-7B-Instruct
+### Configuration
+The following YAML configuration was used to produce this model:
+```yaml
+models:
+  - model: models/Qwen2-7B
+    parameters:
+      weight: 0.6
+  - model: models/Qwen2-7B-Instruct
+    parameters:
+      weight: 0.4
+base_model: models/Qwen2-7B
+merge_method: task_arithmetic
+dtype: bfloat16
+```

config.json ADDED Viewed

	@@ -0,0 +1,28 @@

+{
+  "_name_or_path": "models/Qwen2-7B",
+  "architectures": [
+    "Qwen2ForCausalLM"
+  ],
+  "attention_dropout": 0.0,
+  "bos_token_id": 151643,
+  "eos_token_id": 151643,
+  "hidden_act": "silu",
+  "hidden_size": 3584,
+  "initializer_range": 0.02,
+  "intermediate_size": 18944,
+  "max_position_embeddings": 131072,
+  "max_window_layers": 28,
+  "model_type": "qwen2",
+  "num_attention_heads": 28,
+  "num_hidden_layers": 28,
+  "num_key_value_heads": 4,
+  "rms_norm_eps": 1e-06,
+  "rope_theta": 1000000.0,
+  "sliding_window": 131072,
+  "tie_word_embeddings": false,
+  "torch_dtype": "bfloat16",
+  "transformers_version": "4.41.2",
+  "use_cache": true,
+  "use_sliding_window": false,
+  "vocab_size": 152064
+}

mergekit_config.yml ADDED Viewed

	@@ -0,0 +1,10 @@

+models:
+  - model: models/Qwen2-7B
+    parameters:
+      weight: 0.6
+  - model: models/Qwen2-7B-Instruct
+    parameters:
+      weight: 0.4
+base_model: models/Qwen2-7B
+merge_method: task_arithmetic
+dtype: bfloat16

model-00001-of-00016.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:37acacdc114a0d3687dad7f7c0a04e75743dc76963f88ecfb6640eb0e138767d
+size 1089994880

model-00002-of-00016.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:45dcd463a292c62b6a257c362db3408f959b99fcf7720c6d0dd47b830e05b15d
+size 1089994896

model-00003-of-00016.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:a3668fc9f80d93bca6d50012bf27ef0a39009c7b155197d722a8d2cb1736cf84
+size 932241160

model-00004-of-00016.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:2c495f7d40d23497992019f40fd1f937f3f17597b7b7a72e50c382185d0b1678
+size 932233912

model-00005-of-00016.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:a84af73783a590ca061afe139d8b14aa0a8a6c9ffd698e1509ebc8ccc0dde8c5
+size 932233912

model-00006-of-00016.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:62c3233dd6252010355af9d42f600641124d886341c1eca81786f723e1d49b01
+size 932233912

model-00007-of-00016.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:92965597fbe37ad59527a4cdea55519412a46dcc0ade51eb4b23c6b500f8e2cd
+size 932233912

model-00008-of-00016.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:54def9038d59cf6a5d4b8d7f32a99be090b94c6140b25f7e5b15b5dff06506fb
+size 932233912

model-00009-of-00016.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:93c005c9ed11092c6a5a4a748af71215f02a52f9fa0a64577c0a92f2cb547346
+size 932233904

model-00010-of-00016.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:4516a70ab394af5e2ea0c7d5b807db1e3d5501cc83d7a6fccbd9e2cd8bf1e68c
+size 932233912

model-00011-of-00016.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:ff8bb76ba22b881397316e66d1c23d08245907090f5ba85ccdc894773f99b230
+size 932233912

model-00012-of-00016.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:ad6b0b3487fddfb80ca38d3fcaa672aad2b438840c68aba7546e06ca934c9260
+size 932233912

model-00013-of-00016.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:2865d5f6fcb31c159522497928f59a4097e1d3ed71e0687a53b369cd4d729a8f
+size 932233904

model-00014-of-00016.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:66b5f44e7eadf9a945d05864b6606b5562df33415ee330723f7af97233626490
+size 932233888

model-00015-of-00016.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:0f3b1f66c68b7f0bef3b889b5136121329d18f8cffedea60ce8f81c24f33b971
+size 932233888

model-00016-of-00016.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:f24ba35605d2a3495ab401113e67c0d98cf6f4b6f3c504ea8257cb14b51e4301
+size 932233872

model.safetensors.index.json ADDED Viewed

	@@ -0,0 +1 @@

+ {"metadata": {"mergekit_version": "0.0.4.2", "total_size": 15231233024}, "weight_map": {"lm_head.weight": "model-00001-of-00016.safetensors", "model.embed_tokens.weight": "model-00002-of-00016.safetensors", "model.layers.0.input_layernorm.weight": "model-00003-of-00016.safetensors", "model.layers.0.mlp.down_proj.weight": "model-00003-of-00016.safetensors", "model.layers.0.mlp.gate_proj.weight": "model-00003-of-00016.safetensors", "model.layers.0.mlp.up_proj.weight": "model-00003-of-00016.safetensors", "model.layers.0.post_attention_layernorm.weight": "model-00003-of-00016.safetensors", "model.layers.0.self_attn.k_proj.bias": "model-00003-of-00016.safetensors", "model.layers.0.self_attn.k_proj.weight": "model-00003-of-00016.safetensors", "model.layers.0.self_attn.o_proj.weight": "model-00003-of-00016.safetensors", "model.layers.0.self_attn.q_proj.bias": "model-00003-of-00016.safetensors", "model.layers.0.self_attn.q_proj.weight": "model-00003-of-00016.safetensors", "model.layers.0.self_attn.v_proj.bias": "model-00003-of-00016.safetensors", "model.layers.0.self_attn.v_proj.weight": "model-00003-of-00016.safetensors", "model.layers.1.input_layernorm.weight": "model-00003-of-00016.safetensors", "model.layers.1.mlp.down_proj.weight": "model-00003-of-00016.safetensors", "model.layers.1.mlp.gate_proj.weight": "model-00003-of-00016.safetensors", "model.layers.1.mlp.up_proj.weight": "model-00003-of-00016.safetensors", "model.layers.1.post_attention_layernorm.weight": "model-00003-of-00016.safetensors", "model.layers.1.self_attn.k_proj.bias": "model-00003-of-00016.safetensors", "model.layers.1.self_attn.k_proj.weight": "model-00003-of-00016.safetensors", "model.layers.1.self_attn.o_proj.weight": "model-00003-of-00016.safetensors", "model.layers.1.self_attn.q_proj.bias": "model-00003-of-00016.safetensors", "model.layers.1.self_attn.q_proj.weight": "model-00003-of-00016.safetensors", "model.layers.1.self_attn.v_proj.bias": "model-00003-of-00016.safetensors", "model.layers.1.self_attn.v_proj.weight": "model-00003-of-00016.safetensors", "model.layers.10.input_layernorm.weight": "model-00003-of-00016.safetensors", "model.layers.10.mlp.down_proj.weight": "model-00004-of-00016.safetensors", "model.layers.10.mlp.gate_proj.weight": "model-00004-of-00016.safetensors", "model.layers.10.mlp.up_proj.weight": "model-00004-of-00016.safetensors", "model.layers.10.post_attention_layernorm.weight": "model-00004-of-00016.safetensors", "model.layers.10.self_attn.k_proj.bias": "model-00004-of-00016.safetensors", "model.layers.10.self_attn.k_proj.weight": "model-00004-of-00016.safetensors", "model.layers.10.self_attn.o_proj.weight": "model-00004-of-00016.safetensors", "model.layers.10.self_attn.q_proj.bias": "model-00004-of-00016.safetensors", "model.layers.10.self_attn.q_proj.weight": "model-00004-of-00016.safetensors", "model.layers.10.self_attn.v_proj.bias": "model-00004-of-00016.safetensors", "model.layers.10.self_attn.v_proj.weight": "model-00004-of-00016.safetensors", "model.layers.11.input_layernorm.weight": "model-00004-of-00016.safetensors", "model.layers.11.mlp.down_proj.weight": "model-00004-of-00016.safetensors", "model.layers.11.mlp.gate_proj.weight": "model-00004-of-00016.safetensors", "model.layers.11.mlp.up_proj.weight": "model-00004-of-00016.safetensors", "model.layers.11.post_attention_layernorm.weight": "model-00004-of-00016.safetensors", "model.layers.11.self_attn.k_proj.bias": "model-00004-of-00016.safetensors", "model.layers.11.self_attn.k_proj.weight": "model-00004-of-00016.safetensors", "model.layers.11.self_attn.o_proj.weight": "model-00004-of-00016.safetensors", "model.layers.11.self_attn.q_proj.bias": "model-00004-of-00016.safetensors", "model.layers.11.self_attn.q_proj.weight": "model-00004-of-00016.safetensors", "model.layers.11.self_attn.v_proj.bias": "model-00004-of-00016.safetensors", "model.layers.11.self_attn.v_proj.weight": "model-00004-of-00016.safetensors", "model.layers.12.input_layernorm.weight": "model-00004-of-00016.safetensors", "model.layers.12.mlp.down_proj.weight": "model-00005-of-00016.safetensors", "model.layers.12.mlp.gate_proj.weight": "model-00005-of-00016.safetensors", "model.layers.12.mlp.up_proj.weight": "model-00005-of-00016.safetensors", "model.layers.12.post_attention_layernorm.weight": "model-00005-of-00016.safetensors", "model.layers.12.self_attn.k_proj.bias": "model-00005-of-00016.safetensors", "model.layers.12.self_attn.k_proj.weight": "model-00005-of-00016.safetensors", "model.layers.12.self_attn.o_proj.weight": "model-00005-of-00016.safetensors", "model.layers.12.self_attn.q_proj.bias": "model-00005-of-00016.safetensors", "model.layers.12.self_attn.q_proj.weight": "model-00005-of-00016.safetensors", "model.layers.12.self_attn.v_proj.bias": "model-00005-of-00016.safetensors", "model.layers.12.self_attn.v_proj.weight": "model-00005-of-00016.safetensors", "model.layers.13.input_layernorm.weight": "model-00005-of-00016.safetensors", "model.layers.13.mlp.down_proj.weight": "model-00005-of-00016.safetensors", "model.layers.13.mlp.gate_proj.weight": "model-00005-of-00016.safetensors", "model.layers.13.mlp.up_proj.weight": "model-00005-of-00016.safetensors", "model.layers.13.post_attention_layernorm.weight": "model-00005-of-00016.safetensors", "model.layers.13.self_attn.k_proj.bias": "model-00005-of-00016.safetensors", "model.layers.13.self_attn.k_proj.weight": "model-00005-of-00016.safetensors", "model.layers.13.self_attn.o_proj.weight": "model-00005-of-00016.safetensors", "model.layers.13.self_attn.q_proj.bias": "model-00005-of-00016.safetensors", "model.layers.13.self_attn.q_proj.weight": "model-00005-of-00016.safetensors", "model.layers.13.self_attn.v_proj.bias": "model-00005-of-00016.safetensors", "model.layers.13.self_attn.v_proj.weight": "model-00005-of-00016.safetensors", "model.layers.14.input_layernorm.weight": "model-00005-of-00016.safetensors", "model.layers.14.mlp.down_proj.weight": "model-00006-of-00016.safetensors", "model.layers.14.mlp.gate_proj.weight": "model-00006-of-00016.safetensors", "model.layers.14.mlp.up_proj.weight": "model-00006-of-00016.safetensors", "model.layers.14.post_attention_layernorm.weight": "model-00006-of-00016.safetensors", "model.layers.14.self_attn.k_proj.bias": "model-00006-of-00016.safetensors", "model.layers.14.self_attn.k_proj.weight": "model-00006-of-00016.safetensors", "model.layers.14.self_attn.o_proj.weight": "model-00006-of-00016.safetensors", "model.layers.14.self_attn.q_proj.bias": "model-00006-of-00016.safetensors", "model.layers.14.self_attn.q_proj.weight": "model-00006-of-00016.safetensors", "model.layers.14.self_attn.v_proj.bias": "model-00006-of-00016.safetensors", "model.layers.14.self_attn.v_proj.weight": "model-00006-of-00016.safetensors", "model.layers.15.input_layernorm.weight": "model-00006-of-00016.safetensors", "model.layers.15.mlp.down_proj.weight": "model-00006-of-00016.safetensors", "model.layers.15.mlp.gate_proj.weight": "model-00006-of-00016.safetensors", "model.layers.15.mlp.up_proj.weight": "model-00006-of-00016.safetensors", "model.layers.15.post_attention_layernorm.weight": "model-00006-of-00016.safetensors", "model.layers.15.self_attn.k_proj.bias": "model-00006-of-00016.safetensors", "model.layers.15.self_attn.k_proj.weight": "model-00006-of-00016.safetensors", "model.layers.15.self_attn.o_proj.weight": "model-00006-of-00016.safetensors", "model.layers.15.self_attn.q_proj.bias": "model-00006-of-00016.safetensors", "model.layers.15.self_attn.q_proj.weight": "model-00006-of-00016.safetensors", "model.layers.15.self_attn.v_proj.bias": "model-00006-of-00016.safetensors", "model.layers.15.self_attn.v_proj.weight": "model-00006-of-00016.safetensors", "model.layers.16.input_layernorm.weight": "model-00006-of-00016.safetensors", "model.layers.16.mlp.down_proj.weight": "model-00007-of-00016.safetensors", "model.layers.16.mlp.gate_proj.weight": "model-00007-of-00016.safetensors", "model.layers.16.mlp.up_proj.weight": "model-00007-of-00016.safetensors", "model.layers.16.post_attention_layernorm.weight": "model-00007-of-00016.safetensors", "model.layers.16.self_attn.k_proj.bias": "model-00007-of-00016.safetensors", "model.layers.16.self_attn.k_proj.weight": "model-00007-of-00016.safetensors", "model.layers.16.self_attn.o_proj.weight": "model-00007-of-00016.safetensors", "model.layers.16.self_attn.q_proj.bias": "model-00007-of-00016.safetensors", "model.layers.16.self_attn.q_proj.weight": "model-00007-of-00016.safetensors", "model.layers.16.self_attn.v_proj.bias": "model-00007-of-00016.safetensors", "model.layers.16.self_attn.v_proj.weight": "model-00007-of-00016.safetensors", "model.layers.17.input_layernorm.weight": "model-00007-of-00016.safetensors", "model.layers.17.mlp.down_proj.weight": "model-00007-of-00016.safetensors", "model.layers.17.mlp.gate_proj.weight": "model-00007-of-00016.safetensors", "model.layers.17.mlp.up_proj.weight": "model-00007-of-00016.safetensors", "model.layers.17.post_attention_layernorm.weight": "model-00007-of-00016.safetensors", "model.layers.17.self_attn.k_proj.bias": "model-00007-of-00016.safetensors", "model.layers.17.self_attn.k_proj.weight": "model-00007-of-00016.safetensors", "model.layers.17.self_attn.o_proj.weight": "model-00007-of-00016.safetensors", "model.layers.17.self_attn.q_proj.bias": "model-00007-of-00016.safetensors", "model.layers.17.self_attn.q_proj.weight": "model-00007-of-00016.safetensors", "model.layers.17.self_attn.v_proj.bias": "model-00007-of-00016.safetensors", "model.layers.17.self_attn.v_proj.weight": "model-00007-of-00016.safetensors", "model.layers.18.input_layernorm.weight": "model-00007-of-00016.safetensors", "model.layers.18.mlp.down_proj.weight": "model-00008-of-00016.safetensors", "model.layers.18.mlp.gate_proj.weight": "model-00008-of-00016.safetensors", "model.layers.18.mlp.up_proj.weight": "model-00008-of-00016.safetensors", "model.layers.18.post_attention_layernorm.weight": "model-00008-of-00016.safetensors", "model.layers.18.self_attn.k_proj.bias": "model-00008-of-00016.safetensors", "model.layers.18.self_attn.k_proj.weight": "model-00008-of-00016.safetensors", "model.layers.18.self_attn.o_proj.weight": "model-00008-of-00016.safetensors", "model.layers.18.self_attn.q_proj.bias": "model-00008-of-00016.safetensors", "model.layers.18.self_attn.q_proj.weight": "model-00008-of-00016.safetensors", "model.layers.18.self_attn.v_proj.bias": "model-00008-of-00016.safetensors", "model.layers.18.self_attn.v_proj.weight": "model-00008-of-00016.safetensors", "model.layers.19.input_layernorm.weight": "model-00008-of-00016.safetensors", "model.layers.19.mlp.down_proj.weight": "model-00008-of-00016.safetensors", "model.layers.19.mlp.gate_proj.weight": "model-00008-of-00016.safetensors", "model.layers.19.mlp.up_proj.weight": "model-00008-of-00016.safetensors", "model.layers.19.post_attention_layernorm.weight": "model-00008-of-00016.safetensors", "model.layers.19.self_attn.k_proj.bias": "model-00008-of-00016.safetensors", "model.layers.19.self_attn.k_proj.weight": "model-00008-of-00016.safetensors", "model.layers.19.self_attn.o_proj.weight": "model-00008-of-00016.safetensors", "model.layers.19.self_attn.q_proj.bias": "model-00008-of-00016.safetensors", "model.layers.19.self_attn.q_proj.weight": "model-00008-of-00016.safetensors", "model.layers.19.self_attn.v_proj.bias": "model-00008-of-00016.safetensors", "model.layers.19.self_attn.v_proj.weight": "model-00008-of-00016.safetensors", "model.layers.2.input_layernorm.weight": "model-00008-of-00016.safetensors", "model.layers.2.mlp.down_proj.weight": "model-00009-of-00016.safetensors", "model.layers.2.mlp.gate_proj.weight": "model-00009-of-00016.safetensors", "model.layers.2.mlp.up_proj.weight": "model-00009-of-00016.safetensors", "model.layers.2.post_attention_layernorm.weight": "model-00009-of-00016.safetensors", "model.layers.2.self_attn.k_proj.bias": "model-00009-of-00016.safetensors", "model.layers.2.self_attn.k_proj.weight": "model-00009-of-00016.safetensors", "model.layers.2.self_attn.o_proj.weight": "model-00009-of-00016.safetensors", "model.layers.2.self_attn.q_proj.bias": "model-00009-of-00016.safetensors", "model.layers.2.self_attn.q_proj.weight": "model-00009-of-00016.safetensors", "model.layers.2.self_attn.v_proj.bias": "model-00009-of-00016.safetensors", "model.layers.2.self_attn.v_proj.weight": "model-00009-of-00016.safetensors", "model.layers.20.input_layernorm.weight": "model-00009-of-00016.safetensors", "model.layers.20.mlp.down_proj.weight": "model-00009-of-00016.safetensors", "model.layers.20.mlp.gate_proj.weight": "model-00009-of-00016.safetensors", "model.layers.20.mlp.up_proj.weight": "model-00009-of-00016.safetensors", "model.layers.20.post_attention_layernorm.weight": "model-00009-of-00016.safetensors", "model.layers.20.self_attn.k_proj.bias": "model-00009-of-00016.safetensors", "model.layers.20.self_attn.k_proj.weight": "model-00009-of-00016.safetensors", "model.layers.20.self_attn.o_proj.weight": "model-00009-of-00016.safetensors", "model.layers.20.self_attn.q_proj.bias": "model-00009-of-00016.safetensors", "model.layers.20.self_attn.q_proj.weight": "model-00009-of-00016.safetensors", "model.layers.20.self_attn.v_proj.bias": "model-00009-of-00016.safetensors", "model.layers.20.self_attn.v_proj.weight": "model-00009-of-00016.safetensors", "model.layers.21.input_layernorm.weight": "model-00009-of-00016.safetensors", "model.layers.21.mlp.down_proj.weight": "model-00010-of-00016.safetensors", "model.layers.21.mlp.gate_proj.weight": "model-00010-of-00016.safetensors", "model.layers.21.mlp.up_proj.weight": "model-00010-of-00016.safetensors", "model.layers.21.post_attention_layernorm.weight": "model-00010-of-00016.safetensors", "model.layers.21.self_attn.k_proj.bias": "model-00010-of-00016.safetensors", "model.layers.21.self_attn.k_proj.weight": "model-00010-of-00016.safetensors", "model.layers.21.self_attn.o_proj.weight": "model-00010-of-00016.safetensors", "model.layers.21.self_attn.q_proj.bias": "model-00010-of-00016.safetensors", "model.layers.21.self_attn.q_proj.weight": "model-00010-of-00016.safetensors", "model.layers.21.self_attn.v_proj.bias": "model-00010-of-00016.safetensors", "model.layers.21.self_attn.v_proj.weight": "model-00010-of-00016.safetensors", "model.layers.22.input_layernorm.weight": "model-00010-of-00016.safetensors", "model.layers.22.mlp.down_proj.weight": "model-00010-of-00016.safetensors", "model.layers.22.mlp.gate_proj.weight": "model-00010-of-00016.safetensors", "model.layers.22.mlp.up_proj.weight": "model-00010-of-00016.safetensors", "model.layers.22.post_attention_layernorm.weight": "model-00010-of-00016.safetensors", "model.layers.22.self_attn.k_proj.bias": "model-00010-of-00016.safetensors", "model.layers.22.self_attn.k_proj.weight": "model-00010-of-00016.safetensors", "model.layers.22.self_attn.o_proj.weight": "model-00010-of-00016.safetensors", "model.layers.22.self_attn.q_proj.bias": "model-00010-of-00016.safetensors", "model.layers.22.self_attn.q_proj.weight": "model-00010-of-00016.safetensors", "model.layers.22.self_attn.v_proj.bias": "model-00010-of-00016.safetensors", "model.layers.22.self_attn.v_proj.weight": "model-00010-of-00016.safetensors", "model.layers.23.input_layernorm.weight": "model-00010-of-00016.safetensors", "model.layers.23.mlp.down_proj.weight": "model-00011-of-00016.safetensors", "model.layers.23.mlp.gate_proj.weight": "model-00011-of-00016.safetensors", "model.layers.23.mlp.up_proj.weight": "model-00011-of-00016.safetensors", "model.layers.23.post_attention_layernorm.weight": "model-00011-of-00016.safetensors", "model.layers.23.self_attn.k_proj.bias": "model-00011-of-00016.safetensors", "model.layers.23.self_attn.k_proj.weight": "model-00011-of-00016.safetensors", "model.layers.23.self_attn.o_proj.weight": "model-00011-of-00016.safetensors", "model.layers.23.self_attn.q_proj.bias": "model-00011-of-00016.safetensors", "model.layers.23.self_attn.q_proj.weight": "model-00011-of-00016.safetensors", "model.layers.23.self_attn.v_proj.bias": "model-00011-of-00016.safetensors", "model.layers.23.self_attn.v_proj.weight": "model-00011-of-00016.safetensors", "model.layers.24.input_layernorm.weight": "model-00011-of-00016.safetensors", "model.layers.24.mlp.down_proj.weight": "model-00011-of-00016.safetensors", "model.layers.24.mlp.gate_proj.weight": "model-00011-of-00016.safetensors", "model.layers.24.mlp.up_proj.weight": "model-00011-of-00016.safetensors", "model.layers.24.post_attention_layernorm.weight": "model-00011-of-00016.safetensors", "model.layers.24.self_attn.k_proj.bias": "model-00011-of-00016.safetensors", "model.layers.24.self_attn.k_proj.weight": "model-00011-of-00016.safetensors", "model.layers.24.self_attn.o_proj.weight": "model-00011-of-00016.safetensors", "model.layers.24.self_attn.q_proj.bias": "model-00011-of-00016.safetensors", "model.layers.24.self_attn.q_proj.weight": "model-00011-of-00016.safetensors", "model.layers.24.self_attn.v_proj.bias": "model-00011-of-00016.safetensors", "model.layers.24.self_attn.v_proj.weight": "model-00011-of-00016.safetensors", "model.layers.25.input_layernorm.weight": "model-00011-of-00016.safetensors", "model.layers.25.mlp.down_proj.weight": "model-00012-of-00016.safetensors", "model.layers.25.mlp.gate_proj.weight": "model-00012-of-00016.safetensors", "model.layers.25.mlp.up_proj.weight": "model-00012-of-00016.safetensors", "model.layers.25.post_attention_layernorm.weight": "model-00012-of-00016.safetensors", "model.layers.25.self_attn.k_proj.bias": "model-00012-of-00016.safetensors", "model.layers.25.self_attn.k_proj.weight": "model-00012-of-00016.safetensors", "model.layers.25.self_attn.o_proj.weight": "model-00012-of-00016.safetensors", "model.layers.25.self_attn.q_proj.bias": "model-00012-of-00016.safetensors", "model.layers.25.self_attn.q_proj.weight": "model-00012-of-00016.safetensors", "model.layers.25.self_attn.v_proj.bias": "model-00012-of-00016.safetensors", "model.layers.25.self_attn.v_proj.weight": "model-00012-of-00016.safetensors", "model.layers.26.input_layernorm.weight": "model-00012-of-00016.safetensors", "model.layers.26.mlp.down_proj.weight": "model-00012-of-00016.safetensors", "model.layers.26.mlp.gate_proj.weight": "model-00012-of-00016.safetensors", "model.layers.26.mlp.up_proj.weight": "model-00012-of-00016.safetensors", "model.layers.26.post_attention_layernorm.weight": "model-00012-of-00016.safetensors", "model.layers.26.self_attn.k_proj.bias": "model-00012-of-00016.safetensors", "model.layers.26.self_attn.k_proj.weight": "model-00012-of-00016.safetensors", "model.layers.26.self_attn.o_proj.weight": "model-00012-of-00016.safetensors", "model.layers.26.self_attn.q_proj.bias": "model-00012-of-00016.safetensors", "model.layers.26.self_attn.q_proj.weight": "model-00012-of-00016.safetensors", "model.layers.26.self_attn.v_proj.bias": "model-00012-of-00016.safetensors", "model.layers.26.self_attn.v_proj.weight": "model-00012-of-00016.safetensors", "model.layers.27.input_layernorm.weight": "model-00012-of-00016.safetensors", "model.layers.27.mlp.down_proj.weight": "model-00013-of-00016.safetensors", "model.layers.27.mlp.gate_proj.weight": "model-00013-of-00016.safetensors", "model.layers.27.mlp.up_proj.weight": "model-00013-of-00016.safetensors", "model.layers.27.post_attention_layernorm.weight": "model-00013-of-00016.safetensors", "model.layers.27.self_attn.k_proj.bias": "model-00013-of-00016.safetensors", "model.layers.27.self_attn.k_proj.weight": "model-00013-of-00016.safetensors", "model.layers.27.self_attn.o_proj.weight": "model-00013-of-00016.safetensors", "model.layers.27.self_attn.q_proj.bias": "model-00013-of-00016.safetensors", "model.layers.27.self_attn.q_proj.weight": "model-00013-of-00016.safetensors", "model.layers.27.self_attn.v_proj.bias": "model-00013-of-00016.safetensors", "model.layers.27.self_attn.v_proj.weight": "model-00013-of-00016.safetensors", "model.layers.3.input_layernorm.weight": "model-00013-of-00016.safetensors", "model.layers.3.mlp.down_proj.weight": "model-00013-of-00016.safetensors", "model.layers.3.mlp.gate_proj.weight": "model-00013-of-00016.safetensors", "model.layers.3.mlp.up_proj.weight": "model-00013-of-00016.safetensors", "model.layers.3.post_attention_layernorm.weight": "model-00013-of-00016.safetensors", "model.layers.3.self_attn.k_proj.bias": "model-00013-of-00016.safetensors", "model.layers.3.self_attn.k_proj.weight": "model-00013-of-00016.safetensors", "model.layers.3.self_attn.o_proj.weight": "model-00013-of-00016.safetensors", "model.layers.3.self_attn.q_proj.bias": "model-00013-of-00016.safetensors", "model.layers.3.self_attn.q_proj.weight": "model-00013-of-00016.safetensors", "model.layers.3.self_attn.v_proj.bias": "model-00013-of-00016.safetensors", "model.layers.3.self_attn.v_proj.weight": "model-00013-of-00016.safetensors", "model.layers.4.input_layernorm.weight": "model-00013-of-00016.safetensors", "model.layers.4.mlp.down_proj.weight": "model-00014-of-00016.safetensors", "model.layers.4.mlp.gate_proj.weight": "model-00014-of-00016.safetensors", "model.layers.4.mlp.up_proj.weight": "model-00014-of-00016.safetensors", "model.layers.4.post_attention_layernorm.weight": "model-00014-of-00016.safetensors", "model.layers.4.self_attn.k_proj.bias": "model-00014-of-00016.safetensors", "model.layers.4.self_attn.k_proj.weight": "model-00014-of-00016.safetensors", "model.layers.4.self_attn.o_proj.weight": "model-00014-of-00016.safetensors", "model.layers.4.self_attn.q_proj.bias": "model-00014-of-00016.safetensors", "model.layers.4.self_attn.q_proj.weight": "model-00014-of-00016.safetensors", "model.layers.4.self_attn.v_proj.bias": "model-00014-of-00016.safetensors", "model.layers.4.self_attn.v_proj.weight": "model-00014-of-00016.safetensors", "model.layers.5.input_layernorm.weight": "model-00014-of-00016.safetensors", "model.layers.5.mlp.down_proj.weight": "model-00014-of-00016.safetensors", "model.layers.5.mlp.gate_proj.weight": "model-00014-of-00016.safetensors", "model.layers.5.mlp.up_proj.weight": "model-00014-of-00016.safetensors", "model.layers.5.post_attention_layernorm.weight": "model-00014-of-00016.safetensors", "model.layers.5.self_attn.k_proj.bias": "model-00014-of-00016.safetensors", "model.layers.5.self_attn.k_proj.weight": "model-00014-of-00016.safetensors", "model.layers.5.self_attn.o_proj.weight": "model-00014-of-00016.safetensors", "model.layers.5.self_attn.q_proj.bias": "model-00014-of-00016.safetensors", "model.layers.5.self_attn.q_proj.weight": "model-00014-of-00016.safetensors", "model.layers.5.self_attn.v_proj.bias": "model-00014-of-00016.safetensors", "model.layers.5.self_attn.v_proj.weight": "model-00014-of-00016.safetensors", "model.layers.6.input_layernorm.weight": "model-00014-of-00016.safetensors", "model.layers.6.mlp.down_proj.weight": "model-00015-of-00016.safetensors", "model.layers.6.mlp.gate_proj.weight": "model-00015-of-00016.safetensors", "model.layers.6.mlp.up_proj.weight": "model-00015-of-00016.safetensors", "model.layers.6.post_attention_layernorm.weight": "model-00015-of-00016.safetensors", "model.layers.6.self_attn.k_proj.bias": "model-00015-of-00016.safetensors", "model.layers.6.self_attn.k_proj.weight": "model-00015-of-00016.safetensors", "model.layers.6.self_attn.o_proj.weight": "model-00015-of-00016.safetensors", "model.layers.6.self_attn.q_proj.bias": "model-00015-of-00016.safetensors", "model.layers.6.self_attn.q_proj.weight": "model-00015-of-00016.safetensors", "model.layers.6.self_attn.v_proj.bias": "model-00015-of-00016.safetensors", "model.layers.6.self_attn.v_proj.weight": "model-00015-of-00016.safetensors", "model.layers.7.input_layernorm.weight": "model-00015-of-00016.safetensors", "model.layers.7.mlp.down_proj.weight": "model-00015-of-00016.safetensors", "model.layers.7.mlp.gate_proj.weight": "model-00015-of-00016.safetensors", "model.layers.7.mlp.up_proj.weight": "model-00015-of-00016.safetensors", "model.layers.7.post_attention_layernorm.weight": "model-00015-of-00016.safetensors", "model.layers.7.self_attn.k_proj.bias": "model-00015-of-00016.safetensors", "model.layers.7.self_attn.k_proj.weight": "model-00015-of-00016.safetensors", "model.layers.7.self_attn.o_proj.weight": "model-00015-of-00016.safetensors", "model.layers.7.self_attn.q_proj.bias": "model-00015-of-00016.safetensors", "model.layers.7.self_attn.q_proj.weight": "model-00015-of-00016.safetensors", "model.layers.7.self_attn.v_proj.bias": "model-00015-of-00016.safetensors", "model.layers.7.self_attn.v_proj.weight": "model-00015-of-00016.safetensors", "model.layers.8.input_layernorm.weight": "model-00015-of-00016.safetensors", "model.layers.8.mlp.down_proj.weight": "model-00016-of-00016.safetensors", "model.layers.8.mlp.gate_proj.weight": "model-00016-of-00016.safetensors", "model.layers.8.mlp.up_proj.weight": "model-00016-of-00016.safetensors", "model.layers.8.post_attention_layernorm.weight": "model-00016-of-00016.safetensors", "model.layers.8.self_attn.k_proj.bias": "model-00016-of-00016.safetensors", "model.layers.8.self_attn.k_proj.weight": "model-00016-of-00016.safetensors", "model.layers.8.self_attn.o_proj.weight": "model-00016-of-00016.safetensors", "model.layers.8.self_attn.q_proj.bias": "model-00016-of-00016.safetensors", "model.layers.8.self_attn.q_proj.weight": "model-00016-of-00016.safetensors", "model.layers.8.self_attn.v_proj.bias": "model-00016-of-00016.safetensors", "model.layers.8.self_attn.v_proj.weight": "model-00016-of-00016.safetensors", "model.layers.9.input_layernorm.weight": "model-00016-of-00016.safetensors", "model.layers.9.mlp.down_proj.weight": "model-00016-of-00016.safetensors", "model.layers.9.mlp.gate_proj.weight": "model-00016-of-00016.safetensors", "model.layers.9.mlp.up_proj.weight": "model-00016-of-00016.safetensors", "model.layers.9.post_attention_layernorm.weight": "model-00016-of-00016.safetensors", "model.layers.9.self_attn.k_proj.bias": "model-00016-of-00016.safetensors", "model.layers.9.self_attn.k_proj.weight": "model-00016-of-00016.safetensors", "model.layers.9.self_attn.o_proj.weight": "model-00016-of-00016.safetensors", "model.layers.9.self_attn.q_proj.bias": "model-00016-of-00016.safetensors", "model.layers.9.self_attn.q_proj.weight": "model-00016-of-00016.safetensors", "model.layers.9.self_attn.v_proj.bias": "model-00016-of-00016.safetensors", "model.layers.9.self_attn.v_proj.weight": "model-00016-of-00016.safetensors", "model.norm.weight": "model-00016-of-00016.safetensors"}}

tokenizer.json ADDED Viewed

The diff for this file is too large to render. See raw diff

tokenizer_config.json ADDED Viewed

	@@ -0,0 +1,40 @@

+{
+  "add_prefix_space": false,
+  "added_tokens_decoder": {
+    "151643": {
+      "content": "<|endoftext|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151644": {
+      "content": "<|im_start|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151645": {
+      "content": "<|im_end|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    }
+  },
+  "additional_special_tokens": ["<|im_start|>", "<|im_end|>"],
+  "bos_token": null,
+  "chat_template": "{% for message in messages %}{% if loop.first and messages[0]['role'] != 'system' %}{{ '<|im_start|>system\nYou are a helpful assistant<|im_end|>\n' }}{% endif %}{{'<|im_start|>' + message['role'] + '\n' + message['content'] + '<|im_end|>' + '\n'}}{% endfor %}{% if add_generation_prompt %}{{ '<|im_start|>assistant\n' }}{% endif %}",
+  "clean_up_tokenization_spaces": false,
+  "eos_token": "<|endoftext|>",
+  "errors": "replace",
+  "model_max_length": 32768,
+  "pad_token": "<|endoftext|>",
+  "split_special_tokens": false,
+  "tokenizer_class": "Qwen2Tokenizer",
+  "unk_token": null
+}