internlm
/

internlm-chat-20b

Text Generation

feature-extraction

Model card Files Files and versions

x54-729 commited on Oct 9, 2023

Commit

5f04618

·

1 Parent(s): bb65b6c

Fix InternLMTokenizer

Files changed (1) hide show

tokenization_internlm.py +8 -8

tokenization_internlm.py CHANGED Viewed

@@ -65,6 +65,13 @@ class InternLMTokenizer(PreTrainedTokenizer):
         **kwargs,
     ):
         self.sp_model_kwargs = {} if sp_model_kwargs is None else sp_model_kwargs
         super().__init__(
             bos_token=bos_token,
             eos_token=eos_token,
@@ -73,15 +80,8 @@ class InternLMTokenizer(PreTrainedTokenizer):
             clean_up_tokenization_spaces=clean_up_tokenization_spaces,
             **kwargs,
         )
-        self.vocab_file = vocab_file
-        self.add_bos_token = add_bos_token
-        self.add_eos_token = add_eos_token
-        self.decode_with_prefix_space = decode_with_prefix_space
-        self.sp_model = spm.SentencePieceProcessor(**self.sp_model_kwargs)
-        self.sp_model.Load(vocab_file)
-        self._no_prefix_space_tokens = None
-        """ Initialisation"""
     @property
     def no_prefix_space_tokens(self):

         **kwargs,
     ):
         self.sp_model_kwargs = {} if sp_model_kwargs is None else sp_model_kwargs
+        self.vocab_file = vocab_file
+        self.add_bos_token = add_bos_token
+        self.add_eos_token = add_eos_token
+        self.decode_with_prefix_space = decode_with_prefix_space
+        self.sp_model = spm.SentencePieceProcessor(**self.sp_model_kwargs)
+        self.sp_model.Load(vocab_file)
+        self._no_prefix_space_tokens = None
         super().__init__(
             bos_token=bos_token,
             eos_token=eos_token,
             clean_up_tokenization_spaces=clean_up_tokenization_spaces,
             **kwargs,
         )
+        """ Initialization"""
     @property
     def no_prefix_space_tokens(self):