chore: 优化未使用的模块
This commit is contained in:
@@ -238,42 +238,3 @@ class AutoTokenizer:
|
||||
return self.encode(rendered)
|
||||
|
||||
return rendered
|
||||
|
||||
|
||||
class BpeTokenizer(AutoTokenizer):
|
||||
"""BPE tokenizer implementation."""
|
||||
|
||||
def __init__(
|
||||
self,
|
||||
special_token_map: Dict[str, str] = None,
|
||||
path: Optional[str] = None,
|
||||
chat_template: Optional[str] = None,
|
||||
):
|
||||
special_token_map = special_token_map or {
|
||||
"bos": "<|begin▁of▁sentence|>",
|
||||
"eos": "<|end▁of▁sentence|>",
|
||||
"pad": "<|▁pad▁|>",
|
||||
"im_start": "<|im▁start|>",
|
||||
"im_end": "<|im▁end|>",
|
||||
}
|
||||
self._tokenizer = None
|
||||
self._init_tokenizer()
|
||||
super().__init__(
|
||||
path, special_token_map=special_token_map, chat_template=chat_template
|
||||
)
|
||||
|
||||
def _init_tokenizer(self):
|
||||
"""Initialize a new BPE tokenizer with default settings."""
|
||||
model = BPE()
|
||||
self._tokenizer = Tokenizer(model)
|
||||
self._tokenizer.normalizer = normalizers.Sequence(
|
||||
[normalizers.NFC(), normalizers.Strip()]
|
||||
)
|
||||
self._tokenizer.pre_tokenizer = pre_tokenizers.Sequence(
|
||||
[
|
||||
pre_tokenizers.UnicodeScripts(),
|
||||
pre_tokenizers.ByteLevel(add_prefix_space=False, use_regex=True),
|
||||
]
|
||||
)
|
||||
self._tokenizer.decoder = decoders.ByteLevel()
|
||||
self._tokenizer.post_processor = processors.ByteLevel(trim_offsets=True)
|
||||
|
||||
Reference in New Issue
Block a user