refactor(dataset): 重构数据处理脚本并支持自定义数据集
This commit is contained in:
+2
-2
@@ -93,8 +93,8 @@ class BpeTokenizer:
|
||||
else:
|
||||
return [encoding.tokens for encoding in encodings]
|
||||
|
||||
def decode(self, tokens: List[int]) -> str:
|
||||
return self._tokenizer.decode(tokens)
|
||||
def decode(self, tokens: List[int], skip_special_tokens=True) -> str:
|
||||
return self._tokenizer.decode(tokens, skip_special_tokens=skip_special_tokens)
|
||||
|
||||
def __len__(self) -> int:
|
||||
return self._tokenizer.get_vocab_size()
|
||||
|
||||
Reference in New Issue
Block a user