refactor(project): 将 utils 和 tokenizer 模块移至 modules 目录
This commit is contained in:
+2
-2
@@ -1,5 +1,5 @@
|
||||
from utils import dump_pkl_files, fetch_files
|
||||
from tokenizer import BpeTokenizer
|
||||
from modules.utils import dump_pkl_files, fetch_files
|
||||
from modules.tokenizer import BpeTokenizer
|
||||
import torch
|
||||
import os
|
||||
|
||||
|
||||
+2
-2
@@ -1,5 +1,5 @@
|
||||
from utils import dump_pkl_files, fetch_files
|
||||
from tokenizer import BpeTokenizer
|
||||
from modules.utils import dump_pkl_files, fetch_files
|
||||
from modules.tokenizer import BpeTokenizer
|
||||
import torch
|
||||
import os
|
||||
|
||||
|
||||
@@ -1,5 +1,5 @@
|
||||
from datasets import load_dataset
|
||||
from utils import process_dataset
|
||||
from modules.utils import process_dataset
|
||||
|
||||
if __name__ == "__main__":
|
||||
dataset = load_dataset("shjwudp/chinese-c4")
|
||||
|
||||
@@ -1,5 +1,5 @@
|
||||
from datasets import load_dataset
|
||||
from utils import process_dataset
|
||||
from modules.utils import process_dataset
|
||||
|
||||
if __name__ == "__main__":
|
||||
max_chunk_num = 10
|
||||
|
||||
@@ -1,5 +1,5 @@
|
||||
from datasets import load_dataset
|
||||
from utils import process_dataset
|
||||
from modules.utils import process_dataset
|
||||
|
||||
if __name__ == "__main__":
|
||||
dataset = load_dataset("HuggingFaceFW/fineweb", "sample-10BT")
|
||||
|
||||
@@ -1,5 +1,5 @@
|
||||
from datasets import load_dataset
|
||||
from utils import process_dataset
|
||||
from modules.utils import process_dataset
|
||||
|
||||
if __name__ == "__main__":
|
||||
dataset = load_dataset("Blaze7451/enwiki_structured_content")
|
||||
|
||||
@@ -1,5 +1,5 @@
|
||||
from datasets import load_dataset
|
||||
from utils import process_dataset
|
||||
from modules.utils import process_dataset
|
||||
|
||||
|
||||
|
||||
|
||||
@@ -1,6 +1,6 @@
|
||||
from datasets import DatasetDict
|
||||
from datasets import load_dataset, concatenate_datasets
|
||||
from utils import process_dataset
|
||||
from modules.utils import process_dataset
|
||||
|
||||
|
||||
def replace_seg(query:str, response:str) -> str:
|
||||
|
||||
@@ -1,6 +1,6 @@
|
||||
# inclusionAI/Ling-Coder-SFT
|
||||
from datasets import load_dataset
|
||||
from utils import process_dataset
|
||||
from modules.utils import process_dataset
|
||||
|
||||
|
||||
def process_func(input_dict: dict) -> dict:
|
||||
|
||||
@@ -1,6 +1,6 @@
|
||||
# HuggingFaceTB/Magpie-Pro-300K-Filtered-H4
|
||||
from datasets import load_dataset
|
||||
from utils import process_dataset
|
||||
from modules.utils import process_dataset
|
||||
|
||||
|
||||
def process_func(input_dict: dict):
|
||||
|
||||
Reference in New Issue
Block a user