refactor(project): 将 utils 和 tokenizer 模块移至 modules 目录

This commit is contained in:
2025-08-01 20:59:17 +08:00
parent 1322945b0a
commit 092921f401
12 changed files with 12 additions and 12 deletions
+2 -2
View File
@@ -1,5 +1,5 @@
from utils import dump_pkl_files, fetch_files
from tokenizer import BpeTokenizer
from modules.utils import dump_pkl_files, fetch_files
from modules.tokenizer import BpeTokenizer
import torch
import os
+2 -2
View File
@@ -1,5 +1,5 @@
from utils import dump_pkl_files, fetch_files
from tokenizer import BpeTokenizer
from modules.utils import dump_pkl_files, fetch_files
from modules.tokenizer import BpeTokenizer
import torch
import os
View File
+1 -1
View File
@@ -1,5 +1,5 @@
from datasets import load_dataset
from utils import process_dataset
from modules.utils import process_dataset
if __name__ == "__main__":
dataset = load_dataset("shjwudp/chinese-c4")
+1 -1
View File
@@ -1,5 +1,5 @@
from datasets import load_dataset
from utils import process_dataset
from modules.utils import process_dataset
if __name__ == "__main__":
max_chunk_num = 10
+1 -1
View File
@@ -1,5 +1,5 @@
from datasets import load_dataset
from utils import process_dataset
from modules.utils import process_dataset
if __name__ == "__main__":
dataset = load_dataset("HuggingFaceFW/fineweb", "sample-10BT")
+1 -1
View File
@@ -1,5 +1,5 @@
from datasets import load_dataset
from utils import process_dataset
from modules.utils import process_dataset
if __name__ == "__main__":
dataset = load_dataset("Blaze7451/enwiki_structured_content")
+1 -1
View File
@@ -1,5 +1,5 @@
from datasets import load_dataset
from utils import process_dataset
from modules.utils import process_dataset
@@ -1,6 +1,6 @@
from datasets import DatasetDict
from datasets import load_dataset, concatenate_datasets
from utils import process_dataset
from modules.utils import process_dataset
def replace_seg(query:str, response:str) -> str:
+1 -1
View File
@@ -1,6 +1,6 @@
# inclusionAI/Ling-Coder-SFT
from datasets import load_dataset
from utils import process_dataset
from modules.utils import process_dataset
def process_func(input_dict: dict) -> dict:
+1 -1
View File
@@ -1,6 +1,6 @@
# HuggingFaceTB/Magpie-Pro-300K-Filtered-H4
from datasets import load_dataset
from utils import process_dataset
from modules.utils import process_dataset
def process_func(input_dict: dict):