refactor(project): 将 utils 和 tokenizer 模块移至 modules 目录

This commit is contained in:
2025-08-01 20:59:17 +08:00
parent 1322945b0a
commit 092921f401
12 changed files with 12 additions and 12 deletions
+2 -2
View File
@@ -1,5 +1,5 @@
from utils import dump_pkl_files, fetch_files from modules.utils import dump_pkl_files, fetch_files
from tokenizer import BpeTokenizer from modules.tokenizer import BpeTokenizer
import torch import torch
import os import os
+2 -2
View File
@@ -1,5 +1,5 @@
from utils import dump_pkl_files, fetch_files from modules.utils import dump_pkl_files, fetch_files
from tokenizer import BpeTokenizer from modules.tokenizer import BpeTokenizer
import torch import torch
import os import os
View File
+1 -1
View File
@@ -1,5 +1,5 @@
from datasets import load_dataset from datasets import load_dataset
from utils import process_dataset from modules.utils import process_dataset
if __name__ == "__main__": if __name__ == "__main__":
dataset = load_dataset("shjwudp/chinese-c4") dataset = load_dataset("shjwudp/chinese-c4")
+1 -1
View File
@@ -1,5 +1,5 @@
from datasets import load_dataset from datasets import load_dataset
from utils import process_dataset from modules.utils import process_dataset
if __name__ == "__main__": if __name__ == "__main__":
max_chunk_num = 10 max_chunk_num = 10
+1 -1
View File
@@ -1,5 +1,5 @@
from datasets import load_dataset from datasets import load_dataset
from utils import process_dataset from modules.utils import process_dataset
if __name__ == "__main__": if __name__ == "__main__":
dataset = load_dataset("HuggingFaceFW/fineweb", "sample-10BT") dataset = load_dataset("HuggingFaceFW/fineweb", "sample-10BT")
+1 -1
View File
@@ -1,5 +1,5 @@
from datasets import load_dataset from datasets import load_dataset
from utils import process_dataset from modules.utils import process_dataset
if __name__ == "__main__": if __name__ == "__main__":
dataset = load_dataset("Blaze7451/enwiki_structured_content") dataset = load_dataset("Blaze7451/enwiki_structured_content")
+1 -1
View File
@@ -1,5 +1,5 @@
from datasets import load_dataset from datasets import load_dataset
from utils import process_dataset from modules.utils import process_dataset
@@ -1,6 +1,6 @@
from datasets import DatasetDict from datasets import DatasetDict
from datasets import load_dataset, concatenate_datasets from datasets import load_dataset, concatenate_datasets
from utils import process_dataset from modules.utils import process_dataset
def replace_seg(query:str, response:str) -> str: def replace_seg(query:str, response:str) -> str:
+1 -1
View File
@@ -1,6 +1,6 @@
# inclusionAI/Ling-Coder-SFT # inclusionAI/Ling-Coder-SFT
from datasets import load_dataset from datasets import load_dataset
from utils import process_dataset from modules.utils import process_dataset
def process_func(input_dict: dict) -> dict: def process_func(input_dict: dict) -> dict:
+1 -1
View File
@@ -1,6 +1,6 @@
# HuggingFaceTB/Magpie-Pro-300K-Filtered-H4 # HuggingFaceTB/Magpie-Pro-300K-Filtered-H4
from datasets import load_dataset from datasets import load_dataset
from utils import process_dataset from modules.utils import process_dataset
def process_func(input_dict: dict): def process_func(input_dict: dict):