refactor(project): 将 utils 和 tokenizer 模块移至 modules 目录
This commit is contained in:
+2
-2
@@ -1,5 +1,5 @@
|
|||||||
from utils import dump_pkl_files, fetch_files
|
from modules.utils import dump_pkl_files, fetch_files
|
||||||
from tokenizer import BpeTokenizer
|
from modules.tokenizer import BpeTokenizer
|
||||||
import torch
|
import torch
|
||||||
import os
|
import os
|
||||||
|
|
||||||
|
|||||||
+2
-2
@@ -1,5 +1,5 @@
|
|||||||
from utils import dump_pkl_files, fetch_files
|
from modules.utils import dump_pkl_files, fetch_files
|
||||||
from tokenizer import BpeTokenizer
|
from modules.tokenizer import BpeTokenizer
|
||||||
import torch
|
import torch
|
||||||
import os
|
import os
|
||||||
|
|
||||||
|
|||||||
@@ -1,5 +1,5 @@
|
|||||||
from datasets import load_dataset
|
from datasets import load_dataset
|
||||||
from utils import process_dataset
|
from modules.utils import process_dataset
|
||||||
|
|
||||||
if __name__ == "__main__":
|
if __name__ == "__main__":
|
||||||
dataset = load_dataset("shjwudp/chinese-c4")
|
dataset = load_dataset("shjwudp/chinese-c4")
|
||||||
|
|||||||
@@ -1,5 +1,5 @@
|
|||||||
from datasets import load_dataset
|
from datasets import load_dataset
|
||||||
from utils import process_dataset
|
from modules.utils import process_dataset
|
||||||
|
|
||||||
if __name__ == "__main__":
|
if __name__ == "__main__":
|
||||||
max_chunk_num = 10
|
max_chunk_num = 10
|
||||||
|
|||||||
@@ -1,5 +1,5 @@
|
|||||||
from datasets import load_dataset
|
from datasets import load_dataset
|
||||||
from utils import process_dataset
|
from modules.utils import process_dataset
|
||||||
|
|
||||||
if __name__ == "__main__":
|
if __name__ == "__main__":
|
||||||
dataset = load_dataset("HuggingFaceFW/fineweb", "sample-10BT")
|
dataset = load_dataset("HuggingFaceFW/fineweb", "sample-10BT")
|
||||||
|
|||||||
@@ -1,5 +1,5 @@
|
|||||||
from datasets import load_dataset
|
from datasets import load_dataset
|
||||||
from utils import process_dataset
|
from modules.utils import process_dataset
|
||||||
|
|
||||||
if __name__ == "__main__":
|
if __name__ == "__main__":
|
||||||
dataset = load_dataset("Blaze7451/enwiki_structured_content")
|
dataset = load_dataset("Blaze7451/enwiki_structured_content")
|
||||||
|
|||||||
@@ -1,5 +1,5 @@
|
|||||||
from datasets import load_dataset
|
from datasets import load_dataset
|
||||||
from utils import process_dataset
|
from modules.utils import process_dataset
|
||||||
|
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -1,6 +1,6 @@
|
|||||||
from datasets import DatasetDict
|
from datasets import DatasetDict
|
||||||
from datasets import load_dataset, concatenate_datasets
|
from datasets import load_dataset, concatenate_datasets
|
||||||
from utils import process_dataset
|
from modules.utils import process_dataset
|
||||||
|
|
||||||
|
|
||||||
def replace_seg(query:str, response:str) -> str:
|
def replace_seg(query:str, response:str) -> str:
|
||||||
|
|||||||
@@ -1,6 +1,6 @@
|
|||||||
# inclusionAI/Ling-Coder-SFT
|
# inclusionAI/Ling-Coder-SFT
|
||||||
from datasets import load_dataset
|
from datasets import load_dataset
|
||||||
from utils import process_dataset
|
from modules.utils import process_dataset
|
||||||
|
|
||||||
|
|
||||||
def process_func(input_dict: dict) -> dict:
|
def process_func(input_dict: dict) -> dict:
|
||||||
|
|||||||
@@ -1,6 +1,6 @@
|
|||||||
# HuggingFaceTB/Magpie-Pro-300K-Filtered-H4
|
# HuggingFaceTB/Magpie-Pro-300K-Filtered-H4
|
||||||
from datasets import load_dataset
|
from datasets import load_dataset
|
||||||
from utils import process_dataset
|
from modules.utils import process_dataset
|
||||||
|
|
||||||
|
|
||||||
def process_func(input_dict: dict):
|
def process_func(input_dict: dict):
|
||||||
|
|||||||
Reference in New Issue
Block a user