refactor(utils): 重构数据处理脚本

This commit is contained in:
2025-07-15 13:10:38 +08:00
parent e6f5b26a75
commit e77fb56c45
5 changed files with 20 additions and 21 deletions
+3 -1
View File
@@ -1,7 +1,9 @@
from datasets import load_dataset
from utils import process_dataset from utils import process_dataset
if __name__ == "__main__": if __name__ == "__main__":
dataset = load_dataset("shjwudp/chinese-c4")
process_dataset( process_dataset(
dataset_name="shjwudp/chinese-c4", dataset_dict=dataset,
output_subdir="chinese-c4" output_subdir="chinese-c4"
) )
+7 -3
View File
@@ -1,14 +1,18 @@
from datasets import load_dataset
from utils import process_dataset from utils import process_dataset
if __name__ == "__main__": if __name__ == "__main__":
max_chunk_num = 10 max_chunk_num = 10
chunk_size = 1000000 chunk_size = 1000000
item_size = max_chunk_num * chunk_size
dataset = load_dataset(
"opencsg/chinese-cosmopedia",
data_files=[f"0000{i}.parquet" for i in range(5)]
)
process_dataset( process_dataset(
dataset_name="opencsg/chinese-cosmopedia", dataset_dict=dataset,
output_subdir="chinese-wiki", output_subdir="chinese-wiki",
data_files=[f"0000{i}.parquet" for i in range(5)],
max_chunk_num=max_chunk_num, max_chunk_num=max_chunk_num,
chunk_size=chunk_size, chunk_size=chunk_size,
) )
+3 -2
View File
@@ -1,8 +1,9 @@
from datasets import load_dataset
from utils import process_dataset from utils import process_dataset
if __name__ == "__main__": if __name__ == "__main__":
dataset = load_dataset("HuggingFaceFW/fineweb", "sample-10BT")
process_dataset( process_dataset(
dataset_name="HuggingFaceFW/fineweb", dataset_dict=dataset,
output_subdir="english-fineweb", output_subdir="english-fineweb",
dataset_config="sample-10BT",
) )
+3 -1
View File
@@ -1,8 +1,10 @@
from datasets import load_dataset
from utils import process_dataset from utils import process_dataset
if __name__ == "__main__": if __name__ == "__main__":
dataset = load_dataset("Blaze7451/enwiki_structured_content")
process_dataset( process_dataset(
dataset_name="Blaze7451/enwiki_structured_content", dataset_dict=dataset,
output_subdir="english-wiki", output_subdir="english-wiki",
max_chunk_size=5, max_chunk_size=5,
) )
+4 -14
View File
@@ -1,5 +1,5 @@
from typing import List, Callable from typing import List, Callable
from datasets import load_dataset from datasets import DatasetDict
from tokenizer import BpeTokenizer from tokenizer import BpeTokenizer
from tqdm import tqdm from tqdm import tqdm
from torch import Tensor from torch import Tensor
@@ -58,25 +58,15 @@ def dump_pkl_files(
pkl.dump(tensor, f) pkl.dump(tensor, f)
def process_dataset( def process_dataset(
dataset_name: str, dataset_dict: DatasetDict,
output_subdir: str, output_subdir: str,
dataset_config: str = None,
max_chunk_num: int = None, max_chunk_num: int = None,
split: str = None, chunk_size: int = 1000000,
data_files: List[str] = None,
split_name: str = "train", split_name: str = "train",
column_name: str = "text", column_name: str = "text",
chunk_size: int = 1000000, normalization_func=comprehensive_normalization,
normalization_func=comprehensive_normalization
): ):
dataset_dict = load_dataset(
path=dataset_name,
name=dataset_config,
split=split,
data_files=data_files
)
train_dataset = dataset_dict[split_name] train_dataset = dataset_dict[split_name]
total_samples = len(train_dataset) total_samples = len(train_dataset)
num_chunks = (total_samples // chunk_size) + 1 num_chunks = (total_samples // chunk_size) + 1