refactor: 重构数据管道模块

This commit is contained in:
2026-03-20 21:36:37 +08:00
parent 7045de9c32
commit 3fb2326115
20 changed files with 739 additions and 345 deletions
+4 -2
View File
@@ -1,9 +1,11 @@
from datasets import load_dataset
from modules.utils import process_dataset
from modules.datapipeline import DataPipeline
if __name__ == "__main__":
dataset = load_dataset("shjwudp/chinese-c4")
process_dataset(
pipeline = DataPipeline()
pipeline.process_dataset(
dataset_dict=dataset,
output_subdir="chinese-c4-pretrain"
)
+3 -2
View File
@@ -1,5 +1,5 @@
from datasets import load_dataset
from modules.utils import process_dataset
from modules.datapipeline import DataPipeline
if __name__ == "__main__":
chunk_size = 1000000
@@ -9,7 +9,8 @@ if __name__ == "__main__":
data_files={"train": [f"data/000{i:02d}.parquet" for i in range(25)]}
)
process_dataset(
pipeline = DataPipeline()
pipeline.process_dataset(
dataset_dict=dataset,
output_subdir="chinese-wiki-pretrain",
chunk_size=chunk_size,
+4 -2
View File
@@ -1,9 +1,11 @@
from datasets import load_dataset
from modules.utils import process_dataset
from modules.datapipeline import DataPipeline
if __name__ == "__main__":
dataset = load_dataset("HuggingFaceFW/fineweb", "sample-10BT")
process_dataset(
pipeline = DataPipeline()
pipeline.process_dataset(
dataset_dict=dataset,
output_subdir="english-fineweb-pretrain",
)
+5 -3
View File
@@ -1,10 +1,12 @@
from datasets import load_dataset
from modules.utils import process_dataset
from modules.datapipeline import DataPipeline
if __name__ == "__main__":
dataset = load_dataset("Blaze7451/enwiki_structured_content")
process_dataset(
pipeline = DataPipeline()
pipeline.process_dataset(
dataset_dict=dataset,
output_subdir="english-wiki-pretrain",
max_chunk_size=5,
max_chunk_num=5,
)