Files
DataPipeline/pre_train/chinese-c4.py
T

9 lines
253 B
Python

from datasets import load_dataset
from modules.utils import process_dataset
if __name__ == "__main__":
dataset = load_dataset("shjwudp/chinese-c4")
process_dataset(
dataset_dict=dataset,
output_subdir="chinese-c4-pretrain"
)