refactor(dataset): 更新数据集加载路径和处理代码
This commit is contained in:
@@ -7,7 +7,7 @@ if __name__ == "__main__":
|
|||||||
|
|
||||||
dataset = load_dataset(
|
dataset = load_dataset(
|
||||||
"opencsg/chinese-cosmopedia",
|
"opencsg/chinese-cosmopedia",
|
||||||
data_files=[f"0000{i}.parquet" for i in range(5)]
|
data_files={"train": [f"data/0000{i}.parquet" for i in range(5)]}
|
||||||
)
|
)
|
||||||
|
|
||||||
process_dataset(
|
process_dataset(
|
||||||
|
|||||||
@@ -66,7 +66,6 @@ def process_dataset(
|
|||||||
column_name: str = "text",
|
column_name: str = "text",
|
||||||
normalization_func=comprehensive_normalization,
|
normalization_func=comprehensive_normalization,
|
||||||
):
|
):
|
||||||
|
|
||||||
train_dataset = dataset_dict[split_name]
|
train_dataset = dataset_dict[split_name]
|
||||||
total_samples = len(train_dataset)
|
total_samples = len(train_dataset)
|
||||||
num_chunks = (total_samples // chunk_size) + 1
|
num_chunks = (total_samples // chunk_size) + 1
|
||||||
|
|||||||
Reference in New Issue
Block a user