Add max_chunks=18 to dolma-30b export, remove max_chunks=5 from english-wiki, rename project to datapipline
This commit is contained in:
+1
-1
@@ -3,7 +3,7 @@ requires = ["setuptools>=64", "wheel"]
|
|||||||
build-backend = "setuptools.build_meta"
|
build-backend = "setuptools.build_meta"
|
||||||
|
|
||||||
[project]
|
[project]
|
||||||
name = "khaosz_dataset"
|
name = "datapipline"
|
||||||
version = "0.1.0"
|
version = "0.1.0"
|
||||||
description = "A dataset processing toolkit for language model training"
|
description = "A dataset processing toolkit for language model training"
|
||||||
readme = "README.md"
|
readme = "README.md"
|
||||||
|
|||||||
@@ -0,0 +1,11 @@
|
|||||||
|
from datasets import load_dataset
|
||||||
|
from pipeline import export_dataset
|
||||||
|
|
||||||
|
if __name__ == "__main__":
|
||||||
|
dataset = load_dataset("emozilla/dolma-v1_7-30B")
|
||||||
|
export_dataset(
|
||||||
|
dataset=dataset["train"],
|
||||||
|
output_dir="./dataset",
|
||||||
|
output_prefix="english-dolma-30b-pretrain",
|
||||||
|
max_chunks=18,
|
||||||
|
)
|
||||||
@@ -7,5 +7,4 @@ if __name__ == "__main__":
|
|||||||
dataset=dataset["train"],
|
dataset=dataset["train"],
|
||||||
output_dir="./dataset",
|
output_dir="./dataset",
|
||||||
output_prefix="english-wiki-pretrain",
|
output_prefix="english-wiki-pretrain",
|
||||||
max_chunks=5,
|
|
||||||
)
|
)
|
||||||
|
|||||||
Reference in New Issue
Block a user