This website requires JavaScript.
Explore
Help
Register
Sign In
ViperEkura
/
DataPipeline
Watch
1
Star
0
Fork
0
Code
Issues
Pull Requests
Packages
Projects
Releases
Wiki
Activity
49
Commits
1
Branch
0
Tags
1322945b0af373cf5acf6db1e1599e8bd6cc3deb
T
Code
Clone
HTTPS
Tea CLI
Open with VS Code
Open with VSCodium
Open with Intellij IDEA
Download ZIP
Download TAR.GZ
Download BUNDLE
ViperEkura
1322945b0a
refactor(run): 重构脚本执行方式并优化项目结构
2025-08-01 20:55:31 +08:00
pre_train
refactor(run): 重构脚本执行方式并优化项目结构
2025-08-01 20:55:31 +08:00
supervised_finetuning
refactor(run): 重构脚本执行方式并优化项目结构
2025-08-01 20:55:31 +08:00
.gitignore
feat: 添加中文维基数据集处理脚本
2025-07-11 10:31:10 +08:00
dump_pt_file.py
refactor(dump_pt_file): 重构数据处理流程并优化代码结构
2025-07-21 20:27:07 +08:00
dump_sft_file.py
feat(dump_sft_file): 更新数据集处理逻辑
2025-08-01 16:59:47 +08:00
README.md
docs: 添加 README 文件
2025-07-21 19:19:45 +08:00
run.py
refactor(run): 重构脚本执行方式并优化项目结构
2025-08-01 20:55:31 +08:00
tokenizer.py
refactor(dataset): 重构数据处理脚本并支持自定义数据集
2025-07-15 12:18:58 +08:00
utils.py
feat(project_structure): 重构项目目录并添加运行脚本
2025-08-01 17:41:49 +08:00
README.md
KHAOSZ-dataset
用于训练的KHAOSZ数据集
Reference in New Issue
View Git Blame
Copy Permalink
S
Description
No description provided
Readme
254
KiB
Languages
Python
100%