This website requires JavaScript.
Explore
Help
Register
Sign In
ViperEkura
/
DataPipeline
Watch
1
Star
0
Fork
0
Code
Issues
Pull Requests
Packages
Projects
Releases
Wiki
Activity
48
Commits
1
Branch
0
Tags
2d1c4e9d6cf8e4904166f1ce27178042a27abef3
T
Code
Clone
HTTPS
Tea CLI
Open with VS Code
Open with VSCodium
Open with Intellij IDEA
Download ZIP
Download TAR.GZ
Download BUNDLE
ViperEkura
2d1c4e9d6c
feat(project_structure): 重构项目目录并添加运行脚本
2025-08-01 17:41:49 +08:00
pre_train
feat(project_structure): 重构项目目录并添加运行脚本
2025-08-01 17:41:49 +08:00
supervised_finetuning
feat(project_structure): 重构项目目录并添加运行脚本
2025-08-01 17:41:49 +08:00
.gitignore
feat: 添加中文维基数据集处理脚本
2025-07-11 10:31:10 +08:00
dump_pt_file.py
refactor(dump_pt_file): 重构数据处理流程并优化代码结构
2025-07-21 20:27:07 +08:00
dump_sft_file.py
feat(dump_sft_file): 更新数据集处理逻辑
2025-08-01 16:59:47 +08:00
README.md
docs: 添加 README 文件
2025-07-21 19:19:45 +08:00
run.py
feat(project_structure): 重构项目目录并添加运行脚本
2025-08-01 17:41:49 +08:00
tokenizer.py
refactor(dataset): 重构数据处理脚本并支持自定义数据集
2025-07-15 12:18:58 +08:00
utils.py
feat(project_structure): 重构项目目录并添加运行脚本
2025-08-01 17:41:49 +08:00
README.md
KHAOSZ-dataset
用于训练的KHAOSZ数据集
Reference in New Issue
View Git Blame
Copy Permalink
S
Description
No description provided
Readme
254
KiB
Languages
Python
100%