ViperEkura
|
33c8720d69
|
feat: 并行 batch tokenization + cache_jsonl 批处理支持
- pipeline/tokenize/tokenizer.py: encode() 全部走 encode_batch(支持单条/批量)
- pipeline/processors/base.py: BaseProcessor 新增 process_batch()
- pipeline/processors/pretrain.py: PreTrainProcessor 覆盖 process_batch() 批量编码
- pipeline/io/export.py: cache_jsonl 新增 batch_size 参数默认 1000, 批量处理
- scripts/cache_h5.py: 新增 --batch-size 参数, 默认 tokenizer 路径改为 ../AstrAI/params
|
2026-07-25 12:19:45 +08:00 |
|
ViperEkura
|
900cd91798
|
feat: MinHash+LSH 去重 + Strategy/Factory 存储后端
|
2026-07-04 14:47:38 +08:00 |
|
ViperEkura
|
06735b9cb3
|
fix: 修复 nl_id + BFD 按 group_size 分批打包(存盘不拆分文件)
|
2026-07-03 17:07:26 +08:00 |
|
ViperEkura
|
598e1ce4ae
|
refactor: 重构打包模块,新增 BFD/FFD/Greedy 三种 bin-packing 算法,默认 BFD
- 将 pipeline/packing.py 拆分为 packing/ 子包 (base/stream/binpack)
- 新增 BfdPacker(默认)/FfDPacker/GreedyPacker,移除 StreamingPacker
- 超长序列直接截断至 pack_size
- group_size 语义改为"每 N 个 chunk 合并为一块",默认 1000
- 新增 AutoTokenizer.token_to_id(),修复 ChatML 中 hacky 的 nl_id 获取
- pad_value 默认改为 2(pad_token_id),position_ids pad=0, loss_mask pad=False
- 新增 position_ids 打包后归零一致性测试
- scripts/cache_h5.py 新增 --pack-algo 参数
|
2026-07-03 16:17:27 +08:00 |
|
ViperEkura
|
aa2ea4f3a6
|
feat: SFT 增加 position_ids 边界处理
- SFTProcessor 输出 per-sample position_ids(torch.arange),每个样本从 0 开始
- position_ids 与 sequence/loss_mask 一同打包,边界处自然重置
- PT 路径不生成 position_ids
- 新增 TestPositionIds 测试及 SFTProcessor 相关测试
|
2026-06-04 14:19:32 +08:00 |
|
ViperEkura
|
e1125be3a7
|
fix: mask 全链路保持 bool dtype(创建→打包→HDF5落盘/读盘)
|
2026-05-15 17:23:51 +08:00 |
|
ViperEkura
|
625695fd71
|
fix: padding 默认值改为 0,避免 loss_mask 误计 padding 位置
|
2026-05-15 16:59:42 +08:00 |
|
ViperEkura
|
cb6bfcb976
|
refactor: 重构流水线架构,添加Pipeline抽象并拆分IOHandler
|
2026-04-23 19:45:57 +08:00 |
|