docs: sync architecture/dataflow/training/params with code

- dataflow.md: update DatasetFactory.load signature, stream vs record access, Store._offsets
- architecture.md: add tokenizer to Pipeline, TokenizeTransform class, RecordDataset, Streamable/Recordable mixins, fix GRPOStrategy (old_model/sync_old_model)
- training.md: DPO reduction="sum", GRPO rho_t uses pi_old, gradient_clipping always registered
- params.md: --max_grad_norm default None
This commit is contained in:
2026-07-19 12:33:35 +08:00
parent 31c22dc043
commit d655b65027
4 changed files with 112 additions and 40 deletions
+2 -2
View File
@@ -26,7 +26,7 @@
|-----------|-------------|---------|
| `--warmup_ratio` | Fraction of total steps used for LR warmup | 0.05 |
| `--max_lr` | Maximum learning rate (cosine decay after warmup) | 3e-4 |
| `--max_grad_norm` | Maximum gradient norm for clipping | 1.0 |
| `--max_grad_norm` | Maximum gradient norm for clipping (None disables) | None |
### Optimizer (MuonMix)
@@ -201,4 +201,4 @@ See [Preprocessing Guide](preprocessing.md) for config file format and examples.
---
> Document Update Time: 2026-07-09
> Document Update Time: 2026-07-19