AstrAI

Commit Graph

Author	SHA1	Message	Date
ViperEkura	4145d35e3c	refactor: 检查点加载重构，路径替代对象传递 - model: nn.Module -> model_fn 工厂函数，spawn 边界只传字符串 - Trainer.train(resume_dir=path) — Checkpoint 不再通过 pickle 传递 - TrainContextBuilder.with_resume_dir(path) — 自动检测 meta.json 分流 resume/from-scratch - CheckpointCallback: 拆分 state_dict 收集（全 rank）与磁盘写入（rank-0），修复 FSDP 死锁 - serialization: load_torch 支持 broadcast，消除 _load_extra/_load_torch_broadcast - optimizer/scheduler 恢复逻辑内联到 build()，在 executor.prepare() 之后执行 - pyproject.toml: ruff exclude build/ 避免 CI 扫描构建产物	2026-05-27 20:15:29 +08:00
ViperEkura	34c6c45bd6	feat: 初步实现 MMLU 评测脚本 - 支持 few-shot (log-likelihood ranking) 与 zero-shot - 自动下载 Hendrycks MMLU 数据集 - --device / --dtype 可配置，默认 GPU bf16	2026-05-26 20:23:31 +08:00
ViperEkura	e9def84ce7	fix : perplexity.py left padding 导致 batch>1 时 PPL 计算错误	2026-05-26 19:59:57 +08:00
ViperEkura	836e02a166	docs: 同步 architecture/inference/training 文档至实际代码，CLI 补充 fsdp 选项 - 修正 ProtocolHandler 架构：concrete + ResponseBuilder(ABC) 策略模式 - 修正训练循环 scheduler.step() 在 sync_gradients 块内 - 修正组合/聚合关系：注入组件改为 o--，删除不持有引用的关联 - --parallel_mode CLI choices 加入 fsdp - nprocs > 1 且 parallel_mode=none 时 raise error	2026-05-26 19:37:00 +08:00
ViperEkura	b558e61f63	refactor: 简化 _disable_random_init，scheduler 移入同步块 - _disable_random_init: enable=False 提前返回，dict 推导替代空字典 - scheduler.step() 移入 sync_gradients 守卫内	2026-05-26 17:05:25 +08:00
ViperEkura	65ab69543b	refactor: 统一序列化层，消除分散的 I/O 路径 - Checkpoint 改为 @dataclass，内聚 save/load 方法 - 提取 save_safetensors/load_safetensors/save_json/load_json 共享工具 - 新增 save_model/load_model_config/load_model_weights 模块函数 - automodel 和 lora 统一委托到 serialization 模块	2026-05-26 16:44:40 +08:00
ViperEkura	1d26aa2e93	fix: 禁用DDP static_graph避免PyTorch 2.7.1下no_sync与backward冲突 - static_graph=True时DDP.no_sync() + loss.backward()触发expect_autograd_hooks_内部断言 - PyTorch 2.7.1中no_sync上下文切换与静态图hook状态管理存在兼容性bug - 将static_graph设为False恢复梯度累积正常执行 - find_unused_parameters保持False（模型无不参与计算的参数）	2026-05-26 15:08:01 +08:00
ViperEkura	a548d4553e	fix: 断点续训恢复优化器/调度器状态及采样器剩余长度 - 使用Checkpoint.load()替代手动加载model.safetensors，恢复optimizer/scheduler状态 - TrainContextBuilder从checkpoint.extra恢复优化器和调度器state_dict - ResumableDistributedSampler.__len__返回剩余样本数而非总数 - 训练前对state_dict置空避免mp.spawn pickle 7GB大对象	2026-05-26 13:50:25 +08:00
ViperEkura	dd1b39f435	fix: ProgressBar默认输出到stdout - file参数默认值改为None, 内部用 or sys.stdout 兜底 - 清理inference API中未使用的import (Optional, time, field) - 删除test_protocol中未使用的ctx变量	2026-05-26 13:27:05 +08:00
ViperEkura	94d6e713e9	test: 补充推理协议层单测覆盖 - StopChecker、GenContext、StopInfo 单测 - OpenAIResponseBuilder / AnthropicResponseBuilder 全部方法 - Anthropic 停止序列裁剪逻辑（含 unyielded 边界） - GenerationRequest 参数校验含负值边界 - Scheduler prefill 短路验证	2026-05-26 00:21:52 +08:00
ViperEkura	47c37e4876	refactor: 推理协议层重构为策略/建造者模式 - ProtocolHandler 改为具体类，格式化委托给 ResponseBuilder - 新增 api/protocols/ 目录，含 OpenAIResponseBuilder、AnthropicResponseBuilder - GenContext、StopInfo 参数对象替代 StreamContext - 消除 Builder 的实例可变状态（accumulated、_yielded） - SSE 工具和停止检测收归 ProtocolHandler 统一管理 - prepare() 方法合并原来的 build_prompt、create_response_id - 参数校验去重：仅 GenerationRequest.init 负责校验 - Prefill 阶段提前短路完全命中的缓存任务	2026-05-26 00:12:57 +08:00
ViperEkura	737585a32a	feat: 新增NTK-Aware RoPE缩放支持 - RotaryEmbedding接受rope_scaling配置,自动计算scaled base - AutoRegressiveLMConfig和EncoderConfig新增rope_scaling字段	2026-05-25 21:22:07 +08:00
ViperEkura	a4688021bf	feat: 新增LoRA微调模块 - LoRALinear基于register_parameter托管base weight，state_dict路径不变 - inject_lora/merge_lora/save_lora/load_lora完备封装 - 24个单元测试覆盖注入、合并、存取、边界场景	2026-05-25 20:15:31 +08:00
ViperEkura	7df6eb9211	feat: 新增FSDP并行后端 - FSDPExecutor通过**fsdp_kwargs直传FSDP参数 - unwrap_model同时支持DDP和FSDP - parallel_mode新增fsdp选项	2026-05-25 19:43:14 +08:00
ViperEkura	82a3f2626f	docs: 更新文档与代码同步（Executor/训练循环/参数） - architecture.md: TrainConfig 移除旧 parallel_wrapper/state_dict_fn - architecture.md: 新增 ExecutorFactory/BaseExecutor/DDPExecutor 等类图 - architecture.md: MLA 新增 use_qk_norm/q_norm/k_norm - architecture.md: 新增 protocols 命名空间 - training.md: 修复训练循环 hook 名和 scheduler.step 位置 - training.md: 替换 parallel_wrapper 为 parallel_mode/executor.prepare - training.md: 修复默认回调顺序和 Callback 生命周期表 - params.md: 新增 --parallel_mode 和 --start_method	2026-05-24 22:17:49 +08:00
ViperEkura	7fa69572c0	fix: 测试日志写入临时目录避免冗余文件	2026-05-24 20:54:59 +08:00
ViperEkura	3ab4f237e5	refactor: 重构训练后端为 Executor 模式 - backend.py → executor.py，BaseTrainingBackend → BaseExecutor - 新增 NoneExecutor（单卡）和 DDPExecutor（DDP，world_size=1 自动降级） - 新增 GradientState 分离梯度同步状态，AccumOptimizer/AccumScheduler 包裹拦截 - 新增 astrai/protocols.py：OptimizerProtocol/SchedulerProtocol 结构子类型 - TrainContext.backend → executor，TrainConfig 移除 parallel_wrapper/state_dict_fn，新增 parallel_mode/executor_kwargs - 训练循环用 accumulate() 包裹，on_optimizer_step 命名约定=gate - scripts/tools/train.py 移除 ddp_wrap/prepare_checkpoint，新增 --parallel_mode	2026-05-24 20:35:44 +08:00
ViperEkura	8cbf3f36e2	feat: 新增训练后端工厂框架 - BaseTrainingBackend 定义 prepare/accumulate/unwrap_model 抽象 - DDPTrainingBackend 支持全部 DDP 参数并通过 BackendFactory 注册 - unwrap_model 改为实例方法，由子类各自实现	2026-05-24 15:15:14 +08:00
ViperEkura	0594ce1017	perf: Muon step 改用 torch._foreach_* 批处理并移除 NS 迭代的冗余 bf16 转换	2026-05-23 19:50:12 +08:00
ViperEkura	ff509ff39f	fix: decode后task_extend失败时提前中止，scheduler崩溃时通知waiting任务	2026-05-20 19:23:13 +08:00
ViperEkura	785d65436c	fix: 修复 to_dict list 类型丢失与 OpenAI stop 参数失效 - to_dict() 增加 list 类型序列化支持，metrics 等字段不再丢失 - OpenAIHandler 补充 get_stop_sequences/on_token，读取 request.stop 并检测停止序列 - 文档类图补充缺失字段、修正关系分类、ChatCompletionRequest 字段增加 Optional	2026-05-19 21:07:07 +08:00
ViperEkura	64be81b7b3	feat: ProgressBarCallback 支持日志行输出到 stdout - serialization 和 metric_logger 的 timestamp 统一使用 ISO 8601 格式 - ProgressBarCallback 新增 log_interval/file 参数，默认输出到 sys.stdout	2026-05-19 19:12:38 +08:00
ViperEkura	45479b5731	feat: metric 参数通过 TrainConfig 传递 - TrainConfig 新增 log_dir/log_interval/metrics 配置字段 - metric_logger 调用改用 **kwargs 传递，BaseFactory.create 自动过滤	2026-05-19 17:50:24 +08:00
ViperEkura	e0a3337c22	docs: 更新视频链接	2026-05-19 17:34:01 +08:00
ViperEkura	812238060b	fix: docker-compose UID/GID 添加默认值，修复 docker.sh logs 命令	2026-05-18 14:24:00 +08:00
ViperEkura	14b0d56197	fix: 修复无法创建子进程的问题 - mp.start_processes daemon=False	2026-05-18 09:40:32 +08:00
ViperEkura	6c8533f1d2	docs: 修正文档中类名/字段名与代码不一致之处 - ModelConfig → AutoRegressiveLMConfig, Transformer → AutoRegressiveLM - 新增缺失类: EncoderConfig, EmbeddingEncoder, ConfigFactory, StorageFactory, ValidationCallback - TrainConfig/TrainContext/ChatCompletionRequest 补充缺失字段 - dataflow.md 中 create_storage → StorageFactory.create - 示例 --train_type=pt → seq 与代码一致	2026-05-17 21:02:21 +08:00
ViperEkura	2c2697390d	feat: 新增 GradientCheckpointingCallback - TrainConfig.gradient_checkpointing_modules 指定模块类型 - apply 递归遍历，兼容 DDP，不硬编码模型结构 - modules=None 时静默跳过，零开销	2026-05-17 18:21:05 +08:00
ViperEkura	7621f05d3f	docs: AdamW beta 默认值改为 (0.9, 0.95) - 与 Muon 优化器的 AdamW 子优化器保持一致 - 同步更新 train.py/training.md/params.md/README	2026-05-17 17:08:31 +08:00
ViperEkura	10ebd7211f	feat: 新增 Muon 优化器 - 2D 参数用 Newton-Schulz 正交化 + Nesterov 动量更新 - 1D 参数用 AdamW 更新 - 支持 lr/momentum/weight_decay/ns_steps 配置	2026-05-17 16:44:03 +08:00
ViperEkura	42a391f0fb	feat: 训练中新增验证循环 - TrainConfig 添加 val_dataset/val_step 字段 - TrainContext 添加 val_dataloader/val_loss 字段 - 新增 ValidationCallback 按 step 触发验证 + 训练结束时验证 - ProgressBar/MetricLogger 支持 val_loss 展示与记录	2026-05-17 16:12:42 +08:00
ViperEkura	97c7ac0f4f	refactor: Transformer更名为AutoRegressiveLM并新增EmbeddingEncoder - AutoRegressiveLM 注册名改为 autoregressive_lm - 新增 EmbeddingEncoder 支持 mean/cls/last pooling - ModelConfig 增加 pooling_type / normalize_embeddings 字段 - 导入、注释、测试全部同步更新	2026-05-17 15:29:20 +08:00
ViperEkura	8f1b32f2b6	fix: 移除多余 request 参数并增强 tokenizer 健壮性 - 路由和 _get_engine 不再需要 request 参数，直接引用模块级 app - from_pretrained 增加文件完整性校验，缺 tokenizer.json 则抛 FileNotFoundError - 移除 from_pretrained 中未使用的 **kwargs	2026-05-17 12:52:18 +08:00
ViperEkura	c241a5dcef	refactor: 优化并行训练配置与启动管理 - 配置新增 start_method 支持 spawn/fork/forkserver 选择 - 启动方式 mp.spawn 改为 mp.start_processes，支持 daemon=True - validate() 改为基于 metadata 的反射式校验，不再硬编码字段列表 - CLI 新增 --start_method 参数	2026-05-17 12:33:10 +08:00
ViperEkura	44dab27fdc	feat: 数据集加载时校验必填字段 - BaseDataset.required_keys 属性声明所需存储 key - load() 时自动校验，缺失立即抛 KeyError - SEQ/SFT/DPO/GRPO 各自声明 required_keys	2026-05-17 11:50:38 +08:00
ViperEkura	a44fd22a99	fix: 修复训练与模型参数传递问题 - state_dict_fn 传入 CheckpointCallback，修复多卡 DDP 下 key 前缀丢失 - MLA 增加 use_qk_norm 支持，消除参数静默丢失 - moe_topk_method 统一命名为 topk_method - checkpoint 回调移至最前	2026-05-17 11:20:13 +08:00
ViperEkura	8a11a7d444	fix: 修复训练脚本两处参数传递问题 - prepare_checkpoint 增加 DDP 判断，单卡时不访问 .module - dpo_beta 改为 beta，对齐 DPOStrategy 参数名	2026-05-17 11:04:40 +08:00
ViperEkura	1d54491809	refactor: 改用递归子模块 init 替代统一 normal_(0.006) - Embedding.reset_parameters: normal_(std=0.02) - Linear.reset_parameters: kaiming_uniform_ + uniform_ bias - Transformer._init_weights 通过 apply 递归调用子模块 reset_parameters - 移除全局 normal_(0.006) 覆盖，各模块使用更合适的分布	2026-05-17 10:44:18 +08:00
ViperEkura	ad9f4d9cf6	refactor: generate_ar 改用流式输出并去除冗余注释	2026-05-17 10:23:42 +08:00
ViperEkura	e1638a7ade	fix: 修正AdamW超参数默认值与文档示例 - 交换adamw_beta1/adamw_beta2默认值：beta1=0.95, beta2=0.99 - label_smoothing默认值改为0.05 - 文档示例统一更新：train_type=pt, weight_decay=0.01 - 移除文档中过时的strategy default标注	2026-05-16 22:46:17 +08:00
ViperEkura	f91bfee33e	refactor: Config序列化统一BaseConfig基类 - 新增astrai/config/base.py，提供to_dict/from_dict基类 - 统一命名：load/save → from_file/to_file - Checkpoint.meta合并训练配置到meta.json - sys.stderr.warn → warnings.warn - from_file改为classmethod	2026-05-16 22:06:39 +08:00
ViperEkura	d7a7f570ed	refactor: 训练循环改为两重迭代并统一参数命名 - 训练循环从三重(epoch→batched→batch)改为二重(epoch→batch) - batch_size → batch_per_device, accumulation_steps → grad_accum_steps - scheduler 移入 step block 对齐 optimizer 更新步 - GradientClippingCallback 改用 on_step_begin 避免零梯度裁剪 - 移除 _train_impl 误导性的 -> Checkpoint 标注 - total_steps 修除为向下取整并精简为一行 - warmup_steps 改为 warmup_ratio (默认0.05)	2026-05-16 21:27:35 +08:00
ViperEkura	7dea929788	refactor: checkpoint 按 HF 方式存独立 .pt 文件，callback 接管恢复 - Checkpoint.save/load: extra 逐 key 写为 {key}.pt 而非单个 extra.pt - meta.json 新增 timestamp - CheckpointCallback: save_extra/load_extra 静态方法 + extra_keys 类属性 - on_train_begin 接管 optimizer/scheduler 恢复，TrainContextBuilder 不再传 load_extra_fn	2026-05-16 18:29:04 +08:00
ViperEkura	026d1fc33d	fix: total_steps 改用 ceiling 匹配实际步数原公式全用 floor 少算 optimizer step，改用逐层 ceiling （ceil_div via (a+b-1)//b）对齐 DDP sampler padding + DataLoader drop_last=False 尾批 + batched 尾组截断。	2026-05-16 17:53:18 +08:00
ViperEkura	7242eedbf4	fix: 学习率调度按 optimizer step 计数并防止 warmup 越界 - total_steps 除以 accumulation_steps，匹配 optimizer.step() 频率 - warmup_steps 用 min 截断，避免 lr_decay_steps 为负	2026-05-16 17:07:36 +08:00
ViperEkura	04c0dc7a47	refactor: Storage 改用工厂模式，server reload 接入 uvicorn - 新增 StorageFactory(BaseFactory[BaseStorage]) 替代手写 dict 注册 - H5Storage / JSONStorage 通过 @StorageFactory.register 注册 - dataset.py 使用 StorageFactory.create() 替代 create_storage() - 删除 create_storage / available_storage_types 死函数 - server.py reload 参数正式传入 uvicorn.run()	2026-05-16 17:00:26 +08:00
ViperEkura	48a53121ba	refactor: 工厂 kwargs 过滤及组件参数清理 - BaseFactory.create() 按 __init__ 签名过滤多余 kwargs - 移除 GQA/MLA/MLP/DeepSeekMoE 中多余的 **kwargs - MLP/DeepSeekMoE 参数名统一为 dim_ffn - scheduler max_seq_len 增加 None 显式判断 - 默认 max_prompt_len 提升至 2048	2026-05-16 16:47:41 +08:00
ViperEkura	0ba8c70ce1	fix: 修复 MLA 多个 bug 并缩小测试模型参数 - MLA kv_b_proj 输出维度和 q_rope 切分偏移修复 - 打通 MLA 配置从 ModelConfig 到 DecoderBlock 的传递路径 - rope_theta 配置不再被忽略，MLA 使用 qk_rope_head_dim - tie_weight 使用 is True 避免 None 隐式生效 - norm_eps/rope base 类型标注修正 - 测试模型参数缩小 (dim=8, head_dim=4) - 新增 6 种架构配置 × 2 场景的前向传播测试	2026-05-16 14:57:43 +08:00
ViperEkura	3d12a03909	docs : 拆分文档并补充类图缺失类和关系线 - 将 design.md 拆分为 architecture.md / inference.md / training.md - 精简 dataflow.md 为纯数据管道 - 删除 design.md 和 introduction.md - 更新 README.md 和 README-zh-CN.md 链接 - 补充 ChatMessage / AnthropicMessage 等 6 条孤立类关系线 - 补充 BaseModelConfig 和 TaskManager 两个缺失类	2026-05-15 23:38:26 +08:00
ViperEkura	c169659611	docs: 修正 assets/docs/ 类图、数据流、参数文档及贡献指南 - design.md: 新增 ProtocolHandler/OpenAIHandler/AnthropicHandler 等缺失类 - design.md: 新增 Template Method、Storage 设计模式 - dataflow.md: 修正 GQA/MLA 为独立条目，补充 JSON 存储后端 - params.md: 标注 label_smoothing CLI 默认与 strategy 默认差异 - introduction.md: 修正 max_tokens 默认值 1024→2048 - CONTRIBUTING.md: 重写（纯 Python 无 conda、补充 CI 步骤与常见问题） - .github/PULL_REQUEST_TEMPLATE.md: 修正 lint 命令，去除多余注释要求 - .github/ISSUE_TEMPLATE/bug_report.md: 修正 label（enhancement→bug）	2026-05-15 22:54:41 +08:00

1 2 3 4 5 ...

368 Commits All Branches Search

368 Commits

All Branches