fix: 修复强化学习算法问题

This commit is contained in:
2026-03-19 22:23:51 +08:00
parent a5574f92e2
commit 0f518473af
2 changed files with 62 additions and 83 deletions
+2 -5
View File
@@ -112,11 +112,8 @@ def train(
model = parameter.model
kwargs = {
strategy_kwargs = {
"dpo_beta": dpo_beta,
"bos_token_id": parameter.tokenizer.bos_id,
"eos_token_id": parameter.tokenizer.eos_id,
"pad_token_id": parameter.tokenizer.pad_id,
"label_smoothing": label_smoothing
}
@@ -158,7 +155,7 @@ def train(
parallel_wrapper=ddp_wrap,
state_dict_fn=prepare_checkpoint,
device_type=device_type,
extra_kwargs=kwargs,
extra_kwargs=strategy_kwargs,
)
trainer = Trainer(train_config)