fix : handle zero-token batch generation

- return empty results without running inference for non-positive limits
- keep scheduler batch outputs aligned with requested max_tokens
- add engine and scheduler regression coverage
This commit is contained in:
2026-08-06 12:31:09 +08:00
parent 6f09b1d2ee
commit 5c180cfa90
4 changed files with 44 additions and 7 deletions
+6
View File
@@ -146,6 +146,12 @@ class InferenceEngine:
is_batch = isinstance(prompt, list)
prompts = prompt if is_batch else [prompt]
if max_tokens is not None and max_tokens <= 0:
if stream:
return iter(())
results = [""] * len(prompts)
return results if is_batch else results[0]
if stream:
return self._generate_streaming(
prompts,