fix(utils): 优化数据集处理中的分块逻辑
This commit is contained in:
@@ -65,7 +65,7 @@ def process_dataset(
|
|||||||
|
|
||||||
total_samples = len(train_dataset)
|
total_samples = len(train_dataset)
|
||||||
num_chunks = (total_samples // chunk_size) + 1
|
num_chunks = (total_samples // chunk_size) + 1
|
||||||
lim_chunks = max_chunk_size if max_chunk_size else num_chunks
|
lim_chunks = min(max_chunk_size, num_chunks) if max_chunk_size else num_chunks
|
||||||
|
|
||||||
script_dir = os.path.dirname(os.path.abspath(__file__))
|
script_dir = os.path.dirname(os.path.abspath(__file__))
|
||||||
output_dir = os.path.join(script_dir, "dataset", output_subdir)
|
output_dir = os.path.join(script_dir, "dataset", output_subdir)
|
||||||
|
|||||||
Reference in New Issue
Block a user