From 1ef14a997e7a80eb114a2550e0dd4bb9fd45f6d5 Mon Sep 17 00:00:00 2001 From: ViperEkura <3081035982@qq.com> Date: Mon, 21 Jul 2025 11:36:50 +0800 Subject: [PATCH] =?UTF-8?q?fix(chinese-instruct):=20=E4=BF=AE=E5=A4=8D=20L?= =?UTF-8?q?aTex=20=E5=85=AC=E5=BC=8F=E5=9C=A8=E6=95=B0=E6=8D=AE=E9=9B=86?= =?UTF-8?q?=E4=B8=AD=E7=9A=84=E6=98=BE=E7=A4=BA=E9=97=AE=E9=A2=98?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit --- chinese-instruct.py | 15 ++++++++++++--- 1 file changed, 12 insertions(+), 3 deletions(-) diff --git a/chinese-instruct.py b/chinese-instruct.py index 8543323..e8d551e 100644 --- a/chinese-instruct.py +++ b/chinese-instruct.py @@ -1,11 +1,20 @@ -# Mxode/Chinese-Reasoning-Distil-Data - from datasets import DatasetDict from datasets import load_dataset, concatenate_datasets from utils import process_dataset -def build_prompt(query, response) -> str: +def build_prompt(query:str, response:str) -> str: + replacements = { + "\\[": "$$", + "\\]": "$$", + "\\(": "$", + "\\)": "$" + } + + for old, new in replacements.items(): + query = query.replace(old, new) + response = response.replace(old, new) + return f"<|user|> {query} <|system|> {response}\n"