如何利用腾讯云HAI DeepSeek打造高效企业知识库?
- 内容介绍
- 文章标签
- 相关推荐

归根结底。 以前, 为了回答员工的专业问题,我们需要安排专门的人员进行信息检索和解答,这不仅占用了大量的人力,还可能主要原因是人为因素导致回答的不及时和不准确。而现在智能问答系统能够自动处理大部分的问题,只需少量的人力进行监控和维护即可。
pythonfrom transformers import AutoTokenizer, AutoModelForCausalLM, TrainingArguments, Trainer
model_name = "deepseek-ai/deepseek"
tokenizer = AutoTokenizer.from_pretrained
model = AutoModelForCausalLM.from_pretrained
def tokenize_function:
return tokenizer
tokenized_datasets = tokenize_function # 哎呀,这里少了一个batched=True! 不知道为啥能跑起来...
def preprocess_function:
inputs = ] # 格式有点奇怪啊...不过先凑合用着吧!
targets = examples
model_inputs = tokenizer # 长度限制是512? 感觉有点短了...
labels = tokenizer # 这边也一样啊!好晕!
model_inputs = labels # Labels必须是input ids才能喂给模型...好像是这样?我记得之前写过一个bug来着…也许吧。
return model_inputs
training_args = TrainingArguments(
output_dir="./results", # 输出目录写个相对路径得了…懒得搞绝对路径了。哎…人生好累。
归根结底。 以前, 为了回答员工的专业问题,我们需要安排专门的人员进行信息检索和解答,这不仅占用了大量的人力,还可能主要原因是人为因素导致回答的不及时和不准确。而现在智能问答系统能够自动处理大部分的问题,只需少量的人力进行监控和维护即可。
pythonfrom transformers import AutoTokenizer, AutoModelForCausalLM, TrainingArguments, Trainer
model_name = "deepseek-ai/deepseek"
tokenizer = AutoTokenizer.from_pretrained
model = AutoModelForCausalLM.from_pretrained
def tokenize_function:
return tokenizer
tokenized_datasets = tokenize_function # 哎呀,这里少了一个batched=True! 不知道为啥能跑起来...
def preprocess_function:
inputs = ] # 格式有点奇怪啊...不过先凑合用着吧!
targets = examples
model_inputs = tokenizer # 长度限制是512? 感觉有点短了...
labels = tokenizer # 这边也一样啊!好晕!
model_inputs = labels # Labels必须是input ids才能喂给模型...好像是这样?我记得之前写过一个bug来着…也许吧。
return model_inputs
training_args = TrainingArguments(
output_dir="./results", # 输出目录写个相对路径得了…懒得搞绝对路径了。哎…人生好累。
