0门槛免费商用！孟子3-13B大模型正式开源，万亿token数据训练

　　白交发自凹非寺

　　量子位公众号 QbitAI

　　澜舟科技官宣：孟子3-13B 大模型正式开源！

　　这一主打高性价比的轻量化大模型，面向学术研究完全开放，并支持免费商用。

　　在 MMLU、GSM8K、HUMAN-EVAL 等各项基准测评估中，孟子3-13B 都表现出了不错的性能。

　　尤其在参数量 20B 以内的轻量化大模型领域，在中英文语言能力方面尤为突出，数学和编程能力也位于前列。

　　据介绍，孟子3-13B 大模型是基于 Llama 架构，数据集规模高达 3T Tokens。

　　语料精选自网页、百科、社交、媒体、新闻，以及高质量的开源数据集。通过在万亿 tokens 上进行多语言语料的继续训练，模型的中文能力突出并且兼顾多语言能力。

　　孟子3-13B 大模型开源

　　只需两步，就能使用孟子3-13B 大模型了。

　　首先进行环境配置。

pipinstall-rrequirements.txt

　　然后快速开始。

importtorch fromtransformersimportAutoModelForCausalLM, AutoTokenizer tokenizer = AutoTokenizer.from_pretrained ("Langboat/Mengzi3-13B-Base"， use_fast=False, trust_remote_code=True) model = AutoModelForCausalLM.from_pretrained ("Langboat/Mengzi3-13B-Base"， device_map="auto"， trust_remote_code=True) inputs = tokenizer (指令：回答以下问题。输入：介绍一下孟子。输出：， return_tensors=pt) iftorch.cuda.is_available (): inputs = inputs.to (cuda) pred = model.generate (**inputs, max_new_tokens=512, repetition_penalty=1.01, eos_token_id=tokenizer.eos_token_id) print (tokenizer.decode (pred[0], skip_special_tokens=True))

　　此外，他们还提供了一个样例代码，可用于基础模型进行单轮交互推理。

cdexamples python examples/base_streaming_gen.py --model model_path --tokenizer tokenizer_path

　　如果想要进行模型微调，他们也提供了相关文件和代码。