CPM-Bee-CPM-Bee大模型:百亿参数的开源中英文双语基座大模型
CPM-Bee是一款百亿参数的开源中英文双语基座大模型,具备十余种原生能力与强大的通用语言能力,支持结构化输入输出。作为CPM-Live直播训练的第二个里程碑,它采用低成本和环境友好的训练方式,并已开放开源许可协议,模型与代码完全公开。本文将从性能、语料、生态等方面全面介绍这一基座模型。
自社区成立以来,我们始终坚持“让大模型飞入千家万户”的理念,开发全流程加速系统支持预训练、微调、应用和推理,并发起百亿大模型训练直播项目CPM-Live。如今,CPM-Live第二阶段进度条拉满,我们迎来了第二个里程碑:CPM-Bee开源发布!

CPM-Bee是一个完全开源、允许商用的百亿参数中英文基座模型,也是CPM-Live训练的第二个里程碑。它采用Transformer自回归架构,在超万亿高质量语料上进行预训练,拥有强大的基础能力。开发者和研究者可以在CPM-Bee基座模型的基础上,在各类场景进行适配以创建特定领域的应用模型。

✨ 模型介绍
CPM-Bee是一个完全开源、允许商用的百亿参数中英文基座模型,也是CPM-Live训练的第二个里程碑。它采用Transformer自回归架构(auto-regressive),在超万亿(trillion)高质量语料上进行预训练,拥有强大的基础能力。开发者和研究者可以在CPM-Bee基座模型的基础上在各类场景进行适配来以创建特定领域的应用模型。
- ? 开源可商用:OpenBMB始终秉承“让大模型飞入千家万户”的开源精神,CPM-Bee基座模型将完全开源并且可商用,以推动大模型领域的发展。我们鼓励全球范围内的科研机构、企业和个人开发者在遵守开源许可协议的前提下,地在CPM-Bee基座模型上进行创新。
- ? 中英双语性能优异:CPM-Bee基座模型在预训练语料上进行了严格的筛选和配比,同时在中英双语上具有亮眼表现,具体可参见评测任务和结果。
- ? 超大规模高质量语料:CPM-Bee基座模型在超万亿语料进行训练,是开源社区内经过语料最多的模型之一。同时,我们对预训练语料进行了严格的筛选、清洗和后处理以确保质量。

OpenBMB大模型系统生态支持:OpenBMB大模型系统在高性能预训练、适配、压缩、部署、工具开发了一系列工具,CPM-Bee基座模型将配套所有的工具脚本,高效支持开发者进行进阶使用。- ? 对话和工具使用能力:结合OpenBMB在指令微调和工具学习的探索,我们在CPM-Bee基座模型的基础上进行微调,训练出了具有强大对话和工具使用能力的实例模型,API和内测将于近期开放。
Read this in English.
说明:CPM-Bee是一个基座模型,即从零开始通过预训练得来。我们鼓励用户在自己的场景和数据上适配/微调/对齐后再进行使用。例如,WebCPM 以CPM-Bee为基座,在人类网络检索的序列化数据上进行适配,获得了复杂问答和上网检索的能力。后续我们将会发布更多在CPM-Bee基座模型基础上适配的模型。

本仓库主要提供 CPM-Bee 基座模型
CPM-Bee基座模型已全面开源,开发者可结合自身场景进行适配与微调,探索更多应用可能,共同推动大模型技术发展。