基础模型这一术语,常用于体现这类系统作为企业级 AI 底层基座的定位。传统模型往往是针对具体任务构建的,而基础模型则是通用底座,能够通过灵活定制适配各类下游应用场景。这类模型通常在包含文本、代码、图像、音频的多元化数据集上完成训练,由此形成对模式、概念与上下文的通用理解能力。大语言模型 (LLM) 就是这类系统的典型代表,其核心设计目标是高效处理和生成人类语言。
这类模型的核心创新点在于其可适配性。通过微调单个预训练模型,即可衍生出很多不同的功能,例如提炼复杂文档的摘要、编写代码,以及分析可视化数据、识别安全威胁。基础模型作为技术“底座”,可助力各类企业和组织加速创新,大幅缩短 AI 战略的价值实现周期。
基础模型的核心特质主要体现在以下方面:
- 超大规模:依托澎湃算力资源,基于海量多元化数据集训练而成。
- 自主学习:训练过程高度自动化,也就是说,模型能够直接从数据中洞察底层模式与内在联系,无需人工标注样本。
- 灵活适配:单个预训练模型即可通过定制用于很多应用场景,相比于每次都从零构建专用模型,这种范式能够为企业节省大量时间和研发资源。