Llama2是Meta开源的预训练大语言模型。通过PAI快速开始,可一键部署llama-2-7b-chat推理服务(支持WebUI和API调用),也可用自定义数据集微调模型,实现领域定制。
背景信息
Llama2是由Meta开源的、以英语为主的预训练大语言模型,支持任意自然语言文本作为输入,并产生文字形式的输出。Llama2模型的参数范围从70亿到700亿不等,包括7b、13b、70b三种规格,并在每个规格下都有专门适配对话场景的优化模型Llama2-chat。快速开始支持Llama2系列模型的在线推理,同时也可以作为上游模型训练以达到更好的定制场景效果。
快速开始提供的llama-2-7b-chat模型来源于HuggingFace提供的Llama-2-7b-chat模型,它也是主要基于Transformer架构的大语言模型,使用多种混合的开源数据集进行训练,因此适合用于大多数的英文通用领域场景。
以llama-2-7b-chat模型为例,演示如何通过快速开始将模型部署到EAS并调用推理服务。
使用限制
目前快速开始支持的地域包括华北2(北京)、华东2(上海)、华东1(杭州)、华南1(深圳)、华北6(乌兰察布)。
如需开通华北6(乌兰察布)地域,请联系您的商务经理。
使用费用
使用OSS存储会产生相关费用,计费详情请参见OSS计费概述。
快速开始本身不收费,但使用快速开始进行模型部署和训练时,会产生对应的模型部署(EAS)费用和任务训练(DLC)费用,计费详情请参见模型在线服务(EAS)计费说明、分布式训练(DLC)计费说明。
前提条件
已开通PAI(EAS、DLC)并创建了默认的工作空间,操作详情请参见开通PAI并创建默认工作空间。
- 说明
Bucket所属地域与PAI的地域一致。Bucket一旦创建,则无法更改其所属地域。
阅读并承诺遵守Llama模型的自定义可商用开源协议。
说明如果无法访问,您可能需要设置代理后再尝试重新访问。
操作步骤
llama-2-7b-chat适用于大多数通用场景。如果预测结果不满足业务需求,或需要应用特定领域知识,可对模型微调,提升其在自定义领域的能力。
大语言模型可在对话中直接学习简单知识,请根据需求选择是否训练。快速开始支持的训练方式基于LoRA。LoRA训练相较于其他训练方式(如SFT等)会显著降低训练成本和时间。
直接部署模型
进入Model Gallery页面。
登录PAI控制台。
在左侧导航栏单击工作空间列表,选择并进入目标工作空间。
在左侧导航栏单击快速开始 > Model Gallery ,进入Model Gallery页面。
在右侧模型列表的搜索框中输入llama-2-7b-chat,然后按回车键。
说明您也可以根据实际业务选择需求选择其他模型,模型需要至少64 GiB内存和24 GiB及以上的显存,请确保您选择的计算资源满足以上要求,否则可能导致部署失败。
单击llama-2-7b-chat模型卡片,进入模型详情页面,单击右上角的部署。
在部署页面下方,单击部署。
在弹出的计费提醒对话框中,单击确定。
页面自动跳转到服务详情页面。当服务状态变为运行中时,代表推理服务已部署成功。
服务部署成功后,您可以通过WebUI或API两种方式调用服务。
在服务详情页面右上角,单击查看WEB应用。
调用推理服务。
WebUI方式:在Chat页签中的对话框中输入对话内容后,单击Send,即可开始对话。
界面左侧 Model params 面板可配置推理参数,包括 Max New Tokens(默认值 2048)、Top K(默认值 0)、Top P(默认值 0)、Temperature(默认值 0),并可勾选 Do sample、KV cache 和 Stream output 选项,Max round 默认值为 5。
API方式:单击WebUI页面底部Use via API,查看API调用详情,包括API端点地址、请求示例及调用代码片段。
微调训练模型
进入Model Gallery页面。
登录PAI控制台。
在左侧导航栏单击工作空间列表,选择并进入目标工作空间。
在左侧导航栏单击快速开始 > Model Gallery ,进入Model Gallery页面。
在右侧模型列表的搜索框中输入llama-2-7b-chat,然后按回车键。
说明您也可以根据实际业务选择需求选择其他模型,模型需要至少64 GiB内存和24 GiB及以上的显存,请确保您选择的计算资源满足以上要求,否则可能导致部署失败。
单击llama-2-7b-chat模型卡片,进入模型详情页面,单击训练。
配置模型训练相关参数。
快速开始已默认配置计算资源和超参数,可满足大多数场景,也可根据业务修改。关键参数说明见下表。
参数
说明
输出配置
模型输出路径
选择OSS Bucket路径,用来保存训练生成的模型文件。
说明如果您在工作空间详情页面配置了工作空间存储路径,这里会默认填充该路径,无需手动配置。如何配置工作空间存储路径,请参见管理工作空间。
数据集配置
训练数据集
快速开始已提供默认训练数据,可直接使用。如需自定义数据集,按模型文档中的格式准备数据,通过以下两种方式上传:
训练数据支持JSON格式输入,每条数据由问题、答案和ID组成,分别用
instruction、output和id字段表示,例如:[ { "instruction": "以下文本是否属于世界主题?为什么美国人很少举行阅兵?", "output": "是", "id": 0 }, { "instruction": "以下文本是否属于世界主题?重磅!事业单位车改时间表已出!", "output": "不是", "id": 1 } ]建议另准备一份验证数据集,用于训练中评估效果并优化参数。
单击训练,提交训练作业。
在弹出的计费提醒对话框中,单击确定。
页面自动跳转到任务详情页面。当任务状态变为已成功时,代表模型已经训练完成。
训练完成的模型保存到OSS,可在基本信息区域的输出路径中查看路径。
说明使用默认数据集、超参数和计算资源,训练约需1小时30分钟。使用自定义配置时,训练时间有所差异,通常在数小时内完成。
部署微调模型。
部署和调用微调模型的流程与直接部署相同,详情请参见直接部署模型。
后续操作
您可以在快速开始>Model Gallery页面单击任务管理的训练任务和部署任务Tab页,查看训练任务和部署任务的详情。
训练任务列表包含任务名称/ID、预训练模型、训练方式、资源配额、状态、创建时间、更新时间及运行时长等信息,支持停止、克隆和删除操作。