全部产品
Search
文档中心

人工智能平台 PAI:使用快速开始零代码部署微调Llama2系列大模型

更新时间:Jul 22, 2026

Llama2是Meta开源的预训练大语言模型。通过PAI快速开始,可一键部署llama-2-7b-chat推理服务(支持WebUI和API调用),也可用自定义数据集微调模型,实现领域定制。

背景信息

Llama2是由Meta开源的、以英语为主的预训练大语言模型,支持任意自然语言文本作为输入,并产生文字形式的输出。Llama2模型的参数范围从70亿到700亿不等,包括7b、13b、70b三种规格,并在每个规格下都有专门适配对话场景的优化模型Llama2-chat。快速开始支持Llama2系列模型的在线推理,同时也可以作为上游模型训练以达到更好的定制场景效果。

快速开始提供的llama-2-7b-chat模型来源于HuggingFace提供的Llama-2-7b-chat模型,它也是主要基于Transformer架构的大语言模型,使用多种混合的开源数据集进行训练,因此适合用于大多数的英文通用领域场景。

llama-2-7b-chat模型为例,演示如何通过快速开始将模型部署到EAS并调用推理服务。

使用限制

目前快速开始支持的地域包括华北2(北京)、华东2(上海)、华东1(杭州)、华南1(深圳)、华北6(乌兰察布)。

说明

如需开通华北6(乌兰察布)地域,请联系您的商务经理。

使用费用

前提条件

操作步骤

llama-2-7b-chat适用于大多数通用场景。如果预测结果不满足业务需求,或需要应用特定领域知识,可对模型微调,提升其在自定义领域的能力。

大语言模型可在对话中直接学习简单知识,请根据需求选择是否训练。快速开始支持的训练方式基于LoRA。LoRA训练相较于其他训练方式(如SFT等)会显著降低训练成本和时间。

直接部署模型

  1. 进入Model Gallery页面。

    1. 登录PAI控制台

    2. 在左侧导航栏单击工作空间列表,选择并进入目标工作空间。

    3. 在左侧导航栏单击快速开始 > Model Gallery ,进入Model Gallery页面。

  2. 在右侧模型列表的搜索框中输入llama-2-7b-chat,然后按回车键。

    说明

    您也可以根据实际业务选择需求选择其他模型,模型需要至少64 GiB内存和24 GiB及以上的显存,请确保您选择的计算资源满足以上要求,否则可能导致部署失败。

  3. 单击llama-2-7b-chat模型卡片,进入模型详情页面,单击右上角的部署

  4. 在部署页面下方,单击部署

  5. 在弹出的计费提醒对话框中,单击确定

  6. 页面自动跳转到服务详情页面。当服务状态变为运行中时,代表推理服务已部署成功。

  7. 服务部署成功后,您可以通过WebUI或API两种方式调用服务。

    1. 服务详情页面右上角,单击查看WEB应用

    2. 调用推理服务。

      • WebUI方式:在Chat页签中的对话框中输入对话内容后,单击Send,即可开始对话。

        界面左侧 Model params 面板可配置推理参数,包括 Max New Tokens(默认值 2048)、Top K(默认值 0)、Top P(默认值 0)、Temperature(默认值 0),并可勾选 Do sampleKV cacheStream output 选项,Max round 默认值为 5。

      • API方式:单击WebUI页面底部Use via API,查看API调用详情,包括API端点地址、请求示例及调用代码片段。

微调训练模型

  1. 进入Model Gallery页面。

    1. 登录PAI控制台

    2. 在左侧导航栏单击工作空间列表,选择并进入目标工作空间。

    3. 在左侧导航栏单击快速开始 > Model Gallery ,进入Model Gallery页面。

  2. 在右侧模型列表的搜索框中输入llama-2-7b-chat,然后按回车键。

    说明

    您也可以根据实际业务选择需求选择其他模型,模型需要至少64 GiB内存和24 GiB及以上的显存,请确保您选择的计算资源满足以上要求,否则可能导致部署失败。

  3. 单击llama-2-7b-chat模型卡片,进入模型详情页面,单击训练

  4. 配置模型训练相关参数。

    快速开始已默认配置计算资源超参数,可满足大多数场景,也可根据业务修改。关键参数说明见下表。

    参数

    说明

    输出配置

    模型输出路径

    选择OSS Bucket路径,用来保存训练生成的模型文件。

    说明

    如果您在工作空间详情页面配置了工作空间存储路径,这里会默认填充该路径,无需手动配置。如何配置工作空间存储路径,请参见管理工作空间

    数据集配置

    训练数据集

    快速开始已提供默认训练数据,可直接使用。如需自定义数据集,按模型文档中的格式准备数据,通过以下两种方式上传:

    • 数据集选择:支持使用公共数据集和自定义数据集。如何创建自定义数据集,请参见创建及管理数据集

    • OSS文件或目录:通过OSS上传。操作详情请参见快速入门

    训练数据支持JSON格式输入,每条数据由问题、答案和ID组成,分别用instructionoutputid字段表示,例如:

    [
        {
            "instruction": "以下文本是否属于世界主题?为什么美国人很少举行阅兵?",
            "output": "是",
            "id": 0
        },
        {
            "instruction": "以下文本是否属于世界主题?重磅!事业单位车改时间表已出!",
            "output": "不是",
            "id": 1
        }
    ]

    建议另准备一份验证数据集,用于训练中评估效果并优化参数。

  5. 单击训练,提交训练作业。

  6. 在弹出的计费提醒对话框中,单击确定

  7. 页面自动跳转到任务详情页面。当任务状态变为已成功时,代表模型已经训练完成。

    训练完成的模型保存到OSS,可在基本信息区域的输出路径中查看路径。

    说明

    使用默认数据集、超参数和计算资源,训练约需1小时30分钟。使用自定义配置时,训练时间有所差异,通常在数小时内完成。

  8. 部署微调模型。

    部署和调用微调模型的流程与直接部署相同,详情请参见直接部署模型

后续操作

您可以在快速开始>Model Gallery页面单击任务管理训练任务部署任务Tab页,查看训练任务和部署任务的详情。

训练任务列表包含任务名称/ID、预训练模型、训练方式、资源配额、状态、创建时间、更新时间及运行时长等信息,支持停止克隆删除操作。