相关文章推荐

Colossal-AI使用指南:5分钟搭建在线OPT服务

介绍

本指导手册将说明如何利用 Colossal-AI 搭建您自己的OPT服务。

Colossal-AI 推理概述

Colossal-AI 提供了一个推理子系统 Energon-AI , 这是一个基于Colossal-AI的服务系统,拥有以下特性:

  • 大模型并行: 在Colossal-AI的张量并行和流水线并行策略的帮助下,Colossal-AI的推理可实现大模型的高效并行推理。
  • 预构建大模型: Colossal-AI提供热门模型的预构建部署,例如OPT。其支持用于生成任务和加载检查点的缓存技术。
  • 引擎封装: Colossal-AI中有一个抽象层被称作引擎。其将单实例多设备(SIMD) 执行与远程过程调用封装在一起。
  • 在线服务系统: 基于FastAPI,用户可以快速启动分布式推理的网络服务。 在线服务对生成任务进行了特殊优化。它采用left padding和bucket batching两种技术来提高效率。

基本用法

  1. 下载OPT模型

想要快速发布分布式推理服务,您从 此处 下载OPT-125M。有关加载其他体量模型的详细方法,您可访问 此处

  1. 准备提前构建的服务镜像

从dockerhub拉取一个已经安装Colossal-AI推理的docker镜像。

docker pull hpcaitech/energon-ai:latest
  1. 发布HTTP服务

若想发布服务,我们需要准备python脚本来描述模型的类型和相关的部署,以及HTTP服务的设置。 我们为您提供了一组 示例 。 我们将在本指导手册中使用 OPT 示例 。 服务的入口是一个bash脚本 server.sh。

 
推荐文章