免费获取学习方案
ARTICLE DETAIL

资讯详情

深耕编程基础知识与建站技术分享的一线实战洞察。

Tabby 做 int8 低精度推理需要哪种 NVIDIA GPU?

Tabby 做 int8 低精度推理需要哪种 NVIDIA GPU? Tabby 做 int8 低精度推理需要哪种 NVIDIA GPU【免费下载链接】tabbySelf-hosted AI coding assistant项目地址: https://gitcode.com/GitHub_Trending/tab/tabby在 NVIDIA GPU 上部署 Tabby自托管 AI 编码助手时官方 FAQ 明确说明Tabby 在 CUDA 上默认就运行在 int8 模式也就是说 int8 不是需要你额外开启的量化选项而是 CUDA 推理的默认工作方式。因此部署前的关键问题是你的显卡是否满足 int8 推理的硬件门槛显存是否装得下你要跑的模型。这篇文章给出 Tabby 文档中的 int8 硬件要求、按模型规模的选卡建议、部署命令以及启动日志中对显卡的验证方式。int8 模式的显存开销在选卡之前先看显存需求。FAQ 中给出的数据是默认 int8 模式 CUDA 下CodeLlama-7B 大约需要 8GB VRAMROCm 上的实际限制目前大多未经测试但同一 CodeLlama-7B 在 AMD Radeon™ RX 7900 XTX 上按 ROCm 监控工具显示也大约使用 8GB VRAM。如果你的模型更大如 13B显存需求会相应增加选卡时按下面的模型规模建议对照。int8 对 Compute Capability 的要求FAQ 中 “What GPUs are required for reduced-precision inference (e.g int8)?” 一栏给出了 Tabby 文档支持的精确度与 NVIDIA Compute Capability 的对应关系精度Compute Capability 要求int8 7.0 或 6.1float16 7.0bfloat16 8.0注意 int8 有一项特殊豁免除了 7.0 的显卡外Compute Capability 为 6.1 的显卡也支持 int8而 float16 和 bfloat16 没有这项豁免。具体某张显卡对应哪个 Compute CapabilityFAQ 指引读者去 NVIDIA 官方的 CUDA GPU 列表页查询显卡型号与 compute capability 的映射关系仓库文档未内置该映射表此处不重复列出。按模型规模选择显卡满足 Compute Capability 门槛只是底线Models Registry 文档 还给出了按模型参数规模的选卡建议1B 到 3B 模型至少使用NVIDIA T4、10 系列、20 系列 GPU或 Apple Silicon如 M17B 到 13B 模型建议使用NVIDIA V100、A100、30 系列、40 系列 GPU。结合前面的事实可以这样判断跑 CodeLlama-7B 这类 7B 模型且 int8 下约 8GB VRAM应选 V100、A100 或 30/40 系列中显存足够的卡这些卡的 Compute Capability 均满足 int8 的 7.0 要求。跑 1B~3B 的 StarCoder-1B、StarCoder2-3B 等模型T4、10/20 系列即可覆盖。一个文档示例在 私有仓库接入博客 展示的启动日志中服务器识别到的设备为NVIDIA GeForce RTX 4090, compute capability 8.9, VMM: yes即 40 系列卡以 CC 8.9 被 Tabby 识别满足 int8 7.0要求。部署在满足要求的 GPU 上启动 Tabby确定显卡满足要求后主路径是 Docker 部署Docker 安装文档。前提宿主机已安装 NVIDIA 驱动和 NVIDIA Container Toolkit。docker run -d \ --name tabby \ --gpus all \ -p 8080:8080 \ -v $HOME/.tabby:/data \ registry.tabbyml.com/tabbyml/tabby \ serve \ --model StarCoder-1B \ --chat-model Qwen2-1.5B-Instruct \ --device cuda--device cuda指定使用 CUDA 后端即默认 int8 模式。若你的系统启用了 SELinux需要给数据卷挂载加上:Z选项docker run -d \ --name tabby \ --gpus all \ -p 8080:8080 \ -v $HOME/.tabby:/data:Z \ registry.tabbyml.com/tabbyml/tabby \ serve \ --model StarCoder-1B \ --chat-model Qwen2-1.5B-Instruct \ --device cuda可选分支Linux 独立可执行文件部署Linux 安装文档。从 Tabby 发布页下载 GPU 版本tabby_x86_64-manylinux2014-cuda117.zip示例假设 CUDA 11.7。前提条件需要为发行版安装 nvidia-cuda-toolkitUbuntu 下为sudo apt install nvidia-cuda-toolkit确认本地 CUDA 版本11 或更高检查命令nvcc --version解压后进入dist子目录赋予可执行权限并启动chmod x tabby llama-server ./tabby serve --model StarCoder-1B --chat-model Qwen2-1.5B-Instruct --device cuda验证显卡被正确识别启动后有两种文档给出的验证方式看启动日志中的设备信息。用docker logs -f tabby查看日志。博客中的示例日志以下为文档示例输出非固定预期值ggml_init_cublas: found 1 CUDA devices: Device 0: NVIDIA GeForce RTX 4090, compute capability 8.9, VMM: yes 2024-03-21T16:16:52.464116Z INFO tabby::routes: crates/tabby/src/routes/mod.rs:35: Listening at 0.0.0.0:8080日志中出现的Device 0: 显卡型号, compute capability 版本号一行即是你核对显卡门槛的依据把其中的 compute capability 与上表 int8 的要求 7.0 或 6.1对照即可确认卡片是否满足条件。访问服务入口。容器启动后访问 http://localhost:8080Linux 独立部署同样访问 http://localhost:8080能打开 Tabby 实例页面即表示服务已就绪。边界与限制Tabby只支持使用单张 GPU。若要用多张卡需要启动多个 Tabby 实例并分别设置CUDA_VISIBLE_DEVICEScuda或HIP_VISIBLE_DEVICESrocm来源FAQ。int8 的 Compute Capability 豁免仅适用于 6.1如果你的卡低于 6.1int8 推理不在文档声明的支持范围内。bfloat16 需要 Compute Capability 8.0仅满足 int8 门槛的 6.1/7.x 卡不要按 bfloat16 预期配置部署。【免费下载链接】tabbySelf-hosted AI coding assistant项目地址: https://gitcode.com/GitHub_Trending/tab/tabby创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表