免费获取学习方案
ARTICLE DETAIL

资讯详情

深耕编程基础知识与建站技术分享的一线实战洞察。

llama.cpp 安装教程:从零配置到跑通第一次 LLM 推理

llama.cpp 安装教程:从零配置到跑通第一次 LLM 推理 llama.cpp 安装教程从零配置到跑通第一次 LLM 推理【免费下载链接】llama.cppLLM inference in C/C项目地址: https://gitcode.com/GitHub_Trending/ll/llama.cppllama.cpp 是一个纯 C/C 编写的大语言模型LLM本地推理框架它不依赖任何第三方深度学习库就能把 GGUF 格式的量化模型加载到 CPU、NVIDIA GPU、AMD GPU 或 Apple 芯片上跑起来。适合想在个人电脑上离线对话、不想碰 Python 环境的开发者。本文带你在 10 分钟内完成克隆、编译并验证第一次推理。llama.cpp 项目速览项目说明定位LLM / 视觉语言模型本地推理开箱即用主要语言C / C核心无外部依赖构建工具CMake 3.14 及以上运行环境Windows / macOS / Linux纯 CPU 即可运行硬件加速NVIDIA CUDA、AMD HIP、Vulkan、Apple Metal 等后端可选模型格式GGUF自带 1.5~8 bit 整数量化省显存提速许可协议MIT核心技术组成ggml项目内嵌的张量计算库负责矩阵运算和模型图执行。矩阵内存按行主序/列主序布局转换是它的基本功下图展示了 ggml 中 A、B 两个矩阵转置相乘时的维度布局量化quantization把权重从 FP16 压到 4 bit 等低位宽模型体积和内存占用大幅下降是 llama.cpp 能在消费级硬件上跑大模型的关键。多后端加速CUDA 负责 NVIDIA GPUHIP 负责 AMD GPUVulkan 提供跨厂商 GPU 支持Metal 负责 Apple Silicon没有独显时自动退回 CPU 推理还支持 CPUGPU 混合加载超过显存容量的模型。llama-cli / llama-server 工具链编译产物里自带命令行对话工具和 OpenAI 兼容 HTTP 服务构建完就能用。装前依赖清单Git必装克隆源码。CMake 3.14必装生成构建脚本。C/C 编译器必装GCC、Clang 或 MSVC负责编译 C/C 代码。Python可选仅当你要把 Hugging Face 权重转换成 GGUF 时才需要。GPU 工具链可选CUDA ToolkitNVIDIA、ROCmAMD或 Vulkan SDK跨厂商按你的显卡二选一没有也不影响 CPU 运行。安装实操克隆源码在终端执行把仓库拉到本地git clone https://gitcode.com/GitHub_Trending/ll/llama.cpp cd llama.cpp生成构建脚本用 CMake 配置一个 Release 构建默认按当前机器硬件优化自动启用 Metal、AVX 等指令集cmake -B build编译出可执行文件开始编译加-j参数并行加速机器不同耗时从 1 分钟到十几分钟不等产物统一放在build/bin/目录cmake --build build --config Release -j确认产物列出构建输出确认llama-cli等工具已生成Linux 下为可执行文件Windows 下为llama-cli.exels build/bin如何验证安装成功跑一条最小推理命令用llama-cli从 Hugging Face 直接下载一个小模型并进入对话无需手动准备模型文件./build/bin/llama-cli -hf ggml-org/Qwen3.5-0.8B-GGUF看到以下内容才算装成功终端打印模型加载日志含架构、量化类型、张量大小出现提示符输入一句话后能流式吐出模型回复对话结束后CtrlD 或输入退出末尾打印llama_print_timings给出提示词处理速度和生成速度tokens per second。如果只想快速确认二进制能跑执行./build/bin/llama-cli --version看到版本号即说明构建无误。进阶入口构建选项详解CUDA / Metal / Vulkan / BLAS 等后端开关docs/build.md不想编译可直接装预编译包conda-forge、winget、Homebrewdocs/install.md容器化运行docs/docker.mdCLI 工具完整参数说明tools/cli/README.md起一个 OpenAI 兼容 API 服务让现有 Python 生态直接对接tools/server/把 PyTorch 权重转成 GGUF 的转换脚本convert_hf_to_gguf.py下一步建议先用-hf跑通任意一个小模型找手感然后尝试llama serve起一个本地 API 服务或读一遍 docs/build.md 为你的显卡打开对应加速后端。【免费下载链接】llama.cppLLM inference in C/C项目地址: https://gitcode.com/GitHub_Trending/ll/llama.cpp创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表