尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

《llama.cpp从零编译教程:Windows + Linux完整环境搭建》

《llama.cpp从零编译教程:Windows + Linux完整环境搭建》 LlamaAI本地部署实战专栏第2篇从源码编译开始搭建属于自己的本地大模型推理环境。一、为什么选择自己编译llama.cpp在上一篇文章中我们介绍了为什么越来越多开发者开始部署本地大模型。目前运行本地LLM主要有几种方式OllamaLM StudioGPT4Allllama.cpp对于普通用户下载软件 → 选择模型 → 点击运行即可。但是对于开发者而言我们更推荐源码编译 llama.cpp原因可以开启GPU加速可以自定义编译参数方便二次开发了解底层推理流程后续部署服务器、嵌入式设备更加灵活llama.cpp本质上是一个使用C/C实现的大语言模型推理框架。它负责GGUF模型文件 ↓ 加载模型 ↓ Tensor计算 ↓ Token生成 ↓ 输出文本二、llama.cpp整体架构在正式安装之前我们先了解它的组成。用户输入 ↓ llama-cli ↓ llama.cpp核心引擎 ↓ -------------------- | | CPU Backend CUDA Backend | GGUF模型 | Token输出核心组件组件作用llama-cli命令行聊天程序llama-server启动API服务libllama核心推理库ggml底层计算框架其中ggml负责矩阵计算llama.cpp负责模型推理逻辑三、环境准备本文覆盖两个环境Windows 11Ubuntu Linux推荐配置最低配置硬件要求CPU4核心以上内存8GB硬盘20GBGPU推荐NVIDIA显卡显卡适合模型RTX3060 12G7B模型RTX4060 8G3B~7B量化模型RTX4090 24G13B模型四、Windows环境安装1. 安装Git首先安装Git下载Git检查打开PowerShellgit --version输出git version 2.xx.x表示成功。2. 安装CMakellama.cpp使用CMake管理工程。CMake作用简单理解根据项目配置生成不同平台的编译文件。流程CMakeLists.txt ↓ CMake ↓ Visual Studio工程 ↓ 编译 ↓ exe文件安装CMake - Upgrade Your Software Build System检查cmake --version3. 安装Visual Studio Build ToolsWindows下需要C编译环境。安装Visual Studio Installer选择Desktop development with C必须包含MSVC编译器Windows SDKCMake工具安装完成后打开Developer Command Prompt五、下载llama.cpp源码进入你的工作目录例如cd D:\AI克隆git clone https://github.com/ggerganov/llama.cpp.git进入cd llama.cpp目录结构llama.cpp ├── examples ├── common ├── src ├── ggml ├── CMakeLists.txt └── README.md六、Windows编译llama.cpp方式1CMake编译推荐创建build目录cmake -B build成功Configuring done Generating done然后cmake --build build --config Release等待完成。生成build/bin/ ├── llama-cli.exe ├── llama-server.exe └── llama-quantize.exe七、理解cmake和make的区别很多初学者会疑惑为什么有cmake又有make实际上CMake负责生成编译方案例如WindowsCMake ↓ Visual Studio项目LinuxCMake ↓ MakefileMake负责真正执行编译例如make执行.cpp ↓ .o ↓ 可执行文件简单理解工具作用CMake设计施工方案Make真正施工八、Linux Ubuntu安装如果你使用Ubuntu服务器WSL2Linux电脑流程更简单。1. 安装依赖sudo apt update sudo apt install \ build-essential \ cmake \ git检查gcc --version cmake --version2. 下载源码git clone https://github.com/ggerganov/llama.cpp cd llama.cpp3. 编译直接make完成后查看ls生成llama-cli llama-server llama-quantize运行./llama-cli --help如果出现usage: llama-cli [options]说明成功。九、开启CUDA GPU加速默认CPU推理速度有限。如果拥有NVIDIA GPU需要开启CUDA。Linux CUDA编译进入源码cmake \ -B build \ -DGGML_CUDAON编译cmake --build build --config Release检查./build/bin/llama-cli \ --help运行模型时--n-gpu-layers 50表示将部分网络层放入GPU。十、常见编译错误解决错误1CMAKE_C_COMPILER not found原因没有安装C编译器。解决Windows安装Visual Studio Build ToolsLinuxsudo apt install build-essential错误2NMake Makefiles missing原因CMake选择了错误生成器。解决使用cmake -B build或者指定cmake -G Visual Studio 17 2022 -B build错误3CUDA找不到检查nvidia-smi确认NVIDIA驱动正常CUDA Toolkit安装十一、验证llama.cpp安装成功查看版本./llama-cli --version启动帮助./llama-cli --help看到Options: -m, --model -ngl, --gpu-layers -c, --ctx-size说明你的本地大模型运行环境已经搭建完成。十二、本篇总结本篇完成了✅ 了解llama.cpp架构✅ Windows编译环境搭建✅ Linux环境搭建✅ CMake与Make区别✅ CUDA加速编译现在你的电脑已经具备运行本地大模型的基础环境。下一篇我们将进入真正的模型运行《手把手运行第一个本地大模型Llama/Qwen GGUF模型部署》内容包括什么是GGUF模型如何下载Qwen/Llama模型模型量化原理llama-cli运行模型参数调优打造第一个本地ChatGPT敬请期待。
返回列表