
在飞机上、外出时写代码时——本文教你用 llama工具在本地搭建一套 AI 开发环境。运行效果准备工作1.创建文件夹首先创建一个文件夹结构如下AI offline ├─ main └─ models2.下载 llama.cpp访问 https://github.com/ggml-org/llama.cpp/releases找到适合自己电脑的下载如果你是Windows N卡用户推荐下载Windows x64(CUDA 12) - CUDA 12.4 DLLs这个是显卡加速版本的对老显卡兼容性也好如果你打不开网站使用 Watt Toolkit原名Steam进行网络加速接着我们又发现下载速度很慢这时候我们要获取它的下载链接用第三方下载器下载我推荐使用PCL2在爱发电搜“龙腾猫跃”下载打开后点 更多-百宝箱-下载自定义文件粘贴下载地址即可下载大概1-2MB/s下载好后解压放到main文件夹里AI offline ├─ main │ ├─ 一堆dll.dll │ ├─ 一堆exe.exe │ └─ …… └─ models3.下载.gguf AI模型访问魔塔社区框架选gguf然后选适合自己电脑的模型下载电脑内存能跑的最大模型推荐量化级别4GB~1.5BQ2_K / Q3_K_M8GB~3BQ3_K_M / Q4_K_M16GB~7B~14BQ4_K_M / Q5_K_M32GB~14B~32BQ4_K_M / Q5_K_M这里我以 DeepSeek-R1-Distill-Qwen-1.5B-Q3_K_M.gguf 为例放进 models 文件夹AI offline ├─ main │ ├─ 一堆dll.dll │ ├─ 一堆exe.exe │ └─ …… └─ models └─ DeepSeek-R1-Distill-Qwen-1.5B-Q3_K_M.gguf4.配置start.batstart.bat以实际模型为准echo off chcp 65001 nul title DeepSeek R1 编程助手 main\llama-cli.exe ^ -m models\DeepSeek-R1-Distill-Qwen-1.5B-Q3_K_M.gguf ^ --color auto -cnv ^ -sys Always reply in Simplified Chinese. ^ -ngl 70 ^ --temp 0.45 ^ --repeat-penalty 1.05 ^ --repeat-last-n 128 ^ --show-timings ^ -n 8192 ^ -r |im_end| pause放入文件夹AI offline ├─ main │ ├─ 一堆dll.dll │ ├─ 一堆exe.exe │ └─ …… ├─ models │ └─ DeepSeek-R1-Distill-Qwen-1.5B-Q3_K_M.gguf └─ start.bat运行后调字体为 Consolas解决图标乱码然后你可以使用AI了常见错误缺少dll1.缺少 VC 运行库下载 VC Redistributable 2025-2022 x642.检查是否解压完整关于bat的启动参数这里我只介绍start.bat里出现的其他的可以问AI或看对照表bat 脚本本身命令不属于 AI 模型参数echo off关闭命令行命令回显不把每一行脚本打印到屏幕界面干净。chcp 65001 nul把 CMD 代码页切换为 UTF‑8解决中文方框乱码nul屏蔽 “活动代码页65001” 这条提示文字。title DeepSeek R1 编程助手设置 CMD 窗口标题。main\llama-cli.exe调用主程序程序在main子文件夹。pauseAI 退出之后不直接关闭 CMD 窗口按任意键才关闭方便看报错信息。^bat 脚本换行连接符号表示下一行还是属于上一条命令最后一行参数后面不要加^。llama‑cli AI 推理参数详解-m 模型路径-m models\DeepSeek-R1-Distill-Qwen-1.5B-Q3_K_M.gguf‑m --model指定加载的 GGUF 模型文件。必须写对路径否则报找不到模型。--color auto输出文字着色auto终端支持颜色就开启不支持就关闭对话提示、模型输出会区分颜色。也可以写--color yes/--color no-cnv全称--conversation开启交互式对话模式。 维护上下文记忆你一句 AI 一句会记住前面的聊天记录去掉就变成单次一问一答不会记忆对话。-sys Always reply in Simplified Chinese.‑sys --system-prompt系统提示词。 给模型设定全局角色指令模型全程遵守这里含义始终使用简体中文回复。-ngl 70‑ngl --n‑gpu‑layers把多少层模型放到显卡显存运算CUDA数值越大越多计算交给显卡速度越快超过显卡能容纳的层数剩下部分自动跑 CPU1.5B 模型总层数很少70 已经大于模型实际总层数代表尽可能全部扔给 GPU。如果出现显存溢出报错降低这个数字比如改成 30、20。--temp 0.45温度创造力取值范围0 ~ 2数值越低输出越确定、保守、少幻觉适合写代码0.45适合做题、写程序随机性低越高越有创造力但是更容易胡编乱造、重复写代码推荐0.35‑0.6写作文0.7‑1.0--repeat‑penalty 1.05重复限制范围1.0 ~ 1.5限制模型复读、循环输出一模一样文字。1.0 关闭1.05‑1.10适合代码场景轻微抑制重复不会误伤大括号、换行这些代码符号数值太大模型会不敢写重复符号代码畸形。--repeat‑last‑n 128检查最近多少个 token 文本用来做重复惩罚。128只看最近 128 个 token适合代码。如果设置很大256、512会看到前面大量{}、换行模型不敢输出正常代码结构。--show‑timings开启性能统计结束对话打印性能数据token 生成速度、加载耗时等方便调试测速。-n 8192‑n --n‑predict单次回答最大输出 token 数量。 单次 AI 回答最多生成 8192token不要和上下文窗口混淆。注意不是上下文总长度只是单次回答上限。-r |im_end|‑r --reverse‑prompt反转提示停止标记。 遇到标记|im_end|模型自动停止输出Qwen/DeepSeek 系列模型专用结束符号防止模型无限生成。bat的详细启动参数对照表使用 -h 参数启动llama即可