尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

text-generation-webui 实战:本地部署大模型 + OpenAI 兼容 API,一篇装明白

text-generation-webui 实战:本地部署大模型 + OpenAI 兼容 API,一篇装明白 text-generation-webui 实战本地部署大模型 OpenAI 兼容 API一篇装明白【免费下载链接】textgenOpen-source desktop app for local LLMs. Text, vision, tool-calling, OpenAI/Anthropic-compatible API. 100% private.项目地址: https://gitcode.com/GitHub_Trending/te/textgen想让大模型跑在自己的机器上、数据不出内网text-generation-webui 就是干这个的一个基于 Gradio 的桌面应用装完打开就能和 GGUF 模型对话还能把本地模型伪装成 OpenAI/Anthropic API 供其他程序调用。下面从最短路径装起来讲起到硬件选型、语音和文档问答、参数调优最后说清楚谁适合上这套东西。三种系统各走一条最短路径装它比你想的省事三个平台都有专属一键脚本第一次跑的时候脚本会自己处理 Python 环境和依赖你基本不用动手。Linux一个脚本搞定环境执行start_linux.sh它会自动下载 Miniforge 并建好隔离环境。⚠️ 唯一要避开的是路径里带空格脚本会直接拒绝启动所以把它放在~/textgen这类路径下最稳。macOSApple 芯片有专门适配运行start_macos.sh脚本会自动识别 M 系列和 Intel 芯片并选择对应架构。如果你之前装过 conda它也会先把现有环境 deactivate避免版本冲突。Windows注意两条隐形坑双击start_windows.bat即可。两个坑提前说路径里带特殊字符空格、括号、中文会导致安装失败跨盘安装时脚本会自动把临时目录指到项目目录内不用你操心。装完第一步换模型再说话启动后默认界面是 Chat 标签页。先做一件事去 Model 标签页选一个已下载的 GGUF 模型支持 llama.cpp 加载其余加载器需要完整安装。加载成功后回到对话框输入一句话试水能回复就通了。你的配置走哪条路别管别人跑什么后端先看你自己手里有什么卡。加载器在 modules/loaders.py 里统一管理Model 标签页的下拉框里能看到全部选项。4090 / 3090 / 无显卡怎么选你的硬件推荐加载器模型格式关键设置24G 显存4090/3090ExLlamaV3 或 llama.cppEXL3 / GGUF层数尽量全进 GPU8–12G 显存4060 等llama.cppGGUF 4bitgpu_layers只放一部分层纯 CPUllama.cppGGUF Q4gpu_layers设为 0显存富裕时选 ExLlamaV3EXL3 模型还带投机解码和多卡张量并行显存紧张或纯 CPUllama.cpp 就是最省心的选择CPU 模式下threads设成你的物理核心数即可。三个参数直接决定装得下装不下gpu_layers往 GPU 上塞多少层。放不下就往下减设为 0 则全跑 CPU。ctx_size上下文长度。缓存是预分配的开得越大越吃显存塞不下就降这个值设 0 可以按可用内存自动决定。cache_typeKV 缓存量化可选fp16/q8_0/q4_0。量化等级越低越省显存代价是长对话质量略降。不只是聊天框三个真实场景跑通之后别只拿它当聊天框下面三件事才是日常用得最多的。三种模式对应三种用法instruct模式最接近 ChatGPT 的指令跟随行为chat/chat-instruct则用于和自定义角色对话提示词由 Jinja2 模板自动格式化你不用手写格式。写代码、问答选 instruct玩角色扮演、练对话就切角色模式。语音怎么接语音输入靠 extensions/whisper_stt/语音输出靠 extensions/silero_tts/两者组合就是完整的语音对话闭环按住说话转文字回答再合成语音读出来。装完在扩展列表里勾选启用即可各自有独立的 requirements.txt。上传文件后能做什么Chat 里可以直接上传文本文件、PDF 和 .docx然后基于内容提问。另外 user_data/characters/ 里预置了 Assistant 和 Example 两个角色示例照着改 YAML 就能造自己的角色卡。预置的 Example 角色卡片展示了头像加设定文件的角色配置方式。顺带一提内置工具调用user_data/tools/下有现成的网页搜索、掷骰子、算式计算等 Python 工具模型聊着天就能替你执行。两个参数 一个模型大小先调这三处调优不用碰几十个旋钮先把这三件事调对体感提升最明显。temperature / top_p 设多少合适仓库预置了两份参数包可以参考user_data/presets/Top-P.yaml 里是top_p: 0.95适合通用问答保证回复稳定Creative 预设则用min_p: 0.02加xtc_probability: 0.5适合要发散、要花样儿的场景。我的建议日常使用就锁 top_p 0.95 附近想让它皮一点再切 Creative。7B / 13B / 70B 怎么选7B 是 8G 显存的舒适区日常问答绰绰有余13B 是质量和速度的平衡点4bit 量化后 12G 左右显存能跑70B 留给专业场景多卡或全 CPU 大内存机器才有必要。一个实用法则先跑 7B 熟悉界面别一上来就被 70B 的显存劝退。上下文不是越大越好ctx_size预分配缓存意味着 32K 上下文在 8G 显存上可能是装不下的直接原因。按实际需求给普通聊天 4096–8192 足够文档问答场景再往上加同时用cache_type的量化档位换空间。谁适合装谁不必装最后说点实话省得你装完发现不适合自己。做得好的本地数据完全离线、零遥测这是它相对云端 API 的立身之本一套界面覆盖文本、视觉、工具调用和图像生成OpenAI/Anthropic 兼容的 APImodules/api/让它可以当内部服务的本地代理老项目改个 base_url 就能接进来。目前还差的模型管理偏手动批量下载、版本对比这类事没有现成的面板硬件占用缺少实时可视化显存够不够基本靠试首次配置gpu_layers/ctx_size时文档再全也得自己多试两轮。一句话结论你是开发者或技术爱好者机器上有一块 8G 以上的 N 卡或一台大内存 CPU 主机又在意数据隐私和离线可用性——这套工具值得花一个下午装起来。如果你的需求只是偶尔问问 AI直接订阅云端 API 更划算如果你要的是多用户高并发生产服务它更像一个单人/小团队工作台别指望它扛集群流量。【免费下载链接】textgenOpen-source desktop app for local LLMs. Text, vision, tool-calling, OpenAI/Anthropic-compatible API. 100% private.项目地址: https://gitcode.com/GitHub_Trending/te/textgen创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表