尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

textgen 本地大模型部署实操:按硬件选路线,参数组合一次到位

textgen 本地大模型部署实操:按硬件选路线,参数组合一次到位 textgen 本地大模型部署实操按硬件选路线参数组合一次到位【免费下载链接】textgenOpen-source desktop app for local LLMs. Text, vision, tool-calling, OpenAI/Anthropic-compatible API. 100% private.项目地址: https://gitcode.com/GitHub_Trending/te/textgen这篇文章写给第一次部署 textgen 的人。textgen 是一个开源的本地大模型桌面应用支持纯文本对话、视觉输入、工具调用并提供 OpenAI/Anthropic 兼容的 API全程数据不出本机。读完你能完成三件事装上、跑起来、调好参数全程大约 15 分钟。先对照下表确定你的路线场景推荐方案一句话理由NVIDIA 显卡主流start_linux.sh requirements/full/requirements.txtCUDA 加速生成速度最快AMD 显卡start_linux.sh requirements/full/requirements_amd.txtROCm 优化依赖免手动配环境Apple M 系列芯片start_macos.sh requirements/full/requirements_apple_silicon.txtMetal 统一内存依赖已适配无独显 / 云 CPUrequirements/full/requirements_cpu_only.txt CPU 参数组不占显存稳定性优先按路线起步判断路线只看两点先跑nvidia-smi能识别出显卡就走 NVIDIA 路线没有独显就看 CPU 品牌Intel/AMD 走 CPU 路线Apple 芯片走 macOS 脚本。拿不准时选 CPU 路线也能跑通只是速度慢。拿到代码后Linux 下执行git clone https://gitcode.com/GitHub_Trending/te/textgen ./start_linux.sh --auto-launch脚本会自动建一个隔离的 conda 环境并安装依赖首次运行耗时较长属正常现象。Windows 直接双击 start_windows.batmacOS 执行 start_macos.sh。启动成功的标志只有一个浏览器自动打开 http://localhost:7860左侧出现 Chat 标签页。参数配方参数不用逐个理解按场景整组抄。UI 里 Parameters 标签页能改的和命令行参数一一对应细节见 docs/03 - Parameters Tab.md。场景参数作用与取值日常对话max_new_tokens单次生成上限建议 512–2048日常对话temperature随机性0.7–1.2 之间手感最稳日常对话top_p核采样阈值0.9–1.0日常对话repetition_penalty重复惩罚1.0–1.2低显存--load-in-8bit --auto-devices8 位量化省显存模型自动分到 GPU/CPU仅 CPU--cpu --threads 8强制 CPU 推理线程数按核心数定局域网共享--listen --api放开局域网访问并开启兼容 API不想每次手敲参数把常开的几个写进 user_data/CMD_FLAGS.txt每次启动自动生效# 写入 user_data/CMD_FLAGS.txt每次启动自动带上 --listen --auto-launch参数想直接换风格可以去 user_data/presets/ 挑现成的Creative.yaml偏发散Deterministic.yaml偏稳定输出。进阶场景Docker 容器化适用人群机器上已有别的 Python 环境或多台服务器统一部署想和宿主机彻底隔离。最短步骤docker compose -f docker/nvidia/docker-compose.yml up --buildAMD、Intel、CPU 各有对应目录进 docker/ 里选。配置细节看 docs/09 - Docker.md。4 位量化加载适用人群8 位量化仍装不下模型或想塞进更大参数量的模型。最短步骤在启动命令后追加python server.py --load-in-4bit --wbits 4 --groupsize 128性能换显存的取舍见 docs/03 - Parameters Tab.md。另外Ampere 及以上的 NVIDIA 卡可以加--bf16走 bfloat16 精度推理更快且不掉精度。⚠️ 量化位数越低输出质量波动越大能 8 位装下就别上 4 位。出问题先自查现象先查什么对应配置启动报 CUDA out of memory模型是否量化加载加--load-in-8bit再不行换 4 位组合浏览器打不开 7860 端口是否被占用、防火墙是否拦截换端口或检查防火墙局域网设备访问不到是否加了--listenuser_data/CMD_FLAGS.txt 写入--listen依赖冲突、import 报错是否混用了系统 Python走 start_linux.sh 的隔离环境或 docker/生成明显变慢量化位数和线程数4 位模型天然更慢CPU 场景调--threads部署跑通只是开始下一步建议在 UI 里各换一次Creative和Deterministic预设对比输出差异给 user_data/CMD_FLAGS.txt 固化你常用的两三个启动参数翻一翻 docs/ 里关于 Session 和 Extensions 的章节解锁持久化会话和扩展跑通之后欢迎把你的硬件组合和显存占用贴出来交流帮后来的人少踩坑。【免费下载链接】textgenOpen-source desktop app for local LLMs. Text, vision, tool-calling, OpenAI/Anthropic-compatible API. 100% private.项目地址: https://gitcode.com/GitHub_Trending/te/textgen创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表