尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

textgen 本地大模型部署:从跑通到 API 对接

textgen 本地大模型部署:从跑通到 API 对接 textgen 本地大模型部署从跑通到 API 对接【免费下载链接】textgenOpen-source desktop app for local LLMs. Text, vision, tool-calling, OpenAI/Anthropic-compatible API. 100% private.项目地址: https://gitcode.com/GitHub_Trending/te/textgentextgen 是一个本地大模型的开源桌面应用完全离线、零遥测做文本对话、视觉理解和工具调用还带 OpenAI/Anthropic 兼容 API。这篇文章带你从 clone 到跑通最小可用环境再拆解多后端切换和 API 对接顺带指出几个仓库里藏着的坑。先搞清楚它是什么textgen 相当于「llama.cpp 可视化界面 兼容 API」的合体内置 llama.cpp、Transformers、ExLlamaV3、TensorRT-LLM 四套推理后端配一个 Gradio 界面和一个 API 服务器。最核心的两点差异化一是同一个服务里切换不同后端和不同模型、不用重启进程二是 API 同时兼容 OpenAI 和 Anthropic 两套协议现有客户端代码改一行 base_url 就能指过来。五分钟跑通最小可用环境跑通有两条路便携版从 Releases 下载解压、双击运行零依赖完整版支持 ExLlamaV3、训练、图像生成和扩展需要约 10GB 磁盘。下面走完整版git clone https://gitcode.com/GitHub_Trending/te/textgen进入目录运行对应系统的启动脚本start_linux.sh、start_macos.sh 或 start_windows.bat按提示选择 GPU 厂商等 Miniforge 自动建好 Conda 环境并装完依赖首次约 10GB浏览器打开http://127.0.0.1:7860macOS 用户注意选 Apple Silicon 对应的 requirements 文件Intel Mac 是另一个文件。之后重启就再跑同一个start_脚本想固定参数写进 user_data/CMD_FLAGS.txt每行一个。核心能力逐一拆解四套推理后端热切换它能做的事llama.cpp 吃 GGUFTransformers 吃 safetensorsExLlamaV3 和 TensorRT-LLM 各吃各的格式加载器可手动指定也可自动识别。实际感受切换后端和模型不用重启服务同一会话里快速对比不同量化版本的输出很方便。边界GGUF 只能走 llama.cpp想训或挂 LoRA 只能选 TransformersExLlamaV3 快但不支持 LoRATensorRT-LLM 支持面最窄见 docs/What Works.md 的支持矩阵按你的模型格式和功能需求选。后端选好后下一层需求通常是把模型暴露给别的程序调用这就是 API 模块的活。OpenAI/Anthropic 兼容 API它能做的事--api启动后5000 端口提供 Chat、Completions、Messages 三组端点工具调用也走这套协议细节见 docs/12 - OpenAI API.md。实际感受把现有代码的 base_url 指向http://127.0.0.1:5000/v1、api_key 随便填一个字符串就能直接用SSE 流式和工具调用循环都是现成的。边界适合当本地 drop-in 替代云端 API、复用现有代码只是命令行跑推理的话直接上 llama.cpp 的 llama-server 更省事。有了 API下一步通常是让模型「动手」——调工具、看图。工具调用、视觉与扩展它能做的事模型在对话中调用自定义函数每个工具就是一个.py文件仓库自带 user_data/tools/计算、网页抓取、掷骰子、查日期、搜索也支持 MCP server视觉模型下载配套的 mmproj 文件放进 user_data/mmproj/在 Model 标签页选中加载消息里就能传图。实际感受工具协议和主流模型对得上Qwen、Mistral 可以并行调多个工具GPT-OSS 一次一个循环逻辑文档里给了现成示例。边界工具调用要求模型本身支持 function calling小参数纯文本模型跑了也白跑mmproj 必须和模型配对下错文件直接加载失败。几个容易忽略的细节这里有个坑多文件模型不能散放。GGUF 单文件直接丢进 user_data/models/ 就行但 16-bit Transformers 模型和 EXL3 模型由多个 safetensors 加 config.json 组成必须放在 models 下的子文件夹里UI 只认文件夹不认散文件而且这类格式只有完整版支持。便携版和完整版功能不对等--portable会隐藏训练等高级功能便携构建也不支持多文件模型格式。想要训练、图像生成、TTS 扩展就得装完整版它还要下载 PyTorch。API 和 UI 是两套端口7860 是 Gradio 界面5000 才是 API 默认端口。加--nowebui可以只起 API 不起界面当纯推理服务用--api-key管请求鉴权--admin-key才管加载/卸载模型这类管理操作两个别搞混。多用户模式会丢聊天记录--multi-user适合小团队共用但聊天记录不保存也不自动加载。想留对话历史就别加这个参数。KV cache 量化和上下文默认值容易搞混llama.cpp 的--ctx-size设 0 表示自动其他加载器默认 8192显存紧张时用--cache-type q8_0或q4_0把 KV cache 量化下来换空间代价是精度。跟同类项目比它强在哪、弱在哪维度OllamaLM Studiotextgen冷启动成本二进制一个秒级应用包秒级全套安装约 10GB、首次装依赖较慢后端与格式llama.cpp 单一后端单一后端4 套后端、可热切换API 对接自有协议有内置服务兼容度一般OpenAI/Anthropic 双兼容训练/扩展无无LoRA 训练 扩展目录textgen 赢在 API 兼容度和多后端热切换代价是部署步骤比前两者多一截、磁盘占用更大。它适合谁什么时候该换个方案适合你手里有 GGUF 模型、想把本地模型暴露成 OpenAI 兼容 API 给现有工具调用或者要跑带 mmproj 的视觉模型加工具调用。建议换用需求只是命令行跑一次推理、不需要 UI 和 API直接装 llama.cpp 用 llama-server省掉整个安装流程要做完整的 LoRA 训练管线用 Transformers 加专门训练框架更直接textgen 的训练标签适合轻量微调而不是重训练。如果你的场景是「本地模型接旧代码」建议先按上面五步跑起来再给启动命令加--api把现有 OpenAI 客户端的 base_url 指到 5000 端口验证第一个请求通了再谈调参。【免费下载链接】textgenOpen-source desktop app for local LLMs. Text, vision, tool-calling, OpenAI/Anthropic-compatible API. 100% private.项目地址: https://gitcode.com/GitHub_Trending/te/textgen创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表