尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

OpenAI兼容接口实战:用Ornith-1.0-35B-OptiQ-6bit构建本地视觉问答API服务

OpenAI兼容接口实战:用Ornith-1.0-35B-OptiQ-6bit构建本地视觉问答API服务 OpenAI兼容接口实战用Ornith-1.0-35B-OptiQ-6bit构建本地视觉问答API服务【免费下载链接】Ornith-1.0-35B-OptiQ-6bit项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/Ornith-1.0-35B-OptiQ-6bitOrnith-1.0-35B-OptiQ-6bit是一款基于Qwen3.5架构的35B稀疏MoE模型通过OptiQ技术实现6位混合精度量化将原本70.2GB的bf16权重压缩至仅27GB同时保留视觉问答能力是在Apple Silicon上构建本地OpenAI兼容视觉问答API服务的理想选择。 为什么选择Ornith-1.0-35B-OptiQ-6bit核心优势解析这款模型凭借创新的混合精度量化技术实现了性能与效率的完美平衡高效存储27GB的磁盘占用仅为原始模型的38%视觉能力保留bf16精度的视觉塔optiq/optiq_vision.safetensors支持图像输入混合精度448个敏感层采用8位量化63个稳健层采用4位量化总计511个量化层专家架构256个路由专家40个专家层结合MLX框架实现高效推理硬件兼容性特别优化的Apple Silicon支持在36GB内存的Mac上可舒适运行小内存设备可通过SSD专家流技术stream-experts实现流畅推理将注意力机制、路由和嵌入层常驻内存仅在需要时从磁盘读取路由专家。⚙️ 快速部署OpenAI兼容API服务一键安装步骤通过mlx-optiq工具包实现快速部署pip install mlx-optiq optiq serve --model mlx-community/Ornith-1.0-35B-OptiQ-6bit --stream-experts这条命令会自动启动一个OpenAI兼容的API服务默认监听本地8080端口。--stream-experts参数启用专家流技术适合内存有限的设备。服务特性一览部署后的API服务具备以下特性完全兼容OpenAI聊天补全API规范支持图像内容输入通过image_url格式混合精度KV缓存优化工具调用修复功能提示缓存机制提升响应速度 调用视觉问答API实战准备工作确保服务已启动然后准备一张测试图片如photo.jpg使用以下Python代码构建API请求import base64, json, urllib.request # 读取并编码图片 b64 base64.b64encode(open(photo.jpg, rb).read()).decode() # 构建请求体 body { model: Ornith-1.0-35B-OptiQ-6bit, max_tokens: 512, messages: [ { role: user, content: [ {type: image_url, image_url: {url: data:image/jpeg;base64, b64}}, {type: text, text: 请描述这张图片的内容并分析图片中的主要元素} ] } ] } # 发送请求 req urllib.request.Request( http://127.0.0.1:8080/v1/chat/completions, datajson.dumps(body).encode(), headers{Content-Type: application/json} ) # 处理响应 response json.load(urllib.request.urlopen(req)) print(response[choices][0][message][content])关键参数说明max_tokens控制生成文本的最大长度建议设置为512以上以确保完整回答image_url支持base64编码的图像数据或网络图片URLmessages遵循OpenAI的消息格式可包含多轮对话历史 高级应用纯文本推理除了视觉问答Ornith-1.0-35B-OptiQ-6bit也可作为高性能文本模型使用安装mlx-lmpip install mlx-lmPython推理代码from mlx_lm import load, generate # 加载模型和分词器 model, tokenizer load(mlx-community/Ornith-1.0-35B-OptiQ-6bit) # 构建对话提示 prompt tokenizer.apply_chat_template( [{role: user, content: 解释TCP和UDP之间的区别}], add_generation_promptTrue, tokenizeFalse ) # 生成回答 print(generate(model, tokenizer, promptprompt, max_tokens512))⚠️ 注意这是一个推理型模型在回答前会进行思考因此需要足够的max_tokens以确保回答完整。 模型技术细节属性数值主要精度6-bit8位量化层敏感层4484位量化层稳健层63总量化层数511分组大小64专家数量256个路由专家专家层数量40层视觉塔bf16精度333个张量磁盘大小27GB 总结Ornith-1.0-35B-OptiQ-6bit通过创新的混合精度量化技术在保持高性能的同时大幅降低了资源需求特别适合在Apple Silicon设备上构建本地视觉问答API服务。其OpenAI兼容接口使得迁移现有应用变得简单而专家流技术则让低配设备也能流畅运行大模型。无论是需要处理图像输入的视觉问答场景还是纯文本的复杂推理任务这款模型都能提供高效且高质量的本地AI服务为开发者和研究人员提供了强大而经济的AI解决方案。【免费下载链接】Ornith-1.0-35B-OptiQ-6bit项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/Ornith-1.0-35B-OptiQ-6bit创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表