尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

fuse-1 Lite:5.72B参数革命性代码增强混合专家模型,如何在消费级GPU上实现高效编码?

fuse-1 Lite:5.72B参数革命性代码增强混合专家模型,如何在消费级GPU上实现高效编码? fuse-1 Lite5.72B参数革命性代码增强混合专家模型如何在消费级GPU上实现高效编码【免费下载链接】fuse-1-Lite项目地址: https://ai.gitcode.com/hf_mirrors/Akahsizrr/fuse-1-Litefuse-1 Lite是一款革命性的代码增强混合专家模型拥有5.72B参数它创新性地融合了LiquidAI的LFM2.5-2.6B主体模型与从Qwen3.6-35B-A3B中提取的960个编码专家。该模型专为高效编码辅助、智能体工作流和设备端推理而设计为开发者带来了全新的编码体验。核心技术外科手术式专家移植与学习路由fuse-1 Lite采用了与众不同的技术路径——外科手术式专家移植与学习路由。它从Qwen3.6-35B-A3B中提取出960个专门用于编码的专家经过标准化处理后将其作为残差增强整合到LFM2.5的解码器层中。每层都有一个路由器通过学习来确定为每个标记激活哪些专家同时还有一个学习到的比例因子来控制每层专家的贡献程度。这种独特的架构设计使得模型在保持高效的同时具备了强大的编码能力。消费级GPU上的高效部署方案vLLM——高吞吐量服务fuse-1 Lite通过一个扩展vLLM原生LFM2的插件在vLLM中得到支持。该插件通过vllm.general_plugins入口点将Fuse3ForCausalLM注册到vLLM的ModelRegistry中并重用vLLM的原生LFM2注意力实现确保了高效的推理性能。安装vLLM插件的命令如下pip install githttps://huggingface.co/Akahsizrr/fuse-1-Lite-vLLM使用vLLM服务时显存需求约为12GB适用于A10G、A100、H100等GPU型号。MLXApple Silicon对于Apple SiliconM1用户fuse-1 Lite提供了MLX格式。MLX模型文件fuse3_mlx.py扩展了MLX的原生LFM2实现以支持专家路由和激活。加载模型和分词器的代码示例model, tokenizer load(Akahsizrr/fuse-1-Lite-MLX, trust_remote_codeTrue)使用mlx_lm生成文本的命令mlx_lm.generate --model Akahsizrr/fuse-1-Lite-MLX --trust-remote-code --prompt Write a Python fizzbuzzMLX格式的显存需求约为12GB适用于M1 Pro、M2、M3、M4等Apple Silicon芯片。GGUF / llama.cppfuse-1 Lite还提供了GGUF格式可用于llama.cpp。需要注意的是GGUF使用自定义的fuse3架构标准的llama.cpp无法加载它必须使用支持Fuse3的llama.cpp分支。构建支持Fuse3的llama.cpp的步骤可参考GGUF仓库中的INTEGRATION.md文件。GGUF F16格式的显存需求约为11.4GB。模型参数概览Total Parameters5.72Bfuse-1 Lite通过创新的混合专家架构在5.72B参数规模下实现了高效的编码能力为消费级GPU上的高效编码提供了可能。无论是进行高吞吐量的服务部署还是在Apple Silicon设备上本地运行亦或是通过llama.cpp进行部署fuse-1 Lite都能满足不同场景下的需求助力开发者提升编码效率。想要开始使用fuse-1 Lite可通过以下方式克隆仓库git clone https://gitcode.com/hf_mirrors/Akahsizrr/fuse-1-Lite然后根据自身的硬件环境选择合适的部署方案开启高效编码之旅。【免费下载链接】fuse-1-Lite项目地址: https://ai.gitcode.com/hf_mirrors/Akahsizrr/fuse-1-Lite创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表