
Maple-Preview vs 主流LLM5-16倍速度提升背后的三元量化技术突破【免费下载链接】maple-preview项目地址: https://ai.gitcode.com/hf_mirrors/deepgrove/maple-previewMaple-Preview是DeepGrove推出的开源20B-A1B三元权重推理LLM在同类模型中实现了SOTA推理能力甚至可与更大规模模型竞争。它能解决IMO级别的问题在Mac mini M4上运行速度超过200 tokens/sec比Gemma 4、Qwen3.5和gpt-oss等高效模型快5-16倍同时 checkpoint 仅5.31 GB支持131,072 Token上下文。突破性的三元量化技术架构Maple-Preview从设计之初就专注于高效的设备端推理采用24层、256个专家8个激活配置结合3:1 SWA-512:GA注意力机制。其核心创新在于三元量化技术通过特殊的量化处理fa3.py在保持推理能力的同时大幅降低了计算资源需求这使得模型在普通设备上也能实现高速运行。性能与速度的双重飞跃在性能评估方面Maple-Preview在内存-性能和速度-性能的帕累托前沿上树立了新的标杆充分展示了其强大的推理能力。该模型在LCBv6、AIME 2026、HMMT 2026和GPQA-D等多个基准测试中表现优异通过密集输出头进行的能力比较进一步验证了其在推理任务上的优势。快速开始使用指南要开始使用Maple-Preview你可以通过以下命令克隆仓库git clone https://gitcode.com/hf_mirrors/deepgrove/maple-preview需要注意的是包含的Transformers实现依赖于Triton和FlashAttention适用于兼容的CUDA环境。而报告中提到的Apple Silicon结果则使用了单独的设备端运行时configuration_maple.py。未来展望与局限性虽然Maple-Preview在原始推理方面表现出色但目前的预览版主要专注于该领域在代理类基准测试中可能表现欠佳。此预览版仅接受了少量的代理任务训练和小规模的通用强化学习modeling_maple.py。DeepGrove计划在Maple正式发布前通过扩展训练继续提升整体性能为用户带来更全面的AI体验。Maple-Preview采用MIT许可证发布为开发者和研究人员提供了开放、灵活的使用条件有望推动LLM在设备端高效推理领域的进一步发展。【免费下载链接】maple-preview项目地址: https://ai.gitcode.com/hf_mirrors/deepgrove/maple-preview创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考