Laguna-XS-2.1-8bit性能测试MacBook M5 Max上实现95 tok/s极速生成【免费下载链接】Laguna-XS-2.1-8bit项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/Laguna-XS-2.1-8bitLaguna-XS-2.1-8bit是一款专为MLX框架优化的量化模型基于poolside/Laguna-XS-2.1转换而来采用8位量化技术组大小64有效8.500 bpw在MacBook设备上展现出卓越的文本生成性能。本文将详细测试其在MacBook Pro M5 Max上的运行表现揭示这款小体积模型如何实现高达95 tok/s的极速生成体验。性能测试环境与方法测试在MacBook Pro M5 Max 128GB 40 GPU设备上进行使用oMLX的基准测试工具在单请求场景下生成128个tokens。测试涵盖不同长度的提示词输入1k至32k tokens全面评估模型在不同上下文长度下的生成速度、预填充速度、首次token生成时间TTFT和内存占用情况。实测性能数据95 tok/s的极速体验不同提示词长度下的性能表现提示词长度生成速度tok/s预填充速度tok/s首次token生成时间ms峰值内存占用GB1k95.4355428833.74k94.73874105834.38k91.33665223534.416k86.13067534234.732k76.724111358935.4从数据中可以看出即使在32k长上下文下Laguna-XS-2.1-8bit仍能保持76.7 tok/s的生成速度展现出优秀的长文本处理能力。而在1k短提示词场景下95.4 tok/s的速度几乎达到了实时对话的流畅度要求。与其他量化版本的性能对比Laguna-XS-2.1系列提供了多种量化版本8bit版本在性能与资源占用之间取得了极佳平衡模型版本每参数位数bpw磁盘占用GB生成速度范围1k→32k tok/sbf16166270.6 → 58.78bit8.5003395.4 → 76.76bit6.50125102.9 → 80.95bit5.50221115.9 → 87.74bit4.50318126.0 → 91.33bit3.50314137.2 → 98.88bit版本相比bf16全精度模型生成速度提升约35%磁盘占用减少47%同时保持了接近全精度的输出质量是兼顾速度与效果的理想选择。快速上手简单三步开始使用1. 克隆模型仓库git clone https://gitcode.com/hf_mirrors/mlx-community/Laguna-XS-2.1-8bit cd Laguna-XS-2.1-8bit2. 安装依赖确保已安装MLX框架及相关工具推荐使用uvx快速运行uvx --from mlx-vlm mlx_vlm.generate --model . --prompt 你好世界 --max-tokens 3003. 开始生成文本使用提供的命令行工具传入自定义提示词即可开始文本生成uvx --from mlx-vlm mlx_vlm.generate --model . --prompt 请写一篇关于人工智能发展趋势的短文 --max-tokens 500使用注意事项兼容性该模型适用于mlx-vlm和oMLX需强制启用模型的vlm模式mlx-lm目前暂不支持laguna架构相关支持正在开发中可关注mlx-lm#1223 PR。输出问题部分情况下响应开头可能出现空的/think标签这属于正常现象不会影响整体输出内容。性能优化对于长文本生成建议根据实际需求选择合适的量化版本8bit版本在128GB内存设备上可流畅处理32k上下文。总结Mac用户的高效AI助手Laguna-XS-2.1-8bit凭借MLX框架的优化和8位量化技术在MacBook M5 Max上实现了95 tok/s的极速文本生成为Mac用户提供了一个高性能、低资源占用的AI助手选择。无论是日常对话、内容创作还是长文本处理这款模型都能以流畅的速度和可靠的质量满足需求是Mac平台上AI应用的理想选择。模型的详细配置文件可参考config.json和generation_config.json更多技术细节请查阅项目中的README.md。【免费下载链接】Laguna-XS-2.1-8bit项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/Laguna-XS-2.1-8bit创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考