
最近一位开源界的传奇人物 Salvatore Sanfilippo用几千行纯C代码直接把准前沿284B参数的 DeepSeek V4 Flash 模型塞进了一台 128GB 内存的 MacBook Pro。最近一位开源界的传奇人物 Salvatore Sanfilippo用几千行纯C代码直接把准前沿284B参数的 DeepSeek V4 Flash 模型塞进了一台 128GB 内存的 MacBook Pro。也许大家更熟悉他的另一个名字 AntirezRedis 的创始人在2020年宣布退居二线2024年回归。而这次他开源的DS4在短短两天内就收获了超六千的star。YC 的 CEO Garry Tan 在X上表示“正在下载... 在 128GB 的 Macbook Pro 上拥有 1M token 上下文窗口据说还有可用的编码代理功能”。那么DS4到底是什么为什么能够引起轰动DS4专为 DeepSeek V4 Flash 设计的本地推理引擎DS4ds4.c是一个专为 DeepSeek V4 Flash 设计的本地推理引擎。但目前仅支持MetalApple Silicon未来可能加入CUDA支持。它做的事情可以用一句话概括在不改变模型能力的前提下把运行成本进行极限压缩。与很多通用推理框架不同DS4 直接围绕 DeepSeek V4 Flash 的架构进行优化去掉了大量通用抽象层从模型加载、KV Cache 管理到推理执行、内存调度都采用了高度针对性的设计。目前公开展示的核心能力包括面向 DeepSeek V4 Flash284B 级 MoE 模型进行深度适配重点优化编码、长上下文与 Agent 场景。支持最高 1M tokens 的上下文窗口。可在 128GB 统一内存的 Apple Silicon Mac如 M3/M4 Max 或 Ultra上运行。在部分公开测试中M3 Max 128GB 的短上下文生成速度约为 26–27 tokens/s长上下文预填充速度可达 250 tokens/s。支持 OpenAI 兼容 HTTP API、Thinking Mode、工具调用、持久化 KV Cache以及投机解码MTP等能力。为什么选择 DeepSeek V4 Flash前沿模型这么多Antirez 为什么为 DeepSeek v4 Flash 单独开发一个引擎在官方博客里Antirez 给出了 8 个原因更快因为活跃参数更少、思考模式更“克制”、支持 100 万 Token 上下文、在“知识边缘”更强、英语和意大利语写作质量更强、KV Cache 压缩率非常高、特殊 2-bit 量化后依然能用、认为DeepSeek 后续还会继续发布更强版本的 V4 Flash。三大硬核操作打破行业常规DS4 能在一台 128GB 内存的 MacBook Pro 上运行超大规模的 DeepSeek V4 FlashAntirez 的三项核心操作几乎都打破了行业中的常规认知。非对称 2-bit 量化这里提供的 2 bit 量化不是玩笑它们表现良好在编码代理下工作并以可靠的方式调用工具。DS4 并没有粗暴地把整个模型全部压缩而是只对 MoE 结构中路由专家routed experts进行 2-bit 压缩同时其他组件共享专家、投影、路由保持不变。这种“非对称压缩”既大幅降低了内存占用又尽量保住了模型能力。把 KV Cache 转储到 SSDKV 缓存实际上是磁盘上的“一等公民” 。过去很多人认为KV Cache 必须完整驻留内存否则长上下文推理几乎不可行。尤其是 1M tokens 这种级别的上下文理论上会迅速吃光 128GB RAM。但 DS4 直接换了思路不把 KV Cache 全留在内存而是利用 Apple Silicon 的高速 SSD把磁盘当作“扩展内存”。本质上这是一种典型的内存—存储分层推理memory hierarchy inference设计用更大的存储空间换取有限的内存容量从而支持更长上下文与跨会话恢复能力。纯 Metal 原生优化DS4 几乎没有额外框架封装整个系统直接围绕 Apple Silicon 和 Metal API 深度定制所有代码几乎都只服务于一个目标让 DeepSeek V4 Flash 在苹果芯片上跑到极致。相比很多“什么模型都支持”的通用推理框架DS4 更像一台为单一模型量身打造的专用引擎。网友评价夯爆了Antirez 的 DS4 刚发布不久就有网友抢先试用了“简直不敢相信它运行得这么好甚至没想到这种东西能在我的电脑上运行。谢谢。”Reddit 上的网友也给出了好评“我在我的 M5 Max 128GB 上试用了一下说实话效果真的令人印象深刻。很期待它未来的发展。”当然还有网友期望能够获得llama.cpp 的支持。写在最后在X上有网友评论“Redis 创始人用一个 C 文件就毁掉了大厂烧几十亿的 GPU 集群”。这也就回答了我们开头的问题为什么能够引发轰动大模型的成本并不一定只能靠无限堆 GPU 来解决。过去几年行业里形成了一种越来越强的趋势更大的模型、更多的 GPU、更高的推理成本。但 DS4 展示出了另一条路线通过极端工程优化把原本只有大型 GPU 集群才能完成的事情下放到消费级硬件。在 Reddit 的网友评论:“令人惊叹的是Redis 的开发者现在又给我们带来了这个。”Redis 用十几年从个人开源项目成长为支撑全球互联网的核心基础设施Antirez 又为我们带来了新的惊喜各位大佬体验过 DS4 了吗资料展示下面是我整理的AI大模型学习资料和工具包预览适合收藏后按主题逐步学习。如果你想看完整资料目录可以在评论区留言「资料」也欢迎告诉我你更关注AI大模型里的哪类内容。