尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

硅谷疯抢英伟达芯片背后:Sail Research创始人揭秘AI算力未来新路径

硅谷疯抢英伟达芯片背后:Sail Research创始人揭秘AI算力未来新路径 把智能做成极廉价的大宗商品现在整个硅谷都在疯狂抢购英伟达Blackwell芯片、囤积供电指标、把数据中心推向吉瓦级只为让聊天机器人以毫秒级速度响应用户。但曾在英伟达写底层算子、如今创办Sail Research的Neil Movva认为行业可能一开始就陷入了“延迟陷阱”。在他看来AI的终局不是低延迟实时对话而是能自主运行数小时甚至数天的后台Agent。为让后台推理成本暴跌1000倍Neil正执行“算力拾荒者战略”。在最新一期《Invest Like the Best》访谈中主持人Patrick OShaughnessy与Neil探讨了算力未来要点速览如下最好的延迟是零延迟世界上没有坏芯片只有糟糕的定价Transformer的“原罪”互联网是对数据的一次性补贴买下95%可用率的“廉价”机房。最好的延迟是零延迟主持人询问Sail Research正在构建的系统是什么以及为何有必要存在。Neil Movva表示Sail Research是“Token工厂”提供API以低价提供token推理服务支持客户构建agent托管云端长生命周期agent虚拟机。主持人认为他们专注特定推理类型目标是成为最廉价供应商推动特定智能普及Neil表示认同称公司核心主题是“丰裕”希望让更多人能以低成本使用智能降低token成本会催生新的产品品类。主持人提到“token成本”Neil表示这是当下的北极星指标虽不是工作量或智能的终极度量单位但目前是通用单位未来行业会转向“成果”。他还指出agent消耗token的数量取决于任务未来agent会自我管理token预算。主持人询问他们解决问题的机会在哪Neil认为有两股顺风。一是开源崛起客户希望拥有智能控制权为开源模型托管服务创造市场但现有公司集中在“低延迟推理”而现在对agent的需求更注重持久性和长周期任务处理能力放宽延迟要求可带来效率和成本优势。凡是能被验证的问题背后都标好了Token的价格主持人质疑人都希望快速回复Neil表示最好的延迟是零延迟希望工作在后台自动完成。只要人类参与“提示agent并等待响应”的人机回路就会成为agent处理工作的瓶颈人与agent协作的未来应贴近人类时间节奏。他还提到思考期计算扩展概念Opus 4.5问世让长周期任务有了下注方向现在的agent能连续运行一小时长周期运行的市场上限无穷。他认为今年年底后台任务和实时任务负载比例约为50:50未来会变为90:10。在场景方面深度研究和网络安全领域适合后台任务处理。深度研究如对大量数据源综合分析、建立信息索引等需要不同智能形态网络安全领域需要构建各种agent来攻破软件、寻找漏洞且不同模型发现漏洞的能力不同促成多元化采样策略。在英伟达学到的一课放弃私家车的超低延迟开好吞吐量这辆“大公交”主持人畅想低成本、长运行时间的agent能解锁的新产品品类Neil认为个人用户方面“主动式智能agent”很有前景如后台运行的Siri能理解用户信息并提供帮助。从长远看智能能攻克“可验证问题”目前这类问题有隐藏的美元标价未来解决成本会降低。对于不可验证的任务如人类的审美与品味问题目前还未解决他们专注于高度量化问题。拆解Transformer的“原罪”主持人询问打造技术栈的宏图大略Neil表示从软件谈起要围绕GPU极限效率构建LLM软件栈从底层算子编程入手。他以Tensor Core为例介绍其是GPU上加速矩阵乘法的专用单元NVIDIA为其分配硅片面积经历了漫长过程。矩阵乘法重要是因为它是混合数字并让它们相互作用的简洁方法线性代数是数据复杂关系的紧凑表征形式。NVIDIA从专注图形处理转向支持机器学习黄仁勋决定在芯片上安装第一代Tensor Core。在NVIDIA工作时他们为争取硅片面积与图形渲染团队竞争在第一代芯片上拿到5% - 10%的晶圆面积用于加速卷积。软件团队为压榨芯片性能追逐“光速极限”即理论可能的边界。Neil表示自己仍要求工程师追逐100%的光速极限不在乎相对指标只看绝对指标。他还提到NVIDIA员工留存率高工程师优秀且专注公司节俭文化也影响了他。他认为GPU本质是吞吐量机器但过去AI被用作交互式聊天机器人追求低延迟给GPU带来麻烦在GPU上吞吐量和延迟存在权衡取舍。未来将从聊天机器人转向更多主动式或后台运行的agent围绕吞吐量构建技术栈更合理。主持人询问吞吐量和延迟权衡的原因Neil解释这是计算机科学领域的经典权衡具体到GPU“批处理”概念很重要将用户工作打包运行会增加总工作量导致单个token或用户请求耗时增加就像公交车和私家车的区别。他们的第一步是在NVIDIA GPU上打造极致的“公交车”探索不同并行策略。如NVLink互联技术可降低单次操作最低延迟但不是他的选择他倾向于专家并行或流水线并行等方案可隐藏通信延迟。NVLink是提升延迟性能的技术NVIDIA在低延迟推理方面无敌但Neil认为其他芯片只要基础计算部件出色在单位美元算力上有优势也可在其技术栈中有一席之地。互联网数据被吃光了下一代智能靠沙盒里的自我博弈主持人询问对Cerebras等公司的看法Neil表示它们打造聚焦全新内存层次结构的加速器最大化芯片上的SRAM容量。制造芯片内存有SRAM和DRAM两种途径SRAM极占硅片面积DRAM存储密度高但需定期刷新。Cerebras的思路是将更多芯片晶圆相连塞进大量SRAM以获得高速数据读取能力实现高每秒token速率。但它未来会走向混合形态需与有更大内存容量的硬件结合因为KV cache问题难以解决。KV cache是语言模型中存储对话历史表征的内存其体积会比模型权重庞大且模型在超长上下文对话上表现有挑战主打极致速度、超低延迟的方案会受其限制。像Groq等公司的芯片是专用加速器应与传统GPU协同工作将片外内存大容量和片上内存极致速度杂化融合。Transformer的“原罪”是将受内存带宽限制的层和受计算算力限制的层拼在一起单颗芯片难兼顾可把MLP放在Cerebras芯片上注意力机制放在GPU上。Transformer的贡献是能高效在无监督数据上学习关键是注意力机制适合学习序列数据在语言领域占统治地位且具有可扩展性从数百万跨越到数万亿参数。它是强大的通用学习器能表征任意两两配对关系在找到更好方法前注意力机制很优秀。世界上没有烂芯片只有糟糕的定价在不受待见的硬件里做算力套利主持人询问数据未来Neil认为互联网是对数据的一次性补贴高质量数据已被挖掘殆尽普通大众偏好反馈失效。数据的未来在于通过强化学习环境沙盒让模型自我进化给模型分配可验证任务让交互环境成为数据。这种模式会持续因为实现通用人工智能的最佳路径是叠加专用智能任务可验证是关键前沿实验室资金投向也印证了这一点。在软件方面算子开发很重要虽已有顶尖算子构成深度学习大厦基石但新模型出现时可能需修改算子。现在越来越倾向于将算子融合以提高效率。人类目前仍在手动做算子工程但未来模型可能会更强大前沿实验室内部已有大量算子工程实现自动化。将软件作为壁垒的优势可能会逐渐减弱因为大模型普惠所有人。在芯片利用效率方面GPU在大尺寸矩阵乘法时性能优化高效但在实际运行Transformer时需围绕芯片构建引擎持续喂入大批次工作任务。现在要把整个机架、集群、数据中心当作整体编程NVIDIA在这方面做到了极致。95%可用率的小机房才是推理的性价比之王主持人提到顶级芯片市场火爆询问非尖端芯片市场情况Neil表示NVIDIA对芯片分配有战略考量人脉关系在获取算力时很重要。他认为世界上没有坏芯片只有糟糕的定价只要价格合适任何芯片都有用。AMD芯片优秀但编程难度大市场对其有偏见这是套利机会。新兴创企的芯片面临规模挑战他希望评估并吃下其产能。他们在多芯片架构适配方面顶尖搭建软件栈反应速度快不畏惧挑战能找到芯片的比较优势并榨干其价值。对于投资者对半导体行业市值占比的担忧Neil认为现在的AI消费与过去不同不是投机推理支出会单调递增不存在投机泡沫。扩散不可阻挡3到6个月的闭源代差撑不起高昂的溢价神话主持人询问数据中心现状与未来Neil认为AI技术栈中基础设施提供商保守历史上数据中心为训练而生训练工作负载是推理的超集。数据中心存在规模不经济现在建设吉瓦级数据中心困难而分布式的1兆瓦小型数据中心适合推理。随着液冷技术普及1兆瓦算力可压缩进约8个冰箱大小的机架。他们的愿景是采购不同芯片压榨性能部署在小型数据中心做推理降低成本。他们愿意接纳95%可用率的机房因为后台运行机制下偶尔的抖动不影响长周期运行的agent他们有强大的控制平面处理故障且客户不在乎单轮任务的偶尔延迟。在电力方面Neil认为太阳能和风能利用率不足其间歇性问题可通过建立天气模型迁移数据和工作负载解决这样能以低成本获取电力资源。他的“拾荒者战略”是捡拾遗落芯片和闲散电力建立分布式聚合型大工厂。在企业模式上他内心既渴望全产业链自持又要务实从软件切入先达到一定规模再考虑其他。在生产智能token过程中他们认为算力扩展高效低效的地方在于注意力机制及其对内存的使用如KV cache冗余大且全球算力调度不足大量GPU闲置。晶圆厂应向他开放更多权衡空间他愿意接纳体质较差的芯片以实现全局优化。公司组织体系注重“极限思维”团队高度协作招聘看重好奇心和对性能工程的热爱。商业的本质是套利主持人询问对前沿实验室和闭源、开源阵营关系的看法Neil认为前沿实验室为保持3 - 6个月领先付出高昂溢价目前有商业价值。但围绕“模型蒸馏”存在争议“隐性蒸馏”会长期存在信息和模型能力扩散不可阻挡。企业迭代节奏慢开源不会消亡训练前沿模型门槛降低。他希望未来有充裕的token和百花齐放的适配框架人们能拥有智能所有权依赖上下文学习定制智能他的使命是提供廉价token。主持人询问他最离经叛道的观点Neil主要集中在对芯片的看法上他执着于将KV cache大规模卸载到闪存上。他认为每人每天消耗1万亿token是努力方向需降低单token成本世界对智能的需求无限要打破产品开发者的桎梏。他反思NVIDIA芯片在同等口径下的每瓦能效提升不大台积电芯片能效比变化也不大西方现有制程与台积电差距没那么大。他对OpenAI或Anthropic的技术方向只能祈祷或预测选择稀疏注意力还是稠密注意力、不同数据精度类型对他构建推理服务架构影响重大。对于创办新型算力创企的创业者他建议关注供应链瓶颈如台积电晶圆产能、HBM产能、先进封装产能和电力商业本质是套利要选准突破口。他认为NVIDIA不直接卖token是为了培育多元化生态让买家竞争维护商业信誉。最后他提到导师对他的帮助大二时导师纠正他的心态让他追求全栈通透的专业素养。
返回列表