尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

老黄垒二十年的CUDA护城河,AI刚刚用十小时凿开了

老黄垒二十年的CUDA护城河,AI刚刚用十小时凿开了 一家成立仅一年的小公司用AI编程Agent只花10小时就搭出了一套「类CUDA软件」。CUDA又双叒叕被创了…这回动手的还是英伟达亲手喂大的AI。一家成立仅一年的小公司用AI编程Agent只花10小时就搭出了一套「类CUDA软件」。停停停。你是说这套英伟达花了近20年搭起来的软件帝国就这么被复刻了不止如此。DeepSeek也在尝试少写一点底层CUDA。他们已经开源了一套名为TileKernels的GPU算子库用TileLang来编写省去了大量手写底层CUDA代码的工作。不过类似的「CUDA危机」咱也不是第一次听了。每隔一段时间CUDA都要被拎出来鞭打一番动辄替代了、击穿了、护城河又被颠覆了…真的是这样么10小时「复刻」CUDA提起英伟达很多人的第一反应是GPU。H100、Blackwell、Rubin靠着一代代性能更强的芯片英伟达吃下了这一轮AI浪潮的最大红利。但英伟达真正难以撼动的优势其实不是硬件而是软件。芯片可以买参数可以追制程也会迭代。真正让客户用了英伟达之后很难再换走的是围绕GPU建立起来的整套软件生态。而CUDA就是这套软件帝国的核心。CUDA全称Compute Unified Device Architecture由英伟达高管Ian Buck带队花了近20年打造。它常被叫作编程语言但更准确地说CUDA是一整套围绕英伟达GPU建立的软件平台。如果简单拆成三层最底下是内核层直接让芯片干活的Kernel、编译器和运行时。中间是库层——cuBLAS、cuDNN等经过高度优化的计算库以及调试、验证和性能分析工具。最上面则是PyTorch、TensorFlow等开发框架企业积累的海量代码和工作流以及围绕CUDA成长起来的开发者生态。这么说可能有点抽象但你可以把英伟达GPU想象成一家工厂。CUDA最底层负责告诉机器每一步怎么干中间层提供现成的生产工具最上层则是一整套已经运转多年的生产体系。所以对客户来说买到的不只是英伟达的一块卡而是一座开箱即用的工厂。现在一位名叫Jeremy Nixon的老哥带着AI Agent来了。Nixon是AI软件初创公司Infinity的创始人此前也在Google Brain当研究员。他的团队开发了一套名为Ignition的AI研究Agent专门给不同AI芯片编写底层软件。它可以生成GPU Kernel、运行测试、寻找错误、测量性能再根据结果自动改写代码。人类工程师负责给出高层方向剩下那些琐碎又费脑子的工作就交给Agent反复循环。就这样Infinity用Ignition为AI芯片初创公司d-Matrix搭建了一套类CUDA软件。只花了10小时。啊那些过去需要芯片软件工程师反复调试的底层代码现在真能交给AI了还真不能说完全是炒作。AI Agent确实很适合这种具有明确反馈的编程任务。代码能不能编译结果算得对不对性能有没有提高都可以通过实际运行得到答案。于是Agent能够形成一个完整闭环写代码→编译→运行→测试正确性和性能→根据反馈继续修改不过Infinity主要攻入的是CUDA的第一层为不同芯片生成和优化推理Kernel并围绕这些Kernel搭建底层软件能力。它正在开发一套面向多种芯片的通用推理库但这不等于它在10小时内复制了CUDA近20年积累的完整生态。但是…但是你实际上并不需要复制一个CUDA就可以拿下1500万美元的融资。这家公司目前的估值也已经来到了1亿美元。有没有威胁到英伟达不知道反正资本是相当买账的。doge推理侧第二战场启动如果说AI Agent是攻城的武器那推理市场就是城墙上的缺口。大模型的计算主要分成两段训练是造模型需要上万块卡协同跑几个月推理是用训好的模型回答问题小集群甚至单卡就能跑。在训练侧CUDA目前依然近乎无解。大规模训练对性能、稳定性和集群协同极为敏感。芯片之间的通信、显存的调度、程序出错后如何恢复任何一点效率损失放大到数千乃至数万块芯片上都会变成真实的时间和成本。因此企业选择训练平台时往往极其保守。其他芯片即使纸面参数不错只要软件不够成熟、集群不够稳定省下来的硬件成本很可能从开发和试错成本里加倍偿还。但在推理侧游戏规则变了。韩国AI芯片公司Rebellions首席商务官Marshall Choy就认为在推理侧CUDA不再是决定因素。这将是一场开源软件的竞争。为什么竞争者都盯上了推理因为训练在乎「极致性能」而推理在乎的是「每个回答的成本」。训练需要上万块卡协同推理可以拆分到小集群甚至单卡训练不敢换芯片但推理可以。反正只要能跑、便宜客户就愿意试。更关键的是推理软件可以跨芯片运行。如果推理框架能支持多种芯片用户就能在不同硬件之间切换不用重写代码——CUDA最大的锁定效应就此失效。这就给专用推理芯片留下了机会。推理任务并不都需要CUDA从训练到集群协同的全部能力。针对特定模型、特定场景重新设计的芯片只要能够跑得更快、更便宜或者更省电就有机会从英伟达手里切下一块市场。比如d-Matrix本身就是一家主打推理的芯片公司。这家公司成立于2019年主攻生成式AI推理芯片。联合创始人兼CEOSid Sheth曾回忆他们很早便判断AI推理带来的机会最终会超过训练。Infinity用AI Agent花10小时搭建的类CUDA软件服务的正是d-Matrix的推理芯片。于是「10小时事件」的完整故事就连起来了新芯片想进入推理市场但缺少成熟软件AI Agent快速生成和优化底层Kernel把原本可能耗费数月乃至数年的适配工作压缩到小时或天。Sid还明着放话虽然英伟达在训练领域保持主导地位但在推理方面护城河有所削弱。盯上这个缺口的也不止d-Matrix一家。主攻推理的Rebellions、d-Matrix押注晶圆级芯片的Cerebras亚马逊的Inferentia、谷歌的TPU、AMD的MI300X……各路芯片厂和云计算巨头早已在推理市场排兵布阵准备从英伟达手里抢下一块肉。对这些公司来说他们不需要立刻替代英伟达。他们只需要证明在某些推理任务中不依赖英伟达的全套硬件和CUDA生态也能跑得更快或者更便宜。这就足够了。英伟达护城河到底颠没颠覆答案可能是…还差得远。前面也说了10小时重写的是「一块芯片的适配代码」而CUDA生态还有20年积累的库、调试工具、社区、几百万开发者。这并不是轻轻松松就能被颠覆的。更关键的是代码能生成不等于能用。INT21创始人Bing Xu上一家AI芯片软件公司HippoML被英伟达收购他本人今年4月才离开英伟达。他的判断是Agent能在短时间内生成大量代码但验证才是最大瓶颈。AI生成一万行代码很快但「证明这一万行在各种边界情况下都算得对、跑得稳」极慢。CUDA最深的资产恰恰是它的验证工具链——所以他认为Agent时代验证生态会成为CUDA的下一道护城河。Modular联合创始人兼CEOChris Lattner也泼了盆冷水。他认为编码Agent带来的改进是渐进式的「炒作被严重夸大」。理由有三第一写代码只是软件工程的一小部分生产级优化才决定芯片性能直接决定跑AI的成本第二芯片软件是小众精英领域公开代码远少于应用开发AI在这块能学的训练数据本来就少第三几百万行存量代码的迁移成本还在这不是技术能解决的属于组织决策。还有一点容易忽略的是英伟达自己也在使用AI。英伟达开发者生态副总裁Ankit Patel表示我们也在使用AI Agent来更快地开发CUDA并在更大规模上进行验证。以己之矛攻彼之盾进攻方的相对优势也会打折。Bing Xu总结下来这场仗的胜负取决于竞争对手追赶英伟达的速度能否快过英伟达自我迭代的速度。但很显然这家全球最大的芯片制造商「并没有在睡觉或原地踏步」。总的来说短期内英伟达的护城河安然无恙但变化会先在推理侧悄悄发生。长期的真正悬念是护城河正在从「代码的存量」迁移到「验证和优化的生态」。谁先占住新位置谁才是下一个赢家。
返回列表