尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

揭秘Intern-S2-Mobius:35B参数的革命性AI模型如何实现4倍推理加速?

揭秘Intern-S2-Mobius:35B参数的革命性AI模型如何实现4倍推理加速? 揭秘Intern-S2-Mobius35B参数的革命性AI模型如何实现4倍推理加速【免费下载链接】Intern-S2-Mobius-FP8项目地址: https://ai.gitcode.com/InternLM/Intern-S2-Mobius-FP8Intern-S2-Mobius是一款拥有35B参数的革命性AI模型它基于Mobius-v0架构构建通过创新的知识-推理分离设计在保持强大性能的同时实现了近4倍的推理加速为AI应用带来了全新的效率体验。 Intern-S2-Mobius的核心突破知识与推理的巧妙分离传统Transformer模型将知识存储和推理计算逐层绑定而Intern-S2-Mobius则创新性地将知识组织到一个全局共享的Memory中并让多个Reasoners针对这个共享知识库迭代查询和优化隐藏状态。这种架构革新带来了两大原生能力 反向残差连接Backward Residual Connection推理阶段可以访问超越其本地层级结构的知识不再局限于前向逐层信息流实现了更灵活的跨层知识组合帮助模型用更少的推理步骤合成有用信息。 动态潜在推理Dynamic Latent ReasoningMobius在解码前通过循环潜在迭代优化连续隐藏状态将部分 deliberation 过程内化减少了对长可见思维链的依赖并为不同令牌动态分配计算资源。 四大核心优势解析1️⃣ 知识-推理解耦架构用全局共享的Memory取代了层级绑定的FFN知识存储使每个Reasoner都能访问更广阔的知识空间与标准Transformer布局相比提高了知识压缩效率。2️⃣ 更高推理效率与简洁推理在推理基准测试中Intern-S2-Mobius达到了与Qwen3.5-35B基线相当或更强的分数同时产生了明显更短的推理轨迹和更高的请求吞吐量在报告的评估中实现了近4倍的端到端推理加速。图1推理基准测试的效率对比。Intern-S2-Mobius在保持强大推理性能的同时提高了请求吞吐量其增益主要来自更短、更紧凑的推理轨迹。3️⃣ 强大的通用和科学性能在通用推理基准测试中Intern-S2-Mobius的报告平均分超过了Qwen3.5-35B并且在生物学指令、分子指令和MolecularIQ等科学任务上显示出巨大优势。图2通用和科学基准测试的性能对比。每行中较高的分数以粗体突出显示。4️⃣ 更短的思维链长度与传统模型相比Intern-S2-Mobius能够用更少的令牌完成相同的推理步骤主要得益于模型消除了重复的推导和检查。图3Mobius从Qwen3.5持续预训练后的平均输出长度对比。 案例研究推理步骤的高效优化在一个线性代数多项选择题上Intern-S2-Mobius-35B和Qwen3.5-35B都选择了正确答案选项C但Mobius用更少的令牌完成了相同的推理步骤。图4Intern-S2-Mobius-35B与Qwen3.5-35B在一个线性代数多项选择题上的步骤对齐比较。使用Qwen3.5-35B分词器计算令牌数。Mobius用更少的令牌完成了相同的推理步骤主要得益于模型消除了重复的推导和检查。⚡ 快速开始部署与使用指南Intern-S2-Mobius发布的是bfloat16权重格式的35B模型支持多种部署方式包括LMDeploy、Transformer和vLLM等推理框架。推荐采样参数为确保获得更好的结果建议使用以下超参数top_p 1 top_k 50 min_p 0.0 temperature 0.8部署方法LMDeploy推荐使用MTP推测解码lmdeploy serve api_server \ internlm/Intern-S2-Mobius \ --trust-remote-code \ --backend pytorch \ --tp 1 \ --speculative-algorithm qwen3_5_mtp \ --speculative-num-draft-tokens 4 \ --dtype bfloat16 \ --max-batch-size 64基本服务不使用MTPlmdeploy serve api_server \ internlm/Intern-S2-Mobius \ --trust-remote-code \ --backend pytorch \ --dtype bfloat16 \ --tp 1Transformersimport torch from transformers import AutoModelForImageTextToText, AutoTokenizer model_path internlm/Intern-S2-Mobius tokenizer AutoTokenizer.from_pretrained(model_path, trust_remote_codeTrue) model AutoModelForImageTextToText.from_pretrained( model_path, trust_remote_codeTrue, torch_dtypetorch.bfloat16, device_mapauto, ).eval() messages [ {role: user, content: Give me a short introduction to Intern-S2-Mobius.} ] text tokenizer.apply_chat_template( messages, tokenizeFalse, add_generation_promptTrue, ) inputs tokenizer(text, return_tensorspt).to(model.device) with torch.no_grad(): output_ids model.generate( **inputs, max_new_tokens512, do_sampleTrue, temperature0.8, top_p1, ) response_ids output_ids[0][inputs[input_ids].shape[-1]:] print(tokenizer.decode(response_ids, skip_special_tokensTrue))vLLM使用MTP推荐vllm serve \ internlm/Intern-S2-Mobius \ --trust-remote-code \ --tensor-parallel-size 2 \ --reasoning-parser qwen3 \ --enable-auto-tool-choice \ --tool-call-parser qwen3_coder \ --spec-method mtp \ --spec-tokens 4基本服务不使用MTPvllm serve \ internlm/Intern-S2-Mobius \ --trust-remote-code \ --tensor-parallel-size 2 \ --reasoning-parser qwen3 \ --enable-auto-tool-choice \ --tool-call-parser qwen3_coder 总结Intern-S2-Mobius通过创新的Mobius架构成功实现了知识与推理的分离在35B参数规模下不仅保持了强大的通用和科学性能还实现了近4倍的推理加速。这一突破性进展为AI模型的效率优化开辟了新路径特别适合对推理速度和吞吐量有高要求的应用场景。无论是科研探索还是商业应用Intern-S2-Mobius都展现出了巨大的潜力值得广大AI爱好者和开发者关注与尝试。要开始使用Intern-S2-Mobius请克隆仓库https://gitcode.com/InternLM/Intern-S2-Mobius-FP8【免费下载链接】Intern-S2-Mobius-FP8项目地址: https://ai.gitcode.com/InternLM/Intern-S2-Mobius-FP8创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表