
2026 奇点智能技术大会 · 议题前瞻演讲嘉宾裴明明网易智企 AI 平台技术负责人大会时间2026年11月20-21日 · 北京万达文华酒店一、企业级 AI 中台的定义不是大模型API裴明明在网易智企的实践中将企业级 AI 中台定义为企业级 AI 中台 模型能力层 工程平台层 数据资产层 治理安全层 组织适配层层级核心内容常见问题网易方案模型能力层模型选型、微调、评测模型选型盲目、效果不可控多模型路由 自动评测工程平台层推理服务、RAG、Agent延迟高、成本高、不稳定自研推理引擎 弹性调度数据资产层知识库、标注数据、反馈数据分散、质量差统一数据湖 主动学习治理安全层内容安全、数据安全、合规审核滞后、漏检率高实时审核 多层过滤组织适配层培训、流程、文化抵触变革、使用率低渐进推广 度量驱动二、技术架构五层设计2.1 架构总览┌─────────────────────────────────────────┐ │ 第五层应用层业务系统 │ │ 智能客服 │ 智能营销 │ 智能办公 │ 智能研发 │ ├─────────────────────────────────────────┤ │ 第四层能力层AI 能力封装 │ │ 文本生成 │ 代码生成 │ 图像生成 │ 语音合成 │ │ 知识问答 │ 文档解析 │ 情感分析 │ 意图识别 │ ├─────────────────────────────────────────┤ │ 第三层引擎层核心引擎 │ │ 推理引擎 │ RAG 引擎 │ Agent 引擎 │ 微调引擎 │ ├─────────────────────────────────────────┤ │ 第二层模型层模型管理 │ │ 模型仓库 │ 版本管理 │ A/B 测试 │ 效果监控 │ ├─────────────────────────────────────────┤ │ 第一层基础设施层算力与存储 │ │ GPU 集群 │ 向量数据库 │ 对象存储 │ 网络加速 │ └─────────────────────────────────────────┘2.2 推理引擎设计# 网易智企自研推理引擎核心架构classNetEaseInferenceEngine:def__init__(self,config):self.model_routerModelRouter()# 模型路由self.batch_schedulerBatchScheduler()# 批处理调度self.kv_cache_managerKVCacheManager()# KV Cache 管理self.quantization_engineQuantizationEngine()# 量化引擎# 多模型支持self.models{}formodel_configinconfig.models:self.models[model_config.name]self.load_model(model_config)defload_model(self,model_config):加载模型自动选择最优配置# 根据硬件选择量化策略ifmodel_config.quantizationauto:gpu_memoryget_available_gpu_memory()model_sizemodel_config.parameter_sizeifgpu_memorymodel_size*2:# 充足显存quantizationfp16elifgpu_memorymodel_size:# 中等显存quantizationint8else:# 有限显存quantizationint4model_config.quantizationquantization# 加载模型modelload_model_with_quantization(model_config.path,quantizationmodel_config.quantization,)returnmodeldefroute_request(self,request:InferenceRequest)-ModelInstance:路由请求到最优模型实例# 1. 根据任务类型选择模型candidatesself.model_router.get_candidates(request.task_type)# 2. 根据负载选择实例best_instanceNonebest_scorefloat(inf)forcandidateincandidates:# 评分延迟预测 队列深度 成本latency_predcandidate.predict_latency(request)queue_depthcandidate.get_queue_depth()costcandidate.get_cost_per_token()scorelatency_pred*0.5queue_depth*0.3cost*0.2ifscorebest_score:best_scorescore best_instancecandidatereturnbest_instancedefinfer(self,request:InferenceRequest)-InferenceResponse:执行推理# 1. 路由model_instanceself.route_request(request)# 2. 加入批处理队列futureself.batch_scheduler.submit(request,model_instance)# 3. 等待结果resultfuture.result(timeoutrequest.timeout)returnresultclassBatchScheduler:动态批处理调度器最大化吞吐同时保证延迟def__init__(self,max_batch_size32,max_wait_ms50):self.max_batch_sizemax_batch_size self.max_wait_msmax_wait_ms self.queuePriorityQueue()self.batch_threadthreading.Thread(targetself._batch_loop)self.batch_thread.start()defsubmit(self,request,model_instance):提交请求到批处理队列futureFuture()# 根据延迟要求分配优先级priorityself._compute_priority(request)self.queue.put((priority,request,model_instance,future))returnfuturedef_batch_loop(self):批处理主循环whileTrue:batch[]start_timetime.time()# 收集批次whilelen(batch)self.max_batch_size:elapsed_ms(time.time()-start_time)*1000ifelapsed_msself.max_wait_msandlen(batch)0:break# 已等待足够时间且已有请求try:priority,request,model,futureself.queue.get(timeout0.01)batch.append((request,model,future))exceptEmpty:iflen(batch)0:breakcontinueifbatch:# 执行批处理推理self._execute_batch(batch)def_execute_batch(self,batch):执行批次推理# 按模型分组model_groupsdefaultdict(list)forrequest,model,futureinbatch:model_groups[model].append((request,future))# 并行执行各模型组formodel,requestsinmodel_groups.items():# 填充到相同长度padding truncationinputsself._pad_and_stack([r.inputforr,_inrequests])# 批量推理outputsmodel.batch_infer(inputs)# 分发结果fori,(_,future)inenumerate(requests):future.set_result(outputs[i])三、从 0 到 1 的建设路径3.1 建设阶段阶段一基础设施2-3 个月 ├── GPU 集群采购/云资源申请 ├── 基础推理服务搭建vLLM/TGI ├── 模型仓库建设模型上传、版本管理 ├── 监控告警体系Prometheus Grafana └── 交付物可运行的推理服务 阶段二核心能力3-4 个月 ├── 自研推理引擎路由、调度、批处理 ├── RAG 引擎向量检索、重排序、上下文构建 ├── Agent 引擎工具调用、多轮对话、记忆管理 ├── 微调平台数据管理、训练任务、模型评估 └── 交付物完整的 AI 能力平台 阶段三应用集成2-3 个月 ├── 智能客服知识库 对话 工单 ├── 智能办公文档生成 会议纪要 邮件 ├── 智能研发代码生成 代码审查 测试 ├── 智能营销文案生成 用户画像 推荐 └── 交付物4 业务应用上线 阶段四治理优化持续 ├── 内容安全体系审核、过滤、水印 ├── 数据安全体系加密、脱敏、审计 ├── 效果监控体系A/B 测试、效果归因 ├── 成本优化体系弹性伸缩、量化压缩、缓存 └── 交付物可持续运营的 AI 中台3.2 关键里程碑里程碑时间关键指标验收标准M1推理服务上线第 2 月末延迟 500ms压测通过M2RAG 上线第 4 月末准确率 80%业务测试通过M3Agent 上线第 5 月末任务完成率 70%业务测试通过M4首个应用上线第 6 月末日活 1000业务验收M5四应用上线第 8 月末总日活 5000业务验收M6治理体系完善第 12 月末安全事件 0安全审计通过四、效能数据真实的投入产出4.1 建设投入投入项数量成本万元说明GPU 服务器A10016 台800训练 推理GPU 服务器A1032 台640推理存储NVMe SSD200TB120模型 数据网络RDMA-80高速互联人力10 人团队12 个月1200研发 运维云服务备份/测试-160弹性资源总计-3000-4.2 业务产出应用日活用户替代人力年化节省万元ROI智能客服50,00030 人36012%智能办公8,00015 人1806%智能研发2,00010 人2006.7%智能营销5,0008 人1204%总计65,00063 人86028.7%关键洞察首年 ROI 28.7%第二年随着边际成本下降ROI 预计提升至 60%。4.3 技术指标指标目标实际达成率推理延迟P99 500ms380ms✅ 124%推理吞吐 1000 QPS1500 QPS✅ 150%RAG 准确率 80%85%✅ 106%Agent 任务完成率 70%75%✅ 107%系统可用性 99.9%99.95%✅ 100%安全事件数00✅ 100%五、组织变革技术之外的软因素5.1 组织适配的三阶段模型阶段一认知建立1-2 个月 ├── 高管培训AI 技术趋势、应用场景、风险挑战 ├── 业务调研识别高价值场景、收集痛点需求 ├── 试点选择选择 1-2 个友好团队进行试点 └── 目标让组织知道 AI 能做什么 阶段二能力构建3-6 个月 ├── 培训体系AI 基础、提示工程、工具使用 ├── 流程改造将 AI 嵌入现有工作流程 ├── 激励机制将 AI 使用率纳入绩效评估 ├── 文化建设树立AI 先锋标杆 └── 目标让组织会用 AI、敢用 AI 阶段三文化转型6-12 个月 ├── 角色转变从执行者到AI 协作者 ├── 技能升级从编码到架构设计AI 审查 ├── 组织调整设立 AI 创新中心、AI 赋能团队 ├── 持续优化基于数据反馈持续改进 └── 目标让组织离不开 AI5.2 关键成功因素因素一一把手工程AI 中台建设是一把手工程需要 CTO/CEO 级别的支持和推动。因素二业务驱动技术团队主导容易做成技术自嗨。必须由业务团队提出需求、参与验收、推动使用。因素三度量驱动没有度量就没有改进。必须建立从技术指标到业务指标到财务指标的完整度量体系。因素四容错文化AI 应用初期必然有失败案例。组织需要有容错文化鼓励尝试、容忍失败、快速迭代。六、参会建议角色重点关注推荐演讲技术负责人AI 中台架构、推理引擎、RAG/Agent裴明明业务负责人应用场景、ROI 评估、组织变革裴明明安全工程师内容安全、数据安全、合规审计裴明明技术决策者投入产出、建设路径、风险管控裴明明七、延伸阅读与资料裴明明网易智企 AI 平台技术博客网易智企企业级 AI 中台建设白皮书网易智企AI 应用效能评估方法论大会官网https://ml-summit.org2026 奇点智能技术大会2026年11月20-21日 · 北京万达文华酒店22 位确认嘉宾 · 18 大前沿议题 · 1000 行业精英立即报名 →