尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

网易数据分析师笔试考点拆解:从统计学到SQL的备考路线

网易数据分析师笔试考点拆解:从统计学到SQL的备考路线 网易2020校招数据分析师提前批笔试复盘考点拆解与备考路线又到一年秋招季后台收到不少读者留言问大厂数据分析师笔试到底考什么。我翻出了当年参加网易2020校招数据分析师提前批笔试的完整记录结合后来做面试官的经历把这场笔试从头到尾拆一遍。这篇东西不吹不黑就是实实在在告诉你网易笔试考什么、为什么这么考、以及你该怎么准备。适合谁看正在准备校招数据分析师岗位的应届生、想转行做数据分析的职场新人、以及想系统梳理数据分析师核心技能的朋友。如果你已经工作两三年也可以对照看看大厂对数据基本功的要求到底在什么水位。先说结论网易数据分析师的笔试整体难度在互联网大厂中属于中等偏上比字节和拼多多稍微温和一点但比携程、美团要硬核。它不考偏题怪题考的全是你日常分析工作中真正会用到的东西。这一点很关键——网易的笔试风格暴露了它对数据分析师这个岗位的真实定位不是招一个会跑数的而是招一个能用数据解决业务问题的人。1. 笔试整体形态与考点分布1.1 考试流程与硬性规则网易的校招笔试统一走牛客网系统数据分析师岗位的试卷结构分为四个部分行测题、专业单选题、专业多选题、编程题。整场考试时间120分钟题量大概在40道左右。这里先提醒一个容易踩的坑行测题和专业题是分区块计时的每个区块提交后不能返回修改。我第一次模拟的时候不知道这个规则前面行测做得飞快结果提前交了进入专业题部分后面想回去改两道犹豫的题发现已经回不去了。所以实战中每道题都要当场给出最终答案尤其行测部分不会的题果断蒙一个别恋战。从分值权重来看专业题占大头行测占比相对较小但也不可忽视。坊间传言行测成绩不好会直接筛人这个我没有确切消息但根据我后来参与校招简历筛选的经验笔试成绩是按总分排名的如果行测错得太多导致总分掉出前30%确实会影响到面试邀约。1.2 考点分布全景图我把这场笔试的考点按照出现频率和权重整理了一下板块核心考点占比估算难度系数行测言语理解、逻辑推理、数量关系20%中等统计学概率计算、假设检验、置信区间、分布特征25%中高SQL多表关联、聚合分组、窗口函数20%中等业务分析指标体系、AB测试、用户行为分析20%高机器学习模型评估、过拟合、常见算法原理10%中等Python编程LeetCode简单~中等难度的题目5%中等这个分布其实说明了网易对数据分析师的核心期望统计功底要扎实SQL要能直接上手干活业务思维要在线机器学习懂原理即可不要求手推公式。对比CDA数据分析师的认证考试大纲来看网易的考察范围跟行业主流能力模型高度吻合只是更侧重业务场景的应用能力。2. 行测模块别在这部分浪费太多时间2.1 言语理解与逻辑推理的答题节奏行测部分主要是言语理解、图形推理和逻辑判断。这部分对理工科背景的同学来说通常比较头疼因为平时不怎么练。我当时的策略是言语理解类的题控制在每题40秒以内因为这类题的主观性较强想太久反而容易改错图形推理控制在每题1分钟超过时间直接跳过。这里有一个关键技巧牛客网的行测题很多是公务员考试题库里改编过来的原题或近似题。你不需要专门买行测的教材刷但考前花两天时间在牛客网刷50道行测题找感觉性价比极高。我那年遇到了一道排列组合的题跟之前刷过的真题几乎一模一样只是换了个场景描述。2.2 数量关系题的快算技巧数量关系题是行测里最耗时间的但网易考得不算太深。常见题型包括工程问题、行程问题、排列组合、概率。这里分享一个经验这些题几乎都能用排除法加估算解决不需要精确计算。举个例子一道题问甲乙两人从两地相向而行甲的速度比乙快20%两地相距多少公里如果按精确计算可能需要列方程解但选项中四个数值差距很大你完全可以用一个大概速度乘时间估算出结果直接锁定答案区间再验证唯一接近的选项即可。这种快算意识在真正的工作中同样重要——做数据分析时不需要每次都跑精确查询量级估算order of magnitude能帮你快速判断一个数是否合理。3. 统计学模块笔试的重头戏3.1 概率题与分布题的出题风格网易统计学的题出得比较实务不会让你背公式而是给你一个业务场景让你理解该用哪个公式、怎么算。比如给你一个电商场景用户点击率是10%随机抽取100个用户问至少有15个人点击的概率用哪个分布计算。这类题表面考概率实际考的是你对二项分布适用条件的理解。准备工作中的重点是二项分布、泊松分布、正态分布的区别和适用场景期望和方差的计算公式条件概率和贝叶斯公式的应用。我那年考了一道贝叶斯相关的题场景是垃圾邮件过滤已知某个词在垃圾邮件中出现的概率和在正常邮件中出现的概率求收到包含该词的邮件是垃圾邮件的概率。这道题如果只看过概念没亲手算过几道题很容易在公式变形上卡壳。3.2 假设检验与置信区间必考且容易丢分假设检验几乎是网易笔试每年必考的内容而且考得很细。我当时遇到的题目是一个AB测试的实验中实验组转化率2.1%对照组1.8%样本量各为10000问在显著性水平0.05下结论是什么。这道题表面是计算题实际考的是两个层次一是会不会算Z统计量二是会不会根据P值下结论。Z统计量的计算公式是$$Z \frac{p_1 - p_2}{\sqrt{p(1-p)(\frac{1}{n_1}\frac{1}{n_2})}}$$其中 $p$ 是合并后的转化率。代入数据计算Z值大概在1.56左右小于1.96的临界值所以不能拒绝原假设即不能认为实验组转化率显著高于对照组。这里有一个很多人会犯的错误看到2.1%大于1.8%就直接下结论说实验有效。但统计显著性和实际显著性是两个不同的概念——样本量不够大的时候即使数值上有差异也可能只是随机波动。这个思维在真正的工作中极其重要我在后面面试候选人的时候经常用一个类似的案例来考他们的统计基础能答清楚的人不到三成。3.3 常见分布特征速查表这里整理了一份考前必须掌握的分布特征对照表建议保存下来反复记忆分布适用场景期望方差关键性质二项分布 B(n,p)n次独立重复试验的成功次数npnp(1-p)n大时近似正态分布泊松分布 P(λ)单位时间内随机事件发生次数λλ均值等于方差正态分布 N(μ,σ²)大量独立随机因素叠加的结果μσ²3σ原则覆盖99.7%指数分布 Exp(λ)两次事件之间的等待时间1/λ1/λ²无记忆性这个表格看起来简单但笔试中的很多题都是在这些基础性质上做变形。比如给一个场景问“某客服系统平均每10分钟接到5个电话求5分钟内接到3个电话的概率”你需要先识别这是泊松分布的场景然后注意时间窗从10分钟变成了5分钟λ要从5调整为2.5再代入概率质量函数计算。这种题考的就是你对分布参数变换的敏感度。4. SQL模块看懂业务取数逻辑才是核心4.1 从笔试看网易SQL考查重点SQL在网易笔试中的比重不小但不会像专门的技术岗那样让你手写复杂存储过程。网易考SQL的方式是给一段业务背景然后让你写查询逻辑或者判断某段SQL的输出结果。我那年考了这么一道题有一张用户订单表orders(order_id, user_id, order_date, amount)要求统计每个用户2020年1月的总消费金额且只保留消费超过1000的用户。核心考点是GROUP BY HAVING的组合使用。这题本身不难但有个细节需要留意——订单日期字段如果是datetime类型需要先用DATE_FORMAT或者BETWEEN把日期范围限定正确否则容易把1月1日零点的数据漏掉或者把其他月份的数据纳入。考试中容易丢分的点有三个第一WHERE和HAVING的使用场景搞混聚合前的过滤用WHERE聚合后的过滤用HAVING第二日期边界问题很多人在处理“某月某日”的条件时忽略了一天的开始和结束时间第三对NULL值的处理LEFT JOIN后关联字段为NULL的情况经常被忽略。4.2 窗口函数的实战应用网易的笔试题里虽然没有直接考窗口函数的大题但在选择题中出现了对ROW_NUMBER() OVER(PARTITION BY ... ORDER BY ...)的理解判断。这个趋势在近两年的数据分析师面试中越来越明显——窗口函数已经成为数据分析师的基本功不只是网易几乎所有大厂的面试都会考察。窗口函数的核心理解在于它跟GROUP BY的区别在于GROUP BY会压缩行数而窗口函数不会。用生活化的例子来解释GROUP BY像是把一堆学生按班级分组输出每个班级的平均分你看到的是每个班一行而窗口函数像是给每个学生旁边标注他所在班级的平均分每个学生仍然保留自己的那一行只是多了一列班级信息。这个区别在取“每个类别下排名前N的记录”这类需求时就是关键所在。如果你对窗口函数还不熟练建议把以下三个类型练到肌肉记忆排名类ROW_NUMBER、RANK、DENSE_RANK、聚合窗口类SUM/AVG OVER配合ROWS BETWEEN用于计算累计值、移动平均、偏移类LAG/LEAD用于计算环比、同比。笔试中SQL题分数虽然只有20分左右但这是你最能确保拿满的部分行测和业务题都有主观因素SQL对就是对、错就是错性价比极高。4.3 一道典型SQL题的完整推演为了让你更直观理解网易SQL题的思维过程我把考试时遇到的一道题完整推演一遍。题目大概是有一个用户登录日志表login_log(user_id, login_date)需要找出连续登录3天及以上的用户。看到这个需求常规思路是两步走第一步用LAG窗口函数或者日期减法来标记连续区间第二步按用户和连续区间分组统计区间天数筛选大于等于3的。具体SQL思路如下WITH log_with_gap AS ( SELECT user_id, login_date, DATE_SUB(login_date, INTERVAL ROW_NUMBER() OVER(PARTITION BY user_id ORDER BY login_date) DAY) AS gap_date FROM login_log ) SELECT user_id, MIN(login_date) AS start_date, MAX(login_date) AS end_date, COUNT(*) AS consecutive_days FROM log_with_gap GROUP BY user_id, gap_date HAVING COUNT(*) 3;这个思路的核心逻辑是如果用户是连续登录的那么登录日期减去行号后得到的日期是相同的。比如1月1日登录是第1行1月1日减1天等于12月31日1月2日登录是第2行1月2日减2天也等于12月31日如果中间断了一天1月4日登录是第3行1月4日减3天等于1月1日就产生了不同的gap_date。通过这个巧妙的变换连续登录问题就转化成了分组统计问题。这种转换思维在笔试和工作中都非常有价值。5. 业务分析模块拉开差距的关键战场5.1 网易业务题背后的分析思维考核网易的业务分析题从来不直接问你“什么是转化率”而是给一个具体的网易产品场景让你分析指标变化的原因或者设计一个评估方案。这跟网易的业务结构密切相关——网易有游戏阴阳师、梦幻西游、音乐网易云音乐、电商严选、考拉、教育有道等多条业务线数据产品的形态差异很大。我那年遇到的一道题是某游戏产品的新用户次日留存率连续两周下降从45%掉到了38%作为数据分析师你会如何分析这个问题的原因。回答这个问题的思路很关键它直接暴露你的分析框架是否成熟。一个及格水平的回答是先从用户来源渠道拆分看是新用户质量下降还是产品体验出问题再看版本更新、外部竞争环境等因素。但一个高分回答会在前面加一步先确认数据本身是否正确比如统计口径有没有变化、埋点有没有出问题、渠道归因逻辑有没有调整。数据没核对清楚就埋头分析原因是分析师最容易被业务方诟病的毛病。5.2 AB测试相关的重点题型AB测试是业务分析模块的高频考点。网易考AB测试喜欢考察两类一类是实验设计的合理性判断另一类是实验结果的分析解读。实验设计题常见的陷阱有实验组和对照组样本量不等导致统计功效不足实验期间同时上线了其他功能造成混淆变量样本正交切割不合理导致用户被同时分入多个实验实验间相互干扰。这些陷阱在真实工作场景中天天都能遇到笔试考的就是你有没有踩过这些坑或者有没有认真学过AB测试的系统知识。CDA数据分析师课程里有一个完整的实验设计模块如果系统学过这部分基本不用额外准备。实验结果解读题则倾向于给一个场景实验组点击率比对照组高了5%但P值为0.08业务方急于全量上线问你的建议是什么。这道题考察的是统计显著性和业务决策的关系——P值大于0.05意味着没有足够证据支持实验组更优同时要考虑样本量是否足够、实验是否运行了足够长的周期覆盖完整的业务周期比如包含周末和工作日还要考虑是否存在新奇效应。你需要的不是背诵课本而是形成一套完整的实验评估框架。5.3 指标拆解与异动归因的核心方法论如果只能用一种能力来定义一个优秀的数据分析师我大概率选指标异动归因能力。这也是网易笔试业务题中分值最高、区分度最大的部分。关于留存率下降这类问题的归因框架我的习惯是先拆维度再挖根因。所谓拆维度就是按照用户属性新老用户、渠道来源、设备类型、版本号、时间维度日、周、季节、产品维度功能模块、页面路径把总体指标拆开定位是哪个细分人群或哪个模块出了问题。所谓挖根因就是在维度拆解的基础上进一步分析是用户结构变化导致的外因还是产品体验恶化导致的内因再结合用户访谈、竞品对标、行为路径数据来验证假设。这个分析框架不仅笔试要用入职后每一个指标异动分析工单都离不开它。网易的数据分析师有一个很重要的日常工作就是每天早上看核心指标报表一旦发现异常波动需要在最短时间内给出归因判断。笔试中考核这个能力其实是在预演你入职后的工作状态。5.4 数据敏感度的日常训练方法业务分析题做得好的候选人通常有一个共同特征对数据有天然的敏感度。这种敏感度不是天生的完全可以通过日常训练培养。我的建议是养成“量级估算”的思维习惯。比如看到网易云音乐说有1亿月活用户你可以快速估算一下如果每人每天听歌30分钟平均每首歌4分钟那每天的总播放次数大约是7.5亿次每秒钟就要处理将近8700次播放请求。这种估算不需要精确但能帮你建立对业务数据的直觉。笔试中有一类题就是给你一个业务数据让你判断哪个数值最合理四个选项可能从几万跨度到几十亿如果你对量级没有概念基本只能靠蒙但如果你有估算习惯一眼就能排除掉明显不合理的选项。6. 机器学习模块懂原理会应用即可6.1 网易对算法知识的要求水位网易数据分析师的笔试在机器学习部分的考察明显区别于算法工程师岗位。算法工程师需要手推公式、手写损失函数而数据分析师的机器学习题更注重考查你对常用算法原理的理解和模型评估的能力。常见考点包括过拟合与欠拟合的区别及应对方法正则化、交叉验证、增加样本量、降低模型复杂度精确率、召回率、F1、AUC的适用场景类别不平衡时为什么不能只看准确率决策树和随机森林的基本原理特征选择的方法过滤法、包裹法、嵌入法。这些考察点都停留在概念理解和应用决策层面不涉及复杂的数学推导。6.2 模型评估的经典考点剖析我那年遇到一道经典的模型评估题一个欺诈检测模型数据集99%是正常样本1%是欺诈样本模型在测试集上准确率达到99%但这个模型是否真的可用。这道题的正确答案是不能直接下结论因为即使模型把所有样本都预测为正常准确率也能达到99%所以准确率在这个场景下完全不能反映模型效果。应该看精确率预测为欺诈的样本中有多少真的是欺诈和召回率真实欺诈样本中有多少被识别出来或者看AUC和PR曲线。这个考点出现的频率极高几乎每家大厂的数据分析师笔试都会考。它的现实意义在于业务方在使用模型结果做决策时只看准确率往往会被误导。比如在反欺诈场景中假阴性的代价漏掉一笔欺诈交易远高于假阳性的代价人工复核一笔正常交易所以模型调参时要更多关注召回率指标。理解了这层业务含义你就能在笔试中从应用角度回答这类题跟只背概念的人拉开差距。6.3 特征工程与业务理解的结合网易笔试还会考察特征工程相关的知识特别是特征选择的方法。有一道选择题给了四个特征选择的方法——方差过滤、相关系数、卡方检验、主成分分析问哪个方法更适合处理高维稀疏的特征矩阵。这道题考的是对不同方法原理的理解方差过滤和卡方检验适用于特征选择主成分分析是特征提取会改变特征的原始含义而在高维稀疏场景下直接做PCA的可解释性会比较差。这里有一个很多候选人忽略的点特征工程不仅仅是技术活更需要对业务的理解。一个有效的特征背后一定有其业务逻辑支撑。比如在网易云音乐的推荐场景中“用户最近一周播放次数TOP3歌手的流派分布”这个特征就比单纯的“用户一周播放次数”更有解释力因为它捕捉到了用户的音乐偏好结构。笔试虽然不会让你现场构造特征但会通过选择题考察你有没有这种结合业务构造特征的意识。7. 编程题与综合准备策略7.1 Python编程题的实战节奏网易数据分析师的编程题通常只有一道难度在LeetCode简单到中等之间跟算法岗的hard级别题目完全不是一个量级。题型以字符串处理、数组操作、排序查找为主很少考动态规划和图论。编程题的关键是时间安排。我建议把它放到最后做因为它只有一道题而前面选择题决定了你笔试的基础分被一道编程题卡住导致前面专业题没时间回答是性价比最低的失误。如果考试时间紧张编程题完成暴力解法拿了部分分数就够了。网易笔试按用例通过比例给分部分AC也有分数不要求满分提交。备考编程题的时候不需要刷完LeetCode全部题目。重点刷数组、哈希表、字符串、双指针这几个标签下的简单和中等难度题一共大概40-60道覆盖的考察点已经远远超过网易笔试的要求了。7.2 四步备考路线图结合这场笔试的考察范围我给自己带过的新人做了一份四步备考路线也分享给你参考。第一步基础自查考前3-4周。用一周时间过一遍统计学基础知识包括描述性统计、概率分布、假设检验、置信区间、线性回归。推荐看《深入浅出统计学》配合可汗学院的统计学视频把概念理解透。同时每天刷30分钟SQL题推荐LeetCode数据库题库和牛客网SQL实战优先精通常见的窗口函数和聚合查询。第二步业务思维搭建考前2-3周。精读2-3个完整的数据分析案例报告重点看案例分析的结构和拆解逻辑。如果你是零基础想系统学习CDA数据分析师的课程体系值得参考它的业务分析模块就是按照实际数据岗工作流设计的从指标体系建设到归因分析都有系统讲解。这部分是笔试中最难临时抱佛脚的越早开始积累越好。第三步真题实战考前1-2周。找到往年互联网大厂数据分析师的笔试真题严格按照考试时间进行全真模拟。模拟时注意感受每道题的时间分配特别是行测部分千万别恋战。刷题不是目的重点是在刷题过程中总结出题规律和答题技巧。我当时整理了七页A4纸的错题笔记每一道错题都标注了错误原因和正确思路考前再快速翻一遍效果比重新刷两套卷子好得多。第四步查漏补缺考前3天。重点翻看错题本和统计学公式速查表把容易混淆的概念再理一遍比如精确率和召回率的区别、泊松分布和指数分布的区别保持每天刷一道编程题的手感不要去攻克新知识保持稳定的心态更重要。7.3 比笔试更重要的长期能力建设写到这里我想说一个可能不太受欢迎但非常重要的事实笔试只是整个校招流程中最标准化也最可控的环节。即使你在笔试中拿了高分如果业务思维和沟通能力跟不上面试环节依然可能被刷。从长期职业发展的角度来看数据分析师的核心竞争力排第一位的是业务理解力——能不能理解业务方的真实诉求把模糊的问题翻译成可执行的数据方案。第二位是沟通表达能力——能不能把复杂的分析结果用业务方听得懂的语言讲清楚。第三位才是工具技能和统计功底。笔试考的是第三位的底层部分而面试考的是前两个。这也是为什么我建议你在准备笔试的间隙抽出一些时间关注行业动态和优秀的数据分析案例。无论是网易云音乐的年度听歌报告还是有道的学习数据洞察这些产品背后的数据分析逻辑都值得认真研究。当你养成了从业务出发思考数据的习惯笔试的业务分析题会变得轻松很多。回到这场笔试本身网易2020校招数据分析师提前批的整体难度并不可怕它考的都是数据分析师日常工作中真正会用到的基础能力。只要你把统计学核心概念吃透、SQL练熟、业务分析框架跑通过拿下面试邀请没有太大悬念。祝各位准备秋招的朋友都能收获满意的offer。
返回列表