尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

数据分析师校招笔试考什么?网易2018真题拆解统计、SQL与业务思维

数据分析师校招笔试考什么?网易2018真题拆解统计、SQL与业务思维 1. 网易2018校招笔试卷到底在考什么先聊个实在的。很多人一听到“数据分析师笔试”第一反应就是刷SQL题、背统计公式觉得把这两块啃下来就能过关。但如果你真拿网易2018年这套校招笔试卷做一遍会发现完全不是这么回事。这套卷子给我的整体感觉是它并不追求你掌握了多少工具而是在有限的考试时间里考察你有没有一套完整的数据分析思维框架。换句话说工具只是手段能不能用数据回答业务问题才是目的。整套卷子覆盖了统计学基础、SQL数据提取、业务场景分析和概率计算四个大模块题量不算大但每一道题都很“刁”表面看是考知识点实际上考的是你对分析流程的理解。我身边不少准备校招的同学都有个误区觉得笔试就是“刷题”把牛客网、力扣上的SQL题刷个几百道就稳了。但网易这套卷子给了你一个相反的信号SQL题只占一小部分更多的时间花在“读懂业务问题搭出分析框架”上。如果你只会写代码、不懂业务遇到“某功能上线后DAU下降你如何定位原因”这种题脑子里就会一片空白。还有一类考生则走到了另一个极端觉得业务分析题就是“吹”把产品思维、用户体验这些词堆上去就完事。但阅卷人一眼就能看出你有没有真正做过分析。框架只是骨架每一层框架下面都得有对应的数据指标、可执行的拆解逻辑这才是拿分的关键。适合谁来参考这套题呢首先是正在备战互联网大厂数据分析师岗位的应届生这套卷子的题型结构和考察重点和近几年各家大厂校招笔试基本是同一个套路做完不吃亏。其次是想转行做数据分析的职场人可以通过这套卷子快速自查一下知识盲区。哪怕是已经工作一两年的分析师偶尔翻翻这套题也能发现自己平时分析习惯里的漏洞。1.1 试卷结构与考察范围我根据实际做过的回忆版和培训机构整理的题库把网易2018校招数据分析师笔试卷的题型结构梳理成了下面这个表格考察模块题型方向常见占比核心能力统计学与概率假设检验、贝叶斯、期望、分布约30%推断思维、概率直觉SQL与数据提取多表关联、聚合、窗口函数约20%数据取数与加工能力业务与分析思维指标拆解、留存、漏斗、原因定位约35%业务理解与框架搭建Python/R基础数据结构、pandas操作、简单算法约15%编码落地能力注意这个占比不是绝对的因为不同岗位方向比如偏用户增长的数据分析师和偏商业分析的数据分析师侧重点会有差异但大体框架是一致的。让我意外的是这套卷子里统计学和业务分析的比例几乎旗鼓相当。很多备考者把大量时间花在SQL刷题上结果发现笔试里SQL只考了基础到中等的水平反倒是那些“你品品”的统计推断题和“你怎么看”的业务题占据了大半壁江山。1.2 校招笔试的真正目的想通这套卷子的出题逻辑你得先明白校招笔试和社招面试的本质区别。社招看的是你过去做过什么项目、踩过什么坑这些是靠简历和面试聊出来的。而校招的候选人大都没有完整的项目经验笔试就成了考察“思维底子”的最有效手段。所谓思维底子我理解下来有两层含义。第一层是你有没有统计学直觉。比如给你一组数据你知不知道要先看分布而不是上来就求均值看到两个指标走势背离你知不知道可能存在辛普森悖论。第二层是你有没有结构化的表达能力。业务题往往没有标准答案阅卷人看的是你能不能从多个维度拆解问题、有没有清晰的优先级判断、能不能给出可落地的验证方案。我自己刚入行那会儿也不理解为什么一道业务题要写那么多字后来当了面试官才明白笔试里写分析思路其实是在模拟你和业务方开会时怎么在几分钟内把你的分析逻辑讲清楚。想通这一点你备考的方向就完全不一样了。你不再是“背知识点”而是“练思维”。2. 统计学与概率题型详解统计学是数据分析师的底层语言校招笔试里这部分往往是拉开分差的关键。网易这套卷子的统计学题目不算难但非常“绕”它不直接问你公式而是给你一个业务场景让你判断该用什么方法、怎么解读结果。2.1 假设检验到底在考什么这一块几乎是必考的。常见的考法是这样的某功能改版后观测组和对照组的转化率一个提升了0.5个百分点给你一组样本量数据让你判断这个提升是否显著并说明理由。很多人拿到题第一反应是“算p值”如果p小于0.05就显著。这个理解不能说错但太粗糙了。阅卷人想看的是你脑海里完整的假设检验流程先设原假设和备择假设再确定检验类型双尾还是单尾接着选择检验方法z检验还是t检验独立样本还是配对样本然后考虑样本量是否满足中心极限定理的条件最后才是计算p值并结合业务背景做判断。这里要特别提醒一个校招生最容易踩的坑没有判断样本量就开始上z检验。很多题目故意给出一个只有二三十个样本的小流量实验这时候z检验的适用条件并不成立正确做法是用t检验或者至少说明样本量不足导致的检验功效问题。另外一个高频考点是p值本身的含义。面试官特别爱问“p值等于0.03能不能说原假设为真的概率是3%”这是个经典的陷阱题。答案是“不能”。p值描述的是在“原假设为真”的前提下观察到当前或更极端数据的概率。它不是一个关于原假设本身概率的陈述这两者之间有本质区别。把这一点写清楚能让阅卷人眼前一亮。我在实际做这套题时发现很多统计题其实并不需要真的算到具体数值评分标准里往往是“思路正确给大部分分数”。所以备考时一定要养成写过程的习惯把每一步逻辑都写出来不要只丢一个结果。2.2 业务场景里的AB测试陷阱AB测试是业务侧数据分析师最常用到的统计工具所以笔试里几乎一定会出现。网易这套卷子里的AB测试题考的不是怎么算显著性而是实验设计中的常见陷阱。举个例子题目可能会说某产品页面改版后新版本的点击率显著高于旧版本于是产品经理决定全量上线但上线后整体点击率反而下降了请你分析可能的原因。这道题的标准答法至少包含以下几个方面第一实验是否做了足够的样本量计算有没有因为提前停止实验导致“假显著”第二实验组和对照组是否真的同质有没有存在流量分配不均匀的情况第三实验期间是否有其他因素干扰比如运营活动、市场投放等第四最关键也最容易被忽略的——新版本对部分用户效果好但对另一部分用户效果差整体平均下来看是显著的上线后效果被“平均”掩盖了这就是辛普森悖论的变体。我面试过的人里十有八九能说出前三点但只有极少数人能主动想到用户异质性带来的效应差异。这其实就是一个数据分析师从“会算数”到“会思考”的分水岭。备考时一定要养成多问一句“这个结论放在所有场景下都成立吗”的习惯。实际工作中我也踩过类似的坑。有一回我们上线了一个新的推荐策略小流量实验数据非常漂亮点击率提升将近8个百分点但全量上线后大盘几乎没动。复盘下来才发现小流量实验期间刚好赶上大促预热用户本身的活跃度和点击意愿都被拉高了实验组的提升有一部分是“水涨船高”带来的假象而不是策略本身的功劳。从那以后我对“实验结论必须结合业务背景解读”这句话有了切肤之痛的理解。2.3 概率题贝叶斯与期望除了假设检验概率题也是网易这套卷子的常客。校招笔试的概率题和高考概率题完全是两回事它更看重你对“条件概率”的理解和对期望值的计算能力。贝叶斯公式的经典考法是某用户分类模型的准确率为95%用户中真正是目标人群的比例只有2%现在模型判定某个用户是目标人群问这个用户真正属于目标人群的概率是多少。这道题的陷阱在于很多人看到95%准确率就直接答95%完全忽略了先验概率的影响。代入贝叶斯公式算一下在2%的基准比例下即使模型准确率高达95%被判定为目标人群的用户真正属于目标人群的概率也只有大约27.8%。这个结果对很多没有统计学背景的人来说非常反直觉但恰恰是数据分析师在日常工作中经常要面对的场景。期望类的题目相对友好一些但要注意读题。有一类典型的题目是某抽奖活动中奖概率是千分之一奖金1000元每次抽奖收费2元问主办方平均每抽一次的期望收益。这类题考的是你能不能把收入项和支出项都列全、算清楚。看起来简单但考场紧张时特别容易漏掉“没中奖也收费”这个前提。备考概率题这块我的建议是别沉迷于难题偏题。校招笔试卷里的概率题难度基本控制在“你能用文字讲清楚思路”这个级别重点一定是基础概念贝叶斯、条件概率、独立性、期望、方差、常见分布二项分布、泊松分布、正态分布这些吃透了就够用。3. SQL与数据提取实操要点SQL是数据分析师的看家本领也是笔试里最容易拿到满分的一个模块。为什么说容易因为SQL的知识点是有限的窗口函数、聚合、关联、子查询这几座大山翻过去你就掌握了90%的日常查询需求。3.1 必考SQL从简单查询到窗口函数网易这套卷子的SQL题大致可以分成三个梯度。第一个梯度是简单查询考的是基础语法比如筛选、排序、去重、聚合这些基本是送分题但注意别在细节上翻车比如DISTINCT和GROUP BY的去重逻辑差异、COUNT和COUNT(DISTINCT)的区别。第二个梯度是多表关联。这类题很容易踩坑因为表之间的关联关系可能是多对多的如果不先做去重或聚合关联出来的结果会有笛卡尔积膨胀。举个例子用户表和订单表关联如果一个用户有多个订单直接LEFT JOIN会把用户维度数据重复多遍。想要得到正确结果要么先聚合订单表到用户维度再关联要么关联后再做去重处理。第三个梯度是窗口函数。我记得有一道题是让求每个品类下销售额排名前3的商品或者求每个用户最近一次下单的时间。这类问题用窗口函数是最优雅的解法用ROW_NUMBER()或RANK()配合PARTITION BY就能搞定。这里补充一个备考心得不要死记硬背窗口函数语法要理解它的执行逻辑。窗口函数是在GROUP BY聚合之后执行的它不影响行数每一行都能保留自己的明细信息。理解了这一点你自然就知道什么时候该用窗口函数、什么时候该用GROUP BY。3.2 常见SQL失分点我把批改过的笔试SQL题里常见的失分点整理成了一份清单希望能帮你避坑关联字段没加条件两张表关联时忘了写关联条件产生笛卡尔积数据量直接爆炸。这种错误在笔试里等于直接扣分。NULL值处理不当COUNT(字段)会忽略NULL而COUNT(*)不会。判断某个用户是否有订单时用NOT EXISTS比用NOT IN更稳妥因为NOT IN一旦遇到NULL值就会出现空结果。时间字段格式不统一题目里日期有的存成字符串有的存成时间戳需要先用DATE_FORMAT或FROM_UNIXTIME统一格式再做比较。很多人在这一步被扣了冤枉分。分组粒度理解错误求“每个用户最近一次订单”和“每个用户每个品类最近一次订单”的分组字段完全不同一个只按用户分组一个要按用户加品类分组。审题不清是最大的坑。考场上时间紧张很多人一上来就直接写SELECT写到一半才发现漏了表或者忘了条件。我的习惯是先花30秒把题目里的表结构、字段含义、输出目标写在草稿纸上理清楚各个表的关联关系和粒度关系再动手写SQL。磨刀不误砍柴工这个习惯帮我避免了很多低级错误。如果平时刷题推荐你在本地装一个MySQL或者直接用SQLite把笔试卷里的表结构建出来自己造一些边界数据测试。比如故意把订单表造出重复记录、把用户表造出NULL值看看你的SQL能不能正确处理。这种训练比单纯刷题有用得多因为它逼你思考数据质量问题。4. 业务场景题与产品思维题如果说统计和SQL是笔试的“硬技能”部分那业务场景题就是“软技能”部分也是最难临时抱佛脚的部分。网易这套卷子在业务题上花的心思最多题目往往给一个非常具体的业务场景让你扮演数据分析师的角色去解决一个实际业务问题。4.1 指标体系与留存分析业务题里最高频的考点是指标体系的搭建和留存分析。比如题目给你一个内容社区产品让你设计一套指标来衡量产品健康度并说明每个指标的意义。我的答题框架通常是这样的先分用户生命周期维度拉新、激活、留存、转化、传播再在每个维度下挑核心指标。比如拉新看新增用户数、新增渠道转化率激活看次日留存率、注册转化率留存看7日留存、30日留存最好能用同期群分析看留存曲线转化看付费率、人均付费金额传播看K因子、分享率。这样一拆回答的条理就出来了。但光有框架还不够阅卷人还会看你有没有用户分层的意识。比如新用户和老用户的留存指标要分开看因为新用户的激活期留存和成熟期用户的稳定留存背后对应的产品优化方向完全不同。留存分析还有一个高频考点是“如何评估留存指标波动的原因”。比如题目说某产品次日留存率连续下降了三天让你分析原因。这类题的答题逻辑是先确认数据真实性排除埋点问题和统计口径变化再做维度拆解按渠道、版本、机型、地区分别计算留存率找出下降最严重的维度然后结合业务动作看看这三天有没有发版、有没有投放变化、有没有竞品活动最后给出一个可行的验证方案比如对比历史同期数据看是否存在周期性波动。4.2 估算题与费米问题估算题也是网易笔试的大爱常常以“请估算北京一天有多少人喝奶茶”这种开放式的形式出现。题目看起来天马行空实际上考察的是你的逻辑拆解能力和对数量级的敏感度。我做估算题的通用思路是先从需求端拆解再从供给侧校验。以“估算北京一天卖出多少杯咖啡”为例你可以这么算北京常住人口约2100万按年龄和消费能力过滤后假设有30%的人是潜在咖啡消费者也就是630万这些人平均每两天买一杯咖啡那一天就是315万杯。再用供给侧交叉验证北京大约有6000家咖啡店单店日出杯量按100杯算一天总出杯量是60万杯。你会发现两个口径的结果差了一个数量级这说明你前面的假设有问题。常见的调整方式是常住人口中真正有日常咖啡消费习惯的人远没有30%那么多可能只有10%左右而且不是每两天一杯可能是一周两到三杯。调整后需求端的数据和供给侧就基本能对上了。这个“先发散、后收敛、双口径交叉验证”的过程就是阅卷人想看到的分析素养。答案本身不重要重要的是展示你有一个自洽的估算逻辑并且能在发现自己估算偏差时主动修正假设。另外提一句业务题答完以后如果时间允许一定要花一两句话总结你的核心结论。比如“综合来看短期留存下降最可能的原因是新版启动页拦截了用户首次内容消费路径建议回滚并做小流量验证”。这种有结论、有行动建议的收尾能明显提高你的得分上限。5. 备考路线与实战建议聊完这张卷子的题目再来说说怎么备考。我见过太多人备考数据分析师的时候东一榔头西一棒子今天学Python、明天刷SQL、后天看统计学学了一个月发现什么都没学透。校招备考最怕的就是没有主线。5.1 按阶段推进的备考路线我建议把备考分成四个阶段每个阶段有明确的目标和产出。第一阶段是搭知识框架用时一到两周。把统计学基础描述统计、概率分布、假设检验、相关与回归、SQL基础查询、聚合、多表关联、窗口函数、业务分析指标体系、漏斗分析、留存分析、AB测试这三条线的核心知识点快速过一遍不追求深度但要对全貌有感觉。第二阶段是专项刷题用时两到三周。这个阶段要针对性地刷题统计题每天做几道假设检验和概率题保持手感SQL题每天做几道中等难度的题重点是窗口函数和多表关联业务题每周做两三道要动笔写写完之后对照参考答案找差距。第三阶段是模拟实战用时一周。找完整的笔试卷掐时间做两到三套模拟真实的考试节奏。做完之后不要只看对错要把每一道错题的知识点、出错原因、正确解法整理到错题本里。这一步很多人会跳过但恰恰是提分最明显的环节。第四阶段是查漏补缺考前两三天。这个时候不要再刷新题了把错题本和核心公式过一遍重点是统计学里的检验方法适用条件、SQL里的边界情况处理、业务题的分析框架。保持状态比学新知识重要。5.2 几个值得长期坚持的习惯说完了备考路线再分享几个我觉得比“刷题”本身更重要的习惯。第一个习惯是带着业务视角看数据。平时看任何一篇行业分析报告不要只收藏试着问自己三个问题这个结论是怎么算出来的换一个口径会不会结论反转如果我是分析师我会怎么向业务方汇报长期这样训练你的业务敏感度会明显提升。第二个习惯是动手复现经典分析案例。比如复现一个用户流失预警模型、复现一篇留存分析的报告用真实数据走一遍完整的分析流程。这个过程中你会遇到数据清洗、口径处理、结果解读等各种问题这种实战经验是刷题刷不出来的。我在面试中遇到能清晰讲出自己复现项目细节的候选人好感度会高很多。第三个习惯是积累自己的分析框架。大部分人看到多个资料里讲的“留存分析框架”都是同样的套路但你要做的是把它内化成自己的语言和思考逻辑。当你发现你可以不看任何资料就能拿着笔在纸上画出分析思路时你才算真正掌握。网上关于数据分析师学习路线的资料特别多什么三日入门、七天速成基本都不靠谱。数据分析是一个“慢变量”岗位思维方式的形成需要时间靠突击背知识点可以过笔试但过不了面试里的深挖追问。如果你现在时间还充裕建议老老实实按阶段来如果时间紧迫优先抓统计学基础、SQL窗口函数、业务分析框架这三块它们是性价比最高的得分点。说到底网易这套2018年的校招笔试卷考察的不是答案而是你看待数据的方式。统计题看你能不能严谨地解读数据SQL题看你能不能准确地提取数据业务题看你能不能深入地思考数据背后的意义。把这三个能力练扎实了不管笔试考哪家、怎么考你都有底气。
返回列表