尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

京东数据分析笔试全解析:SQL、AB实验与业务案例备考指南

京东数据分析笔试全解析:SQL、AB实验与业务案例备考指南 开始之前先说说这份试卷为什么值得翻出来看看2019年京东春季校招的数据分析岗试卷放在今天回头看依然有很强的参考价值。不是说题目有多新恰恰相反它考察的东西——SQL取数、指标拆解、业务归因、AB实验设计——在六年后的数据分析面试中依然是主流。甚至可以说当下很多大厂数分岗的笔试核心逻辑和这份试卷是一脉相承的。我当时拿到这份试卷的第一感觉是它不考偏题怪题不考编程语言语法细节而是用京东自己的业务场景电商、物流、用户增长来包装每一道题。这意味着什么意味着它考察的不是“你会不会写代码”而是“你能不能带着业务视角去用数据解决问题”。这套考察逻辑正是数据分析岗位日常工作的真实映射。这篇文章会带你把这份试卷的核心考点逐层拆开从SQL到统计从指标体系到业务案例分析每一部分我都会给出解题思路、踩坑提醒和实操心得。不管你是正在准备大厂数分岗校招的应届生还是工作两年想跳槽的初级数据分析师这篇文章都能给你一套可以直接对照复盘的备考框架。1. 京东数据分析笔试的整体定位与考察逻辑1.1 从试卷看京东对数分岗的能力预期先聊一个很多人忽略的点笔试不是单纯考知识它在筛“适不适合干这行”。京东那份试卷前几道题基本锁定在SQL和数据处理上中间穿插统计推断和概率计算最后落到一两道业务分析大题。这个结构透露出的岗位预期非常清晰——数据分析师不是纯技术岗也不是纯业务岗而是两者的交汇点。你得能从数据库里把数取出来还得能把这些数变成业务决策依据。对比一下同期的其他大厂试卷会更明显。有的公司侧重机器学习算法推导有的公司侧重产品Sense和A/B测试设计京东这份卷子则更偏向“电商业务分析师”的画像SQL必须熟练统计要能落地业务逻辑要清晰。它的业务场景设定通常围绕GMV变动归因、促销活动效果评估、用户分层运营效果分析、供应链库存周转这类电商核心问题展开。所以你在复习时就别花太多精力去啃那些偏算法的深度内容了。把SQL窗口函数练熟把假设检验和AB实验的流程吃透再配合一套业务分析框架去练案例题基本就能覆盖这份试卷90%的考察面。方向对了努力才有效。1.2 题型分布与分值权重透露出的复习优先级我根据考过同学的回忆和公开的帖子整理了这份试卷大致的题型结构。虽然版本不完全一致但分布逻辑是一致的基础数据处理能力占大头业务分析能力紧随其后统计和概率穿插其中。题型大致占比考察核心SQL取数与数据清洗30%-35%多表关联、聚合、窗口函数、去重概率统计与AB实验20%-25%假设检验、置信区间、实验设计指标体系与业务理解15%-20%指标口径、漏斗拆解、归因分析业务案例主观题25%-30%分析框架、逻辑表达、落地建议这个分值分布说明了一个问题SQL和业务案例加起来占了半壁江山。如果时间有限这两个板块的优先级最高。统计部分虽然占比不小但考察的深度通常是应用层的不会让你手推复杂公式。至于概率题主要看你有没有基本的统计直觉。另外注意一个细节这套试卷是限时的通常90到120分钟要完成上面所有题目。时间紧张意味着你不仅要会做还要做得快。很多人栽在最后的大题上不是不会分析而是前面小题耗时太久。这个策略问题我后面会专门展开说。2. SQL与数据提取绕不开的第一道门槛2.1 京东场景下的SQL考点从取数到业务口径京东的SQL题和LeetCode那种纯算法题完全是两码事。它不会扔给你一张员工表和一张部门表让你join一下完事而是模拟一个电商业务场景比如订单表、用户表、商品表、促销活动表——然后问你“计算2023年第一季度各品类的复购率”或者“找出客单价高于品类平均值的前100个SPU”。这种题目表面上考SQL语法实际上在考两件事。第一你能不能把业务问题翻译成SQL逻辑。第二你懂不懂电商数据背后的口径和坑。比如“复购率”就有好几种口径按用户算还是按订单算时间窗口定在多少天新客要不要排除——口径不同答案完全不同。笔试里通常不会明确告诉你这些细节你需要自己定义并在答案里写清楚。我见过太多人在这一步翻车SQL写得很顺但口径考虑不周比如没排除测试订单和异常退款单或者没处理同一天多笔订单的去重逻辑。这些细节恰恰是京东这种规模的公司特别在意的因为日常业务决策依赖的数据报表一点点口径偏差都会被放大。2.2 高频题型拆解留存、复购、GMV拆解结合试卷实际考点和后续考生反馈我整理了三个最高频的SQL题型和解法。第一类用户留存分析。给你一张用户登录记录表让你计算某日新增用户在第7天的留存率。核心逻辑是先圈定新增用户当天首次登录再LEFT JOIN第7天还有登录记录的用户最终按时段分组计算比例。这里的常用技巧是DATE_DIFF函数配合条件聚合或者用窗口函数对每个用户计算首次登录日期。-- 以2023-01-01新增用户7日留存为例 WITH new_users AS ( SELECT user_id, MIN(login_date) AS first_login FROM login_log GROUP BY user_id HAVING MIN(login_date) 2023-01-01 ) SELECT COUNT(DISTINCT n.user_id) AS new_user_cnt, COUNT(DISTINCT CASE WHEN l.login_date DATE_ADD(n.first_login, INTERVAL 7 DAY) THEN n.user_id END) AS retained_cnt, COUNT(DISTINCT CASE WHEN l.login_date DATE_ADD(n.first_login, INTERVAL 7 DAY) THEN n.user_id END) / COUNT(DISTINCT n.user_id) AS retention_7d FROM new_users n LEFT JOIN login_log l ON n.user_id l.user_id第二类复购率分析。区别在于需要定义“购”的维度是订单ID还是下单次数以及时间窗口。推荐在SQL里用带注释的子查询把口径写清楚哪怕代码长一点阅卷人看了会觉得你有业务sense。第三类GMV拆解。比如“统计2023年6月各一级类目GMV环比变化及贡献度”。这题单纯用SUM GROUP BY就能完成80%但如果你想拿高分就要多算一步“各品类GMV变化对大盘GMV变化的贡献率”。这需要在拆解时保留上月GMV、本月GMV、差额、贡献率这几个字段而不是只交一个汇总表上去。2.3 手写SQL的答题规范和细节技巧笔试现场手写SQL和你在本地编辑器里写完全不一样没有自动补全没有报错提示写错了就是错了。几个实操细节分享给你。第一养成写WITH子句的习惯。复杂逻辑拆成一段一段的临时表既方便自己理清思路也方便阅卷人看懂你的解题链路。不要在一条SELECT里堆十几个CASE WHEN那会给阅卷人留下“逻辑混乱”的负面印象。第二时刻关注NULL值的处理。LEFT JOIN 后右表字段大概率出现NULLCOUNT、SUM、AVG这些聚合函数对NULL的处理又各不相同。比如AVG会忽略NULL行但如果你用SUM/NULLIF(COUNT,0)手动计算平均值NULLIF就非常关键。这些细节在笔试题里经常成为区分度。第三写完SQL务必检查边界条件。日期临界点是否包含当天金额单位是元还是分订单状态是否需要过滤“已支付”——每个动作背后都可能影响最终结果。我常用的检查方式是结果先做总量级估算看看算出来的数是不是符合常理。比如“日活5000万”这种量级在京东场景下是合理的如果算出来5万那一定哪里出了问题。3. 统计基础与AB实验别背公式要理解业务含义3.1 假设检验在电商场景中的实际落地统计部分京东这份试卷不会让你手推中心极限定理的证明而是给一个业务场景让你判断用什么方法、为什么、怎么解读结果。典型的题目长这样“促销页改版后我们观察到点击率从2.0%提升到2.3%请问这个提升是否显著应该用什么检验方法需要注意什么”这道题的考点拆开来看有三层。第一层识别问题类型点击率属于二项分布数据样本量足够大时可以用Z检验更严谨的做法是用卡方检验或两比例检验。第二层解释显著性水平与P值P值小于0.05只说明在统计意义上拒绝原假设但不代表实际业务效果一定显著需要结合效应量。第三层指出常见陷阱样本量是否事先计算两组的流量分配是否随机有没有辛普森悖论的可能。答题时我建议按“原假设→备择假设→检验方法→样本量→结果解读→业务建议”这个顺序写逻辑链条完整。比如原假设H0改版前后点击率无差异p1 p2备择假设H1改版后点击率显著提升p1 p2。本场景属于大样本二分类比例检验可采用两比例Z检验。显著性水平取0.05检验功效设为0.8事前计算每组所需样本量不低于8600。实际结果显示P值0.001在95%置信水平下拒绝H0认为改版对点击率有显著正向影响。考虑到置信下限为0.2个百分点虽然统计显著但业务提升幅度有限建议结合运营成本综合判断是否全量上线。你看同样是结论这个回答把方法选择、样本量估算、结论边界和业务建议都覆盖到了。阅卷人一眼就能看出你是有实战经验的人而不是只会背公式。3.2 AB实验设计题目从分组到评估的完整流程AB实验的完整流程是京东数据分析岗笔试和面试的共同重点。记住标准套路确定实验单位用户还是请求→ 确定指标核心指标护栏指标→ 计算样本量 → 随机分组 → 设定实验周期 → 上线观察 → 显著性检验 → 结果解读与决策。笔试中最常考的两个点是样本量计算和实验周期。样本量计算涉及一个公式n (Zalpha Zbeta)^2 * 2 * p * (1-p) / (p1 - p2)^2。如果在笔试中给出提升阈值的场景你要能直接把数字代入算出来这属于基本功。实验周期这块有个坑。很多人以为实验跑满7天就够了但实际要考虑一周的周期性波动工作日vs周末和用户行为延迟效应新用户需要激活期老用户可能受到新奇效应影响。所以笔试里如果问“实验要跑多久”正确答案通常不是“7天”而是“至少覆盖一个完整业务周期如7天且要照顾到行为延迟通常建议14天或21天并在上线第3天、第7天分别做一次中间检查”。3.3 概率题与业务直觉概率部分通常不会太难但会披着电商外衣。比如“某商品加入购物车后购买的概率为30%三个独立用户加入购物车至少一人完成的概率是多少”——这就是1 - (1-0.3)^3 0.657考的是概率论基础。这类题想全对不难就怕你在“独立”这个假设上栽跟头。现实业务里用户行为从来不是完全独立的但笔试默认在理想条件下计算别把问题复杂化。我做这类题的习惯是先判断是不是独立事件再看是“至少”还是“恰好”最后再套公式。每道题我都在草稿上写清楚这两个判断再动笔算。4. 业务案例分析题拉开差距的地方4.1 案例题的三种典型出题形式案例分析题在试卷中的权重最高也是最难临时抱佛脚的部分。京东的案例题通常从以下三种形式中选。形式一指标异动归因。比如“某品类6月GMV环比下降12%请分析可能原因”。这种题的考察核心是归因逻辑和拆解能力。你不能一上来就猜“是因为竞品搞活动”而是要把GMV按“流量×转化率×客单价”拆开再层层下钻到“新客/老客”“各品类/各品牌”“各渠道/各区域”最后结合内外部因素给出假设清单。形式二业务方案设计。比如“设计一套会员召回方案目标是在预算有限的情况下最大化召回率”。这种题考察的是方案设计能力和数据预估能力。你要把目标人群分层、触达方式、成本测算、预期效果、监控指标都说清楚尤其是用什么数据指标衡量方案是否成功。形式三指标体系搭建。比如“为一个同城零售业务设计核心指标体系”。这种题要你从北极星指标出发拆分出用户获取、转化、留存、履约、供应等模块的关键指标并给出各指标之间的逻辑关系。4.2 高分答题框架假设驱动数据验证落地建议无论案例题长什么样我都推荐用“三步法”来组织答案。这套框架我从实际写分析报告的经验里提炼出来笔试和面试都适用。第一步明确问题边界。把题目里模糊的表述转化成可量化的问题。比如“GMV下降了”你要反问自己下降的起点是什么时候、对比口径是什么、哪个品类最先异动在纸上写清楚问题边界后续回答就不会跑偏。第二步分层拆解假设列表。用MECE原则把问题拆成互斥且穷尽的子项再针对每个子项给出可能的假设。以GMV下降为例流量端口(DAU、访问深度)、转化端口(浏览→加购→下单各环节转化率)、客单端口(件单价、连带率)。每个拆分维度下再列出具体假设比如“首页改版导致入口流量大幅下滑”“某个大促活动结束后用户需求被提前透支”。第三步验证方式落地建议。这一步最体现经验因为你要说明用什么数据去验证假设。比如“用渠道漏斗日志确认各环节转化率用分品类日销趋势图定位异动爆发点”。验证完毕后还要给出可操作的改进建议而不是停留在“建议优化流量结构”这种空话。例如“建议次日上线首页核心入口回归A/B测试同时针对流失最大的品类启动定向促销预算控制在50万以内评估周期为7天。”4.3 结合京东业务特色的回答思路京东的业务是“零售物流”一体化的这意味着数据分析不只盯着前端流量转化还要关注供应链效率和履约成本。笔试案例题偶尔会涉及“单均履约成本上升如何归因”“库存周转天数异常怎么分析”这类偏供应链的题目。如果遇到这类题你要把“采购—仓储—配送—售后”全链路的关键指标串起来。采购端看采购周期和批次规模仓储端看周转天数和滞销占比配送端看妥投时长和运力利用率售后端看退货率和逆向物流成本。带着这个链路去拆解比你孤立地分析某一环节要全面得多。即便题目本身是典型的电商前端问题你在回答最后如果补一句“同时要关注这个指标变动对复购和用户口碑的长期影响”也能让阅卷人感受到你理解京东“零售物流”闭环的商业模式而不只是盯着前台GMV看。5. 备考策略与常见失分点复盘5.1 刷题之外更要练的是“限时决策”很多人在准备时把重点放在刷题上但缺少“限时模拟”这个关键环节。京东这份试卷90到120分钟题目量不小我第一次模拟时前面的SQL题抠了太久最后一道案例分析题只写了三行字。后来我调整了策略先花3分钟通读全卷评估每道题的时间成本先做自己最有把握的题再做需要思考的题案例题至少留出25分钟。这个时间分配策略让我多拿了至少15%的分数。笔试不仅是考你会不会还考你在有限时间内能不能稳定发挥。我建议你在复习后期至少做三次完整限时模拟每次结束后认真复盘哪类题耗时超标哪类题容易卡壳哪些知识点在紧张状态下就容易空白。5.2 高频失分点清单结合试卷反馈和我自己踩过的坑整理了一份高频失分点清单对照自查。失分点具体表现应对方法SQL口径不清未说明剔除退款/测试订单留存定义含糊答案开头先写口径假设再写SQL统计方法误用小样本用Z检验无视正态性假设先判断数据类型和样本量再选检验方法案例题空谈只列原因不给验证方法建议不可落地每个假设配一个数据验证方案和量化结论答题缺乏结构想到哪写到哪阅卷人抓不住重点按“结论→证据→行动”顺序组织答案疏于复查计算题单位错误SQL拼写错误留5分钟检查重点看单位、日期边界和空值处理第五点“疏于复查”是很多人最容易忽略的但它可能是性价比最高的一项。笔试那种高压环境下写出来的代码多多少少会有小毛病漏了个逗号、日期没加引号、表名写错。留出几分钟从头扫一遍代码成本极低但可能帮你把“会做”变成“得分”。5.3 从“会做题”到“能拿offer”的最后一公里笔试只是第一关它的成绩直接影响你能不能进面试。站在出题人角度想这份试卷真正想筛选的人不是SQL写得多华丽的而是“遇到业务问题时能形成闭环”的人。所谓闭环就是从问题定义、数据提取、分析方法、结果验证到策略建议跑完整个链路。因此我建议你在备考阶段就刻意用“闭环思维”来对待每一道练习题。每次做完一道SQL题强迫自己再用三句话解释这个查询结果对业务意味着什么每写一道案例题逼自己给出数据验证方案而不是堆假设。长期这样练习你会发现笔试中的主观题越写越顺因为它们不过是你日常分析工作的小型复刻。如果你想在案例分析题上再精进一步可以主动找一些公开的电商数据集练手比如公开的订单流水数据。用SQL跑出每日GMV趋势尝试做一次GMV下降归因分析再把结论写成一页PPT式分析报告。这个过程模拟了笔试案例题从取数到结论的完整链路也是我个人认为最有价值的备考方式之一。写在最后这类试卷考察的核心是一种“数据直觉”说到底京东2019春招这份数据分析试卷和市面上各种“数分笔试100题”最大的区别在于它不是拼知识储备而是拼数据直觉。数据直觉不是靠背题背出来的而是靠你不断用数据去解释真实业务问题、再拿数据结果去检验业务判断的循环来养成的。根据我个人带新人和当时备考的经验如果能完整走一遍“SQL取数→统计推断→案例归因→方案落地”这个闭环你对数据分析岗位的认知会比刷一百道题更扎实。这份试卷最好的用法不是考前刷一遍找手感而是把它当作一面镜子——找到自己最薄弱的环节然后针对性地去补。数据这条路上没有捷径但你走过的每一个坑都会变成未来面试和工作中实实在在的竞争力。
返回列表