ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

网易数据分析师校招笔试攻略:从统计学到SQL的业务思维实战

网易数据分析师校招笔试攻略:从统计学到SQL的业务思维实战 1. 笔试前的岗位认知与情报收集1.1 数据分析师校招笔试到底在筛什么样的人先回答一个很多人会问的问题网易这种大厂校招笔试数据分析师这一岗到底想筛掉什么样的人如果你以为它是在考“你会不会写代码”“你统计公式背得熟不熟”那就想偏了。笔试的底层逻辑是通过限时、限场景的题目考察你在真实业务中拿到一堆数据时能不能做出靠谱的决策。具体到2020年校招这一场数据分析师考拉提前批考拉是网易旗下的跨境电商平台业务模式涉及海外采购、保税仓发货、国内用户端销售核心指标跟纯国内电商有不少差异。笔试不是单纯的“技术测验”更像一轮“业务思维筛选”。筛选标准可以拆成三个层次第一层基本功也就是统计学、SQL、Excel这些是硬底线不会基本的知识点意味着即便进了面试后面也撑不起来。第二层业务敏感度看到一个问题能联想到它背后的业务流程和指标能判断出“哪个指标异常了”、“哪些原因值得排查”这层是区分“做题家”和“准分析师”的分水岭。第三层结构化表达分析题不是写给自己看的是要讲给业务方听的能否在有限篇幅里把“问题假设验证结论”这条线讲清楚很大程度上决定了笔试分数的高低。我当时准备这场笔试的时候采取了一个笨但有效的策略先去把网易考拉的APP翻了一遍看它的首页频道、促销玩法、跨境商品展示方式然后再去补业务背景。事实证明这个动作帮我省了大量临场纠结的时间。1.2 从招聘JD倒推考点数据分析师的笔试地图如果你现在正在准备类似岗位的笔试我强烈建议你先做一件事把招聘JD逐条抄下来用“考点映射”的方式去拆解。比如网易数据分析师这类岗位JD里通常会出现以下关键词“数据分析”“业务指标”“SQL”“统计学”“AB实验”“业务沟通”每一个都能映射到笔试的具体题型。“精通SQL”→ 笔试大概率有SQL编程题多表关联、窗口函数、留存计算这些是高频考点。“具备扎实的统计学基础”→ 假设检验、置信区间、样本量计算、p值含义这些不会直接考公式背诵但会放进业务场景让你做判断。“对电商业务有理解”→ 业务案例分析题会给出一个场景比如“某渠道转化率下降”“大促GMV低于预期”让你给出分析思路。“良好的沟通表达能力”→ 简答题或开放性分析题考察你能不能把分析逻辑讲清楚而不是只堆数据和公式。“有AB实验经验优先”→ 实验设计题比如“如何评估新首页改版的效果”需要你写出完整的实验方案。把JD翻译成这样的考点地图之后后面的复习就有了方向感而不是拿着一本统计学教材从头啃到尾。这个过程一句话总结先射箭、后画靶子用目标反推学习路径是最节省精力的准备方式。1.3 针对考拉业务线的信息储备技巧笔试题目不一定直接问“考拉的XX指标是多少”但业务分析题通常会把场景设在跨境电商的语境下。我做了一些背景信息准备这部分内容在笔试答题时可以作为“业务直觉”的来源。考拉的核心业务逻辑可以从这几个维度理解品类结构母婴、美妆个护、营养保健、家居生活、服饰鞋包不同品类的购买频次、客单价、复购率差异很大做数据分析时要分品类看不能一概而论。供应链模式保税进口和直邮进口是两种主要模式保税仓模式库存周转更快直邮模式时效更长但长尾商品更丰富。不同模式下库存周转天数、履约成本、用户满意度这些指标的权重会不一样。用户结构跨境购物用户中一二线城市女性用户占比较高年龄主要集中在25-35岁对品质和正品保障的关注度高于对绝对低价的关注度。大促节点考拉的大促会紧跟“黑五”“双11”“年货节”这些节点大促期间的GMV、转化率、退货率都会出现剧烈波动笔试场景题很可能围绕大促做文章。这些信息不需要背得多精确关键是形成一个“跨境电商数据大致长什么样”的判断框架。比如当你看到“某商品点击率上升但转化率下降”这个异常时如果能联想到“可能是用户看到价格、物流时效、关税信息后犹豫了”这个答案就会比单纯说“建议优化页面”更有说服力。2. 笔试硬核底盘统计学与SQL的高频考察逻辑2.1 统计学的考察范围与命题套路统计学是校招数据分析师笔试绕不开的板块。但校招笔试中的统计学跟你期末考试里的统计学很不一样它不考“写出正态分布的公式”而是给一个真实数据场景让你选方法、做判断。从我复盘整理的信息看高频考点集中在以下几个方面。第一假设检验的基本逻辑。比如某次版本更新后页面的平均点击率从5%提升到了5.3%问这个提升是否显著。这里需要你理解原假设和备择假设的含义、p值的解释方式以及为什么不能单纯看数值大小下结论。常见陷阱是“p值小于0.05说明原假设为假的概率小于5%”——这句话本身就是错的理解p值是在原假设成立时观测到当前或更极端结果的概率。第二AB实验的设计与评估。笔试可能给你一个场景要你评估某个策略的效果。你需要知道样本量怎么估算、实验组和对照组怎么分配、如何控制实验期间的其他变量、显著性水平和统计功效的关系。这里给大家一个常用的样本量估算简化公式可以用来估算实验所需的最小样本量假设我们要检测的指标是转化率原转化率为p预期提升后的转化率为p’或者检测提升幅度δ显著性水平取0.05统计功效取0.8那每组需要的样本量近似为n ≈ (Zα/2 Zβ)^2 × 2p(1-p) / δ^2其中Zα/2 ≈ 1.96对应双侧0.05Zβ ≈ 0.84对应单侧功效80%p可以用基线转化率代替。举个例子当前转化率是10%p0.1我们想检测出2个百分点的提升δ0.02那每组样本量大概是n ≈ (1.96 0.84)^2 × 2 × 0.1 × 0.9 / (0.02^2) 7.84 × 0.18 / 0.0004 ≈ 3528也就是说每组至少需要大约3500个用户才能较可靠地检测出这个提升幅度。如果样本量不够实验容易出现“不明显”的假阴性结论。这个公式面试中也经常会被追问建议理解记忆而不是死记硬背。第三常见统计陷阱。辛普森悖论是数据分析师笔试里最喜欢的出题点之一。比如在A渠道和B渠道中新用户的转化率都是A更高老用户的转化率也都是A更高但整体转化率却是B更高——问你是否合理为什么这就是辛普森悖论的典型场景本质是不同渠道的用户结构不同导致加权后的结果翻转在答题时一定要想到“分层对比”和“权重影响”这两层。第四分布与抽样。二项分布、泊松分布的基本特征中心极限定理的含义这些不会直接考名词解释但会放在“估算某类事件发生的概率”这种问题里需要你选对模型。我的感受是统计学题的答题关键不是算得快而是每一步都在讲逻辑把为什么要用这个方法、这个方法在什么条件下成立说清楚。2.2 SQL的高频题型与解题思路SQL在校招笔试中几乎必考。网易这类公司对SQL的考察通常有两种形式一种是直接在笔试系统里写SQL查数据另一种是在纸笔环节写出查询语句。不管哪种形式高频考点都非常集中。第一多表关联。给你用户表、订单表、商品表要求统计某些维度的指标。这里考察的重点是JOIN的类型选择什么时候用INNER JOIN什么时候用LEFT JOIN尤其要注意关联键是否有重复值重复值会导致数据膨胀这是新手最容易踩的坑。第二聚合函数与分组统计。按天/按周/按月统计GMV、订单量、用户数这个是基础题但是考察你有没有想到去重。比如统计“有购买行为的用户数”时COUNT(DISTINCT user_id)和COUNT(user_id)的结果可能差很多不注意去重就是给自己挖坑。第三窗口函数。这在数据分析岗笔试中出现频率非常高常见的需求有计算每个用户的第2次购买金额、求每个商品分类下的销售排名、计算前一天的销售额做环比。核心就两个ROW_NUMBER/RANK/DENSE_RANK的区别以及PARTITION BY和ORDER BY的搭配。第四留存率计算。给你一张用户登录表让你计算用户的次日/7日/30日留存率。这类题用一条自关联SQL可以解决但要注意留存率的分母是“第0天的新增用户数”不是当天活跃用户数。举个例子假设我们有一张用户活跃表active_loguser_id, login_date要计算每日新增用户的次日留存率可以先把每个用户的首活日期作为新增日期再关联次日活跃情况核心思路是WITH first_active AS ( SELECT user_id, MIN(login_date) AS first_date FROM active_log GROUP BY user_id ), day0 AS ( SELECT first_date, COUNT(DISTINCT user_id) AS new_users FROM first_active GROUP BY first_date ), day1 AS ( SELECT fa.first_date, COUNT(DISTINCT al.user_id) AS retained_users FROM first_active fa LEFT JOIN active_log al ON fa.user_id al.user_id AND al.login_date DATE_ADD(fa.first_date, INTERVAL 1 DAY) GROUP BY fa.first_date ) SELECT d0.first_date, d0.new_users, d1.retained_users, ROUND(d1.retained_users / d0.new_users, 4) AS day1_retention FROM day0 d0 LEFT JOIN day1 d1 ON d0.first_date d1.first_date这段SQL里最关键的点就是用MIN(login_date)把“新增用户”定义清楚然后通过日期自关联去匹配次日是否活跃。实际笔试中只要把这个思路写到核心步骤分数基本能拿到。第五续费率与时点指标。跨境电商的订阅会员、付费会员续费逻辑需要计算某个时点有多少用户处于付费状态这类题考察的是你能否把“时点指标”和“时段指标”分清楚。SQL的准备没有捷径就是多写。我当时把LeetCode上数据库相关的简单题和中档题刷了一遍然后重点练习了关于留存、复购、排名这三大场景的题目笔试时遇到同类题基本是肌肉记忆了。2.3 数据结构的逻辑推理题要不要花时间准备有些同学可能会纠结数据分析师笔试会不会考编程算法题比如动态规划、二叉树遍历、排序算法。从我掌握的情况来看2020年前后的校招数据分析岗笔试算法题占比不明显大部分是SQL和统计业务题但是会有一些逻辑推理题和概率题比如一个盒子里有3个红球、5个蓝球不放回抽取第3次抽到红球的概率是多少两个人玩掷骰子游戏先掷到6的人获胜问先手获胜的概率。估算一下全北京一天消耗多少杯咖啡。这类题不考复杂算法考的是概率思维、估算能力、逻辑演绎能力。前两种属于基础概率题核心是分情况讨论和条件概率后面那种估算题核心是把问题拆解成可以估算的因子再相乘。我的建议是算法题不需要花太多时间准备但简单的概率题和逻辑题要练熟。尤其是“估算题”它看起来没有标准答案实际上考官心里有一个大致的合理区间。比如估算“全北京一天消耗多少杯咖啡”北京常住人口按2000万算喝咖啡人群比例按20%估即400万人假设喝咖啡人群中平均每人每天喝0.8杯咖啡得到约320万杯/天。这个数不一定准但关键在于展示了“拆解问题—假设—计算”的能力这正是数据分析师日常工作的缩影。3. 业务案例分析题从拿到题目到落笔的完整解题路径3.1 数据异动分析题的通用框架校招笔试的业务分析题最经典的一类就是“指标异动分析”。比如某天App的DAU日活跃用户数下降了10%请分析可能的原因并提出排查思路。这类题不要急着罗列一堆可能原因而是要有结构、分主次。我总结了一个“三层排查范式”笔试时非常管用第一层确认数据本身的问题。先看数据口径有没有变、埋点有没有出问题、报表有没有Bug。真实工作中很多“异动”是数据错误导致的所以把这一步放在最前面是专业的表现。你可以从这样的角度落笔检查数据统计口径是否发生变化确认数据来源是否准确排查是否有重复计算或漏计算。第二层拆解内部业务因素。把DAU按新用户、老用户、渠道来源、活动页面、版本分布等维度拆分定位异动主要集中在哪个细分人群或渠道上。比如是新用户获取减少还是老用户活跃下降是某个渠道的投放预算变了还是某个版本出现闪退问题用维度拆解定位问题比直接猜原因靠谱得多。第三层分析外部环境因素。竞品有没有做大型促销有没有政策变化导致某些品类下架是不是叠加了节假日、天气等自然因素外部因素需要结合业务现实去判断。写这类题的时候我建议大家用“问题定义→影响范围→维度拆解→原因假设→验证方案”这条线来展开即使题目只给了两行字你也能写出一个有说服力的完整回答。另外有一个非常加分的细节在回答的结尾提一句“在定位到根本原因后需要建立监控机制避免同类问题再次发生”这能体现出你有闭环思维。3.2 案例题中的估算与业务推理笔试中还经常出现一种“估算题”有时以“费米问题”的形式出现比如“估算考拉一个月的GMV”有时则是一个开放性问题要求你估计某个品类的市场规模。这类题的解题模板是先定义公式再拆因子再给假设最后计算。以“估算考拉一个月的GMV”为例GMV 月活跃买家数 × 月均购买频次 × 客单价接下来逐一给假设月活跃买家数考拉的用户规模可以参考行业公开数据。如果按当时跨境电商行业头部平台的数据粗估假设月活跃买家数在1000万量级月均购买频次跨境购物决策周期较长购买频次相对低假设月均购买1.2次客单价跨境商品单价较高母婴、美妆类客单价普遍在200-400元区间假设客单价300元。那么GMV ≈ 1000万 × 1.2 × 300 ≈ 36亿元/月。这个结果不需要跟真实值完全一致关键是展示你能够把大问题拆成可估算的小问题并且每一个假设都有业务逻辑支撑。面试官在考察时看重的恰恰是这个拆解过程而不是答案本身。如果你对某个行业数字有了解可以标明“根据公开数据推算”会显得更专业。3.3 跨境电商主题的答题亮点加分配置当业务案例题的背景是跨境电商时有几个“业务特色”是你可以主动带出来的这些点一旦出现会明显让阅卷者感觉到“这个人对业务有认知”。汇率波动与定价策略。跨境商品的价格受汇率影响较大如果本币升值海外采购成本会下降有空间做促销反之利润率会受到挤压。分析GMV或毛利变化时可以把汇率因素作为一个解释变量引进去。库存周转与保税仓模式。考拉这类平台保税仓发货是国内用户最主要的收货方式。库存周转天数、滞销库存占比、动销率这些指标在大促前后会有明显波动。分析某个SKU的销售下滑时可以联想到是否因为库存不足导致断货从而影响了销量。关税与政策变化。跨境综合税、个人行邮税的政策调整会直接影响用户的最终支付价格和购买意愿。2019年跨境电商零售进口政策的调整就对很多品类产生了影响。虽然笔试不会要求你了解具体政策条款但能在分析中留出“政策因素”这个维度说明你的思考框架是完整的。正品心智与信任成本。跨境电商最大的用户顾虑是“是不是正品”。考拉在正品保障方面的形象直接影响高价值品类的转化。当你分析到“某美妆品牌的转化率下降”时如果能想到“差评、假货舆情、品牌授权变动”这些信任因素答案的质感会明显不一样。这些业务特色不需要每题都用上但在跨境电商场景下选准一到两个融入分析框架就能让你的答案不再像“网上的通用模板”。4. 笔试临场的节奏控制与易踩的坑4.1 时间分配策略从抢分题到决定性大题校招笔试最常见的问题不是不会做而是时间不够。尤其是在线上笔试系统里一共就几个小时有的题目分值高但耗时大如果你在前面的难题上死磕后面的大题就没时间写了。我根据常见题型整理了一个时间分配参考题型建议用时策略逻辑推理/概率小题每题3-5分钟快速判断不会就先蒙一个做标记回头再算统计学选择题/判断题每题5-8分钟重点是判断“为什么对/错”别纠结SQL编程题每题10-15分钟先把表结构和思路写出来哪怕不完整也能拿步骤分业务案例题每题20-30分钟分值最高必须留够时间用结构化框架写满开放性设计题每题15-20分钟搭框架、给出关键步骤不需要全部细节在答SQL题时有一个实操技巧即使你中间某一步的语法记不清了也建议把整体的SQL逻辑和关键步骤写出来评卷时“思路分”往往比“正确结果分”占比更高。同样的道理适用于业务案例题只要框架完整、假设合理、结论明确它不会因为你没计算出最终数值而扣光全部分数。4.2 最容易被扣分的非技术细节很多同学把笔试复习重心放在技术上却忽略了三个与“技术无关”的评分点而恰恰是这些点可能造成你笔试通过或淘汰的差别。第一答题界面信息没有读全。笔试系统里往往会有“本题按多个步骤计分”“回答请控制在XX字以内”等提示。有些同学不看这些要求一股脑写了很多反而超过了字数上限或者漏掉了“写出检验统计量”这样一个子问题。一个屡试不爽的习惯是动笔之前用一分钟把题目全文读两遍把关键词圈出来再开始答题。第二业务题的答案缺乏优先级。给出“可能的原因有A、B、C、D、E”这是低分回答。高分的回答是“先看数据口径再按新老用户拆分重点是排查渠道投放的调整因为影响最大、且近期有相关动作”。数据分析师最重要的能力之一就是判断优先级答题时也要体现出来哪怕多写几个“同等重要”的原因也要在里面标出你认为影响概率最高的那条。第三计算过程中没有写单位。尤其在做估算题、样本量计算题时只写“3528”不写“人/组”会让评卷者认为你对业务数字的敏感度不够。数据分析师做日报、周报时任何数字都必须带上下文的单位、口径和时间范围这是职业习惯笔试中的细节恰恰能看出这个习惯有没有养成。4.3 遇到完全没思路的题怎么办先说结论校招笔试遇到不会做的题太正常了关键是不要在一道题上卡死。我的策略是“三级跳过法”第一级读完题后30秒没思路立刻跳过先做后面的小题找手感第二级做完所有会做的题后回头再看用“题目里的关键词能联想到哪些知识点”来找线索第三级如果还是不会用结构化猜测法写一个基于常识的答案。比如让估算某个数时哪怕你给的数据再粗略也要写清楚你的假设过程这比空着强得多。我个人在大大小小的在线笔试里都遇到过“完全意外的题”但几乎没有因为空题而挂掉因为我把所有空题都变成了“写了分析框架但没算出数”的题。笔试考的不只是“会多少”还有“在不会的时候你如何应对”。5. 笔试之后的复盘与下一轮准备5.1 笔试结束后的第一时间复盘方法笔试结束不要只想着“解放了”真正的成长在复盘环节。我建议按照“回忆题目—对照考点—归纳错因—补齐短板”四步来做。笔试结束后立刻把能回忆起来的题型和题目框架记录下来哪怕只是关键词也行。比如“有一道题是算留存率”“有一道题是AB实验样本量”“有一道题是跨境电商大促GMV分析”。当晚就对照招聘JD和考点地图给每一道题打上标签这个题考的是SQL窗口函数、这个题考的是业务假设拆解、这个题考的是显著性理解。然后分析错因时不要把原因简单写成“不会”。而是要细分成知识盲区完全没学过、概念混淆学过但没理解透、计算失误步骤明白但算错了、表达失分会做但没写清楚。四个原因的改进方法是完全不同的前两个需要重新学习后两个需要多练题感和答题规范。复盘做得越细下一轮面试的胜算就越高。5.2 笔试通过后的面试衔接准备笔试只是校招的第一道关笔试通过后通常是业务面。如果你想为后续面试打基础有两件可以在笔试阶段同步启动的事第一把你的笔试答题思路改写成一份“口头面试答案”。业务题尤其值得做这个转化因为面试很多问题会问你“怎么分析这个数据异动”。如果你笔试写的答案已经有了清晰框架直接把它练成一段3分钟的口头回答面试时会事半功倍。第二针对你笔试中暴露的薄弱环节做专项强化。我这里说的薄弱环节指的不是“下次笔试会不会再考”而是“面试中被追问能不能接住”。比如你笔试时样本量计算只会套公式那面试官很可能追问“这个公式的Z值哪里来的”“为什么统计功效取0.8”。你需要在笔试结束后把每一个用到的公式和概念背后的原理搞懂这才是面试官真正想听的深度。5.3 从一次笔试看数据分析师的核心竞争力很多同学关心“这场笔试到底通过率多少”“网易考察有什么偏好”但我更想给你一个不一样的视角。一场校招笔试实际上给了你一个极好的“岗位画像”它清清楚楚地告诉了你这个岗位平时在做什么、遇到什么问题、需要什么能力。从这场考拉数据分析师的笔试复盘来看它的核心可以用一件事概括能不能把一个模糊的业务问题转变成一个可量化、可拆解、可执行验证的分析问题。这句话听起来简单但做起来非常考验综合能力。统计学是地基SQL是工具业务理解是方向表达是桥梁。四者缺一不可而你刚好可以通过一次笔试快速检验自己在这四个维度上的当前水平。如果你正在准备数据岗的校招我的建议是不要只刷题每个月给自己一个小项目找一个真实业务问题写出分析框架用SQL提取数据再用统计方法给出结论。哪怕只是Excel里的模拟数据这个闭环过程本身就是对笔试和面试最高效的实战演练。以我个人在多家公司笔试和面试中反复验证的经验来说数据分析师这个岗位的筛选固然看重你在笔试中写出了多少正确答案但更看重你在思考过程中展现出的“把问题界定清楚”的能力。如果你能通过笔试复盘真正理解并掌握了这项能力那么无论这次笔试结果如何你都已经在职业道路上拿到了一笔非常有价值的收获。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进