尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

顺丰科技AI/ML笔试客观题全解析:考点拆解与备考策略

顺丰科技AI/ML笔试客观题全解析:考点拆解与备考策略 顺丰科技2019年秋季校招的笔试客观题合集是不少准备AI/ML岗位的同学会翻出来做一遍的材料。作为国内物流领域技术投入相当靠前的公司顺丰科技的笔试题特点比较鲜明覆盖面广数学、算法、深度学习、业务场景都有涉及难度梯度合理基础题占大头但有几道区分度很高的题同时部分题目结合了物流业务背景比如时效预测、路径优化、OCR识别、智能客服这类场景这是很多互联网公司笔试题里不太容易见到的。这篇文章不会去逐条报答案而是想基于这套客观题合集做一次系统性拆解——考了哪些模块、每类题在考察什么能力、复习该抓什么重点、现场答题有什么策略。无论你是准备投顺丰科技还是其他公司AI/ML岗位这套题的参考价值都不小。1. 笔试基本面从岗位画像看这套题在考什么1.1 顺丰科技AI工程师在做什么决定了笔试方向在拆题之前得先搞清楚顺丰科技的AI/ML工程师日常到底在解决什么问题。很多同学把笔试当纯刷题其实不全面——技术岗笔试题的命题风格和这家公司的业务场景有很强关联。顺丰科技的核心业务是物流围绕物流会产生几类非常典型的AI需求路径规划与调度优化快递怎么分拨、车辆怎么走、网点之间怎么协同本质上是组合优化问题会涉及运筹学和强化学习。时效预测与资源预估某个快件从A到B多久能到高峰期需要多少运力、多少人力属于典型的回归预测和时序预测问题。图像与OCR识别面单上的地址、手写体、模糊字体识别需要用到CV领域的目标检测、文字识别技术。自然语言处理地址解析、客服机器人、语音质检涉及NLP中的序列标注、文本分类、语义理解。供应链与仓储优化库存预测、仓内机器人调度既是机器学习问题也是系统工程问题。所以笔试客观题里出现这些知识点的概率非常高不是偶然而是岗位的真实需求映射。你在复习时如果只盯《西瓜书》的算法推导不看业务背景有些场景题就会答偏。1.2 客观题的知识地图与分值倾向这套合集我大概过了一遍单选题占多数多选题和判断题也有一部分整体可以分成四块知识模块高频考察点出题比例参考数学与统计基础概率计算、贝叶斯公式、期望与方差、矩阵特征值、最大似然估计约25%经典机器学习算法逻辑回归、决策树、SVM、K-Means、集成学习、过拟合与正则化约35%深度学习与神经网络反向传播、激活函数、CNN、RNN、梯度消失、Dropout、BatchNorm约25%业务场景与综合时效预测建模、地址解析、样本不均衡、模型评估、A/B测试约15%从分值分布能看出来经典机器学习算法占比最高数学基础次之深度学习紧跟其后。这和很多互联网公司的AI岗笔试结构类似但顺丰的题更偏“应用判断”——不太会在推导上卡死你更多是给你一个业务场景或模型描述让你判断对错、选择合适的方法。提示如果你只看深度学习不看经典机器学习这套题会很吃亏。我见过不少只刷CNN/Transformer的同学遇到决策树特征选择、SVM核函数题直接懵。基础知识扎实比追新模型重要得多。2. 核心知识点模块拆解与典型题解析2.1 数学与统计基础最容易被突击复习拿到分数学题在这套客观题里属于“送分但有陷阱”的类型。考点集中在概率统计、线性代数、最优化方法三个方向难度大约是国内工科数学考研的基础题水平但考察方式和考研不太一样更偏实际应用。举个例子贝叶斯公式相关题目几乎是必考的而且不止一次出现。典型问法是一个分类器的准确率已知先验概率已知让求后验概率。这种题目的陷阱在于题目给出的“准确率”究竟是查准率还是查全率还是整体准确率如果题目说的是“分类器在A类样本上的准确率为95%”那这个95%是条件概率 (P(预测正确|真实为A))和后验概率 (P(真实为A|预测为A)) 不是一回事需要通过贝叶斯公式计算。另一类高频题是期望与方差的计算。比如给一个随机变量取值和对应概率要求计算期望或方差。这类题本身不难但考场上容易马虎尤其是遇到常数项的平方、独立随机变量方差相加这些细节时。线性代数部分考得比较规整通常考矩阵特征值分解、矩阵转置与逆的运算、特征值与正定性的关系。这里有个复习技巧不要把精力花在手动做大规模矩阵计算上笔试一般不会出3阶以上的手算题更多是考性质判断比如“半正定矩阵的特征值非负”这种判断对错。最优化方法主要考梯度下降的基础概念比如学习率过大会怎么样、梯度方向是哪个方向、拉格朗日乘子法用来解决什么问题。这一块如果你做过实际模型训练理解的深度会明显不一样。有个典型的考察方式给一个损失函数问在当前参数下梯度方向是什么让从几个选项中选。这种题考的其实是反向传播里链式法则的基本功但会被包装成“给公式、给参数、算梯度”的形式。子模块必会内容易错点概率统计贝叶斯公式、条件概率、期望方差、常见分布混淆先验与后验、混淆查准率与查全率线性代数特征值、特征向量、矩阵正定性、SVD概念特征向量方向、矩阵乘法顺序最优化梯度下降、学习率、损失函数求导梯度的正负号、学习率过大发散2.2 经典机器学习算法高频考点与常见变形说实话这套题里最有含金量的是经典机器学习算法部分考得很细、很灵活不是背概念就能对付的。逻辑回归是高频题中的高频。考察点有逻辑回归的损失函数为什么用交叉熵而不用均方误差因为非凸、梯度更新太慢、逻辑回归是线性模型还是非线性模型决策边界线性但特征变换后可以表达非线性、如何处理多分类Softmax回归或OvR而不是直接用多个二分类逻辑回归硬切。有些题目会包装成“在物流场景中预测快件是否延误”本质上还是二分类问题考察如何设置正负样本、如何选择评价指标。决策树与集成学习也占了不少题。信息增益、Gini系数、基尼不纯度这些特征选择指标是必考内容。这类题容易混淆的是ID3用信息增益、C4.5用信息增益率、CART用Gini系数三个算法的选择标准不同。集成学习方面重点考察Bagging和Boosting的区别以及随机森林和GBDT在“降低偏差还是方差”上的差异。这里要牢牢记住一个核心Bagging / 随机森林并行训练多个独立模型重点降低方差Boosting / GBDT / XGBoost串行训练每棵树拟合前面模型的残差重点降低偏差。SVM的考察多核函数和对偶问题。常见题包括线性不可分时选什么核函数、RBF核函数有两个参数C和gamma分别控制什么、SVM对偶问题为什么引入拉格朗日乘子。这部分对没学过SVM推导的同学有点痛苦但客观题涉及的深度其实不高基本是概念判断把“最大间隔”“支持向量是少数决定边界的样本”“核函数隐式做高维映射”这几个点记住就行。聚类与无监督学习也有涉及。K-Means的时间复杂度、K值选择方法手肘法、DBSCAN处理任意形状簇的能力都是常规考点。EM算法偶尔会跑出来一般是给一个高斯混合模型的问题问应该用什么算法能认出是GMM EM就能拿分。这里插一句这套题里出现了一个比较经典的“模型偏差方差判断题”给定训练集误差低但测试集误差高问是欠拟合还是过拟合该加正则化还是加数据。这种题在面试里可能只是热身但笔试里往往藏了一两个选项的细节比如“增大正则化系数”和“增加训练数据”哪个更有效取决于你判断偏差方差的主导因素。算法爱考察的点备考关键逻辑回归损失函数、线性可分性、多分类方式理解交叉熵为什么优于MSE决策树特征选择指标、剪枝策略ID3/C4.5/CART三者的差异集成学习Bagging vs Boosting、偏差方差随机森林降方差GBDT降偏差SVM核函数、对偶问题记住“少数支持向量决定边界”聚类算法比较、K值选择把K-Means和DBSCAN放一起对比EM算法适用场景看到GMM想到EM2.3 深度学习与神经网络从原理到训练细节深度学习部分的题目能明显感觉到出题人是有过实际训练经验的不是单纯考概念而是会考训练中常见的现象和调参思路。反向传播与梯度计算是基础。真题有可能给一个两层的全连接网络输入是2维向量隐藏层是2个神经元输出层是1个神经元激活函数是sigmoid让计算某一步的梯度。这种题其实不用真的算那么多步掌握链式法则的分解顺序就行。如果复习时间有限至少保证能写出一层反向传播的梯度表达式。激活函数对比很值得专门整理一页笔记。这套题覆盖了sigmoid在深层网络中的梯度消失问题、ReLU的优点解决梯度消失、计算快、ReLU的死亡问题负半轴梯度恒为0导致神经元不更新、Leaky ReLU的出现动机。不少同学只知道“ReLU比sigmoid好”但不知道好在哪遇到“ReLU的缺点”这种多选题就抓瞎。梯度消失与梯度爆炸是可以单独出两三道题的。题目通常会给一个网络结构问为什么深层网络训练不动的可能原因选项里会混入“学习率设置过大”“初始化不当”“激活函数选择不当”“缺少BatchNorm”。实际上这些选项都有一定道理这时就要从“最直接原因”去判断一般优先选主因而不是多个次要因素。BatchNorm和Dropout是训练细节题的高频点。Dropout的作用要理解到“训练时随机丢弃神经元测试时全量使用”而且注意Dropout主要用于全连接层卷积层的正则化更多靠weight decay和BatchNorm。BatchNorm的考察点在训练和推理时的差异训练时用当前batch的均值和方差推理时使用全局滑动平均统计量。这个细节笔试里出现过很多人不在意但理解了训练/推理行为差异后这类题就不容易丢分。CNN和RNN各考一两题。CNN通常考卷积层的参数计算公式、感受野概念、池化层的作用降维、防过拟合、平移不变性。RNN/LSTM常考长期依赖与门控机制题目大概率是“解决RNN长期依赖问题的方案是什么”选LSTM/GRU或门控机制相关选项。Transformer和Attention在这套题里也有涉及但比例不高主要集中在self-attention的Q/K/V是什么、和传统attention的本质区别是什么。考点核心结论常挖的坑sigmoid梯度消失导数最大才0.25连乘趋近0误以为sigmoid导数为1ReLU死亡输入为负时梯度恒0误以为ReLU不会梯度消失Dropout训练随机丢弃、测试全量测试时忘记乘保留比例BatchNorm训练用batch统计量、推理用全局统计量误以为推理也用当前batch卷积参数计算输出尺寸(输入-核2P)/S1Padding与Stride弄反2.4 业务场景题与前沿扩展结合物流背景的灵活问题这类题是这套笔试最出彩的地方也是很多人复习时最容易忽略的部分。它不会考死概念而是把机器学习知识和物流业务绑在一起。比如时效预测场景题干会描述一个快件从揽收到签收的流程给出各个节点的数据让选择预测延误概率的方法。如果你只从模型角度想第一反应是“用GBDT”“用LSTM”但题目要考察的往往不止模型选择还包括特征设计——比如是否该加入天气数据、历史网点负载、节假日因子以及样本不均衡如何处理延误快件通常远少于正常快件。这种题没有标准答案选的是最合理的方案。地址解析是顺丰业务里非常典型的NLP问题。快递面单上的地址文本往往“脏”有省略、错别字、口语化表达比如“市中区”和“市中心”指的是同一个地方。这类题目会考察如何处理地址实体识别用CRF还是BiLSTMCRF、如何做地址标准化基于规则还是基于生成模型、如何评估解析效果。你在复习NLP时如果只关注情感分析、文本分类遇到这种偏“信息抽取”的业务题会吃亏。图像类的场景题一般面向分拣中心的面单拍照识别或包裹破损检测考察目标检测的IoU计算、OCR的文本检测与识别流程、数据标注质量对模型效果的影响。这类题目对纯算法出身的同学不太友好但好在一套卷子里占比不高了解基本流程和评价指标就可以应对。样本不均衡和模型评估是业务题里藏得最深的考点。物流业务中绝大多数问题天然不均衡正常件远大于异常件准时件远大于延误件。如果不做任何处理模型只需要全预测“正常”就能拿到很高的准确率。对应考察点包括采样策略过采样、欠采样、SMOTE、损失函数加权、评价指标从accuracy换成AUC/F1/Recall。这是做题的常见套路方向也是实际工作中经常要面对的问题。注意做这类综合题时正确思路是“先明确业务目标和约束再选技术方案”。比如在时效预测题中如果业务侧说要降低漏报率把延误的件尽量找出来那就要把优化目标定位在Recalling而不是整体Accuracy上对应的模型和阈值调整策略也不同。这种逻辑如果能在答题时体现出来客观题的命中率会高很多。3. 客观题的答题策略与实战技巧3.1 单选题的排除法与极限检验法技术岗笔试的单选题很多时候不是你真的不会而是被干扰选项带偏了。这里建议固定用一套自己的解法先看选项、快速排除明显错误的再回到题干核对。比如题目问“下列哪种方法不能解决过拟合”选项里有增加L2正则化、增加训练数据、增加模型层数、Dropout。如果你能记住“增加模型层数”会提高模型容量、更容易过拟合就能直接排除掉。这样做题速度快不容易被选项带跑。遇上看不准的计算类题目可以用极限检验法。比如给定一个损失函数问在什么条件下梯度最大你可以把输入代入极端值0和1分别计算一下梯度方向就能比较出大小。这种方法对付激活函数题、逻辑回归损失题特别有效完全不用精确算只比大小。3.2 多选题的“少选不如不选”策略这套笔试题里的多选题普遍是每题2分起步选错一个选项扣分更狠。很多人为了求稳直接放弃多选题我觉得没必要但需要掌握一些保守策略。多选题的命制逻辑通常是正确选项一般是2到3个不太会出现4个全对的情况除非是那种“下列说法正确的是”的宏观题。如果你能百分百确定一个是对的另外的选项即使不确定也建议先不选。宁可拿50%的分数也别冒风险扣完。有一种方法是关注绝对化表述。选项里如果出现“一定会”“完全不会”“任何场景下都”这类绝对化的字眼基本可以判定是错的。技术领域罕见绝对完美的结论这是多选题常设的干扰点。3.3 时间分配与做题顺序建议根据这套题的题量和难度建议整体时间分配如下题目类型建议时间策略单选题基础数学、概念每题1分钟快速过拿不准的先标记单选题算法、深度学习每题1.5分钟做深度思考但不要卡超2分钟多选题每题2分钟能确定几个选几个不恋战判断题每题30秒用绝对化词排除法场景综合题每题2-3分钟先通读题干抓住业务目标再做选择做题顺序上建议先把数学和经典机器学习题做完因为这类题拿分确定性最高能给后面深度学习和场景题留足心态。如果你一上来就做场景综合题很容易被大段题干消耗时间导致前面会做的题来不及写。3.4 判断题与填空题的踩坑点判断题在套题里数量不多但错一个就是全扣没有半分余地。最容易错的地方不是知识本身而是对“反直觉陈述”的判断。比如题目说“增加训练数据一定可以降低过拟合”这句话在常规理解下是对的但严格来说如果增加的数据分布和原数据完全不同反而可能引入噪声、降低模型效果。判断时要把每个绝对化表述都当成坑来看。填空题在人工智能笔试里一般不多见但这套题偶尔会有填公式、填参数的主观客观混合题。遇到这种题草稿纸一定要写清楚步骤别跳步很多答案是中间过程直接推导出来的跳步容易错。4. 备考路线与常见问题排查4.1 三轮复习法适合一个月内冲刺我不推荐直接啃教材除非备考时间超过半年。针对一个月内的备考节奏建议按三轮走第一轮约10天主攻知识地图把自己掌握薄弱的模块标记出来。先看经典机器学习算法和数学基础把决策树、逻辑回归、SVM、贝叶斯、期望方差这些高频考点过一遍深度学习部分先掌握反向传播和常见训练技巧。这个阶段不用刷题目标是“看到题目时知道考了啥”。第二轮约10天主攻题型训练。用选择题和判断题模拟题练习重点训练多选题的选项判断和计算类选择题的快速解法。这个阶段建议把错题单独整理成文档记录“错在哪、为什么错、正确思路是什么”哪怕只记一句话也比重新翻书高效。第三轮约10天主攻实战模拟。按考试时间做完整套题训练时间分配和应试心态。做完之后把整套题对应的知识点回填到知识地图里看哪些模块还在丢分。这个阶段的目标不是“多做题”而是“把不确定的题变成确定的题”。4.2 参考资料怎么选、怎么用关于参考资料说几个实用建议按优先级从高到低排列《机器学习》周志华即“西瓜书”经典中的经典重点看决策树、SVM、神经网络、集成学习这几章推导可以略过但概念必须吃透。《统计学习方法》李航啃SVM和EM算法的时候很有用例题质量高适合针对性地补短板。吴恩达《机器学习》课程适合快速建立整体框架但课程本身偏基础刷题前还是要靠书本补深。深度学习方面可以先看《深度学习》花书的基础章节但不要花太多时间在读理论推导上优先理解训练技巧部分比如Dropout、BatchNorm、优化器选择。这里想特别说一下刷题资源的使用心得很多人喜欢刷LeetCode常考题但AI岗笔试的重点从来不在代码题而是概念与判断题。你如果时间紧张优先把精力放在概念理解上而不是去刷LeetCode困难题。代码题可以放在笔试之后的面试阶段再准备。4.3 备考中的典型问题与解决心得先说说很多人的共性问题“数学基础太差怎么办”。我认为不用无脑去把高数线代重新上一遍重点看三个东西导数与链式法则、矩阵与向量运算、概率公式。这三个东西是AI笔试数学题的全部根基其他很多内容都是基于它们做扩展。我见过有同学花两周时间从头刷高数结果发现考试根本不考得不偿失。再聊一个现实问题“知识点都会但做题老错”。这种情况多半不是知识问题而是概念混淆。比如把L1正则化和L2正则化的作用搞反或者把Bagging和Boosting降偏差方差搞反。建议做一套“对比表格”把长得像的知识点放一起区分L1稀疏解 vs L2规则化、数据归一化 vs 标准化、过采样 vs 欠采样、偏差 vs 方差。对比着记忆的效果远好于单独背诵。还有一个容易被忽视的坑复习时只刷题不看错题。刷题的目的不是追求正确率而是暴露出薄弱点。我的做法是每轮练习后把错题对应的知识点在笔记上画一个红圈三轮之后就能很清楚看到自己反复错在哪拼考前半小时只看这些红圈内容就够了。4.4 考前48小时该做什么到了这个阶段不建议再学新知识了强行学只会增加焦虑。我做这几件事效果好把整理的对比表格过一遍当作最后的查漏补缺。把容易混淆的概念再确认一遍比如L1/L2正则化、Bagging/Boosting、查准率/查全率这些。找一两个典型的计算类选择题练练手保持手感和速度。考前一天把题量大的场景题通读一遍熟悉“先业务后技术”的答题思路不用深究不会的模型细节。最后分享一点我的个人体会这套客观题合集真正有价值的不是“答案是什么”而是它帮备考者画出了一张清晰的AI岗位知识地图。从数学基础到经典机器学习再到深度学习训练细节最后落到物流业务场景这个顺序本身就是一个完整的“从理论到实践”的能力链条。我后来复盘时发现凡是知识体系完整的同学即使没做过这套题现场也不会考得太差反之只靠刷题套路、概念零碎的同学很容易在综合题上露馅。所以我建议如果你准备AI/ML方向的笔试不要只盯着单一来源的题库而是花点时间看清楚每一道题背后的考点归属再对应补齐自己的知识盲区。知识体系搭起来了后续遇到其他公司的笔试题也就不用慌了。
返回列表