尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

【必收藏】大模型算法岗面试经验全解析:百度/腾讯/阿里大厂面试真题与知识点总结

【必收藏】大模型算法岗面试经验全解析:百度/腾讯/阿里大厂面试真题与知识点总结 百度部门与岗位百度TPG - 文心一言团队- 大模型算法岗一面自我介绍和项目介绍介绍一下了解的大模型有哪些这些模型在结构上有什么差异说一下大模型常用的位置编码有哪些各有什么优缺点介绍一下大模型的预训练后训练以及推理是怎么做的并且详细问了 RLHF 的做法包括 PPO 算法的原理以及 DPO 和 PPO 的区别大模型的超长上下文是怎么做的比如说 KIMI大模型智能体是怎么工作的有哪些组件场景题如何训练一个大模型可以做到精确的提取摘要代码股票的四个题买卖股票的最佳时机买卖股票的最佳时机 II买卖股票的最佳时机 III买卖股票的最佳时机 IV整体来说一面偏基础问的问题也主要是一些大模型的八股问题没有太多发散性的问题难度不大。但是考察的还是挺全面的整个面试一个半小时多二面自我介绍因为之前是做 CV 的所以面试官问了 CV 和 NLP 的区别和联系在 Transformer 的大背景下CV、NLP包括语音等能否实现大一统训练大模型的时候数据怎么清洗怎么处理怎么配比怎样操作能更容易使模型达到更好的性能什么是大模型的幻觉如何减轻幻觉问题大模型的复读问题是怎么产生的业内一般有什么解决办法大模型的工具调用怎么实现Agent 有哪几部分构成了解哪些具体的实现方法开放题之前训练大模型的时候遇到过什么困难你是怎么解决的代码实现一个 Tokenizer只能用 PyTorch 基础语法二面相比于一面更加看重综合素质喜欢考察分析问题解决问题的能力对于一些细节知识点的考察并不多。二面也面试了一个多小时面试官还是挺专业的。三面首先过项目但是问的特别细致尤其是一个 Agent 的项目从背景到动机再到做法最后的结果都问的非常细大概有半个小时的时间开放题你觉得当前大模型还存在怎样的问题有什么解决办法吗开放题让你自己设计一个 Agent会怎么做为什么这样做找工作比较在意的点是什么除了薪资还有什么对文心一言这个产品了解吗有哪些优点和值得改进的点如果给你发 Offer你到这个团队能做出什么贡献三面整体来说更加综合不止有一些技术问题还有职业规划这些问题更加考察整体的能力。面试官应该是这个团队的大老板看问题更加系统和全面整体面下来还是比较有压力的。总结整体下来感觉面试官都是非常专业的面试深度和广度都很可以三场面试层层递进。面试官人也不错如果比较满意的话也愿意多花时间来聊而不是严格的卡一个小时这种完任务式的面试。腾讯背景:本弱鸡 211 本硕nlp无论文有实习老板没资源且放养本科有 acm 经历1 铜面试 pcg 日常实习。一面Q1了解什么机器学习算法讲一下原理当时只记得实体识别用到了隐马尔可夫模型讲了讲怎么怎么定义观测状态和隐藏状态、前向传播、解码和应用场景。Q2讲一下 Bert 的结构和怎么训练的怎么用 bert 做下游任务八股双向 transformer encoder 结构预训练任务包括 MLM 和 NSP详细讲了讲。下游任务做过文本分类、关系提取等用 cls 做预测也可以做摘要生成等任务。Q3有没有了解过 LLM有自己调过吗了解 RLHF 过程吗自己训练过 llama3 和 glm8、9B跑过 sft 和 dpo有看过一些技术报告。当时用 deepspeed 跑的然后讲了讲 RLHF 三个过程最后 PPO 四个模型的作用。Q4有了解强化学习吗能不能详细说说 PPO 是什么只通过 RLHF 了解过一点好像跟面试官想要的答案不一致跳过。Q5怎么扩展大模型的最大输入长度改变 transformer 结构GQAMQAflash attention等旋转位置编码 RoPE 等只看过论文自己用的很少就想到啥说啥Q6有了解过模型训练方法吗没用过感觉要凉Q7有了解过文生图吗有了解过一些项目diffusion 和 clip 原理之前有自己跑过 unetdiffusionvae 做文生图任务讲了下为什么这么做。Q8手撕快排当天晚上收到了参加二面的邮件小激动。二面二面没有手撕代码问了问项目讲一下微调大模型是怎么做的数据集怎么构建数据怎么处理看项目中用了 RAG讲一下设计流程其中文本 chunk 怎么做的为什么这么做中间有没有遇到什么困难怎么提高召回如果文本输入大模型后效果不好怎么办怎么提高大模型的外推性有了解过文生图任务吗怎么又问这个然后草草结束一天后流程结束挂了继续努力阿里部门与岗位淘天集团 - 搜推智能产品事业部 - 多模态大模型一面首先是自我介绍和过项目面试官还一起探讨项目用到的方法可行性之类的介绍一下 CLIP了解 LoRA 吗LoRA 微调的原理是什么了解哪些多模态大模型简要介绍几个BLIP 的三个损失函数分别是什么数据是怎样清洗的BLIP2 相对于 BLIP 有哪些改进BLIP3 又有哪些改进Qwen-VL 的三个训练流程分别是什么有什么作用视觉编码器和 LLM 连接时使用 BLIP2 中 Q-Former 那种复杂的 Adaptor 好还是 LLaVA 中简单的 MLP 好说说各自的优缺点代码实现多头自注意力一面比较常规几乎都是八股问题我觉得只要了解常见的多模态大模型都问题不大主要还是要理解各个模型设计的动机是什么这也是面试最喜欢考察的二面自我介绍和过项目简要问了项目中使用某些方法的动机以及是否会导致其他的问题了解 Transformer 吗编码器和解码器的注意力有什么区别在计算注意力中时除以 \sqrt{d_k} 的原因是什么后来有哪些比较经典的基于 Transformer 的语言模型Qwen 相比于原始 Transformer 有哪些结构上的改动Qwen2 又有哪些改进了解 RLHF 吗DPO 和 PPO 有什么区别Loss 是什么样的各自的优缺点是什么介绍一下 CLIP还了解什么其他的对比学习方法开放题了解哪些多模态大模型目前多模态大模型最大的问题是什么代码1143. 最长公共子序列二面其实也偏常规几乎也都是八股问题但是也考察了一些对模型的理解以及知识面的广度整体来说比一面的难度大一些三面自我介绍然后详细过了一下项目了解哪些大模型和多模态大模型然后就聊了大模型这一路是怎么发展过来的Transformer、BERT、GPT、LLaMA、Qwen 这些以及当时的 o1 推理模型平常有尝试过训练过大模型吗规模小一点的也没关系聊天包括职业规划等等三面比较轻松面试官说知识点前面两面都考察过了三面就轻松一些大概40来分钟吧总结整体来说面试体验比较好问的问题都不难面试官也都不错遇到一些卡壳的地方也会进行引导讨论面试氛围很轻松。三面应该是加面的大老板面从交流可以看出来对整个大模型这块的理解还是很深刻的收获不小。百度部门与岗位百度TPG - 文心一言团队- 大模型算法岗一面自我介绍和项目介绍介绍一下了解的大模型有哪些这些模型在结构上有什么差异说一下大模型常用的位置编码有哪些各有什么优缺点介绍一下大模型的预训练后训练以及推理是怎么做的并且详细问了 RLHF 的做法包括 PPO 算法的原理以及 DPO 和 PPO 的区别大模型的超长上下文是怎么做的比如说 KIMI大模型智能体是怎么工作的有哪些组件场景题如何训练一个大模型可以做到精确的提取摘要代码股票的四个题买卖股票的最佳时机买卖股票的最佳时机 II买卖股票的最佳时机 III买卖股票的最佳时机 IV整体来说一面偏基础问的问题也主要是一些大模型的八股问题没有太多发散性的问题难度不大。但是考察的还是挺全面的整个面试一个半小时多二面自我介绍因为之前是做 CV 的所以面试官问了 CV 和 NLP 的区别和联系在 Transformer 的大背景下CV、NLP包括语音等能否实现大一统训练大模型的时候数据怎么清洗怎么处理怎么配比怎样操作能更容易使模型达到更好的性能什么是大模型的幻觉如何减轻幻觉问题大模型的复读问题是怎么产生的业内一般有什么解决办法大模型的工具调用怎么实现Agent 有哪几部分构成了解哪些具体的实现方法开放题之前训练大模型的时候遇到过什么困难你是怎么解决的代码实现一个 Tokenizer只能用 PyTorch 基础语法二面相比于一面更加看重综合素质喜欢考察分析问题解决问题的能力对于一些细节知识点的考察并不多。二面也面试了一个多小时面试官还是挺专业的。三面首先过项目但是问的特别细致尤其是一个 Agent 的项目从背景到动机再到做法最后的结果都问的非常细大概有半个小时的时间开放题你觉得当前大模型还存在怎样的问题有什么解决办法吗开放题让你自己设计一个 Agent会怎么做为什么这样做找工作比较在意的点是什么除了薪资还有什么对文心一言这个产品了解吗有哪些优点和值得改进的点如果给你发 Offer你到这个团队能做出什么贡献三面整体来说更加综合不止有一些技术问题还有职业规划这些问题更加考察整体的能力。面试官应该是这个团队的大老板看问题更加系统和全面整体面下来还是比较有压力的。总结整体下来感觉面试官都是非常专业的面试深度和广度都很可以三场面试层层递进。面试官人也不错如果比较满意的话也愿意多花时间来聊而不是严格的卡一个小时这种完任务式的面试。最后为了助力朋友们跳槽面试、升职加薪、职业困境提高自己的技术本文给大家整了一套涵盖AI大模型所有技术栈的快速学习方法和笔记。目前已经收到了七八个网友的反馈说是面试问到了很多这里面的知识点。由于文章篇幅有限不能将全部的面试题答案解析展示出来有需要完整面试题资料的朋友可以扫描下方二维码免费领取哦面试题展示1、请解释一下BERT模型的原理和应用场景。答案BERTBidirectional Encoder Representations from Transformers是一种预训练的语言模型通过双向Transformer编码器来学习文本的表示。它在自然语言处理任务中取得了很好的效果如文本分类、命名实体识别等。2、什么是序列到序列模型Seq2Seq并举例说明其在自然语言处理中的应用。答案Seq2Seq模型是一种将一个序列映射到另一个序列的模型常用于机器翻译、对话生成等任务。例如将英文句子翻译成法文句子。3、请解释一下Transformer模型的原理和优势。答案Transformer是一种基于自注意力机制的模型用于处理序列数据。它的优势在于能够并行计算减少了训练时间并且在很多自然语言处理任务中表现出色。4、什么是注意力机制Attention Mechanism并举例说明其在深度学习中的应用。答案注意力机制是一种机制用于给予模型对不同部分输入的不同权重。在深度学习中注意力机制常用于提升模型在处理长序列数据时的性能如机器翻译、文本摘要等任务。5、请解释一下卷积神经网络CNN在计算机视觉中的应用并说明其优势。答案CNN是一种专门用于处理图像数据的神经网络结构通过卷积层和池化层提取图像特征。它在计算机视觉任务中广泛应用如图像分类、目标检测等并且具有参数共享和平移不变性等优势。6、请解释一下生成对抗网络GAN的原理和应用。答案GAN是一种由生成器和判别器组成的对抗性网络结构用于生成逼真的数据样本。它在图像生成、图像修复等任务中取得了很好的效果。7、请解释一下强化学习Reinforcement Learning的原理和应用。答案强化学习是一种通过与环境交互学习最优策略的机器学习方法。它在游戏领域、机器人控制等领域有广泛的应用。8、请解释一下自监督学习Self-Supervised Learning的原理和优势。答案自监督学习是一种无需人工标注标签的学习方法通过模型自动生成标签进行训练。它在数据标注困难的情况下有很大的优势。9、解释一下迁移学习Transfer Learning的原理和应用。答案迁移学习是一种将在一个任务上学到的知识迁移到另一个任务上的学习方法。它在数据稀缺或新任务数据量较小时有很好的效果。10、请解释一下模型蒸馏Model Distillation的原理和应用。答案模型蒸馏是一种通过训练一个小模型来近似一个大模型的方法。它可以减少模型的计算和存储开销并在移动端部署时有很大的优势。11、请解释一下LSTMLong Short-Term Memory模型的原理和应用场景。答案LSTM是一种特殊的循环神经网络结构用于处理序列数据。它通过门控单元来学习长期依赖关系常用于语言建模、时间序列预测等任务。12、请解释一下BERT模型的原理和应用场景。答案BERTBidirectional Encoder Representations from Transformers是一种预训练的语言模型通过双向Transformer编码器来学习文本的表示。它在自然语言处理任务中取得了很好的效果如文本分类、命名实体识别等。13、什么是注意力机制Attention Mechanism并举例说明其在深度学习中的应用。答案注意力机制是一种机制用于给予模型对不同部分输入的不同权重。在深度学习中注意力机制常用于提升模型在处理长序列数据时的性能如机器翻译、文本摘要等任务。14、请解释一下生成对抗网络GAN的原理和应用。答案GAN是一种由生成器和判别器组成的对抗性网络结构用于生成逼真的数据样本。它在图像生成、图像修复等任务中取得了很好的效果。15、请解释一下卷积神经网络CNN在计算机视觉中的应用并说明其优势。答案CNN是一种专门用于处理图像数据的神经网络结构通过卷积层和池化层提取图像特征。它在计算机视觉任务中广泛应用如图像分类、目标检测等并且具有参数共享和平移不变性等优势。16、请解释一下强化学习Reinforcement Learning的原理和应用。答案强化学习是一种通过与环境交互学习最优策略的机器学习方法。它在游戏领域、机器人控制等领域有广泛的应用。17、请解释一下自监督学习Self-Supervised Learning的原理和优势。答案自监督学习是一种无需人工标注标签的学习方法通过模型自动生成标签进行训练。它在数据标注困难的情况下有很大的优势。18、请解释一下迁移学习Transfer Learning的原理和应用。答案迁移学习是一种将在一个任务上学到的知识迁移到另一个任务上的学习方法。它在数据稀缺或新任务数据量较小时有很好的效果。19、请解释一下模型蒸馏Model Distillation的原理和应用。答案模型蒸馏是一种通过训练一个小模型来近似一个大模型的方法。它可以减少模型的计算和存储开销并在移动端部署时有很大的优势。20、请解释一下BERT中的Masked Language ModelMLM任务及其作用。答案MLM是BERT预训练任务之一通过在输入文本中随机mask掉一部分词汇让模型预测这些被mask掉的词汇。由于文章篇幅有限不能将全部的面试题答案解析展示出来有需要完整面试题资料的朋友可以扫描下方二维码免费领取哦
返回列表