尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

37小时数据分析学习路径:Excel/SQL/PowerBI/Python从入门到求职

37小时数据分析学习路径:Excel/SQL/PowerBI/Python从入门到求职 这次我们来看一个很多人都会问到的选题数据分析到底怎么入门才能既应付日常工作又扛得住求职面试不是推荐书单也不是卖课而是把一条完整的学习路径拆开讲。这个选题的核心信息都在标题里37 小时、Excel/SQL/PowerBI/Python、求职、简历面试、从入门到精通。简单说就是用一套体系化的学习内容把数据分析师最常用的四样工具串起来最后落到“能找到工作”这个结果上。先说结论。这套学习路径适合三类人零基础准备转行数据分析或商业分析已经在做运营、产品、销售等岗位想补数据能力应届生想把项目经验和面试能力一起准备。如果你属于这三类建议把这篇按路线收藏。文章后面会拆每个工具学什么、怎么练、面试怎么考还会给一些能直接抄的代码和数据操作示例。1. 课程与技能速览先给一个整体规格表方便快速判断这套内容适不适合自己。维度说明内容定位数据分析全流程学习从入门到求职总体时长37 小时核心工具Excel、SQL、PowerBI、Python附加模块求职、简历、面试准备适合人群零基础入门、转行数据岗、业务岗补数据技能学习方式系统拆解 实操 面试训练硬件要求常规办公电脑即可PowerBI Desktop 和 Python 均免费从这套内容的结构看它不是单点讲某一个工具而是把数据分析的完整链路拆成了四段Excel日常数据入表、清洗、快速统计的第一入口SQL从业务数据库里准确、可重复地取数PowerBI把分析结果做成可交互、可刷新的可视化报表Python批量处理、自动化、复杂计算和深度分析。再往下就是专门针对求职的简历和面试模块。这个设计思路很实际企业招数据分析师看的不是你会不会某个按钮而是你能不能从“业务问题”走到“数据结论”。2. 为什么是 Excel/SQL/PowerBI/Python 四件套很多初学者的误区是学了一堆工具遇到真实问题还是不知道从哪下手。四件套的组合方式本质上是按照“数据分析流水线”来分工的。2.1 Excel 管什么Excel 是所有数据工作的入口。业务系统导出的明细表、运营同事手工维护的台账、面试邮件里发来的附件大部分都是 Excel 格式。Excel 需要掌握的不是“单元格操作”而是以数据处理为核心的能力查找引用类函数XLOOKUP、VLOOKUP、INDEXMATCH统计汇总类函数SUMIFS、COUNTIFS、AVERAGEIFS文本处理类函数MID、LEFT、RIGHT、TEXT数据透视表按维度汇总、行列切换、值字段设置Power Query多表合并、数据清洗、追加查询。Excel 的优势是快。一个几千行的表最快的方式往往不是写 Python而是直接开透视表。这也是为什么它是面试第一关。2.2 SQL 管什么SQL 负责取数。数据分析师的日常工作里很大一部分时间是在写查询订单表、用户表、行为日志表这些都在数据库里不会以 Excel 附件的形式发给你。SQL 的核心能力包括单表查询SELECT、WHERE、ORDER BY、LIMIT聚合分组GROUP BY、HAVING、COUNT、SUM、AVG多表关联INNER JOIN、LEFT JOIN、RIGHT JOIN子查询与 CTE复杂逻辑分步拆解窗口函数ROW_NUMBER、RANK、SUM OVER。SQL 是企业里最通用的取数语言。面试官考 SQL往往不给 Excel 环境而是给一个在线 SQL 平台让你现场写出查询结果。2.3 PowerBI 管什么PowerBI 负责可视化和自助报表。分析结果不能只停留在个人电脑里要变成团队可以打开、可以交互、可以定时刷新的报表。PowerBI 需要掌握数据导入从 Excel、SQL Server、CSV 导入数据建模表与表之间的关系DAX 度量值SUM、CALCULATE、FILTER、SWITCH报表设计图表选择、页面布局、切片器发布与刷新发布到工作区配置定时刷新。PowerBI Desktop 是免费软件个人学习完全够用。2.4 Python 管什么Python 负责自动化和深度分析。当数据量变大、流程变重复、Excel 卡顿明显时就需要 Python 出场。常用方向pandas数据清洗、分组计算、透视、合并openpyxl直接读写 Excel 文件matplotlib / seaborn定制化图表requests BeautifulSoup提取公开网页数据注意只能处理自己有权访问的数据pyinstaller把脚本打包成 exe分发给不使用 Python 的同事。Python 不是用来替代 Excel 的而是用来处理“Excel 做起来很痛苦”的场景比如每天合并几十个文件、清洗几万行脏数据。2.5 四者串成一条线一份完整的分析任务通常是这样跑的业务问题 → SQL 从数据库取数 → Excel 快速校验 → Python 深度清洗与计算 → PowerBI 可视化 → 汇报结论 → 定时刷新。这四个工具不是四个孤立的选项而是一条流水线上的四个岗位。面试官问“你会什么工具”时他真正想问的是你在流水线的哪个环节能干活。3. 37 小时内容怎么拆从入门到精通的学习主线从标题看这套课程按“入门到精通”组织并且专门加入求职、简历、面试模块。没有拿到内部大纲的情况下可以按数据分析岗位的通用技能要求反推出学习主线。学习阶段核心内容阶段产出面试关键词第一阶段Excel 基础到进阶能完成数据清洗、统计报表VLOOKUP、透视表、Power Query第二阶段SQL 取数能写复杂查询、多表关联JOIN、窗口函数、执行顺序第三阶段PowerBI 可视化能做出交互式报表DAX、度量值、模型关系第四阶段Python 自动化能批量处理 Excel 数据pandas、openpyxl、脚本化第五阶段求职冲刺简历项目 面试题训练项目复盘、SQL 手写题、业务问题拆解这个顺序也是推荐的学习顺序。先 Excel因为上手快、能建立信心再 SQL因为它是面试硬门槛然后 PowerBI把成果可视化最后 Python把效率提上来。如果时间有限优先把一、二、三阶段跑通第四阶段至少做到“能运行现成脚本、能改参数”再去准备面试。4. Excel 部分函数、透视表与数据清洗Excel 看起来简单但面试题往往不是“会不会用”而是“这个场景用哪个函数”。4.1 高频函数与场景场景函数/工具示例根据订单号匹配金额XLOOKUP / VLOOKUPXLOOKUP(A2, 订单表!A:A, 订单表!C:C)提取身份证出生日期MID TEXTTEXT(MID(A2, 7, 8), 0-00-00)多条件求和SUMIFSSUMIFS(金额列, 区域列, 华东, 月份列, 1月)去除重复统计透视表 / UNIQUECOUNTA(UNIQUE(A2:A100))文本拆列分列功能按分隔符拆分多表合并Power Query追加查询“提取第几位到第几位”是 Excel 搜索里的高频词对应的就是 MID 函数。例如 A2 单元格里的证件号是 18 位需要取第 7 到第 14 位作为出生日期MID(A2, 7, 8)再配合TEXT转换格式TEXT(MID(A2, 7, 8), 0000-00-00)这类函数在面试中常被当作快速筛选能不能不看帮助就写出来直接反映日常使用熟练度。4.2 Excel 与网页数据交互还有一个高频问题HTML 调用 Excel 数据能不能根据 Excel 表动态变化先说结论浏览器出于安全限制无法直接读取用户本地的 Excel 文件。如果要做“网页展示 Excel 数据并动态变化”比较常见的方案有三种把 Excel 导出为 CSV 或 JSON发布到服务器前端请求接口数据用 Python 定期把 Excel 转成 JSON/CSV再推送到数据库或静态目录如果数据源是公开网页表格用 Excel 的 Power Query 从网页获取数据刷新时更新。第一种是“网页实时读 Excel”需要配合后端接口第二种适合企业内部看板第三种适合定期同步公开数据。想“双击本地 Excel 文件网页就自动变”是不太现实的必须有一个中间层负责读取和推送。4.3 Excel 的边界Excel 能处理的数据量有限。几万行没问题几十万行开始卡顿上百万行会明显吃力。遇到这种情况不要硬用 Excel直接进入 SQL 或 Python 环节。5. SQL 部分取数与查询SQL 是数据分析面试的硬门槛。笔试通常直接给表结构和查询要求现场写代码。5.1 学习环境怎么搭如果本机没有数据库不建议直接装很老的版本。SQL Server 2008 R2 已经是多年前的产品在新系统上安装容易遇到兼容性和安全补丁问题。更稳妥的做法是学习用SQLite DB Browser零配置文件适合练习语法正式练习 Windows 环境SQL Server Express 2019/2022免费支持大部分企业面试需要的功能在线练习部分平台提供无需安装的 SQL 练习环境适合模拟笔试。安装 SQL Server 时核心组件选“数据库引擎服务”即可身份验证可以选混合模式方便本地用 sa 或 Windows 身份登录。5.2 从单表到多表一个最常用的 SQL 示例统计 2024 年第一季度每个区域的订单数和订单金额。SELECT region, COUNT(DISTINCT user_id) AS user_cnt, SUM(order_amount) AS total_amount FROM orders WHERE order_date 2024-01-01 AND order_date 2024-04-01 GROUP BY region ORDER BY total_amount DESC;面试中常考的一个点是SQL 的执行顺序并不是按照 SELECT 的顺序而是FROM → WHERE → GROUP BY → HAVING → SELECT → ORDER BY → LIMIT知道这个顺序才能理解为什么 WHERE 里不能使用 SELECT 里定义的别名而 ORDER BY 可以。多表关联是另一个重点。LEFT JOIN 和 INNER JOIN 的区别几乎是必问-- 取所有用户最近一笔订单 SELECT user_id, order_date, order_amount FROM ( SELECT user_id, order_date, order_amount, ROW_NUMBER() OVER (PARTITION BY user_id ORDER BY order_date DESC) AS rn FROM orders ) t WHERE rn 1;窗口函数是面试加分项尤其 ROW_NUMBER、RANK、DENSE_RANK 的区别以及 SUM() OVER() 做累计求和在业务分析里非常常用。5.3 SQL 注入与安全边界搜索热词里经常出现“SQL 注入”“万能密码绕过”这类词。这里明确说一句SQL 注入是安全漏洞不是用来绕过的技巧学习它的唯一目的是理解原理、做好防御。正确的做法是使用参数化查询。以 Python 为例import sqlite3 conn sqlite3.connect(example.db) cursor conn.cursor() # 错误的写法直接拼接用户输入 # sql SELECT * FROM users WHERE name user_input # 正确的写法参数化查询 sql SELECT * FROM users WHERE name ? cursor.execute(sql, (user_input,))在企业里凡是涉及用户输入的查询都必须参数化不能直接拼字符串。6. PowerBI 部分可视化与 DAXPowerBI 的作用是把分析结果变成别人能看的报表。面试不会只看你会不会拖拽图表更关注你是否理解数据模型和 DAX。6.1 从数据到报表PowerBI Desktop 免费下载安装后操作流程一般是获取数据选择 Excel、SQL Server 或 CSV在 Power Query 编辑器里清洗数据建立表关系创建度量值拖拽可视化发布到 PowerBI 服务配置刷新。关键点在于不要只在一个表里做所有分析。业务数据通常拆成订单表、用户表、商品表、区域表PowerBI 里要用“星型模型”把这些表连接起来而不是把几十个字段堆在一张宽表里。6.2 DAX 度量值示例DAX 是 PowerBI 的核心语言。最基础的是求和销售金额 SUM(订单表[金额])面试高频题是“度量值和计算列有什么区别”。一句话版本计算列在刷新时逐行计算并存储度量值在报表交互时动态计算能用度量值就不要用计算列避免数据模型膨胀。6.3 SWITCH 函数用法PowerBI 搜索热词里经常出现“SWITCH 函数用法举例”。SWITCH 类似 Excel 里的多层 IF 嵌套适合做分组订单量分级 SWITCH( TRUE(), [销售金额] 10000, 低, [销售金额] 50000, 中, [销售金额] 100000, 高, 极高 )第一个参数用TRUE()后面会按顺序判断条件返回第一个满足结果对应的值。这个写法比多层 IF 嵌套清晰很多也是面试里常考的分组逻辑。6.4 PowerBI 面试常见场景面试官可能给出一个销售表要求做一张“按区域、按月展示销售额和环比变化”的报表。考察点通常包括是否会用 CALCULATE 改变筛选上下文是否会在可视化对象里添加同比、环比是否了解日期表的作用是否能把业务指标翻译成 DAX 表达式。建议面试前自己动手做一张完整看板把数据导入、关系建模、度量值、页面排版全部走一遍。项目经验里如果能写“通过 PowerBI 将周报制作时间从 3 小时缩短到 30 分钟”比写“熟悉 PowerBI”有说服力得多。7. Python 部分自动化与批量处理Python 是四件套里门槛最高的一个也是拉开差距的关键。入门不需要学完整个语言只需要掌握数据分析常用子集。7.1 环境配置推荐直接使用 Python 官方安装包配合 VSCode。安装时勾选“Add Python to PATH”避免命令行找不到 python。VSCode 里装 Python 扩展然后打开命令面板选择解释器python --version如果命令行直接输入 python 没有反应考虑是不是没有勾选 PATH或者系统存在多个 Python 版本。建议把 Python 安装目录、Scripts 目录都加入系统 PATH。7.2 pandas 批量处理 Excel一个很常见的需求文件夹里有几十个格式相同的 Excel 文件需要合并成一个总表。import pandas as pd from pathlib import Path input_dir Path(./data) output_file Path(./all_data.xlsx) frames [] for file in input_dir.glob(*.xlsx): df pd.read_excel(file) df[来源] file.stem frames.append(df) result pd.concat(frames, ignore_indexTrue) result.to_excel(output_file, indexFalse) print(f合并完成{len(result)} 行输出至 {output_file})这段代码比用 Excel 手动复制几十个文件要稳定得多。批量任务的关键是加日志和异常处理避免一个文件出错导致整个流程中断。import pandas as pd from pathlib import Path import traceback input_dir Path(./data) output_file Path(./all_data.xlsx) frames [] failed [] for file in input_dir.glob(*.xlsx): try: df pd.read_excel(file) df[来源] file.stem frames.append(df) print(f[OK] {file.name}{len(df)} 行) except Exception: failed.append(file.name) traceback.print_exc() if frames: result pd.concat(frames, ignore_indexTrue) result.to_excel(output_file, indexFalse) print(f合并完成共 {len(result)} 行) if failed: print(f失败文件{, .join(failed)})7.3 pandas 分组计算另一个高频场景按区域统计销售额。import pandas as pd df pd.read_excel(sales.xlsx) summary ( df .groupby(region, as_indexFalse)[order_amount] .agg([sum, count, mean]) ) print(summary)这种表达能力是 Excel 很难直接替代的输入输出路径清晰可以配置化执行。7.4 爬虫与数据合规Python 爬虫是热门搜索词但必须强调爬取公开数据前先确认数据来源是否允许抓取遵守网站的 robots 协议和服务条款不能爬取个人信息、版权内容或需要登录才能访问的私有数据。学习爬虫用来练手时优先选择官方提供 API 或明确开放的示例数据源。7.5 Python 转 exe如果做好了一个自动化脚本想交给不使用 Python 的同事可以用 PyInstaller 打包pip install pyinstaller pyinstaller --onefile --console merge_excel.py打包后会在dist目录生成 exe。注意杀毒软件可能误报打包体积也比较大适合小工具分发不适合作为正式产品。8. 求职、简历、面试怎么准备这一部分最容易被人忽视但恰恰是决定能不能拿到 offer 的关键。工具学完了面试时说不出来或者简历上写不出有效信息都是白学。8.1 简历怎么写简历不要写“熟悉 Excel、SQL、PowerBI、Python”要写“用这些工具解决了什么问题”。一个比较实用的写法模板项目模块内容示例项目名称销售经营分析看板数据规模处理 2023 年全年订单表约 80 万行数据业务目标解决销售周报人工汇总耗时问题分析动作使用 SQL 从数据库中提取订单、用户、区域表使用 Python 清洗异常数据合并多数据源使用 PowerBI 搭建销售看板量化结果周报制作时间从 3 小时缩短到 30 分钟异常订单识别率明显提升同样一份技能按这种写法面试官一眼就知道你能干活。8.2 高频面试题按工具分类整理ExcelVLOOKUP 和 XLOOKUP 的区别是什么如何从一个证件号里提取出生日期数据透视表能否做多表关联什么时候用 Power Query 而不是公式SQL说说 SQL 的查询执行顺序。LEFT JOIN 和 INNER JOIN 的区别如何取每个用户最近一条订单记录一个表有重复数据如何去除什么是 SQL 注入如何避免PowerBI度量值和计算列的区别CALCULATE 的作用是什么SWITCH 函数如何实现区间分组如何做同比、环比Pythonpandas 如何按列分组求和如何批量读取多个 Excel 文件并合并如何处理缺失值手中的脚本运行时报找不到模块怎么排查业务题某页面访问量下降了 20%你会怎么分析如果销售目标是提高 10%你如何从数据中找到切入点指标下跌数据本身看不出问题你下一步干什么业务题没有标准答案考察的是分析思路。比较稳妥的回答框架是先确认指标定义和数据口径再拆维度再定位问题最后给建议。8.3 项目复盘点面试前把简历上的项目完整复盘一遍数据从哪来清洗做了哪些处理为什么用这个指标而不是别的发现了什么结论这些结论产生了什么影响能把这五个问题讲通比背一百道题更有用。面试官真正想确认的是你到了项目现场能不能独立解决问题。9. 常见问题与排查方法学习过程中遇到问题很正常关键是快速定位。整理一份排查清单问题现象可能原因排查方式解决方案Excel 打开大文件卡顿文件行数过多或公式过多查看文件大小和计算公式量改用 Power Query 或 pandas 处理Excel 公式不刷新计算选项被设为手动检查公式所在单元格格式按 F9 或改为自动计算SQL 查询结果中文乱码数据库字符集不一致查看表和客户端编码统一使用 UTF-8 或对应字符集SQL Server 连接失败服务未启动或端口不通检查服务状态和防火墙启动 SQL Server 服务确认端口PowerBI 刷新失败数据源路径变化或权限不足查看刷新历史记录更新数据源路径检查凭据pip 安装包很慢默认源访问慢查看安装日志配置国内镜像源VSCode 不识别 Python 解释器未安装 Python 扩展或未选解释器底部状态栏查看解释器命令面板选择解释器Python 脚本打开文件报路径错误当前工作目录不对打印当前工作目录使用绝对路径或Path(__file__).parent10. 最佳实践与学习建议最后给几条可以直接照做的建议。第一先跑通最小闭环。不要第一遍就把四个工具全部学完而是从“一个 Excel 文件 → 一个透视表 → 一个图表”开始建立能看得到成果的路径。第二固定一套环境。比如 Excel 2021 或 Office 365、SQL Server Express、PowerBI Desktop、VSCode Python 3.10 以上。别今天换一个工具、明天换一个版本排查问题会变得很麻烦。第三所有练习分目录管理。输入数据、脚本、输出结果分开命名带日期和版本。批量任务要加日志和失败重试避免跑到一半断掉。第四涉及任何数据都要注意权限。不要使用未经授权的数据不要把企业数据外传不做任何绕过系统安全限制的操作。这是职业底线也是面试里会考察的规范意识。第五面试前用一周专门做复盘。别急着刷一堆偏题怪题先把自己的项目讲清楚再把 SQL 手写题练熟最后用 PowerBI 重新做一遍看板。这套 37 小时课程最值得尝试的地方是把工具、项目、求职三个环节串在了一起。如果你刚准备入行第一步不是买课而是先按本文路线把 Excel 和 SQL 基础跑起来能独立完成一个小分析项目后再进入求职冲刺效率会高很多。最容易踩的坑是“只收藏不实操”——数据分析是手熟技能看一百个小时不如亲手跑通一个文件合并脚本。
返回列表