尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

用Python写自动化脚本:一个真实项目的完整复盘

用Python写自动化脚本:一个真实项目的完整复盘 电话铃声响起来的时候我刚泡好一杯咖啡。市场部的小刘几乎是带着哭腔——那份跨区分店销售报表她手动汇总了三天结果老板只看了一眼就指出数据对不上。二十家分店每家发来一个Excel格式各不相同有.xls也有.xlsx有的带合并单元格有的藏着隐藏行。她复制粘贴到怀疑人生最后发现自己漏掉了其中一家的数据。领导拍拍桌子说“写个Python脚本以后自动汇总。”我拿到样本文件时第一反应是想把电脑屏幕摔了。文件名像是从垃圾堆里捡来的“销量表(2).xlsx”、“7月——最终版请以此为准.xls”、“aaaa.xls”……打开之后更是群魔乱舞有的第一行是公司名称有的直接就是表头日期列里混着“2023-04-01”“4月1日”“2023/4/1”三种写法销售额里出现“-”“”“#N/A”甚至一句注释“这个数大概对吧”。自动化项目的最大敌人从来不是代码复杂而是数据格式的无序。这句话在我整理完六个样本文件后从脑子里冒了出来。技术选型倒是没什么悬念。Python生态里pandas处理表格数据几乎是无敌的openpyxl能处理带格式的xlsxxlrd负责读取老式xls文件。报告部分用matplotlib画图reportlab生成PDF邮件走smtplib。整个脚本设计成命令行工具不依赖任何GUI方便后续挂到定时任务里。我甚至提前想好了架构读取、清洗、汇总、报告、发送五个模块各干各的但事实证明这个架构在真实数据面前不堪一击。第一版读取函数还算顺利用pathlib遍历文件夹根据后缀分发到不同解析器。但隐藏的坑很快就浮出来了一个分店的表格里合并单元格导致pandas只读到了第一行的值其余全是NaN另一个分店在表格中间插了一张Logo图片读出来的DataFrame直接错位。当你为一堆脏数据写了200行清洗代码时你就会明白什么是真实世界。我不得不用openpyxl的底层API逐行遍历判断单元格类型跳过非数据行这才勉强把数据归位。清洗逻辑越写越长日期转成统一格式空白替换成0#N/A直接过滤金额列里的千分位逗号去掉。最让人崩溃的是有两家分店上报的销售额一个是含税价一个是裸价——税率还不同。我只能做了一张映射表手动录入每家店的税率在汇总前统一换算。这阶段我意识到一件事写脚本容易写能持续跑的脚本很难。因为业务逻辑本身不复杂但持续变化的业务规则才是真正的时间黑洞。汇总计算本身没什么技术含量pandas的groupby几行搞定。麻烦在于要给老板看图表。用matplotlib画了月度销售额趋势、各店占比饼图、环比变化柱状图然后雷打不动地遇到中文乱码。折腾了半个下午找到系统里的中文字体文件注册到matplotlib里才解决。任何自动化脚本的收益都应该折算成‘人工小时’而不是‘感觉方便了’。项目总共节省了大约每个月3个人天但前期调试花了整整两周——这笔账必须算明白不然你很难说服自己继续投入。PDF报告用reportlab拼装把图表和表格按固定版式排好。这里的教训是字体嵌入要提前搞定否则发出去的PDF在别人电脑上全是方块。另外报告文件名里带了日期但我犯了个低级错误——用英文月份缩写导致老板以为文件是“4月”的其实是“8月”。一个细节失误足以抹掉整个自动化项目建立起来的信任。邮件发送是最后一步也最让人心悸。第一次测试时脚本报错“SMTPAuthenticationError”我还以为是密码错了后来发现邮箱需要生成专门的授权码而不是登录密码。改好之后以为万事大吉结果对方服务器直接退信因为发件人地址的域名没通过SPF认证。邮件发送失败比数据处理错误更可怕因为你会毫无察觉。如果数据处理出问题函数会抛出异常但邮件静默丢失你以为发送成功其实对方什么也没收到。那段日子我每天凌晨守在电脑前看日志文件。第一周就发现三个隐藏bug一个分店的文件扩展名是“.xls”但实际是HTML格式的假Excel另一个文件里有个公式引用了外部工作簿导致pandas读出来全是错误值还有一个文件超过50MBpandas直接内存溢出。处理这些问题的过程让我彻底理解了自动化脚本的优雅体现在它对意外情况的容忍度上——而不是代码写得多么花哨。项目稳定运行两个月后我做了第二次重构。把单个300行的脚本拆成reader、cleaner、aggregator、report、mailer、config、logger七个模块。用配置文件管理分店列表和税率新增分店时不用改代码只需要在YAML里加一行。添加了--dry-run参数可以在不发送邮件的情况下生成报告预览。加了全局try/except任何异常都写入日志并发送告警。不要相信任何没有日志的定时任务。这句话成了我后续所有自动化项目的铁律。部署倒是简单Windows的任务计划程序足够用了。每天凌晨2点运行生成报告后发送然后把日志和中间文件归档。没有用更复杂的调度框架因为一台普通办公电脑的稳定性比任何高大上的工具都靠谱。运维过程中最常发生的是供应商更新了模板比如新增一列“备注”我的清洗代码就崩了。于是加了schema校验模板结构与预期不符时抛错并附上详细说明而不是给出一堆莫名其妙的NaN。从“能用”到“好用”中间隔着一个同事的抱怨。当小刘不再需要问我“脚本怎么跑”的时候这个项目才算真正落地。三个月后新开了一家分店还换了一个合作方的报表系统。我修改了配置文件添加了新店的税率和路径。但合作方的导出文件日期格式又变了而且多了几十行合计。我盯着日志看了半天发现cleaner已经能自动跳过合计行因为它在数据完整性检查时发现“这些行缺少商品编号”。这让我很欣慰也让我想起了最初的自己——那个以为写个循环遍历Excel就叫自动化的人。项目复盘的本质是承认自己最初的设计有多天真。真正的自动化不是把一次操作变成脚本而是把一次次变化变成可配置、可追踪、可恢复的流程。现在这个脚本已经默默运行了两年每个月自动处理二十多个文件生成一份二十页的PDF报告发给十几个收件人。它依然会出错但每次出错都有日志、有告警、有回滚方案。它不再是一个脚本而是一个有生命的系统。我从中最大的收获不是学会了几十个库的用法而是明白了脚本是一份正在运行的文档——那些注释、日志和异常处理才是你写给未来接手者包括自己的信。如果你也在写自动化脚本请记住你写的不是代码是别人未来几个月的安心。
返回列表