尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

如何消除Shotlooter误报?高熵字符串与信用卡检测的3个调优技巧

如何消除Shotlooter误报?高熵字符串与信用卡检测的3个调优技巧 如何消除Shotlooter误报高熵字符串与信用卡检测的3个调优技巧【免费下载链接】shotlootera recon tool that finds sensitive data inside the screenshots uploaded to prnt.sc项目地址: https://gitcode.com/gh_mirrors/sh/shotlooterShotlooter 是一款开源的截图敏感信息嗅探工具它通过 OCR 识别上传到 prnt.sc 的截图内容并综合运用关键词匹配、高熵字符串检测和信用卡 Luhn 校验帮你快速定位 API 密钥、私钥等敏感数据。不过很多新手在使用时会发现误报特别多明明只是一段普通随机字符串却被标记为高熵字符串随便一个 16 位数字也可能触发信用卡检测。本文结合源码分享消除 Shotlooter 误报的 3 个实用调优技巧让你的扫描结果更精准。为什么 Shotlooter 会产生误报Shotlooter 的完整检测流程见 shotlooter.py大致分为四步遍历 prnt.sc 图片 ID逐张下载截图用 Tesseract OCR 把图片转换成文本匹配 keywords.txt 中的敏感关键词对每个单词计算信息熵并校验信用卡号Luhn 算法误报的根源在于信息熵只衡量字符串的随机程度并不关心它是不是真正的密钥。任何随机生成的内容验证码、订单号、UUID熵值都接近满值自然会被判定为敏感。下面这张截图里的比特币私钥就是典型的高熵字符串目标信用卡检测同样如此——它只依赖「16 位数字 Luhn 校验」截图里的订单号、会员卡号很容易满足条件。理解了误报来源下面的调优技巧就有了明确的发力点。调优技巧一提高熵值阈值滤掉普通随机串高熵检测的核心判断在 shotlooter.pyif entropy(word) 4.5 and http not in word and / not in word and len(word) 65:默认阈值是4.5信息熵满值为 8这个值对长密钥比较友好但也会把验证码、乱码文本统统捞进来。推荐的调整方向扫描场景建议阈值抓 API 密钥 / 私钥5.0 ~ 5.5只抓高置信度密钥5.5 ~ 6.0宁多勿漏的广撒网保持 4.5把4.5改成5.0左右误报率通常能下降 30% 以上。同时可以收紧长度条件把len(word) 65改为len(word) 16 and len(word) 65进一步排除短随机串。真实场景中像 AWS 的 Access Key 这类目标本身就带有明显前缀如AKIA开头熵值高且不受阈值上调影响放心加阈值即可 如果只想靠关键词抓敏感信息可以直接跳过熵检测用--no-entropy参数见技巧二。调优技巧二按场景使用 --no-entropy / --no-cc 排除检测Shotlooter 内置三个「一键排除」参数误报严重时是最快的兜底方案python3 shotlooter.py --code sjgmm5 --no-entropy # 跳过高熵字符串检测 python3 shotlooter.py --code sjgmm5 --no-cc # 跳过信用卡检测 python3 shotlooter.py --code sjgmm5 --no-keyword # 跳过关键词检测什么时候该用当你的目标很明确比如只关心 SMTP 密码、数据库连接串时直接加上--no-entropy --no-cc让 keywords.txt 中的关键词成为唯一判定标准输出会干净很多。而做全量审计时可以把熵检测当作线索而非结论先用默认参数跑一遍再人工复核 findings.csv 中entropy类型的记录。下图这类 Postman 截图中的access_token、client_secret才是真正值得关注的高熵字符串调优技巧三信用卡检测的 OCR 分词与 Luhn 校验优化信用卡检测逻辑在 shotlooter.py要求单词为 16 位纯数字再通过 Luhn 算法校验末位。这带来了两类误报OCR 分词错乱截图里的卡号常写成4111 1111 1111 1111这种带空格形式OCR 会拆成多个词导致漏检反过来订单号等 16 位数字若碰巧通过 Luhn 校验就成了误报。号码格式多样卡号可能带-或空格分隔当前逻辑无法识别。针对性的优化思路预处理 OCR 文本检测前先去掉空格与连字符把4111 1111 1111 1111还原成完整 16 位再校验增加卡 BIN 前缀校验如 4 开头为 Visa、5 开头为 MasterCard可大幅减少随机数字误报结果二次确认把credit_card类型的结果单独导出人工快速复核一遍。很多用户喜欢把各种凭据存在 Excel 里这类截图的误报率也偏高调优时值得重点观察调优后的快速检查清单✅ 根据目标把熵值阈值调整到 5.0 ~ 5.5并加上长度下限✅ 明确场景善用--no-entropy/--no-cc/--no-keyword参数✅ 信用卡检测前先合并 OCR 拆分出的号码段✅ 用 findings.csv 汇总结果定期复盘误报类型上手体验先执行git clone https://gitcode.com/gh_mirrors/sh/shotlooter拉取项目再按 requirements.txt 安装依赖记得先装好 tesseract-ocr。调优的核心思路其实很简单工具负责发现你负责判断——把阈值、排除参数和预处理三者结合就能把 Shotlooter 误报率降到可接受的范围。【免费下载链接】shotlootera recon tool that finds sensitive data inside the screenshots uploaded to prnt.sc项目地址: https://gitcode.com/gh_mirrors/sh/shotlooter创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表