尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Garak 命令行实战:6 步跑完一次完整的 LLM 安全扫描

Garak 命令行实战:6 步跑完一次完整的 LLM 安全扫描 Garak 命令行实战6 步跑完一次完整的 LLM 安全扫描【免费下载链接】garakthe LLM vulnerability scanner项目地址: https://gitcode.com/GitHub_Trending/ga/garak模型要上线了你敢拍胸脯说它测过安全吗被一句假装你是……绕过的防线、被诱导吐出的敏感内容上线之后都可能变成事故。LLM 安全扫描就是冲着这个来的给一个模型用各种手法把它问崩再告诉你哪里崩了。Garak 是这类 LLM 安全评估工具里的命令行选手思路类似当年的 nmap。下面不罗列参数表直接按一次真实扫描任务的流程走摸清家底、跑起来、收窄范围、调性能、读报告、迭代复测。扫描前先列出所有可用探针和检测器第一次敲 Garak 命令最容易栽在探针名上——凭印象写换来一串 unknown 提示。花两分钟把家底列清楚后面能省不少试错。没装过的话先python -m pip install -U garak就位。把三类插件都列一遍探针负责怎么问检测器负责怎么判生成器负责问谁。下面三个命令分别打印各自的名字加-v还能看到带描述的明细表python -m garak --list_probes python -m garak --list_detectors python -m garak --list_generators查看单个插件的详情对某个名字感兴趣想知道它测什么、有哪些配置项把类型.模块.类的三段式名字丢给--plugin_infopython -m garak --plugin_info probes.lmrc.Profanity描述和配置项会直接打在终端里不用去翻 探针源码 里的定义。一条命令跑完首次 LLM 安全扫描告诉 Garak 问谁它要知道两件事走哪个接口--target_type具体是哪个模型--target_name。本地模型直接跑接 OpenAI 这类服务要先设好密钥环境变量export OPENAI_API_KEYsk-你的密钥 python -m garak --target_type openai --target_name gpt-4不挑探针的话Garak 按默认配置跑一组内置探针。留意一下默认配置偏向快而不是全终端有时会提示你换个更完整的配置再跑。先挑一个探针家族试水全量扫描动辄几十分钟第一次不如先试水。--spec是目前推荐的选探针入口下面这条只跑 DAN 越狱家族python -m garak -t openai -n gpt-4 --spec probes.dan只查一类漏洞精确选择探针与检测器如果只想针对某类漏洞做快速验证呢把选择写到类这一级就行。按模块名或类名缩小范围python -m garak -t huggingface -n gpt2 --spec probes.dan.Dan_11_0spec 还支持混合表达-开头表示排除tag:按标签筛。比如--spec probes.dan,-probes.dan.DanInTheWild,tag:owasp:llm01意思是跑 dan 家族、去掉其中一个探针、再并入 OWASP LLM01 标签下的探针。给判定换把尺子每个探针自带推荐检测器--detectors可以整体换掉它传名字或all懒得挑就加--extended_detectors让所有检测器都参与判定。尺子越多结论越细代价是更慢。控制扫描行为与性能并行度、种子和配置扫描太慢、结果没法复现基本都逃不出下面这几个旋钮。四个最常调的旋钮--parallel_attempts它决定了同时跑多少个探针尝试测远程 API 时调大它提速最明显--parallel_requests它决定了单条提示词并发发几个生成请求-g--generations它决定了每条提示词生成多少条回复想快就调小-s--seed它决定了随机数的起点不固定的话两次扫描没法直接比。python -m garak -t openai -n gpt-4 --spec probes.dan --parallel_attempts 16 --parallel_requests 4 -g 5 -s 42用 JSON 文件替代重复参数给插件传参数有两条路把参数存成 JSON 文件后用--probe_option_file指过去或者干脆在命令行里直接传一段 JSON 字符串python -m garak -t openai -n gpt-4 --probe_options {temperature: 0.7}更上层的 Garak 漏洞扫描配置并行度、生成次数、探针选择交给--config加载一份 YAML/JSON 即可configs 目录 里有两份现成的可以参考。读报告结果存在哪怎么打开三份输出各有各的用途扫描收尾时终端会打印报告路径。每次运行生成一份garak.运行ID.report.jsonl每条探针尝试的生成与判定各占一行同名.html是浏览器直接能开的摘要页。出错的时候从哪查起持续追加在garak.log里的调试信息最顺眼。交互式探查和 AVID 转换不想一次跑完整流程可以进交互模式手动跟模型聊、边聊边看它的反应python -m garak -t openai -n gpt-4 --interactive已有的报告想转成 AVID 格式继续分析python -m garak --report garak.运行ID.report.jsonl迭代复测固定变量对比两次扫描固定种子复现一次结果今天失败率 3%明天 8%你敢信哪个把-s 42钉死同一配置连跑两次结果一致说明配置稳了对不上回头查是不是顺手换了检测器或生成次数。换个阈值再扫一遍--eval_threshold它决定了多大的命中率才算中招。默认偏保守想抓得灵敏就调低它误报会跟着变多。留个马上能动手的小任务挑你最担心的那类问题比如probes.encoding固定种子跑一遍记下失败率再把-g从 5 提到 20 跑第二遍。两次数字的差距能直接告诉你这个模型是侥幸没中还是确实扛得住。【免费下载链接】garakthe LLM vulnerability scanner项目地址: https://gitcode.com/GitHub_Trending/ga/garak创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表