尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

如何 10 分钟用 DevOps-Eval 评测你的 LLM:从环境搭建到第一份榜单的完整教程

如何 10 分钟用 DevOps-Eval 评测你的 LLM:从环境搭建到第一份榜单的完整教程 如何 10 分钟用 DevOps-Eval 评测你的 LLM从环境搭建到第一份榜单的完整教程【免费下载链接】codefuse-devops-evalIndustrial-first evaluation benchmark for LLMs in the DevOps/AIOps domain.项目地址: https://gitcode.com/gh_mirrors/co/codefuse-devops-evalDevOps-Eval 是一款面向 DevOps 与 AIOps 领域的大模型评测基准evaluation benchmark收录 7486 道 DevOps 多选题、2840 个 AIOps 样本和 1509 个 ToolLearning 样本帮你快速量化大模型在 8 大 DevOps 模块上的真实能力。本教程带你走完环境搭建 → 配置模型 → 一键评测全流程10 分钟内跑出属于自己的第一份模型榜单。一、评测数据一图看懂8 大模块、55 个细分类别DevOps-Eval 按照 DevOps 完整生命周期把题目划分为PLAN、CODE、BUILD、TEST、RELEASE、DEPLOY、OPERATE、MONITOR8 个通用模块并进一步细化为 55 个类别单元测试、版本控制、容器化、告警、日志解析等。除了选择题项目还包含两大特色子集AIOps覆盖日志解析、时序异常检测、时序分类、时序预测、根因分析 5 类智能运维场景ToolLearning兼容 OpenAI 函数调用Function Calling格式涵盖 59 个领域、239 种工具场景。二、3 步搭建评测环境约 3 分钟第 1 步克隆 DevOps-Eval 仓库git clone https://gitcode.com/gh_mirrors/co/codefuse-devops-eval第 2 步安装依赖创建虚拟环境并安装依赖即可建议 GPU 环境 CUDA评测推理会明显更快pip install -r requirements.txt核心依赖包括transformers4.32.0、torch2.0.1、datasets、accelerate等完整清单见 requirements.txt 所在位置。第 3 步下载评测数据集从 Hugging Face 官方数据集devopseval-exam下载devopseval-exam.zip并解压具体地址见项目 README 的 Data 一节支持 Hugging Face datasets 与 ModelScope 两种方式直接加载。数据分为dev和test两部分dev 集每个类别含 5 条带解析的示例供 few-shot 使用test 集为正式评测集并附标准答案。三、配置你的模型两条路任选打开conf/model_conf.json可以看到项目已预注册了多个模型例如Qwen-7b-Chat、Baichuan2-13b-Chat、Internlm-7b-Chat等。方式 A直接复用已注册模型最快如果你的模型与预注册模型同源如 Qwen-7B 对话版直接复用对应的loader和context_builder配置跳过一切代码工作直奔下一步。方式 B为自己的模型注册 Loader 与 Context Builder如果你的模型需要特殊的加载方式或对话模板如 ChatML 格式只需做两件事编写 Loader继承ModelAndTokenizerLoader位于src/model_and_tokenizer_loader/model_and_tokenizer_loader_family.py覆写load_model与load_tokenizer编写 Context Builder继承ContextBuilder位于src/context_builder/context_builder_family.py覆写make_context方法把输入转成模型需要的对话格式。最后在conf/model_conf.json里注册你的模型名例如{ MyModel-Chat: { loader: MyModelAndTokenizerLoader, context_builder: MyChatContextBuilder } } 提示如果模型加载后无需特殊处理、输入也无需转格式可以完全跳过这一步。四、一键启动评测跑出你的第一份榜单确认数据集配置文件conf/dataset_fp.json中维护了各数据集与 CSV 文件的映射后执行主评测脚本python src/run_eval.py \ --model_path path_to_model \ --model_name model_name_in_conf \ --model_conf_path conf/model_conf.json \ --eval_dataset_list all \ --eval_dataset_fp_conf_path conf/dataset_fp.json \ --eval_dataset_type test \ --data_path path_to_downloaded_devopseval_data \ --k_shot 0完整示例可参考 scripts/run_eval_example.sh每个参数都有注释。关键参数速查参数作用--model_path你的 HuggingFace 格式模型路径--model_name在 model_conf.json 中注册的模型名--eval_dataset_listall全量评测或用#连接多个数据集名--k_shot0~5few-shot 给模型前置的示例数量--data_path解压后的评测数据集目录脚本内部流程见src/run_eval.py加载数据集 → 加载模型与 tokenizer → 构建上下文 → 逐题取 A/B/C/D 四个选项 token 的 logits取分数最高者为预测 → 由src/metric/metric_score.py统计各数据集准确率与总体得分。五、看懂你的第一份榜单评测结束后日志会输出每个数据集的题数、答对数、准确率以及所有数据集的总体平均分——这就是你的 DevOps 榜单第一行。几个实用建议先跑 zero-shotk_shot 0再跑 five-shot对多数指令微调模型few-shot 准确率会明显更高两组对比能看出模型的指令遵循能力按模块定位短板榜单会按 PLAN/CODE/.../MONITOR 分类展示比如某模型 monitor 模块 80 分、plan 模块仅 60 分短板一目了然ToolLearning 榜单看 6 项指标工具调用准确率fccr、意图识别失败占比1-fcffr、工具名识别失败占比1-fcfnr、参数识别失败占比1-fcfpr、幻觉失败占比1-fcfnir与答案相关度aar评测实现在src/evals/目录toolfill/toolparser 等模块。六、常见坑与快速排查问题快速排查方法跑不动、显存不足换 7B 级别模型或用accelerate做张量并行选项分数异常、预测全是 A检查 context_builder 是否把选项拼进了上下文选项应只保留单 token数据集加载报错确认--data_path指向解压后的根目录且包含 test 子目录few-shot 结果不稳定项目已用src/utils/set_seed.py固定随机种子无需担心写在最后从克隆仓库到拿到第一份 DevOps/AIOps 评测榜单你只需要装依赖 → 配模型 → 跑一条命令。DevOps-Eval 的完整评测流程、样本格式说明和排行榜细节都可以在项目README_zh.md中找到。现在就去评测你的模型看看它在 DevOps 大模型榜单上能排到第几名吧【免费下载链接】codefuse-devops-evalIndustrial-first evaluation benchmark for LLMs in the DevOps/AIOps domain.项目地址: https://gitcode.com/gh_mirrors/co/codefuse-devops-eval创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表