尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

MCP技能评估3步跑通:准确率、耗时、工具调用次数一次看全

MCP技能评估3步跑通:准确率、耗时、工具调用次数一次看全 MCP技能评估3步跑通准确率、耗时、工具调用次数一次看全【免费下载链接】skillsPublic repository for Agent Skills项目地址: https://gitcode.com/GitHub_Trending/skills3/skills你刚写完一个MCP服务器上线前最该问的不是能不能跑而是它到底答得准不准。skills3/skills 项目里的 MCP 技能评估脚本就是干这个的拿一批问题考你的服务器自动判分、出报告。评估脚本在哪文件长什么样说人话MCPModel Context Protocol大模型调用外部工具的协议技能评估就是让 Claude 只挂你服务器的工具去答题答完自动对答案、算分。核心脚本在 skills/mcp-builder/scripts/evaluation.py出题规范和参数细则在 skills/mcp-builder/reference/evaluation.md。评估文件是个 XML根节点 evaluation里面放若干 qa_pair每题一个 question 加一个 answerevaluation qa_pair question2024年1月提交issue最多的用户是谁给用户名。/question answeralice_dev/answer /qa_pair /evaluation出题有讲究题目只读、互相独立答案要是能直接比对的单个值过段时间问答案也不能变。数量上建议 10 道太少看不出规律太多跑一轮又费钱。为什么要出难题模型靠关键词一搜就中的题测不出工具的成色。好题是多跳的先查 A再靠 A 找 B最后从 B 里算出答案。三步把评估跑起来先把仓库拉下来进到 mcp-builder 目录git clone https://gitcode.com/GitHub_Trending/skills3/skills cd skills/skills/mcp-builder装依赖并配好 key评估靠它驱动 Claude 答题pip install -r scripts/requirements.txt export ANTHROPIC_API_KEY你的key跑评估。主线走 stdio脚本会自己把服务器起起来你不用手动开。加 -o 能把报告存成文件默认模型是 claude-3-7-sonnet-20250219想换就加 -mpython scripts/evaluation.py \ -t stdio -c python -a my_mcp_server.py \ -o report.md my_evaluation.xml如果服务器是 SSEServer-Sent Events服务端单向推流或 HTTP 部署把 -t 换成 sse 或 http再用 -u 传地址、-H 传鉴权头服务器得提前自己起好。报告里的数字怎么读换个角度把指标翻译成你关心的事你想知道答对几道→ 系统拿模型答案和标准答案做字符串比对每题 0 或 1 分报告给总准确率你想知道每题花了多久→ 从发题到交出答案全程计时报告给每题耗时和平均耗时你想知道调了多少次工具→ 每次调用都记账报告给平均每题调用次数和总调用次数你想知道工具哪里不好用→ 每题答完模型必须交一段工具反馈点名描述不清、参数没文档、返回太多的地方每道题在报告里还会单列预期答案、实际答案、对错标记、耗时、调用明细外加模型自述的解题思路。跑挂或分数低先查这三处实操的时候你会发现问题基本逃不出三类题目跑到一半卡很久甚至超时 → 多半是工具单次返回数据太多把上下文塞爆了 → 给工具加 limit 和分页再用 -m 换个更强的模型。明明答对了却判零分答案就差个句号 → 判分是严格字符串比对格式差一点就算错 → 在题干里把输出格式写死比如用 YYYY/MM/DD只答 A/B/C/D。stdio 模式压根连不上 → 多半是 -c 和 -a 拼的不是能直接启动的命令或环境变量没透传 → 先手动跑同一命令确认能起再用 -e 逐个补环境变量。测一次不是目的测→改→再测才是。改完工具描述后用同一份评估文件重跑一遍把两轮 report.md 的准确率摆一起看涨了合进去没涨接着改。【免费下载链接】skillsPublic repository for Agent Skills项目地址: https://gitcode.com/GitHub_Trending/skills3/skills创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表