
MCP 工具的 AI 好不好使跑一次测试【免费下载链接】skillsPublic repository for Agent Skills项目地址: https://gitcode.com/GitHub_Trending/skills3/skills你调了三天 MCP 工具上线后 AI 就是调不对你连到底哪里不行都说不清。skills3/skills 仓库里有一套现成的 MCP 测试工具写几道题让真模型跑一遍它告诉你工具差在哪。东西藏在 mcp-builder 技能的 scripts 目录核心就是一个 evaluation.py。它不是单测框架是个驾驶员把 Claude 放上去只许用你的工具答题再给结果打分。MCP 技能怎么测你给它一个 XML 文件每个qa_pair是一道题加一个标准答案evaluation qa_pair questionFind the user who created the most issues in January 2024. What is their username?/question answeralice_dev/answer /qa_pair qa_pair questionWhich repository created before 2023 has the most stars? What is its name?/question answerdata-pipeline/answer /qa_pair /evaluation仓库自带一份 example_evaluation.xml 可以直接抄。题怎么写是有讲究的evaluation.md 里写得很全每道题必须只读、彼此独立标准答案得是单个、不会变的值。别问现在有多少个 open issue这种数字每分钟都在变下次跑结果就两样了。文件给进去之后脚本分三步走。先建连接stdio 会自动拉起你的服务进程SSE 或 HTTP 则要先自己把服务跑起来再把 URL 递过去。然后拉取工具列表逐题喂给模型。系统提示词逼着模型把输出包进三个标签summary写解题思路feedback写对你工具的看法response写最终答案。模型每次想调工具脚本都替它执行并记下这次调用花了多久、调了几次。你拿到一份 Markdown 报告。头部是总体命中率、平均每题耗时、平均工具调用次数。往下每题一个 ✅ 或 ❌列出期望答案、实际答案、耗时、每个工具的调用计数外加模型的自述和吐槽。判分很朴素response里的内容和标准答案逐字比对一致得 1 分不一致 0 分没有半分。几行命令跑通第一次评估pip install -r skills/mcp-builder/scripts/requirements.txt export ANTHROPIC_API_KEYyour_key python skills/mcp-builder/scripts/evaluation.py \ -t stdio -c python -a my_mcp_server.py \ -o report.md \ my_evaluation.xml真正跑的只有一条命令前两行是依赖和密钥。-t是你最常改的参数本地脚本用 stdio服务自动拉起远程服务用-t sse或-t http-u给 URL要鉴权就-H挂请求头。-c和-a是启动服务的命令与参数服务自己需要 token 时用-e KEYVALUE把环境变量递进去。评估报告怎么读报告里数字不少最值得盯的是这四个准确率唯一的硬指标而且极严。多一个逗号、差一个小数位都算错。所以出题时先把格式锁死——只答数字保留两位小数。每题耗时从提问到交卷的总时间。哪题明显慢先去读它的 summary多半是模型在兜圈子分页翻数据或者反复试错工具。平均工具调用次数AI 翻了多少个抽屉才找到东西。高而答对说明题有深度高而答错多半是工具描述不清晰模型在瞎猜。总调用量与单工具耗时哪个工具被调最多、最慢它就是第一优化对象通常就是返回数据太多的那个。不过最值钱的其实不是数字是每题的feedback。那是 AI 用你工具的第一手体验名字看不懂、参数没写全、报错不说怎么修。照着这段改工具命中率最高。开始前注意三件事标准答案要稳定别问实时计数答案格式写死比对是逐字的工具怎么改先看 feedback【免费下载链接】skillsPublic repository for Agent Skills项目地址: https://gitcode.com/GitHub_Trending/skills3/skills创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考