搭建一套零成本的模型A/B测试流水线——用大模型评测大模型
模型评测最大的痛点是什么人工看。200条输出一条条看至少两小时而且不同人打分标准不一样。后来我发现一个很讨巧的方法——让大模型当裁判去评其他大模型的输出。不需要人工参与不需要买评测工具在TokenStar上就能跑通。评测流水线的四步· 准备50条你自己的业务数据客服对话/产品描述/代码片段什么都可以· 同一条数据同时发给两个模型——比如DeepSeek V4和GPT-5.4拿到两份输出· 让Claude当裁判盲评——把两份输出和原始问题发给Claude你觉得哪份更好1-5分说明理由· 统计50条结果——谁赢得多差距有多大我们用这个方法对比了DeepSeek和GPT在中文客服场景的表现——Claude给出的评分中DeepSeek赢了28次、GPT赢了18次、4次平手。和后来人工复评的结论高度一致相关系数0.86。整个过程花了约10分钟如果人工做至少要两小时。总成本——几十次API调用不到一美元。自动化扩展组件实现成本测试数据管理存为JSON格式版本化管理免费被测模型调用TokenStar API统一调用改model参数切换API费用裁判模型调用Claude Opus评分最稳的判断力API费用结果统计与可视化Python脚本自动生成对比报告免费TokenStar的地址是 tokenstar.world上面能同时调用评测所需的所有模型——DeepSeek当选手、Claude当裁判——同一个平台全搞定。