尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

我花了54个小时,做了一个可能更公平的AI大模型排行榜。

我花了54个小时,做了一个可能更公平的AI大模型排行榜。 这个周末在家里做了一个有趣的东西。一个非常有意思的AI大模型排行榜。没想到效果还不错所以我也觉得可以免费开放给大家一起玩。起因是我上周发了文章然后一位朋友的一条评论被很多朋友都顶的很高。希望能做一个各个模型评分排行的汇总方便实时了解和对比各种模型的性能。这个是一个非常有趣、且对我自己非常刚需的需求。因为现在的模型评测排行榜、评测集等等实在是太多太多了人人其实都可以做一份自己的评测集然后来跑一份模型排行榜有的测的全一些有的就是个垂直场景的特定任务这个量级真的特别大。甚至我自己都搓了一套所谓的模型评测集方便我自己看一下大模型的效果到底怎么样。但是我其实根本不敢对外放出来或者大言不惭的说我这个就是标准啥的我自己清楚图一乐可以如果你要对外那专业水平还差了八万条街。但是这么多排行榜还有来源究竟该看谁呢我们到底该信谁呢我自己的过去的解法就是找出我相信的那些排行榜或者评测机构然后我只看他们的排名和跑分看完以后综合判断一下其实我心里就有数了。其实你看这个理念和方法跟AIHOT还有我自己的理念其实是如出一辙的这个时代最重要的其实就是筛选信源而不是筛选信息本身。所以当看到那个用户的评论之后我就想不如我就开发一个小功能吧聚合一些我信任的排行榜清楚的反映出大模型的综合能力。而且我想着反而也不复杂比如一个模型在这个榜上第一、在那个榜上第二在那个榜上又第一我取个平均数不就好了估计几个小时就开发完了然后放在AIHOT上给大家免费看这多好啊。结果从周五晚上吃完饭回到家里11点开始这一做整个周六周日就再也没出过门了一直就做到了周一的凌晨5点。。。我是真没想到想把这些玩意凑在一块根本不是取个平均数就完事的想要做好想要靠谱居然能有这么多细节需要考虑我甚至去恶补了关于贝叶斯的知识。。。不过还好皇天不负有心人在熬了2天之后我总归还是做出来了。网址在此https://aihot.virxact.com/leaderboard或者如果你是AIHOT的老用户的话你也能在首页左边的Tab上看到一个新的Tab就是模型榜。在这个界面上你就能看到所谓的AIHOT共识分了。这个分数的背后其实就是我自己挑选出来的一些我觉得真的有参考意义的一些排行榜了第一批一共10个后面还会加大家如果有觉得非常靠谱的且新的也可以给我反馈。这10个来源我列了一个表格。而你点击这个地方也能进入我们参考的所有排行榜的界面。这里把大家的榜单都集成过来了方便大家查看当然也放了跳转源网址的快捷入口方便大家去源站看其他的信息。而你如果回到排行榜首页每个模型本身也可以点击去到他们的详情页看看每个来源给他们的打分和排行分别是多少。大概就是这么个东西。讲道理如果不做外面的那个AIHOT的共识分只做一下集成把大家的数据放到这定时更新其实挑选来源大概2小时Codex按我的流程现在开发最多3小时半天怎么滴也就能搞完了。但是吧我自己还是觉得如果纯粹的只是集成展示还是不够有意思。包括这也是我自己一直想知道的如果把这些排行榜的数据都汇聚在一起出一个新的排行榜就是大家的共识榜那是不是就肯定有意思多了。人的很多念头啊只要你起念的那一刻那再也不会消下去了。于是这一个周末的时间我几乎把所有的时间都铺在了这个上。起初我想的特别简单我觉得这个排名不是挺好算的吗就是比如说我有10个榜比如Kimi K3这个模型在那个榜单上排第1在那个榜单上排第2在那个榜单上排第5我直接取个平均数就能算出来它的综合排名2.66然后所有模型一起来比这个综合排名不就搞定了。但是当实际把那些数据拿出来的时候我才发现这个方案就纯纯是拍脑袋的呆逼方案问题实在太多了。比如同样是第5在一张只有10个模型的榜里只能算中游但是在一张有200个模型的榜里已经是最顶尖的了这两个第5的含金量能是一回事吗比如这个榜的第1领先第2领先了30%另一个榜单里第1只比第2多了0.01分领先的幅度微乎其微这个领先幅度能是一回事吗还有等等等等全是坑。而且还有一个特别现实的事情就是有的榜他更新就是慢半拍有的榜他就是不跑某个特定的模型于是同一个模型可能在6个榜里是有它身影的但是在另4个榜里却处于缺失状态。那这时候这个缺失得咋处理呢。。。如果给它填0分这肯定不行啊它只是没测又不是真零蛋你填平均分那对其他人也不公平如果你只平均它参加过的6张榜又会把这6张榜的影响莫名其妙的放大导致也不客观。这个时候我才发现这个事的棘手程度而且不止这个算法我才发现每一个榜单上大家的模型名称还有评测的规则还有命名规范全都不一样这又给我带来了一些工作量不过这个好解决就是纯粹的工程化问题。我建一个我们自己的中心模型名称库然后把其他榜单的名称全部映射过来就非常快的速度就解决了。但是唯独这个排行算法。于是在周六我就开始跟AI一轮一轮的聊一轮一轮的去学习和探索。这个时候你会发现如果我们只在Codex里面让它根据我们的代码和项目来去探索效果是稀巴烂基本上就是一个快沉的满身漏洞的大船它疯狂的给你想着怎么打补丁但是真正的本质是我们得换一艘不会漏水的船。所以呢这个时候我一般会把我自己的坑还有这些问题给梳理出来。我直接打开ChatGPT的5.6 Sol Pro来去跟他聊。相信我这个模型绝对不比Claude Fable 5差很强非常强尤其是在讨论方案上强的离谱。然后我一般的方法呢不是让它在自己的领域里面去找而是把我的困惑和我的问题还有这个事情的背景说给它听同时问它人类历史上有没有过类似的解决方案。这个时候你会发现你的思路瞬间就会被拓宽了人类的局限很多时候就是因为自己的知识因为每一个人的能力都过于渺小。而如果你在找一个方案的时候只局限在自己的领域你会发现你经常会撞上南墙。可人类的知识本就浩瀚如星海你的领域解决不了那有没有可能其他的领域是可以解决的呢AI给我找了两个领域一个叫教育一个叫电竞。在教育这个事呢在很久以前就遇到过了。比如说不同的学生他做的试卷不一样那题目难度也不一样。单纯的比较卷面的总分其实是并不公平的。那所以后面我们有了一整套的方法它可以从你的答题结果里面去评估一个看不见的潜在分数。在电竞里面也有类似的机制特别是竞技类游戏一个可能只打了几十场把把超神的人你不可能还给他匹配同样打了几十场的萌新吧这个机制被大家亲切的称为Elo机制。微软也有一个自己的项目叫TrueSkill是一种更偏团队更高级的游戏匹配系统。太像了跟我们遇到的问题太像了。那从这两条路去归纳最后我们找到了一个非常非常适合我们现有数据的成对比较方法同时又做了一些定制化的改良。底层叫Bradley-Terry同时又加了先验来限制小样本结果的评分。它大概的意思呢就是我们核心看的是模型之间真正发生过的PK和较量比如两个模型同时出现在了一张榜单里面那谁高谁就赢了一场。然后把所有榜单里面真实发生过的一些胜、负、平最后放到了一张巨大的网里面反过来推算模型背后真正的那个能力值。这其实就变成了纯粹的电竞PK。那有些模型可能互相之间从来没有在同一张榜单里面出现过那也没有关系只要它们分别跟同一批对手交过手那整张大网络仍然可以把它们连起来。比如某个榜单里面缺了A就导致A没有直接打过B但在另一个榜单里面A打过CB也打过C当这样的共同对手足够多以后这时候我们就可以根据它们的分数大概来去推断A和B的能力值和它们的关系了。当然大模型的榜单跟电竞还是有一些区别因为来源之间会互相重叠小榜的偶然性会更强证据太少的模型也可能因为刚好赢了几场就算出一个特别离谱的能力值。于是我们又做了很多的工作比如做了一些叫证据预算的东西又加了一些先验。而且为了我们归一到100分制我们又冻结了一组锚点模型用它们来定义共识分的刻度。那最终呢这套榜单我们的实现方式AI给我取了个名字叫LatentRank。在这套规则下前5名就是这几个。Opus 5超过Fable 5我还是有点意外的不过看了一下源榜编程的评测确实更强一些以及Fable 5有的任务一跑就降级反而拉低了分实在是没招。同时呢这套规则我也完全的公开出来了在AIHOT中有一个规则页大家如果感兴趣的话可以自己去看。网址在此https://aihot.virxact.com/leaderboard/rules当然最后我想说我们做的这套东西它一定也不是百分百的标准它更不能定义每一个模型真正的能力的边界和参数。我只能说用这种方式尽可能的在我的理解里在我的能力的范围里面尽可能公平的把它们汇总起来给大家一个可能会更加客观的答案。所以所有的一切数据我们都暴露在了网页之上大家全部都可以进行查看或者玩一玩。当然这还只是第一版后面我肯定还会继续去做一些优化的再补上一些更好、更加客观、更加多样化的评测来源让我们这个榜单也更加的客观一些。最后也希望这个小小的功能。能对大家有用。玩的开心以上既然看到这里了如果觉得不错随手点个赞、评论、转发三连吧这对我们有特别大的帮助~谢谢你看我的文章我们下次再见。
返回列表