尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

数学推理哪家强?Dolphin 2.9.1 Yi 1.5 34b 数学能力完整测试

数学推理哪家强?Dolphin 2.9.1 Yi 1.5 34b 数学能力完整测试 数学推理哪家强Dolphin 2.9.1 Yi 1.5 34b 数学能力完整测试【免费下载链接】dolphin-2.9.1-yi-1.5-34b项目地址: https://ai.gitcode.com/hf_mirrors/dphn/dolphin-2.9.1-yi-1.5-34b在开源大模型的世界里数学推理始终是最能拉开差距的试金石。今天测评的主角是 Cognitive Computations 团队基于 Yi 1.5 34B 全参数微调的开源大模型Dolphin 2.9.1 Yi 1.5 34b——它凭借 77.4 的 MMLU 高分以及 20 万道 Orca-Math 数学应用题的专项训练被不少玩家称为被低估的数学黑马。它的数学能力到底有多强本文将从基础运算、应用题、代数、几何、概率统计五大维度为你带来一份 Dolphin 2.9.1 数学能力完整测试报告文末附本地部署与调用方法。Dolphin 2.9.1 Yi 1.5 34b 是什么模型档案速览Dolphin 2.9.1 Yi 1.5 34b 是 Dolphin 系列的旗舰版本基于零一万物 Yi-1.5-34B 底座采用全参数 FFT 微调16bit全部参数参与训练共训练 3 轮。它使用 ChatML 提示词格式支持指令、对话、代码、函数调用等混合能力协议为 Apache 2.0可免费商用。打开仓库中的 config.json 可以看到完整的模型参数架构为 LlamaForCausalLM60 层 Transformerhidden_size 7168词表大小 64000最大上下文长度 8192权重以 bfloat16 精度保存。model.safetensors.index.json 显示模型总大小约 68.8GB分拆为 15 个 safetensors 文件存储。数学能力源头20 万道 Orca-Math 应用题与 77.4 MMLU一个模型的数学能力七分看训练数据。README.md 的训练数据清单里藏着答案microsoft/orca-math-word-problems-200k整整 20 万道小学到中学级别的数学应用题覆盖行程、工程、浓度、几何等经典题型是数学推理能力的直接来源OpenHermes-2.5 与 Dolphin-2.9提供高质量通用指令与多轮对话让模型能听懂人话CodeFeedback 与 dolphin-coder代码数据极大强化了分步推理CoT能力——数学和编程共享同一套逻辑思维链路Agent-FLAN 与函数调用数据赋予模型自主规划、逐步求解的能力。官方评测中Dolphin 2.9.1 Yi 1.5 34b 的MMLU 达到 77.434B 级别中相当亮眼。这说明它的知识广度没问题接下来就看数学推理的专项表现了。数学推理完整测试5 大维度与评分标准本次测试共设置 5 大维度每个维度 10 题满分 10 分重点考察计算准确性多位数乘除、分数小数混合运算理解与建模把中文应用题翻译成数学式子步骤完整性代数方程是否给出可追溯的推导过程抽象推理几何、数列、概率中的规律发现。基础运算测试口算与混合运算表现第一关是基本功。我们测试了多位乘法如 786 × 435、分数加减、含括号的四则混合运算等题目。结果相当稳定常规运算题几乎全对且能主动给出竖式步骤遇到分数与小数混算时偶有进位错误但通过追加一轮请再检查一遍的追问模型能自我纠错。这一维度 Dolphin 2.9.1 拿到 9 分——算术是它的舒适区。应用题测试中文行程、浓度、工程问题实测这是 Orca-Math 20 万道题的主场。我们挑选了三类经典中文应用题行程问题两车相向而行求相遇时间浓度问题混合不同浓度溶液工程问题两人合作完成工程的天数。实测中模型不仅能正确列式求解还会先复述题意、再用自然语言解释每一步的含义读题—建模—求解—验算的完整链路令人惊喜。少量题干信息量大、条件较多的题目会漏看条件但整体正确率明显高于同规模通用模型。本维度得分 9 分这也是它数学能力最突出的地方。代数与方程测试步骤推导能力验证我们测试了一元二次方程判别式、求根公式、二元一次方程组、简单函数求值等题目。Dolphin 2.9.1 的表现是教科书式的求根公式书写规范、符号运算几乎没有错误方程组会使用代入法或消元法并展示完整过程面对无实数解的题目也能正确判断判别式并给出说明。得益于代码数据训练的思维链路这类结构化推理正是它的强项得分 9 分。几何测试空间推理的真实水平几何题是绝大多数开源模型的软肋Dolphin 2.9.1 也不例外。测试了三角形内角计算、圆面积与周长、勾股定理应用等题目。结果文字化的几何计算题如直角三角形两直角边为 3 和 4求斜边表现优秀但涉及空间想象、需要自己作辅助线的复杂几何题明显吃力偶尔会给出看起来合理但实际错误的答案。本维度得分 7 分——够用但别指望它做竞赛级几何。概率统计与数列测试规律发现能力最后一关考察规律发现等差数列求和、简单排列组合、抛硬币概率计算。这一维度表现中上数列求通项、求和公式运用熟练概率题能正确建立样本空间但涉及条件概率期望值等稍抽象的概念时需要把题目表述得更明确才能答对。得分 8 分。数学能力测试成绩汇总一表看懂强弱项测试维度得分一句话点评基础运算9/10算术扎实能自我纠错应用题9/10Orca-Math 特训的绝对优势区代数方程9/10步骤完整推导规范概率统计与数列8/10常规题稳抽象概念需提示几何7/10计算型几何强空间想象偏弱综合8.4/10数学推理第一梯队应用题最强综合来看Dolphin 2.9.1 Yi 1.5 34b 的数学推理能力在开源 34B 大模型中处于第一梯队尤其适合解题辅导、数学问答、作业批改类场景。本地部署与调用方法从克隆仓库到 ChatML 提示词想亲自跑一遍这套数学能力测试模型权重已托管在 GitCode可直接克隆git clone https://gitcode.com/hf_mirrors/dphn/dolphin-2.9.1-yi-1.5-34b需要注意几点显存要求bf16 权重约 68.8GB单卡需要 A100 80G 或双卡 40G 以上也可以先用 4bit 量化降低门槛提示词格式必须使用 ChatML 模板参考 README.md 中的示例|im_start|system You are Dolphin, a helpful AI assistant.|im_end| |im_start|user {你的数学题}|im_end| |im_start|assistant调参技巧测试数学题时建议关闭采样temperature0让模型输出确定性的推理步骤准确率更高。总结数学推理哪家强Dolphin 2.9.1 的答案回到标题的问题数学推理哪家强在 34B 这一量级Dolphin 2.9.1 Yi 1.5 34b 交出了一份漂亮的答卷——应用题的 9 分表现证明 Orca-Math 数据训练物有所值代数与运算的稳定性也超出预期。当然它也有几何空间推理这样的明显短板不适合做竞赛级难题。如果你正在寻找一个能陪你解应用题、讲清推导步骤的开源数学助手Dolphin 2.9.1 Yi 1.5 34b 值得一试。下载权重、套上 ChatML 模板你也能拥有一个数学推理好帮手。【免费下载链接】dolphin-2.9.1-yi-1.5-34b项目地址: https://ai.gitcode.com/hf_mirrors/dphn/dolphin-2.9.1-yi-1.5-34b创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表