尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Prompt perturbation and fraction facilitation sometimes strengthen Large Language Model scores

Prompt perturbation and fraction facilitation sometimes strengthen Large Language Model scores 文章核心总结与翻译一、主要内容该研究聚焦大型语言模型(LLMs)对期刊文章研究质量的评分任务(采用1*-4*四级评分标准),通过170万次Gemma3 27b模型查询(基于2780篇健康与生命科学领域文章、58个相似提示词),结合ChatGPT 4o-mini、Llama4 Scout等其他5个模型的验证,探索提示词设计对评分效果的影响,核心结论如下:有效提示词策略:(1)测试语义等效的提示词变体;(2)对语义等效提示词的评分结果取平均;(3)允许给出分数值;(4)避免强调输入文本(仅标题和摘要)的不完整性。模型差异性:最优提示词因模型而异——ChatGPT 4o-mini的最优提示词与Gemma3几乎相反,Llama4 Scout和Magistral的提示词效果弱相关,Qwen3 32b和DeepSeek R1 32b受提示词影响极小。关键发现:分数提示词能增加评分多样性和模型置信度表达;语义等效提示词取平均可降低无评分输出的概率,且是所有模型的通用有效策略;LLMs普遍存在回避1*(最低分)的倾向。二、创新点首次系统验证了“语义等效提示词变体+结果平均”策略在文本质量评分任务中的普适性,解决了单一提示词可能导致的评分偏差问题。拓展了分数提示词的应用场景,证实即使目标评分为整数,允许分数输出仍能提升模型与人类判断的相关性,揭示分数可释放模型对答案的置信度信息。
返回列表