尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Leveraging Large Language Models for Predictive Analysis of Human Misery

Leveraging Large Language Models for Predictive Analysis of Human Misery 文章总结与翻译一、文章主要内容该研究聚焦于利用大型语言模型(LLMs)从现实场景的自然语言描述中预测人类感知的痛苦评分,将此任务构建为回归问题,即模型为每个输入语句分配0-100的标量值。1. 数据基础使用含516条现实或虚构场景文本描述的数据集,每条数据标注0-100分的痛苦评分,数据源自公开博客和用户整理资源,涵盖家庭关系问题、事故、医疗紧急情况等多类情感场景,且评分呈近似对称分布,多数场景对应中高程度感知痛苦。2. 实验设计与评估提示策略对比:评估零样本提示(无标注示例)、少样本提示(含固定/随机/基于BERT嵌入检索的标注示例)、两阶段思维链(CoT)提示三种策略,发现少样本提示(尤其基于语义相似示例的检索增强提示)显著优于零样本和CoT提示,如少样本提示(k=2)MAE降至12.49,而零样本MAE为23.48。评估指标:采用平均绝对误差(MAE)、均方根误差(RMSE)、皮尔逊相关系数、斯皮尔曼等级相关系数和决定系数(R²),以MAE为主要指标,因其在现实场景中可解释性强。游戏化评估框架:设计“痛苦游戏秀”(Misery Game Show),含四个回合(序数推理、二元比较、标量预测、区间校准),分静态(无反馈)和自适应(有反馈)模式。结果显示,反馈能提升模型在二元比较和区间校准任务的性能,且GPT-4o在所有模型中表现最优,总体准确率达61.79%。
返回列表