
文章主要内容与创新点总结一、主要内容现有AI偏见评估基准多反映西方视角,非洲语境严重缺位,导致大语言模型(LLMs)在非洲相关应用中可能传播有害刻板印象。为此,研究团队推出首个以非洲社会文化为背景的开源刻板印象数据集AfriStereo,通过在塞内加尔、肯尼亚、尼日利亚的社区参与式调研,收集1163条涵盖性别、种族、宗教、年龄、职业等维度的刻板印象,结合少样本提示与人工验证,扩充为5000余条“刻板印象-反刻板印象”配对。研究对2019-2024年间的11个主流语言模型(含GPT-2、Llama 3.2、Mistral 7B等)进行评估,采用偏见偏好比(BPR)与配对t检验量化偏见。结果显示,11个模型中有9个存在统计显著偏见(BPR=0.63-0.78,p≤0.05),年龄、职业、性别是主要偏见维度;领域专用模型(如BioGPT、FinBERT)偏见较弱,而2023-2024年的现代模型(如Llama 3.2 3B)偏见甚至强于早期模型,表明单纯的架构优化未能有效缓解非洲语境下的刻板印象问题。二、创新点首个非洲语境刻板印象基准:填补全球南方AI偏见评估空白,聚焦非洲特定身份(如伊博族、卢奥族、塞雷族等),捕捉西方基准中缺失的区域文化刻板印象。社区驱动的混合方法论:结合开放式社区调研、语义聚类、人工验证与LLM辅助扩充,确保数据集的文化真实性与覆盖广度,同时提出可复现的偏见评估流程。系统的跨代模型评估:涵盖近5年11个不同