文本聚类黑科技:用BERT将几千条客户投诉自动归类,精准定位产品缺陷从海量投诉中打捞“信号”客服部门传过来一份Excel,里面是几千条客户投诉。文本长短不一,表达方式五花八门——“手机用着用着就黑屏了”“充电的时候特别烫”“售后根本不回消息”。你一眼扫过去,脑子里只有一个问题:这些投诉里,到底藏着多少个产品缺陷?传统的做法是人工打标签。但几千条文本,光是读完就需要几天,更别提归类了。更棘手的是,新出现的缺陷类型往往不在预设的标签体系里,人工维护分类规则永远慢半拍。这就是文本聚类派上用场的地方。而基于BERT的聚类方案,正在成为处理这类问题的“黑科技”。与LDA等传统方法相比,BERT + KMeans在捕捉语义丰富且差异明显的主题方面表现显著更优。为什么传统方法不够用先看最常见的两种传统做法。基于词频的向量化(TF-IDF)把每篇投诉变成一个高维稀疏向量,每个维度对应一个词。这种方法的问题是:它只认词,不认意。“屏幕碎了”和“显示屏裂了”在向量空间里可能相距很远,因为它们几乎没有共同词汇。但二者明明说的是同一个缺陷。LDA主题模型通过词共现模式推断主题,输出“主题-词语”分布和“文档-