题目内容多多是一个大模型架构师,在部署大语言模型时为了提高GPUGPUGPU的利用率,推理引擎通常会将多个用户的请求合并成一个批次进行并行计算。同一批次内如果请求长度不同,短请求会被填充空白TokenTokenTo