尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Toward Automatic Safe Driving Instruction: A Large-Scale Vision Language Model Approach

Toward Automatic Safe Driving Instruction: A Large-Scale Vision Language Model Approach 文章核心总结与创新点一、主要内容本文聚焦于基于大规模视觉语言模型(LVLMs)实现自动安全驾驶指令生成,核心研究围绕“同步处理驾驶员视角与道路视角双视频流”展开:研究背景:现有LVLMs在自动驾驶领域的应用多依赖单一道路视角摄像头,难以检测驾驶员使用手机、注意力不集中等风险行为,需整合双视角视频输入以保障驾驶安全的全面性。数据集构建:创建了包含同步双视角视频的对话式数据集,涵盖1719个训练样本、215个验证样本和215个测试样本,标注了10类主要驾驶事件(如急刹车、违规使用手机、未完全停车等)及多维度子事件(如天气、道路条件、信号使用情况等),并通过GPT-4o生成标注文本后经专家审核确认。模型与实验:采用Qwen2.5-VL 3B和7B模型,冻结视觉编码器仅对语言模型进行全参数微调,以BERTScore和BLEU为评估指标,在事件检测和安全驾驶指令生成两项任务上开展实验。核心发现:预训练LVLMs性能有限,生成的指令较为通用;微调后的模型能生成与视觉语境高度契合的精准指令,但在检测细微/复杂事件(如转弯时超速)、避免模态偏差(提及视频中不存在的物体)等方面仍存在挑战。二、创新点双视角融合框架:首次提出整合驾驶员视角与道路视角同步视频流的LVLM应用方案,解决了单一视角无法全面覆盖驾驶风险的问题。
返回列表