论文原标题:LLAVIDAL : A Large LAnguage VIsion Model for Daily Activities of Living这是一篇发表在2025年IEEE/CVF计算机视觉与模式识别会议(CVPR)的正式论文,属于多模态大语言模型(MLLM)应用于日常生活活动理解的前沿工作。项目资源位置:https://adl-x.github.io/一、问题背景:1. 现有LLVM在ADL上的“水土不服”现有LLVM的训练数据特点为什么不适合ADL(Activities of Daily Living)网络视频(如Web-scraped)体育剪辑、电影片段、教学视频有严格的时序结构(如“先打羽毛球再休息”是线性的)、背景干净可控、动作单一明确ADL视频(真实生活)厨房做饭、客厅休闲、老人护理没有严格时序(做饭时可能穿插打电话)、多动作并发、背景杂乱、视角多变2. 现有方法的三大缺陷缺陷具体表现后果① 缺乏ADL专用的指令微调数据现有LLVM主要在ActivityNet、WebVid等数据集上训练对ADL特有的“杂乱时序”和“多动作并发”理解差② 缺乏多模态融合只用RGB视频,没有利用3D骨架和物体交互信息无法学习视角不变的表示——换个角度看同一个动作就认不出来了③ 简单的“一键对齐”多模态训练效果差
