尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

《LLAVIDAL:一个面向日常生活的大型语言视觉模型》论文核心部分详解

发布时间:2026/9/6 6:51:21

资讯中心
01
ARTICLE

《LLAVIDAL:一个面向日常生活的大型语言视觉模型》论文核心部分详解

《LLAVIDAL:一个面向日常生活的大型语言视觉模型》论文核心部分详解
论文原标题:LLAVIDAL : A Large LAnguage VIsion Model for Daily Activities of Living这是一篇发表在2025年IEEE/CVF计算机视觉与模式识别会议(CVPR)的正式论文,属于多模态大语言模型(MLLM)应用于日常生活活动理解的前沿工作。项目资源位置:https://adl-x.github.io/一、问题背景:1. 现有LLVM在ADL上的“水土不服”现有LLVM的训练数据特点为什么不适合ADL(Activities of Daily Living)网络视频(如Web-scraped)体育剪辑、电影片段、教学视频有严格的时序结构(如“先打羽毛球再休息”是线性的)、背景干净可控、动作单一明确ADL视频(真实生活)厨房做饭、客厅休闲、老人护理没有严格时序(做饭时可能穿插打电话)、多动作并发、背景杂乱、视角多变2. 现有方法的三大缺陷缺陷具体表现后果① 缺乏ADL专用的指令微调数据现有LLVM主要在ActivityNet、WebVid等数据集上训练对ADL特有的“杂乱时序”和“多动作并发”理解差② 缺乏多模态融合只用RGB视频,没有利用3D骨架和物体交互信息无法学习视角不变的表示——换个角度看同一个动作就认不出来了③ 简单的“一键对齐”多模态训练效果差
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。