尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

FaceLLM: A Multimodal Large Language Model for Face Understanding

发布时间:2026/9/29 8:22:56

资讯中心
01
ARTICLE

FaceLLM: A Multimodal Large Language Model for Face Understanding

FaceLLM: A Multimodal Large Language Model for Face Understanding
文章主要内容和创新点主要内容现有多模态大语言模型(MLLMs)多在通用数据集上训练,对人脸图像的特定领域视觉线索(如面部结构、表情、情绪、人口统计学特征等)理解能力有限,且缺乏大规模带标注的人脸图像-文本数据集。为此,论文提出:FairFaceGPT数据集:通过弱监督流水线,利用ChatGPT结合属性感知提示,基于FairFace数据集的元数据(年龄、性别、种族等)生成高质量问答对,涵盖表情、姿态、皮肤纹理、法医信息等多种属性。FaceLLM模型:以InternVL3为基础模型,采用低秩适应(LoRA)技术在FairFaceGPT上微调,专注于人脸理解任务。实验表明,FaceLLM在FaceXBench基准的多项人脸任务(如年龄估计、性别预测、人脸识别、深度伪造检测等)中性能优于现有MLLMs,达到当前最优水平。创新点提出一种新颖的弱监督流水线,通过属性感知提示ChatGPT,利用FairFace数据集的元数据生成人脸图像的高质量问答对。构建FairFaceGPT数据集,包含人脸图像的结构化问答,覆盖面部结构、表情、姿态等多维度属性,为特定领域MLLMs训练提供资源。提出FaceLLM模型,通过在FairFaceGPT上微调InternVL3,显著提升了多模态模型在人脸理解任务上的性能,实现当前最优结果。
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。