尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

MAC: A Live Benchmark for Multimodal Large Language Models in Scientific Understanding

发布时间:2026/9/30 2:19:51

资讯中心
01
ARTICLE

MAC: A Live Benchmark for Multimodal Large Language Models in Scientific Understanding

MAC: A Live Benchmark for Multimodal Large Language Models in Scientific Understanding
MAC相关研究总结与核心部分翻译一、文章主要内容本文聚焦多模态大型语言模型(MLLMs)在科学理解能力评估方面的挑战,提出了一个动态演进的基准测试集MAC(Multimodal Academic Cover benchmark),并针对MLLMs跨模态科学推理能力不足的问题,设计了轻量级推理方法DAD(Description and Deduction)。1. 现有基准测试集的局限性静态基准测试集(如MMMU)随着MLLMs能力提升逐渐饱和,例如Gemini-2.5-pro在MMMU的pass@1设置下准确率已达81.7%,失去对模型发展的指导意义。现有动态基准测试集(如LiveBench)仅关注单一语言模态,且依赖互联网快速变化的内容,在科学理解评估的数据质量上存在隐患。2. MAC基准测试集的构建与特点数据来源:从Nature、Science、Cell、美国化学学会(ACS)等顶级科学期刊中收集超过25,000个图文对,涵盖分子细胞生物学、材料科学、医学、化学等多个学科领域。核心快照:2025年快照MAC-2025包含2024年1月至2025年2月期间的2287个期刊封面-封面故事对,用于当前MLLMs的评估。任务设计:包含Image2Text(给定封面图选对应封面故事)和Text2Image(给定
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。