DrawingVQA:首个面向建筑施工图的视觉-文本推理基准,MLLM 表现远逊专家
多模态大语言模型(MLLM)在自然图像和通用视觉问答上已取得显著进展,但面对工程领域的专业图纸时,其表现如何?近日,伊利诺伊大学厄巴纳-香槟分校等机构的研究人员推出了 DrawingVQA,这是首个专门用于评估 MLLM 在真实建筑施工图上进行多深度视觉-文本推理能力的基准。相关论文已被 CVPR 2026 Findings 接收。
为何聚焦建筑施工图?
与自然图像或简单的楼层平面图不同,建筑施工图融合了抽象几何图形、符号标注、表格数据、注释以及领域特定文本,构成了一个高度复杂且专业的视觉-文本领域。它是建筑、土木等工程实践的核心媒介,但长期以来缺乏针对性的 AI 评估数据集。DrawingVQA 填补了这一空白。
基准构成:33 张图纸与 92 个问答对
DrawingVQA 包含 33 张“签发施工”图纸(即实际施工使用的最终版本)和 92 个由专家精心设计的问答对。这些问题覆盖三个推理深度层级:
- 感知理解:识别图纸中的基本元素(如尺寸、符号);
- 上下文解释:理解元素之间的空间或逻辑关系;
- 领域专家推理:结合工程规范进行专业判断。
此外,研究团队还提出了一个双分类框架,从七个工程维度(如结构、机电、管道)和四个 MLLM 能力维度(如视觉定位、文本理解、多步推理)进行联合分析,首次将工程工作流映射到 AI 推理能力上。
评估结果:MLLM 与专家差距明显
在对当前最先进 MLLM 的评估中,模型在感知层级表现尚可,但在更高推理深度(上下文解释和专家推理)上,模型性能与人类专家之间存在显著差距。这表明,尽管 MLLM 在通用场景中能力惊人,但在需要领域知识和多步推理的专业任务上,仍有很长的路要走。
行业意义
DrawingVQA 的发布为 AI 在工程领域的落地提供了关键测试平台。它揭示了当前模型在处理专业图纸时的短板,也为未来开发领域专用多模态推理系统指明了方向。随着建筑信息模型(BIM)和智能建造的推进,让 AI 真正理解施工图纸,将能大幅提升自动化审查、施工进度监测和安全检查的效率。
不过,论文也提醒,当前基准规模有限(92 个问答对),未来需要扩展更多图纸类型和问题数量,并引入更多工程学科。
小结
DrawingVQA 是一个务实且专业的基准,它让 MLLM 的“考试”从自然场景延伸到了真实的工程场景。对于关注 AI 落地和行业智能化的读者来说,这项研究提供了一个清晰的信号:通用模型在专业领域仍需“补课”,而领域知识与多模态推理的深度融合,将是下一阶段的关键突破点。