何恺明团队推出纯视觉ARC推理方案NAT-ARC。该模型基于ImageNet预训练掌握视觉先验,在ARC-1基准上集成准确率达70.2%,仅凭四分之一参数量逼近专用大语言模型,成功打破了视觉路线的扩展瓶颈。
利用自然图像训练视觉模型,居然能让 AI 掌握抽象逻辑推理。

何恺明团队发布了最新研究成果 NAT-ARC,提出了一套完全依赖视觉表征的 ARC(Abstraction and Reasoning Corpus)解题框架。该方案不依赖大语言模型(LLM),而是通过在 ImageNet 图像集(包含大量猫、狗、植物等自然图像)上进行预训练,让模型先学会观察物理世界,再将视觉感知能力迁移到抽象的彩色格子几何推理中。
测试结果显示,NAT-ARC 表现最好的单模型在 ARC-1 上取得了 63.4% 的 pass@2 准确率,模型集成后准确率攀升至 70.2%。

这是纯视觉技术路线首次在抽象推理任务中逼近专用大语言模型系统的表现。
ARC 基准测试由 Keras 之父 François Chollet 于 2019 年提出,是目前公认衡量通用人工智能(AGI)抽象推理能力的核心标杆之一。
ARC 的每道题目都由最大 30×30 的二维格子组成,最多包含 10 种颜色。题目仅提供 2 到 5 组输入输出网格作为示例,要求模型归纳出背后隐藏的变换规则,并准确预测全新输入格子的输出。

ARC 的挑战在于极度缺乏训练样本,规则千变万化且无法通过模板记忆。长期以来,主导 ARC 赛道的方案基本是大语言模型:将网格编码为文本或数字序列,交由语言模型做符号推理。

随后,以何恺明团队为代表的研究者开辟了纯视觉路线。他们将 ARC 视为条件图像生成任务,直接使用视觉编码器处理网格图像。团队此前推出的 VARC 方案以 19M 的小参数量跑出了 54% 的成绩。

后续的 LoopViT 加入循环推理机制,以 18M 参数取得 65.8% 的成绩;Loop-OWM 引入视频预训练,以 10.6M 参数达到 68.5%。虽然这些模型参数量远低于大语言模型,但始终受制于一个关键瓶颈:缺乏大规模预训练红利。多数视觉模型都从随机初始化起步,难以像大语言模型那样通过海量通用数据预训练实现性能扩展。

NAT-ARC 的核心改进,是在视觉推理流程前端引入了 ImageNet MAE(Masked Autoencoder)预训练。
MAE 是何恺明此前提出的一种自监督预训练方法:将输入图像大面积遮挡,促使模型依据残余信息重建原始图像,从而自主学习物体的边界、形状和空间拓扑关系。

NAT-ARC 直接采用开源的 ImageNet MAE 检查点初始化视觉编码器,解码器则采用随机初始化。训练与测试流程包含三步:
由于 ImageNet 图像分辨率远大于 ARC 的 64×64 网格,团队移除了原始的 Patch Embedding 和绝对位置编码,改用 2D RoPE(旋转位置编码)以灵活适应网格分辨率。

注意力可视化分析解释了自然图像预训练的有效性。随机初始化的模型在解题时注意力涣散;而经过 ImageNet 预训练的模型在未接触 ARC 数据前,就已经能够自动区分前景和背景,聚焦于网格内的核心图元。

任务拆解表明,预训练带来的提升主要集中在「模式匹配与复制」和「连通区域推理」两类任务上。模型在自然图像中学会的「区分猫与草地背景」,在网格任务中直接迁移为「提取彩色连通块」,证明视觉世界与抽象逻辑在底层共享表征空间。

免费获取企业 AI 成熟度诊断报告,发现转型机会
在基准测试中,NAT-ARC 0.6B 参数的单模型取得了 63.4% 的 pass@2 成绩。融合不同预训练策略的模型集成后,整体参数量约 2B,ARC-1 成绩达到 70.2%。
相比之下,专为 ARC 调优的语言模型方案 The ARChitects 成绩为 71.6%,但其依赖 8B 参数。NAT-ARC 凭借四分之一的计算参数量,达到了与专用大语言模型相当的水准。

更关键的是,研究打通了纯视觉路线的模型扩展规律(Scaling Law)。在离线训练阶段,加入预训练的模型收敛速度更快,精度上限显著提高。

在没有预训练时,模型参数从 Large 增至 Huge 会因为数据匮乏而过拟合,性能出现倒退。引入 ImageNet 预训练后,模型从 Base、Large 到 Huge 的性能随体量增长稳定上升,扩展曲线恢复正常。
团队还设计了一项概念验证实验:训练一个自编码器将自然照片映射为 60×60、10 色的离散网格,再用 NAT-ARC 执行诸如「旋转180度并加蓝色边框」的规则,最后将网格还原为像素。

实验结果表明,猫的图像被正确翻转且准确添加了边框,直观证实了抽象几何变换与自然图像潜在特征具备双向迁移能力。
该研究一作 Xiaoman Delores Ding 与胡珂雅、Katelyn Gan、Victor Yin 均来自麻省理工学院计算机科学与人工智能实验室(MIT CSAIL),通讯作者为何恺明。此前团队提出的前作 VARC 已被 CVPR 2026 接收,关于该研究的更多细节可参考论文详情页面。
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断