跳到正文
原文
量子位· henry·· 13 小时前精选AI 评分58

何恺明团队发布多模态 Harness 框架 VISTA,让模型按需回看视觉记忆

何恺明团队发布多模态Harness框架

AI 导读

何恺明团队在论文《VISTA: A Visual Harness for Reasoning in an Interactive World》中提出视觉原生 Harness 框架 VISTA,让现有多模态模型无需额外训练即可保存原始画面、按需回看并放大检查细节。

推荐理由

文章详细拆解了 VISTA 的组件与评测数据,读者可据此判断视觉原生 Harness 对多模态 Agent 能力的提升路径。

来源:量子位 · qbitai.com