量子位· henry·· 13 小时前精选AI 评分58
何恺明团队发布多模态 Harness 框架 VISTA,让模型按需回看视觉记忆
何恺明团队发布多模态Harness框架
AI 导读
何恺明团队在论文《VISTA: A Visual Harness for Reasoning in an Interactive World》中提出视觉原生 Harness 框架 VISTA,让现有多模态模型无需额外训练即可保存原始画面、按需回看并放大检查细节。
推荐理由
文章详细拆解了 VISTA 的组件与评测数据,读者可据此判断视觉原生 Harness 对多模态 Agent 能力的提升路径。
来源:量子位 · qbitai.com