【MLLM Agent】多模态理解Agent研究进展
note方案选型做图片输入 function call 通用多模态 Agent → 优先看DeepSeek‑Harness MTA‑Agent做图片多轮检索求证 → DR‑MMSearchAgent做长文档图文问答 → MDocAgent做成本优化、工具调用节流 → ToolGate做GUI 屏幕自动化 Agent → UI‑TARS / Agent‑TARS。新一代视觉 Agent 不会始终把整张图片或整段视频放进上下文而是让模型主动如下这样可以降低视觉 token 数量并提升模型处理高分辨率图像和长视频的能力裁剪局部区域。放大关键区域。选择视频关键帧。通过工具生成 OCR 或 grounding 结果。按需构建后续视觉上下文。文章目录note一、2026多模态Agent研究热点1、图片问答agent进展2、视频理解二、相关项目1、框架类2、多模态深搜三、方向确定四、多模态 Agentic RL 框架1. PyVision-RL2. VAGEN3. OpenRLHF4. VerlTool5. VISTA-Gym6. Visual-ARFT7. Agent-R18. Verl一、2026多模态Agent研究热点原生视觉工具调用最核心热点VLM 不再仅做图文问答输入图片 → Agent 推理 → 调用检索 / 截图放大 / OCR / 搜索 / 计算器等工具像 DeepSeek V4‑Flash‑Vision‑Exp 这条线保留原有 function call 能力新增图片输入原生把视觉嵌入 Agent 循环而不是外挂 OCR 预处理。痛点VLM 容易幻觉、分不清什么时候需要调用工具、多轮识图求证不稳定。长时序多轮深度搜索 Agent多模态检索智能体针对图片做多轮搜索、反复核验解决 Agent 提前停止搜索、信息收集不全DR‑MMSearchAgent、MTA‑Agent 就是这类。Agent 成本与调用效率优化ToolGateCVPR26代表方向增加前置路由模块过滤不必要工具调用、减少冗余 step工具缓存、动态路由、轻量化调度降低多步 Agent 的 token 开销。专用场景多模态 Agent文档 AgentMDocAgent长图文 PDF、图表、表格问答、切片解析GUI 视觉 AgentUI‑TARS / Agent‑TARS截图识别界面、点击操作多模态 Agent 训练范式升级RL 微调、反射自省、工具轨迹蒸馏用 Agent 轨迹数据微调 VLM提升工具决策准确率同时配套多模态 Agent 评测 benchmark 建设。1、图片问答agent进展工作首次公开时间主要问题工具/动作训练最值得借鉴当前可复现性IMAgent2025-12多图推理、后段忽略视觉reflection、confirmation、图像索引Pure RL 两级 mask多图动作空间与视觉注意力再分配论文可读官方代码/数据未发布SenseNova-MARS2025-12高分辨率与外部知识问答crop、image search、text search冷启动 BN-GSPO与搜索型业务最贴近的完整 pipeline代码、模型、数据、benchmark 已发布CodeV2025-11工具过程不忠实Python 视觉工具SFT GRPO/TAPO基于工具结果的过程奖励代码、模型、RL 数据已发布CodeVision2025-12固定工具难组合Code-as-ToolSFT dense process reward RL工具组合、错误恢复、开放动作空间训练代码与数据已发布VISTA-Gym/R12025-11缺少统一视觉 Agent RL 环境grounding、parsing 等多轮采样 端到端 RL任务/工具/日志/verifier 标准化官方仓库已公开美团 TAPO2026-06失败轨迹中正确动作被误罚crop、图搜、文搜等batch 内 credit transfer低成本纠正结构化动作 advantage论文可读代码/模型未发布2、视频理解待补充二、相关项目1、框架类1框架类可直接搭建多模态 Agent 基座DeepSeek‑HarnessDeepSeek 2026定位Agent 运行时框架近期新增 Vision 支持对接 V4‑Flash‑Vision‑Exp实现图片输入 原生 function call 闭环可插拔 Agent 循环、工具、记忆、上下文管理仓库https://github.com/deepseek‑ai/harnessAgent‑TARS / UI‑TARS字节 2026GUI 视觉 Agent定位屏幕截图理解 GUI 操作 Agent视觉动作智能体仓库https://github.com/bytedance/ui‑tars核心截图输入 → 识别界面元素 → 输出点击动作典型视觉工具 Agent 范式。2、多模态深搜2论文向多模态 Agent顶会 /arxiv有开源代码MTA‑AgentSalesforce 2026论文MTA‑Agent: An Open Recipe for Multimodal Deep Search Agents方向多模态深度检索 Agent自带数据生成流水线、工具缓存训练arxivhttps://arxiv.org/html/2604.06376v1✅ 开源https://github.com/salesforce/mta‑agentDR‑MMSearchAgent2026论文DR‑MMSearchAgent: Deepening Reasoning in Multimodal Search Agents解决多模态搜索 Agent 容易提前终止、搜不全适合图片多轮识图 联网求证arxivhttps://arxiv.org/html/2604.19264v1✅ 开源https://github.com/DR‑MMSearch/DR‑MMSearchAgentMDocAgent2025文档多模态 Agent论文MDocAgent: A Multi‑Modal Multi‑Agent Framework for Document Understanding方向图文混合文档 DocQA文档切片、图表解析、检索工具链arxivhttps://arxiv.org/pdf/2503.13964v1✅ 开源https://github.com/mdocagent/MDocAgentToolGateCVPR2026工具调用成本优化论文ToolGate定位前置门控模块不改动主模型预判是否调用工具减少无效工具请求降低 Agent 成本arxivhttps://arxiv.org/pdf/2606.03054v1✅ 开源https://github.com/ToolGate2026/ToolGate三、方向确定做图片输入 function call 通用多模态 Agent → 优先看 DeepSeek‑Harness MTA‑Agent做图片多轮检索求证 → DR‑MMSearchAgent做长文档图文问答 → MDocAgent做成本优化、工具调用节流 → ToolGate做GUI 屏幕自动化 Agent → UI‑TARS / Agent‑TARS。四、多模态 Agentic RL 框架1. PyVision-RL项目https://github.com/agents-x-project/PyVision-RL定位面向图像和视频理解的多模态 Agentic RL 框架。主要能力1使用 Python 作为视觉工具。2支持图像裁剪、旋转、局部分析等操作。3支持视频关键帧选择和按需构建视觉上下文。4支持多轮工具交互。5使用 rollout 过采样、过滤和排序策略。6加入累积工具 reward减少训练后模型不再调用工具的问题。适合任务图像搜索。图像细节分析。图片处理和视觉推理。视频关键帧选择。多轮视觉问答。2. VAGEN项目https://github.com/mll-lab-nu/VAGEN定位面向多轮 VLM Agent 和视觉环境交互的 RL 框架。主要环境FrozenLake。Navigation。Sokoban。ManiSkill。SVG。主要能力1将任务表示为视觉状态、Agent 动作和环境反馈组成的 POMDP。2支持多轮环境交互。3对状态估计和状态转移建模进行奖励。4支持长轨迹压缩和 compaction RL。5主线基于 verl agent-loop便于自定义环境。适合任务GUI 操作。视觉导航。游戏环境。具身交互。需要连续观察环境变化的 Agent 任务。3. OpenRLHF项目https://github.com/OpenRLHF/OpenRLHF定位通用 Agentic RL 底座近期增强了 VLM 和多轮 VLM Agent RL。主要能力1VLM 单轮 RL。2Multi-Turn VLM RL。3环境返回图片或截图。4自定义 Agent Executor。5PPO、GRPO、DAPO、REINFORCE 等算法。6LoRA/QLoRA 和异步 rollout。适合任务初始图片 - Agent 行动 - 环境返回截图 - Agent 继续行动如果已有自定义tool_impl.py、reward 和 rollout 逻辑OpenRLHF 可以作为通用迁移目标。4. VerlTool项目https://github.com/TIGER-AI-Lab/verl-tool定位基于 verl 的工具 Agent RL 框架。主要能力统一工具 API。异步 rollout。多轮 trajectory。代码执行、搜索和 SQL 工具。图像处理。视频帧选择。图像/视频 observation。DAPO recipe。适合已有工具和 reward 代码的团队。当前agent_my目录中的工具、reward 和 rollout 逻辑后续可以重点评估向该框架迁移。5. VISTA-Gym论文https://arxiv.org/html/2511.19773v1定位视觉工具集成的 Agent 训练环境。主要工具和任务包括1GroundingDINO、SAM、EasyOCR 等视觉工具。2图表理解。3文档解析。4几何和数学推理。5区域定位和结构化视觉反馈。该方向适合OCR。图表理解。文档问答。视觉定位。工具选择。多步视觉推理。6. Visual-ARFT项目https://github.com/Liuziyu77/Visual-RFT需要区分1Visual-RFT主要是单轮视觉 RLVR例如分类、检测、grounding 和视觉问答。2Visual-ARFT重点是视觉 Agent支持网页搜索、图片裁剪、图片旋转和代码分析图片。主要基座包括Qwen2-VL、Qwen2.5-VL适合研究视觉搜索和图像处理工具增强的多模态推理。7. Agent-R1项目https://github.com/AgentR1/Agent-R1主要抽象包括AgentFlowBase AgentEnvLoop AgentEnv ToolEnv支持多轮工具调用。环境reset/step。trajectory 训练。tool reward。process reward。VLM Agent 扩展。它更偏通用 Agent RL 基础设施视觉能力不是最专用但适合研究环境、工具和 credit assignment。8. VerlVerl支持VLM训练DAPOhttps://github.com/verl-project/verl/blob/main/docs/ascend_tutorial/model_support/examples/dapo_multi_model_optimization_practice.md