【EMNLP 2025】VistaWise 论文解读:跨模态知识图谱让 Minecraft 智能体成本降两个数量级|从游戏AI与开放世界智能体视角

发布时间:2026/10/10 6:22:38
【EMNLP 2025】VistaWise 论文解读:跨模态知识图谱让 Minecraft 智能体成本降两个数量级|从游戏AI与开放世界智能体视角
摘要本文解读 EMNLP 2025 论文《VistaWise: Building Cost-Effective Agent with Cross-Modal Knowledge Graph for Minecraft》。该论文提出VistaWise一个面向 Minecraft 的低成本开放世界智能体框架通过融合跨模态知识图谱、目标检测视觉感知与桌面级键鼠技能库让大模型在不微调、不依赖环境 API 的前提下直接操作游戏客户端其特别之处在于把领域知识从模型参数搬到可编辑的图结构里只微调 471 帧标注训练的检测器就把领域数据需求从百万级帧压到几百帧。实验表明该方法仅用 24 GB 显存就取得 33% 的「获得钻石」成功率超过此前 25% 的最好成绩推理成本约为 Voyager 的 5.1%为开放世界具身智能体与低成本 LLM Agent 提供了重要借鉴。整个决策可写为 $\mathcal{A}(t)\pi_\theta(\mathcal{I}(s), \mathcal{G}(s,t), \mathcal{H}(t), \mathcal{L})$其中检索得到的知识子图 $\mathcal{G}(s,t)$ 承担了全部领域知识注入。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现局限性论证与措辞这篇论文是怎么说服的附录 F常见问题FAQVistaWise 与传统 Minecraft 智能体最大的区别是什么为什么不用语义相似度检索知识图谱记忆栈和 CoT 分别解决了什么问题目标检测模型能替代多模态大模型的视觉能力吗成本能降到多少这套框架能迁移到 Minecraft 之外吗参考链接论文基本信息项目内容标题英文VistaWise: Building Cost-Effective Agent with Cross-Modal Knowledge Graph for Minecraft标题中文VistaWise面向 Minecraft 的跨模态知识图谱低成本智能体作者Honghao Fu, Junlong Ren, Qi Chai, Deheng Ye, Yujun Cai, Hao Wang通讯作者HKUST(GZ)机构香港科技大学广州 · 昆士兰大学 · 腾讯会议EMNLP 2025arXivhttps://arxiv.org/abs/2508.18722项目网站无官方项目主页数据集https://drive.google.com/file/d/1QXGtSJJWw4emKB8RLGYUvq_fNEDCxhP_/view?uspsharing背景与动机开放世界智能体的核心困难不是「模型不够大」而是「模型不懂这个世界」。在 Minecraft 里想砍一棵树需要知道原木能合成木板、木板能合成木棍、木棍加木板才能做出木镐——这些事实依赖不属于通用语言知识而属于领域知识。缺少它大模型会在多步合成任务中给出错误的材料关系也就是幻觉。既有工作用两条路线填补这个缺口代价都很高视觉策略路线MineRL、VPT、STEVE-1、GROOT 用模仿学习或强化学习训练视觉策略。VPT 使用 140B 帧视频与约 23040 GB 显存估算STEVE-1 使用 160M 帧与 192 GB 显存。API 依赖的 LLM 路线Voyager、STEVE 通过 MineFlayer 等环境 API 获取精确的文本状态描述并直接执行「砍树」这类高层动作。泛化性受限——并非所有虚拟环境都提供 API而且高层动作把智能体的自主性限制住了。混合路线JARVIS-1、OmniJARVIS、ROCKET-1 用多模态大模型做规划、再交给独立的视觉策略执行。OmniJARVIS 使用 990M tokens 与 640 GB 显存ROCKET-1 仍需 1.6B 帧训练钻石成功率 25%。三条路线的共同前提是「用更多数据或更大模型注入领域知识」。VistaWise 审计并绕开了这个前提。从历史脉络看这条路线也符合 Minecraft 智能体的演进方向2019—2022 年靠数据驱动视觉策略2023 年大模型成为终身学习智能体但依赖环境 API2024 年 Cradle 提出通用计算机控制截图输入 键鼠输出首次摆脱 API2025 年 VistaWise 把知识外置到跨模态知识图谱把数据需求压回几百帧。附录补充本文附录 A 记录了数据集细节附录 B 给出游戏世界设置与技能库函数示例附录 D 给出知识图谱构建流程与 Prompt 模板附录 E 是消融细节。下表为主结果表用于对照各基线的成本与收益。方法训练数据规模显存铁镐成功率钻石成功率STEVE-1 (NeurIPS23)160M frames192 GB0.000.00GROOT (ICLR24)1.6B frames384 GB0.050.00DEPS (NeurIPS23)未披露未披露0.700.01OmniJARVIS (NeurIPS24)990M tokens640 GB0.320.08JARVIS-1 (TPAMI24)未披露未披露0.340.09VPT (NeurIPS22)140B frames23040 GB0.570.15ROCKET-1 (CVPR25)1.6B frames未披露--0.25VistaWise (本文)471 frames24 GB0.730.33研究主线从问题到结论图 7研究主线 —— 从领域知识缺失到低成本跨模态智能体Mermaid 流程图。基准/方法设计VistaWise 的设计原则可以概括成一句话把领域知识从参数里搬到图里。整个系统由一个冻结的大模型、一个微调过的目标检测模型、一张跨模态知识图谱和一套桌面级技能库组成其中唯一需要领域数据训练的组件只有目标检测模型。图 1注入外部知识的动机。(a) 缺乏领域知识时大模型会生成错误的实体依赖导致合成任务推理出错(b) 从外部知识库注入事实依赖后模型给出更准确的回答。三个基于图的过程构成主干文本模态图构建用带网页工具的大模型从在线资料抽取实体与依赖边类型被严格限定为 9 类can use、can mine、is used to craft、is the fuel of 等保证图的相关性与简洁性。跨模态图构建把实时视觉信息嵌入对应实体节点静态文本图 $\mathcal{G}\text{init}(\mathcal{V}\text{init}, \mathcal{E}_\text{init})$ 因此升级为带动态视觉属性的视觉—文本图 $\mathcal{G}(\mathcal{V}, \mathcal{E})$。任务特定信息检索以任务描述 $\mathcal{I}(s){T_\text{td}(s), T_\text{cot}(s)}$ 指导检索从图中池化出与当前状态最相关的子图 $\mathcal{G}(s,t)$。除了图还有两个交互模块桌面级技能库基于 PyAutoGUI 的混合动作空间直接产生键鼠操作与记忆栈后进先出存储决策历史召回步数可控。分类全景图 8非 API Minecraft 智能体路线全景VistaWise 的位置Mermaid 图。方法细节方法的核心难点在于「轻量图的检索」图是刻意保持精简的节点上的描述文本很少传统基于语义相似度的检索会失效——用 BERT 嵌入all-MiniLM-L6-v2加余弦相似度的基线在假阳性率与假阴性率上都明显更差。论文因此提出检索式池化retrieval-based pooling由两步组成PSP路径搜索池化保留玩家节点 $v_\text{player}$ 到任务目标节点 $v_\text{target}(s)$ 的所有路径得到全局子图 $\mathcal{V}\text{global}(s)$ 与 $\mathcal{E}\text{global}(s)$。这条路径本身就是合成任务的因果链。EMP实体匹配池化检查全局子图节点是否出现在提示 $\mathcal{I}(s)$ 或当前视觉属性中保留匹配的节点与边得到随任务进度动态收缩的子图。顺序至关重要先路径后实体时假阳性率与假阴性率同时最优先实体后路径会打散节点—边的结构丢失关键路径两个指标同时变差。图 2VistaWise 总览。以 LLM 为核心包含三个基于图的过程文本图构建、跨模态图构建、任务特定检索与两个交互模块桌面级技能库、记忆栈右侧为技能库中可调用函数的示例。视觉感知侧论文使用 YOLOv10-L 检测 23 类视觉实体并区分两类信息描述环境空间分布的环境实体$V_\text{env}(t)$以及用于追踪任务进度的条件实体$V_\text{inv}(t)$背包中的物品图标。由于真实域训练出的深度估计模型在虚拟环境中失效论文改用人玩游戏的直觉——用实体包围盒宽高 $w_e$、$h_e$ 配合经验阈值 $k_w110$、$k_h275$ 做粗粒度距离判断。图 3检索式池化。先用 PSP 保留「Player → Target」路径再用 EMP 保留提示中引用及带视觉属性的实体池化后的子图文本化后送入 LLM提供事实依赖与实时视觉信息。技能库与记忆栈则负责「怎么动」。技能库用 PyAutoGUI 实现混合动作空间底层是按键、拖动鼠标上层是挖竖直矿井、合成铁镐这类组合技能大模型只选择函数具体参数背包物品坐标、按键时长、像素偏移由它依据视觉线索自行计算。记忆栈按 LIFO 弹出决策历史 $\mathcal{H}(t)M(q(t))$使最近决策权重最高符合连续决策的因果性。完整工作流可写为 $\mathcal{A}(t)\pi_\theta(\mathcal{I}(s), \mathcal{G}(s,t), \mathcal{H}(t), \mathcal{L})$动作执行后观测更新为 $\mathcal{O}(t1)Env(\mathcal{A}(t))$。实验设计与结果论文自建了一个小规模数据集从游戏视频抽取471 帧画面用 X-AnyLabeling 标注3304 个实例覆盖23 类视觉实体训练/测试按 9:1 划分。标注量最大的三类是 trunk608、plank_icon446与 log_icon361——它们有多种纹理橡木、白桦木等成本来自纹理多样性而非实体新颖性而任务链末端的 diamond_ore 只有 50 个标注、diamond_pickaxe_icon 只有 15 个。评测任务是「获得钻石」被拆成 9 个必须顺序执行的子目标工作台 → 木镐 → 圆石 → 石镐 → 铁矿石 → 熔炉 → 铁锭 → 铁镐 → 钻石任何一步失败后续全部失败。运行环境为 Vanilla 1.11.2 桌面客户端Windows 10、1080p、3060 Ti 8G、i7-12700F、32 GB RAM检测模型在单张 L424 GB上微调 150 个 epochbatch size 16输入尺寸 768策略模型为 GPT-4o每个目标连续尝试 3 次记作 $a/b$。方法训练数据规模显存铁镐钻石STEVE-1160M frames192 GB0.000.00OmniJARVIS990M tokens640 GB0.320.08JARVIS-1未披露未披露0.340.09VPT140B frames23040 GB0.570.15ROCKET-11.6B frames未披露--0.25VistaWise本文471 frames24 GB0.730.33主结果是训练数据量跨越六个数量级471 帧 vs 1.6B—140B 帧VistaWise 反而在钻石目标上取得最高成功率0.33超过 ROCKET-1 的 0.25 与 VPT 的 0.15。组件消融给出清晰的因果排序配置木镐石镐铁镐钻石w/o Memory Stack1.001.000.000.00w/o CoT0.670.000.000.00w/o KG1.000.670.330.00Full (VistaWise)1.001.000.670.33去掉记忆栈后铁镐与钻石直接归零去掉 CoT 后连木镐都掉到 0.67、石镐之后全部为 0去掉知识图谱则石镐 1.00→0.67、铁镐 0.67→0.33稳定性下降。视觉方式的交叉实验同样关键只让多模态大模型看图V时Gemini-1.5-pro 与 GPT-4o 在石镐之后的复杂目标上全部 0/3换成目标检测OD后两者分别达到 3/3、2/3、1/3而 VOD 与 OD 表现相同——说明精确的实体坐标比让大模型自己看图更重要。Qwen-VL-Max 即便加了检测石镐之后仍全部 0/3框架收益对底座能力仍然敏感。图 4检索策略消融——假阳性率FPR。检索结果中冗余信息的比例相似度基线明显偏高PSP→EMP 最低。图 5检索策略消融——假阴性率FNR。本应被检索到却被漏掉的信息比例EMP→PSP 因打散节点—边结构而漏检最多。图 6推理成本。去掉完整实体属性with FA与关闭 MLLM 视觉输入with V在性能无显著退化的情况下分别减少 30.6% 与 41.0% 的 token 开销。结果对比总结图 9成本与性能的对比结论Mermaid 图。关键发现成本与性能解耦只用 471 帧标注数据、24 GB 显存就在「获得钻石」目标上把成功率从 25% 提升到33%而对比方法使用 160M—140B 帧。CoT 是入门门槛移除显式推理后木镐成功率从 1.00 掉到0.67石镐及之后全部为 0。记忆栈决定长程上限移除后前三个目标仍为 1.00但铁镐与钻石从0.67 / 0.33直接掉到 0.00 / 0.00。知识图谱提升合成稳定性石镐 1.00→0.67、铁镐 0.67→0.33、钻石 0.33→0.00收益集中在多步合成环节。属性只需实体名只保留实体名可在合成任务上不失败同时节省30.6%的 token在已有目标检测的前提下关闭 MLLM 视觉再降41.0%。推理成本按 GPT-4o 定价、160 次迭代计算VistaWise 约1.28 美元同条件 Voyager 约 25 美元下降94.9%。创新模式层面本文同时命中「通过条件化适配而非重训练」知识以检索结果形式条件化注入、「统一异构输入到同一空间」视觉属性与文本依赖共用同一批节点与「审计并扭转负载假设」审计「领域知识必须靠大规模微调」这一前提三种顶会常见模式且都给出了可量化的执行证据。局限性实时性受 LLM 推理限制每一步动作都要等待模型推理必要时还有服务器往返无法达到人类玩家的反应速度。时间尺度靠暂停环境同步暂停虚拟世界进程可以让决策与环境节奏对齐代价是完成任务的总时长显著增加。知识图谱覆盖依赖人工干预源网站选择、9 类关系的定义、冗余节点清理都需要人工参与图的完备性直接决定检索质量。评测规模有限主实验集中在「获得钻石」一条任务链与 3 次连续尝试上跨世界、跨游戏的泛化尚未充分验证23 类实体、单一 1.11.2 客户端与 1080p 分辨率也构成了封闭词表。基线透明度DEPS 与 JARVIS-1 的数据规模与显存均未披露跨方法的效率对比因此不完全对等1.28 美元 vs 25 美元的成本对比中Voyager 的价格取自其常见问题页而非同等条件下的复现。论证与措辞这篇论文是怎么说服的附录 F叙事弧线成本对立开场 → 三条范式缺口 → 数字兑现。摘要首段先立靶Methods that finetune on large-scale domain-specific data entail prohibitive development costs.相关工作按 vision models / LLMs / LLMvision 三条范式点名后一句收割these approaches incur substantial costs in data collection and training. In this paper, we offer a more efficient framework最后用 471 帧与 33% 钻石成功率兑现摘要承诺from millions of samples to a few hundred。措辞六维证据框架与贡献显著性均为正向。结论直接带双数字——achieving a success rate of 33% in obtaining diamonds, surpassing the previous state-of-the-art rate of 25%贡献以 Our key contributions are summarized as follows: 显式前置三条均带量化或机制标签成本降低、跨模态图、SOTA 成功率新颖性立场偏强断言we offer a more efficient framework。需要 report 的地方hedge 残留——对 API 依赖的普遍性质疑只以 This reliance may hinder generalization 表述未做跨环境实测越界声明——1.28 美元 vs 25 美元的成本对比取自 Voyager 常见问题页而非同等条件复现且按 160 次迭代单点外推基线透明度——DEPS 与 JARVIS-1 的数据与显存规模以未披露占位跨方法效率对比因此不完全对等。读法建议这是一篇证据框架强、断言果断的写作样本评估时应把「可复现性口径」成本对比、基线披露与「机制结论」逐组件消融链条分开看待。常见问题FAQVistaWise 与传统 Minecraft 智能体最大的区别是什么区别在于领域知识放在哪里。传统方法把知识写进模型参数需要百万级帧的领域数据与数百 GB 显存VistaWise 把知识放进一张可编辑、可审计的跨模态知识图谱用检索结果作为条件信号注入冻结的大模型训练侧只需要 471 帧微调一个目标检测器。为什么不用语义相似度检索知识图谱因为这张图是刻意保持轻量的节点上的描述文本很少语义相似度的判别力不足。论文用 BERT 嵌入all-MiniLM-L6-v2加余弦相似度做基线假阳性率与假阴性率都明显更差。改用「玩家→目标」路径为骨架的 PSPEMP 池化后两个指标同时最优。记忆栈和 CoT 分别解决了什么问题CoT 是决策基础把「准星是否对齐」「是否需要靠近」变成显式推理步骤去掉它连木镐都只能做到 0.67。记忆栈解决长程回溯问题LIFO 结构让最近决策权重最高去掉它之后前三个目标不受影响但铁镐与钻石直接归零。目标检测模型能替代多模态大模型的视觉能力吗可以但需要精确的实体信息。实验中只给 MLLM 图像时复杂目标全部 0/3换成目标检测提供实体坐标与包围盒后Gemini-1.5-pro 与 GPT-4o 都达到 3/3、2/3、1/3且再叠加 MLLM 视觉输入没有额外增益。成本能降到多少训练侧只需 471 帧微调一个检测器L4 24 GB150 epoch推理侧通过轻量图结构替代把原文塞进上下文按 GPT-4o 定价、160 次迭代计算约 1.28 美元同条件的 Voyager 约 25 美元降低 94.9%。这套框架能迁移到 Minecraft 之外吗设计上没有环境特定的假设技能库基于 PyAutoGUI 产生通用键鼠操作不依赖仿真器或环境 API知识图谱的构建流程与检索机制只依赖「依赖链」这一结构。代价是知识图谱需要为新环境重新构建且单步延迟问题仍然存在。参考链接论文 arXiv 摘要页https://arxiv.org/abs/2508.18722ACL Anthology 正式版EMNLP 2025 Mainhttps://aclanthology.org/2025.emnlp-main.1111/官方数据集471 帧视觉实体标注Google Drivehttps://drive.google.com/file/d/1QXGtSJJWw4emKB8RLGYUvq_fNEDCxhP_/view?uspsharingVoyager: An Open-Ended Embodied Agent with Large Language ModelsTMLR 2024https://arxiv.org/abs/2305.16291VPT: Video PreTrainingNeurIPS 2022https://arxiv.org/abs/2206.11795ROCKET-1: Mastering Open-World Interaction with Visual-Temporal Context PromptingCVPR 2025https://arxiv.org/abs/2410.17856Cradle: Empowering Foundation Agents Towards General Computer Controlhttps://arxiv.org/abs/2403.03186给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件