LLaVA-Bench 评测基准全解析:用 GPT-4 给多模态聊天机器人打分(LLaVA-Bench In-the-Wild 数据集、评测流程与结果解读)

发布时间:2026/9/20 10:51:44
LLaVA-Bench 评测基准全解析:用 GPT-4 给多模态聊天机器人打分(LLaVA-Bench In-the-Wild 数据集、评测流程与结果解读)
人工智能大模型多模态计算机视觉NLP预训练微调模型推理服务【免费下载链接】LLaVA[NeurIPS23 Oral] Visual Instruction Tuning (LLaVA) built towards GPT-4V level capabilities and beyond.项目地址https://gitcode.com/gh_mirrors/ll/LLaVA点击查看免费下载LLaVA-Bench 是 LLaVA 项目为「开放式多模态视觉对话」设计的评测基准核心思路是用 text-only GPT-4 充当裁判对候选多模态模型与参考答案进行 110 分制打分从而在不依赖选择题题库的情况下衡量模型的视觉聊天能力。本文以仓库 docs/LLaVA_Bench.md 为主体结合scripts/v1_5/eval/llavabench.sh、llava/eval/eval_gpt_review_bench.py、llava/eval/table/rule.json 等源码完整还原 LLaVA-Bench 的数据构成、打分机制、可复现评测命令与历史结果读完即可在自己模型上跑通整套评测。一、为什么需要 LLaVA-Bench对标商业多模态聊天机器人2023 年 7 月前后微软发布了多模态 Bing-Chat2023-07-18 宣布支持多模态视觉搜索、谷歌发布了多模态 Bard。这些商业聊天机器人背后大概率由闭源的大型多模态模型Large Multimodal Model, LMM驱动。相比 LLaVA 这类开源 LMM闭源 LMM 可以视为当前 SoTA 技术路线规模化成功的天花板upperbound参照。两者目标一致构建能理解人类意图、在真实开放场景in the wild中完成各类日常视觉任务的聊天机器人。但当时「如何评测多模态聊天能力」这一课题尚缺乏探索因此 LLaVA 团队认为将开源 LMM 与商业多模态聊天机器人放在同一把尺子下对比能为开源社区提供非常有用的反馈。于是在用于早期版本开发的 LLaVA-Bench (COCO) 之外团队公开了 LLaVA-Bench (In-the-Wild) 数据集供社区使用。二、数据集构成24 张图、60 个问题、三种任务类别LLaVA-Bench (In-the-Wild) 定位为持续改进中的开放工作ongoing work其设计目标有两个评估模型在更具挑战性任务上的能力评估模型对新领域的泛化能力。为此数据集收集了24 张风格多样的图片共配60 个问题覆盖室内与室外场景表情包memes绘画paintings素描sketches等。每张图片都关联一段人工精心撰写的详细描述highly-detailed and manually-curated description以及一组精选问题。这种设计同时考验模型对不同提问方式的鲁棒性。问题被划分为三个类别后续评测与打分也按类别分别统计类别说明conversation对话/简单 QA围绕图片的简单问答与多轮对话detail_description详细描述要求模型对图片给出细致、全面的描述complex_reasoning复杂推理需要结合常识、逻辑或外部知识进行推理的问题数据集的 prompt 风格可以从仓库 playground/data/prompts 目录中一窥端倪conversation、detail_description、complex_reasoning三个子目录分别存放对应类别的*_caps.txt图片描述与*_conv.txt对话样例。例如 playground/data/prompts/complex_reasoning/000_conv.txt 展示了一个典型复杂推理问题Question: What is unusual about this photo? Answer: In the photo, the man is wearing a total of ten ties around his neck. ...在发布该版本时官方还人工向 Bing-Chat 与 Bard 查询获取了它们的回答作为对比数据并持续扩充 LLaVA-Bench (In-the-Wild) 的多样性。三、打分机制text-only GPT-4 生成参考答案GPT-4 担任裁判LLaVA-Bench 的核心思想是「用语言模型评估视觉模型」既然视觉模型的输出是自然语言那么可以交由一个纯文本模型来评判其质量。具体流程分两步生成参考答案把问题question连同图片的 ground truth 标注ground truth image annotations作为上下文喂给 text-only GPT-4生成一份参考回答。这份参考回答代表了「信息完整、表述良好」的理想水平。打分再让一个 text-only GPT-4 评测器同时评估参考答案与候选模型回答输出两个 110 分的分数Assistant 1 / Assistant 2。官方约定把参考答案排在前面、候选模型回答排在后面即第一位是 Assistant 1参考第二位是 Assistant 2候选。对于 Bard 与 Bing-Chat官方上传的是原始分辨率图片images at their original resolution来获取回答。源码层面的打分实现评测打分脚本 llava/eval/eval_gpt_review_bench.py 完整实现了上述机制关键细节如下调用openai.ChatCompletion.create使用模型gpt-4-0314system prompt 为You are a helpful and precise assistant for checking the quality of the answer.采样温度temperature0.2源码注释里留有 TODO探究最佳评测温度默认max_tokens1024遇到RateLimitError会静默重试每次失败后 sleep 0.5 秒保证长时间批量评测的稳定性打分结果解析parse_score取回复的第一行将,替换为空格后按空格拆分得到[score1, score2]两个浮点数解析失败则返回[-1, -1]占位支持断点续跑若输出文件已存在会先读入已有 review跳过已完成的条目Skipping {idx} as we already have it.并以追加模式继续写入每条 review 记录包含question_id、answer1_id、answer2_id、category、contentGPT-4 的完整评语与tuple分数对。拼接给 GPT-4 的内容模板为[Context] 图片描述 [Question] 问题文本 [Assistant 1] 参考答案 [End of Assistant 1] [Assistant 2] 候选模型回答 [End of Assistant 2] [System] 打分规则 prompt其中类别category会拼接为llava_bench_前缀如llava_bench_conv、llava_bench_detail、llava_bench_complex与 llava/eval/table/rule.json 中的键一一对应。打分规则文件里针对不同类别提供了差异化 promptllava_bench_conv/llava_bench_detail/llava_bench_complex告知评测器「用户是在观察图片后提问视觉内容用几句描述性句子表示」要求从 helpfulness有用性、relevance相关性、accuracy准确性、level of details细节丰富度四个维度打分先输出一行两个空格分隔的分数再给出消除顺序偏差的综合评语default通用问答同样按上述四个维度打分math/coding分别针对数学与编程任务的专门规则要求先独立解题再逐步核对体现同一打分框架对不同任务的可扩展性。分数汇总打分完成后用 llava/eval/summarize_gpt_review.py 汇总按category分组统计分数对输出每个类别的相对分数stats[1]/stats[0]*100即候选得分占参考得分的百分比保留 1 位小数以及参考/候选的原始分10 分制 ×10 后的数值。因此结果表中的「分数」本质上是候选模型相对 GPT-4 参考回答的比例得分Conversation / Detail / Reasoning / Overall 分别对应三个类别与全量平均。四、官方评测结果LLaVA-13B 与 Bard、Bing-Chat 的对比下表为文档 docs/LLaVA_Bench.md 公布的官方结果模型命名中的 0719 指 2023-07-19 发布的版本336px 指以 336×336 分辨率输入beam 为解码时的束搜索宽度ApproachConversationDetailReasoningOverallBard-071883.769.778.777.8Bing-Chat-062959.652.290.171.5LLaVA-13B-v1-336px-0719 (beam1)64.355.981.770.1LLaVA-13B-v1-336px-0719 (beam5)68.459.984.373.5可以观察到在 Overall 上 Bard-071877.8领先LLaVA-13B 使用 beam5 时73.5已相当接近且明显优于 beam170.1说明解码策略对开放问答得分有明显影响Bing-Chat 在复杂推理Reasoning 90.1上表现突出但对话与描述类得分偏低增大束搜索宽度beam 1→5使 LLaVA 在三个类别上全面小幅提升。关于人类内容的子集说明官方特别注明Bard 有时会拒绝回答含人类humans图片的问题Bing-Chat 则会对图片中的人脸做模糊化处理这会对分数造成系统性偏差。因此文档还提供了去除含人类图片的子集上的基准分数ApproachConversationDetailReasoningOverallBard-071894.974.384.384.6Bing-Chat-062955.853.693.572.6LLaVA-13B-v1-336px-0719 (beam1)62.256.482.270.0LLaVA-13B-v1-336px-0719 (beam5)65.661.785.073.6在去人类子集上Bard 的对话分大幅提升83.7→94.9印证了其此前失分与「拒绝回答含人图片」直接相关。这类细节提示评测者在对比不同模型时需要警惕模型自身的内容策略差异对分数公平性的影响。五、本地复现在自有模型上跑通 LLaVA-Bench 评测仓库提供了开箱即用的完整评测脚本 scripts/v1_5/eval/llavabench.sh一条龙完成「模型生成回答 → GPT-4 评审 → 分数汇总」三步# 1. 用 LLaVA 模型生成回答 python -m llava.eval.model_vqa \ --model-path liuhaotian/llava-v1.5-13b \ --question-file ./playground/data/eval/llava-bench-in-the-wild/questions.jsonl \ --image-folder ./playground/data/eval/llava-bench-in-the-wild/images \ --answers-file ./playground/data/eval/llava-bench-in-the-wild/answers/llava-v1.5-13b.jsonl \ --temperature 0 \ --conv-mode vicuna_v1 # 2. GPT-4 评审候选回答 vs 参考答案 mkdir -p playground/data/eval/llava-bench-in-the-wild/reviews python llava/eval/eval_gpt_review_bench.py \ --question playground/data/eval/llava-bench-in-the-wild/questions.jsonl \ --context playground/data/eval/llava-bench-in-the-wild/context.jsonl \ --rule llava/eval/table/rule.json \ --answer-list \ playground/data/eval/llava-bench-in-the-wild/answers_gpt4.jsonl \ playground/data/eval/llava-bench-in-the-wild/answers/llava-v1.5-13b.jsonl \ --output \ playground/data/eval/llava-bench-in-the-wild/reviews/llava-v1.5-13b.jsonl # 3. 汇总分数 python llava/eval/summarize_gpt_review.py -f playground/data/eval/llava-bench-in-the-wild/reviews/llava-v1.5-13b.jsonl各步骤与输入文件的作用如下步骤 1调用 llava/eval/model_vqa.py 对questions.jsonl中的每个问题 images目录中的对应图片做批量推理。官方采用--temperature 0贪心解码与 README 中「LLaVA-1.5 用贪心解码保证可复现性、与聊天 demo 的实时输出保持一致」的评测策略一致--conv-mode vicuna_v1指定对话模板见 llava/conversation.py。步骤 2把候选回答answers/llava-v1.5-13b.jsonl与 GPT-4 参考答案answers_gpt4.jsonl成对送入 eval_gpt_review_bench.pycontext.jsonl提供每张图片的 ground truth 描述由image字段建立索引脚本中image_to_context {context[image]: context for context in context_list}rule.json提供各类别打分 prompt。注意此步骤需要设置OPENAI_API_KEY环境变量且会产生 OpenAI API 调用费用。步骤 3summarize_gpt_review.py读取 review 文件按category输出各维度相对分数与总分前述脚本第 59 行print(k, round(stats[1]/stats[0]*100, 1), ...)。评测流程在代码中的验证上述流程与仓库中另一条 GPT 辅助评测管线COCO 视觉问答场景见 README.md 的 GPT-assisted Evaluation 一节与 llava/eval/eval_gpt_review_visual.py在机制上同源都是「候选回答 vs 参考回答 → GPT-4 双答打分」。区别在于eval_gpt_review_visual.py的context.jsonl额外包含五句图片描述 各实例的边界框坐标[Context]\n{cap_str}\n\n{box_str}\n\n更适合需要空间定位信息的视觉问答eval_gpt_review_bench.py的rule.json使用llava_bench_*前缀的键且 context 只提供描述性句子与 LLaVA-Bench 的数据形态严格对应更早的通用版 llava/eval/eval_gpt_review.py 用 Ray 并行调用gpt-4是这套评测思路的雏形。六、评测结果的可视化与人工复核仓库还提供 llava/eval/generate_webpage_data_from_table.py把question.jsonl、各模型answer/*.jsonl、review/*.jsonl汇总为webpage/data.json供 llava/eval/webpage/index.html 渲染成可交互对比页面——可以逐题查看问题、双方回答、GPT-4 评语与分数方便对打分结果做人工复核与案例级分析。这也说明 LLaVA-Bench 的产出不仅是分数还保留完整评语用于诊断模型短板。七、使用 LLaVA-Bench 的注意事项结合文档与源码使用该基准时有几点值得留意费用与网络打分阶段依赖 OpenAI GPT-4 API需要有效 API Key60 个问题 × 若干候选模型会产生相应调用量脚本内置限流重试但批量运行耗时较长。公平性商业模型存在内容审核策略拒绝回答含人图片、人脸模糊对比时建议同时参考去人类子集分数避免把策略差异误读为能力差异。解码参数官方在基准结果中使用 beam1 与 beam5 两种设置后续 LLaVA-1.5 系列评测则统一采用贪心解码--temperature 0以保证可复现报告分数时需注明解码配置。参考答案的版本敏感性参考回答由 text-only GPT-40314 快照生成GPT 模型版本更新可能影响打分分布跨版本复跑时分数不完全可比。八、总结LLaVA-Bench (In-the-Wild) 是 LLaVA 项目针对「开放域多模态视觉对话」给出的评测方案以人工精标描述 精选问题构成 24 图 / 60 问的紧凑数据集以 text-only GPT-4 双答打分替代选择题形式的传统评测并通过 scripts/v1_5/eval/llavabench.sh 把「生成 → 评审 → 汇总」全流程脚本化使任何 LLaVA 系模型都可以快速对照 Bard、Bing-Chat 等商业系统的历史成绩。该基准在 2023-07 随 LLaVA 大版本更新LLaMA-2 支持、336px 分辨率等一同发布是 README 中「benchmarking open-ended visual chat with results from Bard and Bing-Chat」这一评测体系的落地载体文档中标注其为持续扩充的 ongoing work社区可在此基础上扩展更多图片与问题类别推动多模态聊天能力的可量化评估。赞分享人工智能大模型多模态计算机视觉NLP预训练微调模型推理服务【免费下载链接】LLaVA[NeurIPS23 Oral] Visual Instruction Tuning (LLaVA) built towards GPT-4V level capabilities and beyond.项目地址https://gitcode.com/gh_mirrors/ll/LLaVA点击查看免费下载相关推荐Compiler Explorer 架构全景解析使命、配置体系、扩展模式与规模化部署设计Compiler Explorer 架构全景解析使命、配置体系、扩展模式与规模化部署设计 Compiler Explorer以下简称 CE是一个在浏览器中后端前端开发工具RIR-Generator终极指南如何在MATLAB中快速生成房间脉冲响应RIR Generator终极指南如何在MATLAB中快速生成房间脉冲响应 RIR Generator是一个基于图像法的MATLAB MEX函数专门用于生成BAGEL基准测试终极指南全面解析GenEval、WISE、GEdit-Bench评估流程与结果分析BAGEL基准测试终极指南全面解析GenEval、WISE、GEdit Bench评估流程与结果分析 BAGEL是一个开源的多模态基础模型拥有70亿个活跃参人工智能大模型基础模型多模态计算机视觉媒体生成深度学习预训练微调模型评测上一篇Mutagen故障排除手册解决8个最常见同步问题的实用方法下一篇Kubernetes集群节点超额配置技术详解创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考