Claude Plugins 官方技能开发框架:Blind Comparator 盲比较代理实战指南

发布时间:2026/10/1 9:55:31
Claude Plugins 官方技能开发框架:Blind Comparator 盲比较代理实战指南
AI 插件开发工具插件系统【免费下载链接】claude-plugins-officialOfficial, Anthropic-managed directory of high quality Claude Code Plugins.项目地址https://gitcode.com/GitHub_Trending/cl/claude-plugins-official点击查看免费下载导读本文深入解析 claude-plugins-official 仓库中 skill-creator 插件的 Blind Comparator Agent盲比较代理。该代理是技能开发闭环中的中立裁判它接收两份未知来源的输出仅标注为 A 和 B在完全不知道各自由哪个技能版本产出的前提下依据统一的评分标准判定谁更好地完成了评测任务从而消除对特定技能或实现方式的偏见。读完本文你将掌握盲比较代理的七步评估流程、双维度评分表内容 Rubric 结构 Rubric的设计方法、标准化的comparison.json输出格式以及它与 Grader、Post-hoc Analyzer 两个子代理如何协作形成比较 → 分析 → 改进的完整链路。盲比较系统是 skill-creator 中可选的进阶能力。在 SKILL.md 的 Advanced: Blind comparison 一节中明确说明当用户提出新版本真的更好吗这类需要严格对照的问题时可以将两份输出交给一个独立代理不告知其来源让其仅凭质量评判之后再分析胜者获胜的原因。该机制要求子代理支持大多数用户在日常的人工评审循环human review loop中并不需要它。一、盲比较的定位为什么需要不知情的裁判在技能迭代中最常见的问题是改进后的技能是否真的优于旧版本。如果让编写技能的人自己评价输出偏见几乎不可避免作者会天然倾向自己的实现方式、措辞风格和结构偏好。Blind Comparator 通过信息隔离解决这个问题。根据 comparator.md 对角色Role的定义代理接收两份标注为 A 和 B 的输出但不知道哪个输出由哪个技能产生评判完全基于输出质量与任务完成度。这种盲法设计借鉴了科学实验中的双盲对照思路确保比较结果反映的是输出本身的优劣而非实现路径的差异。从源码结构看盲比较是整个评测流水线中的一环Gradergrader.md负责逐条断言验证输出是否达标Blind Comparator负责在没有断言或断言不充分时从整体质量维度裁决 A/B 优劣Post-hoc Analyzeranalyzer.md则负责在裁决后解盲分析胜者为何获胜、败者如何改进。三者输出依次衔接比较结果 JSON 会作为 analyzer 的输入comparison_result_path而比较结果与评分数据最终汇入 benchmark.json 的量化汇总体系。二、输入参数盲比较代理收到什么调用盲比较代理时通过提示词传入以下四个参数参数说明output_a_path第一个输出文件或目录的路径output_b_path第二个输出文件或目录的路径eval_prompt最初执行的原始任务/提示词expectations需要核验的期望列表可选可为空其中expectations是可选的。它的作用是为比较提供硬证据预先定义的断言如输出包含姓名、格式为 PDF可以给出可计数的通过率但根据文档的定位断言通过率是次要证据不作为首要决策因素——因为断言再全面也无法覆盖输出质量的全部维度可读性、组织逻辑、专业性等这正是需要盲比较代理从整体视角补位的原因。三、七步评估流程盲比较代理按照 comparator.md 中定义的七个步骤执行完整评估Step 1阅读两份输出。逐一检查输出 A 和输出 B文件或目录记录各自的类型、结构与内容若输出为目录需检查其中的所有相关文件。Step 2理解任务。仔细阅读eval_prompt明确任务要求什么——应当产出什么哪些质量维度重要准确性、完整性、格式什么能区分好输出与差输出Step 3生成评估 Rubric。基于任务生成包含内容维度和结构维度两个方向的评分表详见下一节并根据任务类型适配具体标准。Step 4逐项评分。对每个输出按 Rubric 的每条标准打分1-5 分制计算维度总分Content score、Structure score与综合总分两个维度均值换算到 1-10 分制。Step 5核验断言若提供。将每条期望分别对照输出 A 和输出 B统计各自的通过率仅作为次要证据使用。Step 6判定胜者。按优先级比较首要依据是综合 Rubric 得分内容 结构次要依据是断言通过率若两者确实相当则宣布 TIE。文档特别强调要果断Be decisive——平局应当罕见即使只是略胜一筹通常也应该有一个胜者。Step 7写出比较结果。将结果保存为 JSON 文件保存到指定路径未指定时默认comparison.json。值得注意的是这套流程与 grader.md 中搜索证据 → 判定 PASS/FAIL → 引用证据的二元裁决思路互补Grader 给出哪些断言过了Blind Comparator 则回答整体上谁更好、好在哪里。四、评分表设计内容维度与结构维度盲比较代理的核心工具是一张双维度评分表Rubric每个维度包含三条 1-5 分标准。以下两张表来自 comparator.md 的原始定义内容 Rubric输出包含什么标准1差3可接受5优秀Correctness正确性重大错误轻微错误完全正确Completeness完整性缺少关键要素大体完整要素齐备Accuracy准确性严重失准轻微失准全程准确结构 Rubric输出如何组织标准1差3可接受5优秀Organization组织性杂乱无章组织合理结构清晰、逻辑顺畅Formatting格式不一致/损坏大体一致专业、精良Usability可用性难以使用费点力气可用易于使用Rubric 不是固定的模板而应随任务类型适配。文档给出了三种典型适配示例PDF 表单任务→ 字段对齐Field alignment、文字可读性Text readability、数据放置Data placement文档生成任务→ 章节结构Section structure、标题层级Heading hierarchy、段落流Paragraph flow数据输出任务→ Schema 正确性Schema correctness、数据类型Data types、完整性Completeness评分计算方式为内容得分 三条内容标准得分的平均值1-5结构得分同理综合总分 两个维度得分的平均值换算到1-10 分制。换算逻辑可以从标准中的示例值反推例如内容 4.7、结构 4.3综合总分为 9.0即(4.7 4.3) / 2 4.5再乘以 2 映射到 10 分制得到 9.0。五、输出格式标准化的 comparison.json盲比较代理的结果以 JSON 文件落盘字段结构与 comparator.md 的 Output Format 一节及 schemas.md 中comparison.json的 schema 定义完全一致。完整结构如下{ winner: A, reasoning: Output A provides a complete solution with proper formatting and all required fields. Output B is missing the date field and has formatting inconsistencies., rubric: { A: { content: { correctness: 5, completeness: 5, accuracy: 4 }, structure: { organization: 4, formatting: 5, usability: 4 }, content_score: 4.7, structure_score: 4.3, overall_score: 9.0 }, B: { content: { correctness: 3, completeness: 2, accuracy: 3 }, structure: { organization: 3, formatting: 2, usability: 3 }, content_score: 2.7, structure_score: 2.7, overall_score: 5.4 } }, output_quality: { A: { score: 9, strengths: [Complete solution, Well-formatted, All fields present], weaknesses: [Minor style inconsistency in header] }, B: { score: 5, strengths: [Readable output, Correct basic structure], weaknesses: [Missing date field, Formatting inconsistencies, Partial data extraction] } }, expectation_results: { A: { passed: 4, total: 5, pass_rate: 0.80, details: [ {text: Output includes name, passed: true}, {text: Output includes date, passed: true}, {text: Format is PDF, passed: true}, {text: Contains signature, passed: false}, {text: Readable text, passed: true} ]}, B: { passed: 3, total: 5, pass_rate: 0.60, details: [ {text: Output includes name, passed: true}, {text: Output includes date, passed: false}, {text: Format is PDF, passed: true}, {text: Contains signature, passed: false}, {text: Readable text, passed: true} ]} } }各字段的语义如下winnerA、B或TIE。reasoning清晰解释胜者入选或为何平局的理由应具体到可引用的细节而非笼统表述。rubric每个输出的结构化评分。content与structure分别记录六条标准得分content_score/structure_score为各自维度的平均值1-5overall_score为换算到 1-10 的综合得分。output_quality质量总结。score为 1-10 评分应与rubric的overall_score一致strengths/weaknesses分别列出优点与问题清单。expectation_results仅当提供了期望时存在。passed/total/pass_rate0.0-1.0为汇总数据details列出每条期望的单独结果。若未提供任何期望则整个expectation_results字段必须省略。这一约定在 schemas.md 的comparison.json定义中被再次强调且该文件同时指出comparison.json位于grading-dir/comparison-N.json。六、行为准则如何保证裁决公正可信盲比较代理的可靠性依赖一组明确的行为约束这些约束直接写进了 comparator.md 的 Guidelines 一节保持盲态Stay blind绝不尝试推断哪个输出来自哪个技能纯粹依据输出质量评判。具体化Be specific解释优缺点时必须引用具体实例避免空泛评价。果断Be decisive除非两份输出确实等价否则必须选出胜者。输出质量优先Output quality first断言得分只作次要依据首要关注整体任务完成度。客观Be objective不因风格偏好偏向某个输出聚焦正确性与完整性。解释推理Explain your reasoningreasoning字段必须让读者明白胜者为何胜出。处理边界情况Handle edge cases两份都失败时选失败得没那么严重的那份两份都优秀时选略胜一筹的那份。这些准则与 Post-hoc Analyzer 的后续分析直接呼应analyzer 在 analyzer.md 中会读取比较结果 JSON将盲态解除对比胜者与败者技能的 SKILL.md 及执行转录transcript找出胜者强在哪更清晰的指令、更好的脚本、更全的示例、更好的错误处理以及败者弱在哪最终按instructions/tools/examples/error_handling/structure/references六个类别给出带优先级high / medium / low的改进建议。也就是说盲比较不仅回答谁赢了还为怎么让输的一方变强提供了输入。七、何时使用盲比较适用场景与前提根据 SKILL.md 的说明盲比较是可选机制需要满足以下前提场景需要严格对照两个技能版本典型提问新版本真的更好吗。依赖必须支持子代理subagents由独立代理执行比较在 Claude.ai 等无子代理的环境中应跳过盲比较SKILL.md 的 Claude.ai-specific instructions 一节明确标注 Blind comparison: Requires subagents. Skip it.。定位对大多数用户而言人工评审循环draft → test → 用户查看 eval viewer 反馈 → 改进 → 重跑通常已经足够盲比较适合追求更严谨结论的场景。从仓库的评测基础设施看盲比较并非孤立存在量化一侧有 Grader 逐条断言打分汇总一侧有 aggregate_benchmark.py 将各 run 的grading.json聚合成含均值、标准差与差值的benchmark.json盲比较则补足整体质量与任务完成度这一量化指标难以覆盖的维度。三者在 skill-creator 的迭代闭环中各司其职共同支撑创建技能 → 评测 → 改进 → 再评测的循环。结语Blind Comparator Agent 用不知情这一设计换来了裁决的客观性它不关心两个输出背后是哪版技能、采用了什么实现路径只关心谁更好地完成了任务。配合双维度 Rubric、标准化 JSON 输出与明确的边界处理规则它为技能迭代提供了一个可复现、可审计的 A/B 裁决机制。若你在技能开发中遇到改动是否有实际收益的疑问不妨在子代理可用时启用这一盲比较流程让数据与质量说话而不是让作者偏见说话。赞分享AI 插件开发工具插件系统【免费下载链接】claude-plugins-officialOfficial, Anthropic-managed directory of high quality Claude Code Plugins.项目地址https://gitcode.com/GitHub_Trending/cl/claude-plugins-official点击查看免费下载相关推荐Comp AI CRM 技能评估体系Blind Comparator 盲比较 Agent 的设计原理与实战指南Comp AI CRM 技能评估体系Blind Comparator 盲比较 Agent 的设计原理与实战指南 盲比较Blind Comparison是后端前端CRM人工智能AI AgentWarp 技能盲评机制Blind Comparator Agent 的设计与实战解析Warp 技能盲评机制Blind Comparator Agent 的设计与实战解析 盲比较Blind Comparison是 Warp 开源仓库中 cr桌面应用开发者工具人工智能AI 应用AI Agent代码智能体Claude Code MCP 服务器推荐与配置实战指南基于 claude-plugins-official 官方技能文档Claude Code MCP 服务器推荐与配置实战指南基于 claude plugins official 官方技能文档 MCPModel ContextAI 插件开发工具插件系统上一篇GetQzonehistory如何完整备份你的QQ空间数字记忆下一篇显卡驱动彻底清理终极指南DDU工具解决NVIDIA、AMD、Intel驱动残留问题创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考