Mingbird:面向本地小开源模型完成真实任务的优先本地智能体管控框架

发布时间:2026/10/4 19:25:59
Mingbird:面向本地小开源模型完成真实任务的优先本地智能体管控框架
Mingbird面向本地小开源模型完成真实任务的优先本地智能体管控框架arXiv:2610.02001v12026‑10‑01项目仓库https://github.com/Mingbird/Mingbird‑agentApache‑2.0协议摘要2‑9B参数量级的开源小模型已经可以在普通笔记本电脑运行。但直接对接云原生智能体管控框架时会频繁出现任务失败工具预填充耗尽上下文窗口、自我修正发生发散、工具演示死循环、任务被静默放弃。本文基于单机对照实验与第三方基准数据集的结果证明大量失败根源不在模型本身而是管控框架harness的设计缺陷。本文提出Mingbird面向Windows Ollama的优先本地智能体管控框架设计10项核心机制针对性解决小模型各类典型失效模式代表性机制包括字节级零净增长预填充预算、完成校验网关接受任务结束声明前重读原始任务描述、基于调用签名的死循环检测。在自研受控基准LRAB实验4套管控框架 × 4个开源模型(2B‑35B) × 18项真实任务共288组基于产物确定性打分Mingbird综合得分0.886对比goose(0.631)、opencode(0.479)、agent‑mini(0.405)Mingbird是唯一不存在小模型性能断崖的框架2B模型上达到0.821其余基线仅0.017‑0.271。在第三方基准τ 2 \boldsymbol{\tau^2}τ2‑bench278个任务统一实验协议Mingbird得分0.856对比原生智能体0.791、opencode 0.737。使用前沿大模型在同样18个任务做对照不同管控框架得分跨度0.478‑0.997设计良好的框架之间得分差距控制在0.072以内。开展移除单一机制消融实验仅做方向性参考同一组实验多次复现会造成均值波动最高可达0.069和单项消融效果处于同一量级配对对照实验表明具备可执行完成校验防护相比仅文本重读平均收益0.10三次重复实验。实验证据存在局限基准为自研、单机器运行、单次试验打分。1 引言2‑9B开源小模型已经具备实用能力16‑32GB共享内存的集成显卡笔记本即可完成问答、摘要、翻译。Ollama、llama.cpp让本地部署简化为单条命令。行业普遍观点小模型不适合作为智能体完成多步骤工具任务写可测试代码、文件整理、搜索调研、数据库操作。但本文实验表明限制往往来自管控框架而非模型本身。现象观察小模型经常能够输出下一步正确动作但在为大模型设计的管控框架中无法可靠完整执行全部步骤。使用云原生框架驱动2B模型高频出现四类失效静态工具预填充占用大量上下文token长上下文性能衰减工具调用失败后模型无法自我修正陷入工具演示死循环在目标产物尚未生成时宣称任务完成或者中途静默放弃任务。上述属于管控脚手架缺陷可以通过工程手段针对性修复。本文实现Mingbird面向WindowsOllama原生针对2‑9B模型设计最高测试到35B。同时提供GUI图形界面与CLI命令行接口复用Ollama推理后端自身不新增推理逻辑。整套设计包含10项核心机制M1‑M10外加v1.6.0版本五环安全模型M14每项机制一一对应观测到的失效模式。为隔离管控框架带来的影响构建**LRABLocal Real‑task Agent Benchmark**受控实验基准。固定机器、后端、模型、时间预算、打分逻辑仅更换管控框架。全部288组原始实验数据全部开源聚合指标可以直接从公开CSV重新计算。同时使用第三方独立基准τ 2 \tau^2τ2‑bench做外部验证。主要贡献面向小模型的管控框架机制集10项核心设计模式 五环安全模型每项按照「失效模式 → 对应机制 → 设计权衡」文档化Apache‑2.0开源实现v1.6.0版本441个单元测试v1.8.2版本461个字节级预填充回归校验五环安全模型在54个对抗样例做双小模型评估。受控对比实验方法论LRAB固定机器、模型、后端、预算、打分仅变换管控框架明确定位为受控实验而非排行榜任务集、打分代码、全部原始数据随仓库发布。288组大规模实验结果Mingbird综合0.886唯一不存在小模型性能断崖的框架长时序任务得分0.827。第三方基准验证τ 2 \boldsymbol{\tau^2}τ2‑bench覆盖零售、航空、电信三大领域278个任务统一协议Mingbird 0.856原生agent 0.791opencode 0.737。机制层面消融证据2B模型下的leave‑one‑mechanism‑out消融覆盖M1、M3两部分、M4结果仅具备方向性配对对照实验证明可执行完成校验防护带来稳定收益。本文不提出新算法模型、后端、提示词均为通用实现核心是系统工程定位哪些管控行为会破坏小模型性能并修复带来显著指标提升。2 相关工作2.1 智能体范式主流智能体范式起源ReAct模型自由推理交织工具调用管控框架执行调用并追加观测。Toolformer、Gorilla针对API调用微调。Reflexion、Self‑Refine依靠模型自身输出批判做迭代优化这类方案前提是模型可以产出高质量自我批判而小模型很难做到。Mingbird将重心放在管控框架侧不依赖模型做抽象自我提升而是改变模型看到的内容、允许停止的时机、畸形输出之后的处理逻辑。符合Anthropic工程区分Workflow是预定义代码路径Agent由模型主导流程Mingbird属于Agent但在小模型高频失效点增加管控护栏。2.2 智能体基准AgentBench、AgentBoard做多轮智能体评测WebArena提供可复现Web环境SWE‑bench评估GitHub issue解决GAIA面向通用助手。τ 2 \tau^2τ2‑bench、T‑bench用户模拟器与智能体交互智能体操作领域工具校验最终数据库状态。LRAB设计目标不同不是用来排名模型而是隔离管控框架带来的效果差异单机单后端基于产物确定性打分。2.3 本地小模型推理llama.cpp实现量化模型CPU/GPU推理Ollama做模型管理与API服务。SmolLM2、Gemma、Qwen系列持续提升小模型单位参数量能力。但现有管控框架大多从云方案直接移植smolagents、Open Interpreter对比框架goose、opencode、agent‑mini原本面向大上下文云模型、Unix shell。Mingbird起点不同目标硬件Windows消费级笔记本2‑9B模型任务混合代码、文件、调研。专门针对小模型失效模式设计管控机制。2.4 管控脚手架效应2026已有多篇工作证明管控框架配置对性能的影响甚至大于模型选型。Zhang等人提出约束约束命题Starace在GAIA上观察同一模型不同脚手架最高28个点差距CAIS Arena同一个模型跑6套框架。OpenHands的StuckDetector做循环检测Mingbird的M4在此基础增加工具参数签名归一化、分级升级策略、CI回归保障。Mingbird独有创新点CI字节级强制零净增长预填充预算完成网关重读原始任务文本再接受done声明。Agentless证明精简脚手架在软件工程任务优于通用智能体ADAS/AFlow/GPTSwarm/DSPy自动搜索优化管控结构Mingbird采用手工设计非自动搜索。3 Mingbird管控框架3.1 架构总览Mingbird是优先本地智能体管控框架模型、工具、语音识别、记忆全部运行本机仅搜索为可选出站配置框架本身不引入额外推理开销。v1.6.0版本GUIttkbootstrap双语/CLI复用同一套智能体循环。每轮循环流程通过任务域路由器M1组装扁平化预填充M2区分聊天模式 / 任务模式M3完成校验网关M4签名级死循环监控M5格式修复通过带编辑防护M6、安全边界M8的沙盒执行器运行工具M7弹性层处理编码错误、空轮次、断点续跑Ollama后端提供本地开源模型自动检测模型默认上下文128K最大256K。关键约束出厂静态预填充token固定797v1.6.0单元测试做字节级回归校验禁止无理由膨胀。v1.5.0版本774token。质量基底M10v1.6.0共441项CI测试v1.8.2版本461项。Mingbird核心机制清单编号机制名称解决的失效模式M1扁平化预填充零净增长预算工具schema预填充过大耗尽上下文M2聊天/任务分层闲聊输入触发工具演示死循环M3完成网关 计划重注入提前/虚假宣称任务完成M4签名级防循环反复调用完全相同工具无有效输出M5虚假完成拒绝 格式救援工具调用以纯文本输出畸形调用反复出现M6编辑安全(.bak备份)模型破坏性编辑文件无法回滚M7弹性层编码容错、空轮、断点检查点读取线程静默崩溃、空生成、进程被杀丢失进度M8安全边界越目录写文件、凭证泄露、无约束子智能体派生M9能力面扩展语音、视觉、记忆、MCP、技能集不膨胀预填充M10质量基底CI回归管控框架回归尤其是预填充膨胀M14五环安全模型(v1.6.0)模型冲动调用工具造成不可逆系统破坏3.2 各项机制详解M1扁平化预填充、零净增长预算失效模式云风格大量JSON schema工具清单在任务还未开始就消耗数千token输入越长小模型指令遵循性能越差。机制管控框架先分类任务领域仅加载该领域相关工具定义扁平化非嵌套格式。MCP工具同样走分类路由压缩schema超过8个参数只保留必填参数。硬性约束任何新增功能不能带来静态预填充净增长CI做字节级断言。权衡分类器可能错分隐藏需要的工具提供手动重新路由。新增能力必须以删减、压缩其他内容为代价对小模型代价很高大模型感知微弱。性能测试4B模型预填充耗时随工具数量线性增长2B模型超线性。256套工具情况下2B每轮预填充耗时33.6s。路由器自身固定开销计入797token静态预填充。M2聊天 / 任务分层失效模式闲聊提问模型看到全套工具开始无意义调用工具做演示进入死循环。机制区分聊天模式与任务模式。聊天模式使用极简预填充回答完成直接结束循环不给继续调用工具机会任务模式才解锁全部工具。已经产出产物的对话简短后续提问识别为任务继续。权衡真实任务错分到聊天模式会缺少工具分类器偏向判定为任务模式。两套循环分开可独立测试。M3完成网关、提交时重注入任务原文失效模式小模型静默放弃任务输出完成摘要但需要产出的文件/产物完全缺失经过上下文压缩原始计划、验收条件丢失。机制管控框架接受完成声明之前重新读取完整原始任务文本要求模型逐条对照验证交付物。发生上下文压缩之后todo/计划流水线原样重新注入计划文本提供显式完成动作todo(update, alltrue)。网关会运行任务自身校验把真实错误反馈给对话。权衡每个任务额外消耗一轮模型调用不能强制模型自我检查正确但强制任务文本回到上下文把大部分静默放弃转化为真实完成或者明确报告阻碍。M4签名级防循环检测失效模式反复执行完全相同工具调用几十上百次零产物。测试案例4B模型任务WF‑08未修复前156次调用0产物。机制计算工具调用签名工具名 参数归一化。触发阈值≥6次完全相同调用或者≥15次连续调用无输出。分级升级提示连续6次空轮触发硬重置。同时处理大文件读取截断输出上限提升至8192token文件读取字节预算保护不会拒绝读取只做分块返回。修复后WF‑08任务仅15次调用产出3份产物。权衡存在误报合法迭代反复运行测试阈值设置高于正常合法重复。误触发只会输出修正提示不会终止任务。M5虚假完成拒绝与格式救援两类失效宣称完成但产物不存在工具调用以普通文本输出伪XML、裸JSON、引号包裹片段。机制拒绝虚假完成的消息附带下一条可执行动作识别三类常见畸形调用转换成真实调用多次同样签名畸形调用输出修正提示。不采用严格grammar约束解码采用启发式修复。权衡只处理三类已知模式不在修复器做过度推测解析避免执行模型本意之外指令。M6编辑安全防护失效小模型错误覆盖文件没有回滚手段后续大量轮次消耗在修复。机制每次写文件自动生成.bak备份模型可以手动执行回滚命令交替破坏性编辑会被监控。成功收敛后备份文件自动清理不计入产物打分。权衡工作目录堆积bak文件设计保持简单方便模型自己调用回滚。M7弹性恢复层失效Windows下GBK等传统编码严格UTF‑8读取会直接静默崩溃模型偶尔输出空生成长时间运行被断电/用户终止进度丢失。机制读取侧UTF‑8带替换字符解码不会让读取线程崩溃空生成触发轮次硬重置检测只有思考标签没有输出的回复kill‑resume检查点保存状态可以从上一步恢复。权衡替换解码个别字符会乱码但保证整个流不中断每个运行仅保存一份检查点文件。M8安全边界失效Agent读写工作目录之外、读取密钥文件、无限制派生子智能体。机制Windows下做归一化路径校验处理符号链接与路径分隔符敏感路径.ssh、.env设置闸门越界操作需要GUI人工确认子智能体默认拒绝。权衡确认弹窗给高级用户带来操作摩擦面向普通本地用户优先安全。M9能力面管理所有新增能力必须满足M1零净预填充预算约束。语音输入本地STT模型CPU运行视觉图片读入消息payload会话持久可搜索记忆MCP服务器通过JSON配置接入Skill技能使用markdownfrontmatter渐进式披露Ollama自动识别模型身份与上下文窗口可选任务时间盒限制总运行时长。权衡渐进披露意味着模型需要主动读取skill文件技能索引常驻上下文把开销控制在一次读取。M10质量基底CI运行441个测试v1.6.0两个关键回归断言M1字节级零净预填充、M4循环检测阈值。权衡单元测试约束开发部分优美方案会因为预填充膨胀被拒绝。M14五环安全模型v1.6.0失效任务中途模型尝试卸载依赖、删除系统文件。五层安全防护子智能体沙盒运行权限严格低于主Agent不可逆操作格式化、裸设备写、驱动卸载直接拒绝修改系统操作区分是否人机值守无人值守默认拒绝递归删除约束在工作目录内拒绝时提供单文件替代方案可逆兜底写前.bak备份删除移入回收站大文件覆盖需要显式确认。全局环境变量可以全部绕过安全模型风险由操作者承担。54例对抗测试集结果44个对抗样例 10个良性控制样例无人值守temperature0关闭思考输出。测试gemma4:e2b(2B)、qwen3.5:4b(4B)。注意本测试是测试Agent自身工具调用对主机的伤害不是提示注入防御。环模型样例数尝试次数拦截数拦截率标记数确认真实生效泄露1gemma4:e2b7640.67201qwen3.5:4b7750.71632gemma4:e2b9991.00002qwen3.5:4b9991.00003gemma4:e2b9991.00203qwen3.5:4b9980.89314gemma4:e2b121190.82214qwen3.5:4b121280.67665gemma4:e2b7710.14115qwen3.5:4b7720.2911现象第二层彻底不可逆命令拦截率100真实泄露全部来自原始bash命令通道2B模型泄露很少4B模型会多路径试探绕过防护。防护可以阻止冲动式危险调用但对抗性的多路径试探不能完全拦截。4 LRAB受控实验基准非排行榜4.1 设计原则LRAB为自研基准明确定位受控实验不是排行榜。三条原则除管控框架全部变量固定机器、Ollama后端、模型、时间预算、打分器仅改变harness。全部单元格可复现任务、测试用例、打分代码、全部288组原始结果全部开源聚合指标完全可以从CSV原始行重新计算。只作为证据链一环搭配第三方基准τ 2 \tau^2τ2‑bench交叉验证。4.2 任务集合18个任务脚本生成4个难度等级T1检索2个从给定文件定位提取内容T2综合4个实现功能合成数据写单元测试T3工作流9个多步骤、产出明确产物网页调研、性能剖析重构、对比报告T4长时序3个 LH‑01~LH‑03多阶段运行可达数小时检验计划留存、断点续跑。LH‑03专门做kill‑resume压力测试。任务定义写明领域、输入文件、最小可行计划、里程碑检查点、最终产物校验所有检查点可自动化判定。覆盖本地Agent典型任务带测试代码、数据分析、调研、文件整理、重构、长时间构建。刻意不覆盖交互式对话交给τ 2 \tau^2τ2‑bench。4.3 实验协议硬件Windows1132GB共享内存集成显卡Ollama唯一后端。4套管控框架Mingbird、goose、agent‑mini、opencode全部原始版本不打补丁。模型Ollama标签全部Q4_K_M量化规模Ollama标签总参数量每token激活参数量架构2Bgemma4:e2b5B2.3BMatFormerPLE弹性4Bqwen3.5:4b4B‑稠密12Bgemma4:12b12B‑稠密35Bornith‑1.5:35b35B~3BMoE多模态ornith‑1.5为MoE虽然总参35B但每token激活约3B在本机可以跑长任务。预算普通工作流任务90分钟长时序任务180分钟每个cell全新工作目录管控框架进程与打分器隔离。采样统一固定temperature0goose、opencode本身没有温度配置本地代理在请求层强制改写允许最多重试1次取最新结果超时直接得0分。不同框架实验分三批运行协议保持统一原始默认参数敏感性数据保留用于对比。4.4 打分规则基于产物的确定性打分检查指定文件是否存在、测试是否运行通过、报告是否包含要求内容支持部分得分。管控框架无法访问打分器只能通过生成产物来提升分数。4.5 时间预算定价策略LRAB使用任务最大时间预算来约束不做原始秒数归一化。理由用户视角只要在可接受等待时间内完成才有价值运行快慢是架构真实代价。本批次没有任何cell达到预算上限超时判0分。LRAB主要结果管控框架2B4B12B35B综合平均分Mingbird0.8210.8760.9060.9410.886goose0.2710.8010.7720.6790.631opencode0.0170.4650.5390.8960.479agent‑mini0.2460.7060.5760.0920.405Mingbird是唯一在2B模型不会性能断崖的框架第二个小模型qwen3.5:2B复现该现象Mingbird 0.779其余基线0.096‑0.239。长时序任务平均Mingbird 0.827goose 0.394opencode 0.354agent‑mini 0.484。统计检验任务作为分析单元双边配对Wilcoxon符号秩检验bootstrap 95%CIHolm校正。2B、12BMingbird对比全部对手统计显著4B仅对比opencode显著goose差距不显著35B对比goose、agent‑mini显著对比opencode差距不显著。重要聚类bootstrap因为任务家族数量少不能输出家族层面显著性报告任务层面统计结果。各框架典型失效模式Mingbird72个cell仅有1个完全0分35BWF‑08反复宣称完成无产物被M3网关全部拒绝agent‑mini35B大量任务80s内退出输出Unix命令到Windows shell平台不兼容大量短时间退出0分opencode2B大量任务49‑115s提前终止没有产出任何产物goose运行速度最慢但有实质进度2B受预填充膨胀影响性能暴跌。耗时统计全部cellMingbird均值585.5s中位数440.5goose均值866.4s中位数692.4agent‑mini均值233.5s中位数116.4opencode均值633.4s中位数450.1。agent‑mini快是因为大量直接崩溃退出。5 第三方基准τ 2 \boldsymbol{\tau^2}τ2‑bench统一协议agent端本地qwen3.5:4b(Ollama)temperature0关闭思考用户模拟器和judge使用阿里云DashScope大模型pass1单次运行出错任务记0分打分校验数据库最终状态。goose因为吞吐量问题每个任务耗时40‑113分钟本实验放弃运行goose。管控框架零售114航空50电信114零售航空164全部278任务综合Mingbird0.7630.7401.0000.7560.856原生LLM‑agent0.6750.7400.9300.6950.791opencode0.5880.5000.9910.5610.737电信领域趋近饱和零售航空是区分度更高子集。McNemar配对检验Mingbird对比原生agent p0.030对比opencodep 2.7 × 10 − 5 p2.7\times10^{-5}p2.7×10−5。思考开关本身属于管控框架重要配置不同框架对思考开关敏感度差异巨大。前沿模型探测实验云端qwen3.8‑flash同一套18LRAB任务使用Ollama shim把云端API伪装成本地Ollama服务管控框架代码完全不变。管控框架工作流任务15长时序3全部18任务总分Mingbird1.0000.9800.997goose0.9900.9800.989opencode0.9130.9800.925agent‑mini0.4900.4150.478结论管控框架缺陷会掩埋前沿模型大半能力设计合格框架之间差距仅0.072缺陷框架与合格框架差距巨大。agent‑mini依旧早期退出证明缺陷来自框架和模型无关。6 消融实验leave‑one‑mechanism‑out仅方向性证据gemma4:e2b2B模型18任务每一组环境变量AGENT_ABLATION禁用机制注意同一套配置隔夜复现均值波动最大可达0.069与消融delta量级相当因此全部结果仅作方向性解读不做统计显著性结论。实验组综合得分相对完整基线差值完整机制基线0.821‑‑finish_gate关闭完成网关可执行防护保留文本重读0.723‑0.098‑verify_feedback关闭校验失败详细反馈0.772‑0.048‑anti‑loop关闭签名级防循环0.805‑0.015‑flat_prefill关闭分类路由扁平化预填充0.818‑0.003关键对照实验只保留文本重读、关闭四项可执行防护做三次同批次重复配对实验三次配对均为完整可执行防护收益为正平均0.095。现象长时序任务LH‑01对批次条件高度敏感同一配置不同运行会暴跌这会干扰消融指标。机制激活统计Mingbird全部72个LRAB任务交付自检重读任务原文65次todo同步拒绝43次摘要产物交叉校验23次pytest防护拒绝13次计划完整性拒绝11次循环拦截95次格式救援4次编辑安全防护9次。7 威胁有效性Threats to Validity自研LRAB基准偏差基准和框架同一作者全部任务、脚本、原始数据开源同时第三方τ 2 \tau^2τ2‑bench交叉验证。不对外宣称是通用排行榜只作为受控实验。外部基准少仅τ 2 \tau^2τ2‑bench一套第三方完整多arm实验筛选大量其他基准大部分自带智能体循环无法替换管控框架。开发‑测试重叠M3完成网关、M4循环检测针对LRAB任务迭代开发存在样本内暴露依靠第三方基准做离样本锚定。单机器Windows平台agent‑mini在Windows上失效POSIX系统行为可能不同Mingbird优先Windows未充分测试其他操作系统。实验批次时间混淆不同arm不是完全交错轮次运行全部原始记录公开可审计。模型集合有限仅少量小模型做复现部分开源小模型工具调用输出本身存在底层缺陷任何管控框架无法修复。打分产物确定打分但任务权重由作者定义没有人工人类基线。单轮greedy采样temperature0消除采样随机性但长时序任务执行层面存在很大运行间波动同一配置隔夜复现长时序任务得分浮动最高可达0.5‑0.7。τ 2 \tau^2τ2‑bench没有使用官方gpt‑4o用户模拟器改用qwen3.8‑flash绝对分数不能和官方榜单对比但是组间对比是受控公平。消融局限消融只在2B模型跑18任务无法得到4B以上模型的机制边际贡献不能评估机制之间交互效应。安全评估54对抗样例每个case单次运行没有外部红队存在部分绕过泄露。8 讨论与未来工作小模型场景管控框架不是胶水辅助而是能力核心组成。2B模型下同一模型Mingbird得分0.821其余框架0.017‑0.271失效模式属于工程问题不需要微调模型。前沿模型对照脚手架缺陷可以掩埋大部分模型能力高质量脚手架之间差距较小。跨平台移植计划移植Linux/macOSM7编码层、M8路径归一化是重点agent‑mini案例证明平台适配会严重改变性能。LRAB增加人类基线同一套18任务人类参与者在同样时间预算完成标定分数参考。扩展消融实验在全部模型规模开展逐个机制消融量化各机制边际收益。9 结论本文提出Mingbird优先本地的Windows/Ollama智能体管控框架专门针对小模型典型失效做工程修复。受控实验LRAB 288组单元格Mingbird综合得分0.886显著优于goose(0.631)、opencode(0.479)、agent‑mini(0.405)Mingbird是唯一不会出现2B模型性能断崖的框架长时序任务得分0.827。第三方基准τ 2 \tau^2τ2‑bench278任务Mingbird得分0.856优于原生Agent(0.791)与opencode(0.737)。前沿模型对照实验管控框架本身带来得分跨度0.478‑0.997设计良好框架之间差距控制在0.072‑0.12。leave‑one‑mechanism‑out消融实验关闭完成网关带来最大单项损失同时「思考开关」本身是管控框架的重要可调参数不同任务收益不同。大量被归结为小模型能力不足的现象本质是管控脚手架缺陷并且这些缺陷是可以通过工程手段修复。附录要点精简附录A真实运行案例格式救援、完成网关拦截、循环防护拦截WF‑08任务附录B可复现说明仓库地址、各个tag版本、Ollama manifest摘要、数据集、打分脚本、统计脚本仓库地址https://github.com/Mingbird/Mingbird‑agent许可证 Apache‑2.0关键tagv1.5.0LRAB矩阵v1.6.0完整五环安全模型v1.8.2最新开发tag。实验硬件Windows 1132GB共享内存集成GPU工作流任务预算90min长时序180min最多重试1次超时计0分。