决策模型开战:Jev / Decisions API / Strands Decider 的 ClosedSet、置信度闸门与混合 Agent
本文面向正在搭建 agent / 平台 harness的软件与平台工程师。素材来自 2026-09-2910-01 前后 TypeSafe Jev、OpenAI Decisions APIDevDay、AWS Strands Decider 2B 的公开报道与官方博文。文中严格区分「公开事实」与「作者架构建议」不编造未公布的 OpenAI 请求 JSON / 价目表也不把决策模型写成「不会出错的文本生成器」。1. 为什么工程师该关心又一类模型不是又一个聊天框过去一周「决策模型 / System One」从单点产品变成三方同场TypeSafe Jev只做决策、不吐开放文本返回带概率与置信度的类型化答案OpenAI Decisions APIDevDay 宣布专用GPT-6 Luna引擎在有限预定义选项里做选择分类 / 路由 / agent 下一步AWS Strands Decider 2B开源 Hugging Face 权重Qwen3.5-2B 躯干 pointer head本地毫秒级面向 Strands harness 介入点。对自建 agent 栈冲击不是「又多了三个模型名」而是ClosedOptionSet变成一等公民调用方先声明有限选项模型在集合内选置信度 / 校准开始进入产品闸门低于阈值就升级而不是「模型说了就算」PlannerLLMvs Decider分离长程规划留给文本模型高频分支留给决策模型wrong-but-valid 仍然存在类型合法 ≠ 语义正确——闸门必须承认这一点。公开材料描述的是各家产品能力与早期采用轶事不是强制行业标准。可立刻写进 harness 的是作者建议的四件套DecisionGate ClosedOptionSet ConfidenceThreshold EscalationPolicy。2. 公开事实一览仅复述可核对信息以下表格只收录截至2026-10-02CST可从 InfoQ、TechCrunch、Strands 官方博文与 CryptoBriefing 等交叉核对的信息。不补全未公布细节项公开信息明确「未公布 / 勿发明」TypeSafe Jev 定位决策专用「System One」不生成开放文本返回Choice / Score / Noul带概率分布与置信度单次并行评估多题完整训练数据与内部评测方法未要求正文复现Jev 成本 / 窗口 / 延迟输入约$0.042 / M tokens输出免费上下文约32K厂商报价端到端延迟70–500ms各区域实际 SLA、批量计费细则以官方为准Jev 训练与采用Reinforcement Learning for Calibrated DecisionsVercel AI Gateway 次日接入InfoQ/Vercel 报道称约 24h 内达近13%付费团队引用报道非作者复测LangChain 等有集成叙事勿把「13%」写成全网市占勿发明未报道的百分比Jev 能力边界官方 jaggedness 页提示计数/算术/日期比较不可靠大噪声 state 精度下降建议数学放代码里钉死版本如 jev-1.13.x勿用jev-latest完整 jaggedness 清单以厂商页为准OpenAI Decisions APIDevDay ≈ 2026-09-29宣布专用GPT-6 Luna有限预定义答案用例含分类、路由、agent next action支持文本或图像上下文报道所述limited preview演示延迟约150msvs 标准 Luna ~1.6s约 10×演示数字公开定价、完整 request/response schema、置信度字段、准确率基准尚未全文公布——正文不发明 JSONStrands Decider 2B2026-10-01strandsagents.com 宣布开源 GitHub HF 权重Qwen3.5-2B躯干去掉 LM head换pointer head本地 RTX 3090 中位延迟约115ms博客JevBench 2B 档有竞争力表述示例InterventionHandler.before_tool_call→Proceed / Deny / Confirm / Guide完整训练脚本细节以仓库为准勿把示例阈值写成官方强制用例共性报道/博客路由、工具选择、护栏、混合 agentLLM 难决策 Decider 高频分支不声称覆盖编码/长文摘要等开放生成任务纪律二手文若给出「OpenAI Decisions 正式价 / 未公开字段名」却无官方同口径出处一律不进正文。Vercel 采用比例一律标注「Vercel/InfoQ 报道」。3. 把发布特性映射到 harness 失效模式产品语言偏「更快、更便宜、更结构化」落到工程上作者建议映射为四类可观测失效。3.1 Open-Set Leak开放集合泄漏公开镜像决策模型要求有限选项Jev/Strands 在集合内打分OpenAI Decisions 也强调预定义答案。Harness 侧症状Prompt 里写「选一个工具」但运行时工具表可被模型侧改写选项集合与权限矩阵不同步已下线工具仍在 ClosedSet把「结构化 JSON 输出的 LLM」误当成决策模型——仍可能吐出集合外键。作者建议的验收问题进入执行器前选项是否来自代码侧注册表不可被对话改写集合外答案是否在物理上不可达3.2 Confidence Bypass置信度旁路公开镜像Jev 返回置信度并强调阈值上下的行动/升级Strands 强调校准OpenAI Decisions 的置信度字段尚未公开——不能假设已有。Harness 侧症状永远argmax从不读 confidence阈值写在运维 Wiki不在执行器用「延迟低」代替「可信」。作者建议的验收问题低于min_confidence时是否强制走EscalationPolicy人审 / 更大模型 / Deny而不是静默放行3.3 Wrong-but-Valid合法但错误公开镜像Hacker News 等讨论指出——决策模型不能吐非法类型但可以吐完全错误的合法值CryptoBriefing 亦强调 constrained ≠ correct。Harness 侧症状营销话术「不会幻觉」被写进验收无金标回归集只测 schema 合法把 ClosedSet 当成正确性证明。作者建议的验收问题是否有「错误但合法」的合成用例错路由、错工具、错升级必须被下游闸门拦住3.4 Planner/Decider Confusion规划器与决策器混用公开镜像Strands 博客明确——决策模型不适合编码/聊天/长文适合路由、工具选择、护栏、混合 agent。Harness 侧症状用 Decider 做开放式规划用大模型做每次before_tool_call的是/否一套 Prompt 既当 Planner 又当 Decider无角色边界。作者建议的验收问题高频分支是否走 Decider开放推理是否走 LLM二者交接是否有显式契约4. 作者架构建议DecisionGate ClosedOptionSet ConfidenceThreshold EscalationPolicy以下整节为作者架构建议不是 TypeSafe / OpenAI / AWS 官方处方。字段均标为示例。对 OpenAI Decisions不填写未公开的请求体字段名。4.1 ClosedOptionSet选项在代码里不在 Prompt 散文里# 示例 schema作者示意非官方 API closed_option_set: set_id: tool_select_v3 # 示例 options: - id: search_docs - id: create_ticket - id: escalate_human - id: no_op source: code_registry # 示例禁止对话改写 allow_model_to_add_options: false规则选项 ID 与权限 / 计费 / 审计字典同一来源集合变更走配置发布不走「模型建议加一个工具」对 LLM 结构化输出路径仍应用同一 ClosedSet 校验——类型合法不等于集合合法。4.2 DecisionGate统一入口屏蔽三家方言# 示例每次决策前 decision_gate: provider: typesafe_jev | openai_decisions | strands_decider | mock set_id: tool_select_v3 state_ref: opaque_state_handle # 示例文本或结构化状态引用 question_id: next_tool # 示例 # OpenAI仅声明「有限预定义答案 文本/图像上下文」能力面 # 不在此发明 request JSON 字段名Gate 在执行器内实现模型拿不到「绕过 ClosedSet」的开关Provider 可替换业务策略不绑死一家 SDKPreview / 本地 / 云端延迟差异巨大——Gate 必须带超时与降级而不是假设「都是 100ms」。4.3 ConfidenceThreshold阈值是闸门不是日志装饰# 示例 confidence_policy: min_auto_act: 0.85 # 示例阈值非厂商硬限 min_escalate: 0.55 # 示例介于中间则升级 below_min_escalate: deny # 示例过低直接拒绝 on_missing_confidence: escalate # 示例OpenAI 字段未公开时的默认要点有置信度就用Jev / Strands 公开强调校准无置信度就升级/保守OpenAI Decisions 公开材料尚未给出置信度字段——作者建议默认on_missing_confidenceescalate或等价保守策略而不是假装有分阈值进配置中心与审计不进某次 Prompt演示延迟数字如 ~150ms不替代置信度策略。4.4 EscalationPolicy人、更大模型、或硬拒绝# 示例事件 escalation_event: decision_id: dec_20261002_001 reason: low_confidence | provider_timeout | set_mismatch | jagged_task action: ask_human | call_planner_llm | deny | guide_retry evidence_ref: scores_and_option_ids_only # 示例保留可审计摘要落地纪律低置信度 / 超时 / 集合不匹配→ 结构化事件call_planner_llm只处理「需要开放推理」的分支不要把所有失败都扔回同一 Decider 死循环Strands 示例中的Proceed / Deny / Confirm / Guide是很好的动作枚举灵感作者借用形状不声称照搬官方强制 APIJev jaggedness计数/数学/日期→ 这类题不要进 Decider留在代码或 Planner。4.5 混合 Agent谁规划、谁拍板角色典型模型负责不负责Planner通用 LLM按你们现网选型拆解目标、写草稿、解释、开放推理每次工具前的是/否高频闸门DeciderJev / Decisions API / Strands DeciderClosedSet 选择、打分、护栏前置写代码、长聊天、开放摘要Gate你们的 harnessClosedSet、阈值、升级、审计「相信模型自觉」作者建议的最小闭环Planner 产出「候选下一步」或状态摘要Decider 在代码注册的 ClosedSet上选择confidence min_auto_act→ 执行否则 Escalation账本同时记provider、set_id、option_id、confidence若有、action_taken。5. 两周内可落地的验收清单作者建议ClosedSet 注册表至少一条业务决策如工具选择 / 工单路由选项只来自代码对话无法增删。DecisionGate 单测注入集合外答案必须硬失败钉死模型版本禁*-latest作为生产默认。置信度闸门构造低置信度响应断言走升级而非静默argmax对「无置信度字段」的 provider 走保守策略。wrong-but-valid金标集包含「合法但错误」样本下游必须拦或升级。混合路径统计一周内「Decider 自动放行 / 升级 LLM / 人审 / Deny」比例没有升级通道的「纯 argmax」不允许上生产。Jaggedness 黑名单计数、日期比较、金额算术等任务默认不进 Decider。延迟与降级超时 → 预定降级缓存策略 / Deny / Planner禁止无限重试烧钱。无营销 CTA价档与采用比例仅作公开可用性事实UI/文档不出现试用导流话术。6. 结语Jev、Decisions API、Strands Decider 2B 在同一周把「决策」从 Prompt 散文里拽了出来有限选项、概率/置信度、毫秒级分支、开源与托管并行。对 agent / 平台建设者现阶段最有用的回应不是押注哪一家永久获胜而是把浪潮翻译成代码ClosedOptionSet、DecisionGate、ConfidenceThreshold、EscalationPolicy以及 Planner 与 Decider 的硬分工。公开事实止于各源已写明的内容上文闸门与 schema 均为作者架构建议。待 OpenAI 公布完整 schema/定价、各家校准评测更清晰时再替换示例字段——但「选项在代码里、低置信度必须升级、合法不等于正确、决策模型不是文本生成器」这四条现在就可以写死。