不写代码也能玩转Jev:给非程序员的一份智能体判断模型入门地图
不写代码也能玩转Jev给非程序员的一份智能体判断模型入门地图【免费下载链接】jev-chat-jarvisThe chat decision assistant: before you reply, Jev reads the chat, judges intent and risk, and drafts replies you fill in with one tap. You press send. Android · Windows · macOS · iOS | 聊天辅助决策工具先看懂对方再回复发不发由你。项目地址: https://gitcode.com/gh_mirrors/je/jev-chat-jarvis2026 年 9 月一个不会说话的 AI 模型突然刷屏TypeSafe AI 带着 4000 万美元种子轮融资结束两年隐身发布首款System One模型 Jev三天内冲上 Hacker News 榜首1863 分、491 条评论估值传闻达百亿美元。它最大的卖点听起来很反常识——不生成文本、不写代码、只做判断输出一个选择 概率 置信度然后闭嘴。全网热度集中在Codex 接入本地部署Agent 架构等开发者话题反而让普通用户以为这是又一款程序员专用工具。但如果你愿意花十分钟理解它会发现一个相反的结论Jev 或许是近年来对非程序员最友好的 AI 突破。它把让 AI 做决定这件事拆成了选择题、打分题和是非题——而你天天在做选择题。这篇文章不讲编译环境不碰命令行只做三件事用大白话讲清 Jev 在判断什么看三个普通人立刻能用的场景再给出一条零代码的体验路径——一个现成的聊天副驾项目装上就能用。一、用大白话理解 Jev不生成文本的模型到底在做什么判断先纠正一个流传最广的误解Jev 不是聊天机器人它甚至不是一个会回答的模型。圈内人给它起了个传神的绰号——一个智能 if 语句。普通大模型GPT 这类的工作方式是生成你把一段话喂进去它吐出一段新的话。这个过程又慢又贵因为每个 token 都要计算。而 Jev 的工作方式是分类你把一段对话、一封邮件、一个界面状态喂进去它只回答三类问题choice单选题给一组选项选一个并给出每个选项的概率分布score打分题按一个有序的分档标准打分返回加权分数noul是非题给出 0 到 1 之间的真值估计判断命题成不成立。没有长篇大论没有客套寒暄。换来的是两个硬指标单次判断约 70–500 毫秒输入 token 成本约 $0.042/百万一次典型判断约 1000 输入 token成本不到万分之五美分。社区实测的对比更直观在 Codex 里给 Agent 配 Jev 做决策比让大模型自己判断快 40–200 倍、便宜 40–400 倍而且输出 token 免费。为什么这么快这么省因为判断比生成简单得多。TypeSafe 的创始人 Diogo Almeida 是前 OpenAI InstructGPT 核心作者他对 Jev 的定位是明确的把智能体里重复发生的判断性工作从大模型上卸载下来交给一个专门的、只做决策的轻量模型。大模型负责想说什么Jev 负责该不该说、什么时候说、说到什么程度。这套逻辑在仓库里有完整的工程化落地。以 cn/app/src/main/java/com/jev/probe/jev/JudgeClient.kt 为例客户端一次请求发送全部 7 道判断题目请求体就是{model, state, questions}三件套其中questions里的每一道题都明确标注type是noul、choice还是score。响应里的字段同样类型化choice携带probabilities和confidencescore携带legend分档说明如 cn/app/src/main/java/com/jev/probe/core/ChatModels.kt 中的Choice与Score数据结构所示。而真正让 Jev 好用的是题目怎么出。判断的质量不取决于模型有多聪明取决于你把问题翻译得多精确——这一步叫做写题目集它本质上是措辞和数据工作不是编程工作。cn/tools/jev/TASK.md 里记录了出题的铁律题目指令一律用英文Jev 主训练语言是英文中文效果明显差但聊天内容保留中文原文每题必须写具体情景而不是抽象程度题目之间不许互相矛盾。仓库里 cn/tools/jev/questions.py 和它在 Android 端的镜像 cn/app/src/main/java/com/jev/probe/jev/JevQuestions.kt 就是这份题集的成品——7 道判断题 1 道排序题措辞经过真实标注集校准。这引出一个关键认知对普通用户而言用 Jev 的全部门槛就是把问题翻译成选择 / 打分 / 是非。而这件事现成的项目已经替你翻译好了。二、普通人能上手的三个场景邮件分类、回复时机、风险提醒社区里流传的Jev 十大应用清单——模型路由、工具风险门控、输出护栏、RAG 重排序……几乎全是开发者术语。但剥掉术语外壳其中至少有三个场景普通人在日常生活中马上就能用上而且不需要写一行代码。场景一邮件与工单分类。判断这封邮件是要我行动、还是要我解释、还是只是通知本质是一道单选题。企业用 Jev 把客服工单自动分流到投诉 / 咨询 / 退费 / 无关个人用同样逻辑给收件箱打标签。你不需要知道背后的请求长什么样只需要理解分类这件事Jev 比大模型更便宜、更快、更稳定——同一封邮件大模型要生成一整段分析Jev 只输出一个选项和概率。场景二回复时机判断。这是仓库项目最核心的场景之一也最能体现 Jev 的判断价值。在 cn/app/src/main/java/com/jev/probe/jev/JevQuestions.kt 里有一道should_reply_now是非题它的指令写得很讲究这不是问你现在要不要发消息而是问你下一条消息该不该包含实质内容。接着还有一道best_action单选题给出七个动作选项翻聊天记录确认事实check_history、先道歉apologize、给承诺give_commitment、解释explain、让对方感到被看见acknowledge、少说两句say_less、约时间make_plan。注意这里的细节Jev 不是替你决定回不回而是替你判断现在回什么类型的内容最合适。这比该不该回更实用——因为在真实聊天里现在急着回但没话可说和可以回但要先道歉是两种完全不同的处境前者需要查证后者需要姿态。你把回复时机这个模糊的社交直觉翻译成了一组明确的动作选项——这正是普通人每天在做、却从未意识到可以自动化的事。场景三风险提醒。聊天会不会吵起来、这笔交易危不危险、这封邮件是不是在施压——风险判断是 Jev 最出圈的能力。仓库里的danger_level打分题把这段对话离吵架/伤感情有多近拆成了 10 个具体档位从语气轻松或带调侃没有抱怨、测试或截止时间一路到对方已经说了结束、别回我、删了你或正在爆发。每一档都写具体情景不写抽象程度——这是 Jev 官方对 score 题的硬性要求cn/tools/jev/TASK.md 明确记录每档写具体情景不写抽象程度官方明确要求。普通人用这个场景的方式很直接把对话交给工具得到危险等级 7/10 对方真实意图是测试你是否在意然后决定自己是先服软还是先查证。你获得的是一个可量化的决策输入而不是一段可能帮倒忙的客套话。这正是判断模型和生成模型的分工Jev 告诉你现在是什么状况生成模型比如 DeepSeek负责该说什么话。三、零门槛路径用现成聊天副驾类项目体验 Jev再决定要不要深挖理解了前面两节你已经掌握了 Jev 的全部核心概念。现在的问题是怎么在不写代码的前提下真实地体验一次判断模型替你决策最省事的路找一个把 Jev 封装好的现成项目直接装来用。这正是仓库里cn/目录下的Jev 聊天助手在做的事——一个开源聊天副驾官方定位是先看懂对方再回复发不发由你。它不 hook 聊天软件、不改包、不走任何 App 的接口或账号只用系统无障碍服务读屏幕上正在显示的对话判断模型给出对方真实意图、危险等级1–9、该不该马上回、最佳动作生成模型起草 3 条候选回复再由 Jev 按最合适排序悬浮窗展示后由你决定填不填入输入框cn/README.md。上手只需要三步装 APK → 填一个 API KeyOpenRouter 一把密钥即可判断/回复/视觉三路接口留空会自动继承→ 按向导开无障碍、悬浮窗、自启动三项权限。界面上已经内置了 OpenRouter、博查 Jev、TypeSafe 直连、Vercel、OpenCode Zen、DeepSeek 官方、通义兼容等预设选中即自动填好地址和模型名每路都有独立的一键连通测试——整个配置过程没有一个命令行操作。上图是它的数据边界示意聊天界面的读取与 OCR 全部在手机本地完成只有触发分析时聊天文字和你启用的背景信息才会发给你自己配置的模型服务商候选回复由你确认应用没有任何自动发送的代码路径。这一点对普通用户很重要——你始终是发送权的唯一持有者工具只负责把回复填进输入框点发送键的永远是你。装上之后你会立刻感知到判断模型的体验差异消息进来约一秒悬浮窗就给出危险等级 对方真实意图 三句话术而不是让一个大模型长篇大论地分析这段聊天。你可以拿一段真实对话试一次感受判断和生成在速度与质感上的区别——这是任何文章都替代不了的体验。体验完如果还想深挖仓库给你留了一条不需要写代码的进阶路径Jev 的判断质量取决于题目集而校准题目集靠的是标注数据不是编程。打开 cn/tools/jev/calibrate.py 和 cn/tools/jev/fixtures/labeled_set.json 你会发现标注集就是一批 JSON 格式的对话片段 人工期望答案——比如情侣拌嘴期望危险等级 6、意图是测试你是否在意、需要的是行动。你把真实对话整理成这种格式跑一遍校准脚本就能得到每道题的命中率、danger_level的平均绝对误差、平均置信度和总花费cn/docs/acceptance.md 里甚至立了验收线danger_level平均绝对误差 1.0 档true_intent命中率 ≥ 60%。出题是数据工作不是编程工作——这可能是不写代码玩转 Jev最被低估的一层。结语判断模型的普通用户红利回看 Jev 的爆火路径开发者圈讨论的是架构——把决策从生成模型里剥离出来做快与慢的混合智能体而普通用户真正应该带走的是一个更朴素的事实AI 替人拍板这件事第一次变得又便宜又快又透明。透明在于它给你的不是一段解释而是一个带概率的明确选择便宜在于单次判断成本以万分位美元计快在于毫秒级响应。大模型负责会说Jev 负责想清楚而你——永远负责决定。判断模型的时代刚刚开始从一条聊天消息开始你不需要写代码就已经在玩转它了。【免费下载链接】jev-chat-jarvisThe chat decision assistant: before you reply, Jev reads the chat, judges intent and risk, and drafts replies you fill in with one tap. You press send. Android · Windows · macOS · iOS | 聊天辅助决策工具先看懂对方再回复发不发由你。项目地址: https://gitcode.com/gh_mirrors/je/jev-chat-jarvis创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考