GEV-26B-Decide 机器人控制:61毫秒决策让机械臂学会抓取与放置
GEV-26B-Decide 机器人控制61毫秒决策让机械臂学会抓取与放置【免费下载链接】GEV-26B-Decide项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/GEV-26B-DecideGEV-26B-Decide 是一个面向机器人控制与智能决策的开源模型它基于 Gemma-4-26B260 亿参数、每 token 仅激活约 40 亿单步 System 1 决策只需61 毫秒——看一眼摄像头画面判断机械臂该往哪走最终完成抓取—搬运—放置。对想给机械臂、桌面机器人加装快速反应大脑的新手来说这篇文章讲清楚它做了什么、实测效果如何、怎么跑起来。⚡ 61 毫秒是什么概念人类眨眼大约需要 100 毫秒——模型还没眨一下眼决策已经给出。什么是 GEV-26B-Decide机器人控制背后的决策模型一句话概括一个把选择题做到极致的决策模型。输入文本或图像摄像头画面、屏幕截图 一个问题输出每个选项一条校准过的概率单次前向传播完成不生成任何文字架构骨架是未改动的 Gemma-4-26B-A4B-it26B 参数、约 4B 活跃System 1 由 LoRA 适配器 一个 24 槽决策头实现见 adapter_vllm/ 与 head.safetensors自适应思考System 1 不够自信领先概率低于 0.8时自动切换 System 2 推理再折回最终概率也就是说它既能当快速直觉又能当慢思考大脑而机器人控制只用到前者。机械臂如何学会抓取与放置把动作拆成两个视觉问题关键洞察不要问模型下一步做什么动作而是把决策拆成最简单的视觉问题来自 README.md 的官方实验每一步System 1 看顶部摄像头图像回答两个问题目标方块在夹爪左还是右在夹爪上还是下机械臂按答案移动只要某个答案翻转步长就减半类似二分查找伺服式收敛位置足够接近后夹爪下移、闭合、提起移动到托盘上方释放环境为 MuJoCo 仿真每个动作间隔重新拍照、重新决策每个问题都是一次单发 System 1 决策实测中位数60.7 毫秒逐集数据见 reports/demos/arm_servo.json。平均 68.8 步决策整次 pick and place 的模型耗时只有4–8 秒。实测效果20 个随机场景40% 完成放置指标结果随机场景数MuJoCo 仿真20完成抓取→放入托盘8/2040%抓握成功率45%平均决策步数68.8 步单次决策耗时中位数60.7 ms抓住后的落点9 次中 8 次进托盘同系列模型横向对比相同场景、相同任务GEV-26B-DecideJEV-27B-VLJEV-9B机器人决策耗时61 ms239 ms163 mspick and place 成功率40%75%50%结论很直白GEV-26B-Decide 是家族里最快的比 JEV-27B-VL 快约 4 倍成功率接近中游。失败主因是靠近目标时左/右判断不够精细导致空抓偏多但一旦抓起方块8/9 能稳稳放进托盘——手稳只是眼还差一点。一个重要教训别直接问下一步做什么动作对比实验记录在 reports/demos/arm_direct.json让 System 1 直接从 8 个电机指令左移、右移、升降、开合夹爪……里挑一个结果10 个场景 0 成功夹爪还会陷入一直闭合的死循环。给新手的三条使用原则✅ 在控制循环里用 System 1 回答简单视觉问题左还是右远还是近❌ 不要直接让它输出多步电机指令❌ 不要开 thinking控制循环需要毫秒级响应思考要花好几秒附赠能力85 毫秒点一次鼠标的电脑操作同一套 System 1 用在截图上同样飞快真实无头浏览器里每个可点击元素画上编号框模型选出下一次点击或宣告任务完成浏览器执行循环往复。60 个随机多步任务购物、设置、邮件每个 3–7 次点击完成 95%每次点击约85 ms——与 JEV-27B-VL 相同成功率快 3 倍逐集结果见 reports/demos/cu_results.json小提醒给模型喂上元素文本类似无障碍树成功率才上 95%只靠编号框只能完成 15%。快速部署一条命令启动机器人决策服务硬件要求1 张 80 GB 以上显存的 GPU实测 B200需要支持 Gemma-4 的 vLLM 构建 patches/vllm-gemma4-lm-head-lora.patch在 Gemma-4 共享 lm_head 上做 LoRA 的补丁。git clone https://gitcode.com/hf_mirrors/autotrust/GEV-26B-Decide bash GEV-26B-Decide/serve.sh # 服务启动在 :8000启动后向POST /v1/decide发一道选择题即可复现机械臂的单步决策curl localhost:8000/v1/decide -H Content-Type: application/json -d { kind: choice, state: [Photo: , {image: data:image/png;base64,...}], question: 目标方块在夹爪左边还是右边, options: [left, right], thinking: off }响应返回每个选项的概率与最高概率选择推理类问题可把thinking设为auto启用自适应思考。服务端实现见 serve_decide.py启动脚本与参数见 serve.sh。关键文件导览路径用途serve_decide.pyvLLM 决策服务器OpenAI 接口 POST /v1/decideserve.sh一键启动脚本含投机解码开关MTP1adapter_vllm/System 1 的 vLLM 版骨干 LoRA 决策头lm_head LoRAadapter/System 1 的 transformers 路径 LoRAhead.safetensors24 槽决策头fp32hidden 2816 → 24calibration.json / calibration_gold.json按题型的温度校准按置信度门控自动动作请用 gold 版reports/demos/arm_servo.json机械臂抓取放置20 集逐决策延迟数据reports/demos/arm_direct.json反例实验直接选 8 个电机指令reports/demos/cu_results.json电脑操作逐集结果videos/robot_arm_pick_place.mp4机械臂抓取放置演示视频局限与新手使用建议图像决策是零样本决策头只在文本上训练摄像头任务表现未经微调靠近目标时左/右精度有限抓取成功率偏保守追求成功率可换更慢的 JEV-27B-VL控制循环务必thinking: off推理题才用auto全场景 Decision Index 达62.48细节见 README.md英文为主不适合高风险场景直接自动执行——建议用返回概率做置信度门控一句话总结机器人控制循环要的不是慢但全知的大脑而是 61 毫秒的反射——GEV-26B-Decide 恰好把这件事做到了开源模型的第一梯队。【免费下载链接】GEV-26B-Decide项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/GEV-26B-Decide创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考