AutoSci实验自动化教程:/exp-run三种模式如何自动部署并监控远程GPU实验

发布时间:2026/10/11 4:29:55
AutoSci实验自动化教程:/exp-run三种模式如何自动部署并监控远程GPU实验
人工智能AI 技能/插件深度研究知识图谱MCP 服务【免费下载链接】AutoSciKarpathys LLM-Wiki vision, fully realized — wiki-centric full-lifecycle AI research platform powered by Claude Code项目地址https://gitcode.com/gh_mirrors/om/AutoSci点击查看免费下载AutoSci是一个以 wiki 为中心的全生命周期 AI 科研平台其中的/exp-run实验自动化技能可以一键完成实验代码生成、本地/远程 GPU 部署、运行监控与结果收集。本教程带你快速掌握它的三种运行模式deploy / --collect / --full几分钟就能把实验丢上远程 GPU 服务器并自动盯盘。/exp-run是什么一条龙的实验执行流水线在 AutoSci 中实验设计由/exp-design生成到wiki/experiments/目录后/exp-run就接手执行环节。它把原本需要手工操作的 4 个步骤全部自动化阶段做什么自动化细节Phase 1 准备生成实验代码读取实验页配置写出train.py、config.yaml、run.sh并做小规模 sanity checkPhase 2 部署启动实验本地用 screen 后台运行远程则 SSH 同步代码、选空闲 GPU、启动 sessionPhase 3 监控检查状态检测 NaN、OOM、Traceback 等异常还能自动降学习率/减 batch size 修复一次Phase 4 收集汇总结果拉回results/{slug}/seed_*.json计算 mean±std对比 baseline更新实验页完整流程定义见 i18n/zh/skills/exp-run/SKILL.md远程 GPU 操作的实现集中在 tools/remote.py。三种运行模式速览怎么选/exp-run用三个参数切换工作模式适配不同时间尺度的实验模式命令覆盖阶段适合场景默认deploy/exp-run slugPhase 1-2要跑几小时甚至几天的长实验部署后立即返回收集collect/exp-run slug --collectPhase 3-4实验已在跑检查是否完成、完成则收结果完整full/exp-run slug --fullPhase 1-4几分钟就出结果的本地快速实验 官方推荐流程/exp-run slug部署 →/exp-status监控 →/exp-run slug --collect收集。模式一deploy 默认模式自动部署到远程 GPU这是最常用的模式。假设wiki/experiments/里有一个status: planned的实验exp-demo执行/exp-run exp-demo --env remoteAgent 会依次完成读取实验配置从实验页提取模型、数据集、硬件、指标与 baseline并加载关联 idea 的方法草图和参考论文细节生成代码统一写入experiments/code/exp-demo/模块化组织训练入口 utils 超参配置 启动脚本结果按seed_N.json保存天然支持多 seedSanity check用小规模数据先跑一遍验证不 crash、GPU 可用、loss 能下降用户确认关卡这是刻意保留的人工检查点——代码和配置数据集路径、API 配置等交给你确认后才真正部署避免浪费 GPU 资源远程部署调用tools/remote.py依次执行status连通性→gpu-status找空闲 GPU→sync-codersync 代码→setup-env装依赖→launch --gpu N在远程 screen session 中启动写回 wiki状态改为running记录 session 名、启动时间并根据硬件/数据规模估算 ETA。完成后终端会输出一份DEPLOY_REPORTsession 信息、日志路径、预计完成时间以及用/exp-status监控、用--collect收集的下一步指引。远程 GPU 只需一份 server.yaml远程模式唯一的额外准备工作是复制 config/server.yaml.example 为config/server.yaml填好四要素host/user/portSSH 连接信息work_dir远程工作目录代码同步到这里、实验也在这里跑;conda或env_setup环境激活方式可选的identity_file、proxy_jump跳板机与同步 include/exclude 规则。tools/remote.py会把 9 个远程操作status、gpu-status、sync-code、setup-env、launch、check、tail-log、pull-results全部封装成子命令/exp-run全程无需你手写任何 SSH 命令。模式二--collect检查是否跑完并自动收结果几小时后或第二天执行/exp-run exp-demo --collect它会分两种情况处理实验还在跑只输出进度报告当前 step/epoch、最新指标、异常检测、剩余时间估算不修改任何 wiki 文件如果检测到 NaN 或 OOM会自动尝试一次修复从 checkpoint 恢复并降学习率或减小 batch size 重启。实验已完成自动拉回远程结果与日志解析各 seed 的 JSON计算 mean ± std 并与 baseline 对比把实验页状态推进到completed填入 outcomesucceeded / failed / inconclusive、一句话核心发现并输出RUN_REPORT末尾还会建议接下来运行/exp-eval更新关联 idea 的状态。模式三--full快速实验一口气跑完对于 CPU 或本地 GPU 上几分钟就能跑完的实验sanity check、toy 数据集验证加--full即可让 Phase 1→4 一口气执行完生成代码 → 部署 → 轮询等待 screen session 结束 → 收集结果中间不会返回打断你。如果 session 超过预计时间的 2 倍还没结束它会警告你但不会强制终止防止误杀长实验。用 /exp-status 批量监控所有实验多实验并行时/exp-status是统一监控入口定义见 i18n/zh/skills/exp-status/SKILL.md。它会扫描所有running实验逐一检查 screen session / SSH 状态输出四栏状态表Running耗时、最新指标、环境⚠️AnomalyNaN / OOM / Traceback 异常及建议动作✅Completed — Pending Collectsession 已消失、等待收集Already Collected已收集及结果。再配合两个高级参数--collect-ready对所有已跑完待收集的实验自动批量执行--collect--pipeline slug --auto-advance在/research流水线中当所有实验完成时自动推进到 Stage 4判定与迭代实现从实验到论文的无人值守衔接。常见问答Qdeploy 模式提示已在运行中说明该实验 status 已是running直接用/exp-run slug --collect检查进度即可。Q没有本地 GPU 怎么办配置好config/server.yaml后加--env remoteAgent 会自动查找远程空闲 GPU显存占用低于阈值即视为空闲并部署。Q实验代码会被 Review LLM 审查吗可选。deploy / full 模式加--review参数会调用独立的 Review LLM 以资深 ML 工程师视角审查训练循环正确性、数据泄漏、公平对比等常见坑并根据反馈修正代码。Q结果保存在哪所有实验结果以 JSON 格式保存在results/{slug}/seed_{N}.json多 seed 报告取 mean ± std不报告单次运行保证结论可复现。总结三步搞定实验自动化步骤命令说明1️⃣ 部署/exp-run slug [--env remote]生成代码 部署到本地/远程 GPU立即返回2️⃣ 监控/exp-status批量查看进度与异常--collect-ready可批量收集3️⃣ 收集/exp-run slug --collect拉回结果、对比 baseline、更新实验页配合/exp-eval完成结果判定后AutoSci 的实验循环就闭环了——记忆沉淀在 wiki下一个实验会自动参考这次的经验。想深入了解各技能的完整参数与错误处理策略可以从 i18n/zh/skills/ 目录下的中文技能文档开始读起。赞分享人工智能AI 技能/插件深度研究知识图谱MCP 服务【免费下载链接】AutoSciKarpathys LLM-Wiki vision, fully realized — wiki-centric full-lifecycle AI research platform powered by Claude Code项目地址https://gitcode.com/gh_mirrors/om/AutoSci点击查看免费下载相关推荐ARIS GPU 实验环境配置实战在 CLAUDE.md 中声明远程、本地与 Vast.ai 三种模式让自动审稿循环替你跑实验ARIS GPU 实验环境配置实战在 CLAUDE.md 中声明远程、本地与 Vast.ai 三种模式让自动审稿循环替你跑实验 本文围绕 ARISAutoAI 技能/插件AI 评测科研人工智能MCP 服务dsh-pluginOdoo MLOps实践指南企业智能模型的部署与监控自动化流程Odoo MLOps实践指南企业智能模型的部署与监控自动化流程 Odoo作为全球领先的开源企业资源规划系统正在通过MLOps实践将人工智能和机器学习能力深度企业应用后端电商ngxtop自动化部署监控监控部署过程与结果ngxtop自动化部署监控监控部署过程与结果 你是否还在为Nginx服务器的部署监控烦恼手动检查日志、分析指标耗时费力还容易遗漏关键问题。本文将带你通过n运维可观测性CLI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考