20 分钟跑通 RD-Agent:AI 数据科学研发自动化的安装配置与首跑教程
20 分钟跑通 RD-AgentAI 数据科学研发自动化的安装配置与首跑教程【免费下载链接】RD-AgentResearch and development (RD) is crucial for the enhancement of industrial productivity, especially in the AI era, where the core aspects of RD are mainly focused on data and models. We are committed to automating these high-value generic RD processes through RD-Agent, which lets AI drive>项目地址: https://gitcode.com/GitHub_Trending/rd/RD-AgentRD-Agent 是微软开源的 LLM Agent 框架用于自动化数据驱动的研发流程自动提出假设、生成代码、执行实验并根据反馈迭代覆盖数据科学竞赛、量化因子与模型进化、LLM 微调等场景。本文按装环境 → 配 LLM → 跑通首任务 → 排查卡点的真实操作链路展开适合准备上手的算法工程师和数据科学新手从零到首次运行只需一个终端。 准备工作三条硬性要求与安装环境清单先过一遍RD-Agent 目前仅支持 Linux。Python 使用 3.10 或 3.11CI 实测过的两个版本pyproject.toml要求 ≥3.10仓库同时提供constraints/3.10.txt、constraints/3.11.txt用于锁定依赖。多数场景依赖 Docker 隔离执行代码当前用户必须能免 sudo 运行 Docker用docker run hello-world验证即可。两种安装方式普通用户直接从 PyPI 安装先建好 conda 环境再装包conda create -n rdagent python3.10 -y conda activate rdagent pip install rdagent要跟进最新版或参与贡献则克隆源码后执行make devMakefile 里已串好可编辑安装、依赖与钩子git clone https://gitcode.com/GitHub_Trending/rd/RD-Agent cd RD-Agent make dev装完执行rdagent --help能看到fin_factor、data_science、health_check等子命令即代表入口正常。⚙️ 配置 LLM.env 放哪、怎么验.env 与最小可用配置rdagent命令启动时会自动加载当前目录下的.env仓库根目录自带模板 .env.example复制为.env后填值即可。核心是CHAT_MODEL与EMBEDDING_MODEL两项默认后端为 LiteLLM见rdagent/oai/llm_conf.py。最易踩的坑embedding 若与 chat 不同服务商EMBEDDING_MODEL必须加litellm_proxy/前缀并单独配 key 与 base。DeepSeek 没有 embedding 模型官方给出的组合是DeepSeek 对话 SiliconFlow 向量CHAT_MODELdeepseek/deepseek-chat DEEPSEEK_API_KEYDeepSeek 密钥 EMBEDDING_MODELlitellm_proxy/BAAI/bge-m3 LITELLM_PROXY_API_KEYSiliconFlow 密钥 LITELLM_PROXY_API_BASEhttps://api.siliconflow.cn/v1若用输出含思考过程标签的推理模型再加一行REASONING_THINK_RMTrue。最快验证命令rdagent health_check这一条命令会连测三件事Docker 是否可用、UI 默认端口 19899 是否被占、chat 与 embedding 模型是否真实调通。看到 All tests completed 才能进入下一步。 首次运行内置医疗预测任务选一个开箱即用的竞赛跑通数据科学场景统一入口是rdagent data_science --competition 竞赛名。仓库内置示例任务 arf-12-hours-prediction-task12 小时心率预测按 README 示例下载数据解压后设置数据目录与场景类再启动dotenv set DS_LOCAL_DATA_PATH $(pwd)/git_ignore_folder/ds_data dotenv set DS_SCEN rdagent.scenarios.data_science.scen.DataScienceScen rdagent data_science --competition arf-12-hours-prediction-task之后 Agent 会循环执行数据加载 → 特征工程 → 模型训练 → 集成评估每轮把指标反馈给下一轮假设全程无需人工改代码。用 UI 观察执行过程另开一个终端启动监控页rdagent ui --port 19899 --log-dir log/ --data-scienceStreamlit 页面实时展示数据科学场景的日志与 trace。若端口被占可先跑rdagent health_check --no-check-env --no-check-docker查看可用端口再用--port换端口。 常见卡点与场景扩展高频报错的排查顺序Docker 报错先确认 daemon 已启动、当前用户在 docker 组免 sudo这是 health_check 里最常见的失败项。chat 通过但 embedding 失败九成是litellm_proxy/前缀漏加或LITELLM_PROXY_API_BASE写错模型名必须与 LiteLLM 支持的命名一致。端口冲突19899 是 UI 默认端口换--port即可。本地无 Docker 想跑通在.env设置DS_CODER_COSTEER_ENV_TYPEconda数据科学场景或MODEL_COSTEER_ENV_TYPEconda量化场景让代码改在本地 conda 环境执行完整说明见安装与配置文档。换场景Kaggle 与量化Kaggle 竞赛把kaggle.json放到~/.config/kaggle/.env里将DS_SCEN指向KaggleScen类、DS_IF_USING_MLE_DATATrue即可用同一条rdagent data_science命令按名跑比赛内置模板如 tabular-playground 系列可参考rdagent/scenarios/kaggle/experiment/templates/。量化方向用rdagent fin_factor因子进化、fin_model模型进化、fin_quant因子模型联合进化三条命令覆盖。下一步安装与配置文档LiteLLM 各服务商配置与执行环境细节数据科学示例任务示例竞赛数据与说明文件场景目录金融、医疗、通用场景的完整清单贡献指南提交 Issue 与参与开发的入口【免费下载链接】RD-AgentResearch and development (RD) is crucial for the enhancement of industrial productivity, especially in the AI era, where the core aspects of RD are mainly focused on data and models. We are committed to automating these high-value generic RD processes through RD-Agent, which lets AI drive>项目地址: https://gitcode.com/GitHub_Trending/rd/RD-Agent创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考