HyperAgents六大评测域全景指南:从搜索问答到机器人控制,自进化如何跨越领域

发布时间:2026/10/1 21:05:00
HyperAgents六大评测域全景指南:从搜索问答到机器人控制,自进化如何跨越领域
HyperAgents六大评测域全景指南从搜索问答到机器人控制自进化如何跨越领域【免费下载链接】HyperAgentsSelf-referential self-improving agents that can optimize for any computable task项目地址: https://gitcode.com/gh_mirrors/hy/HyperAgentsHyperAgents 是一个自引用、自我改进的智能体框架能通过元智能体 任务智能体的循环自动优化任何可计算任务。本文带你一次性看懂它的六大评测域搜索问答search_arena、论文评审paper_review、多语言编程polyglot、奥数证明imo、文本游戏环境balrog和机器人控制genesis并解释自进化机制如何跨越这些截然不同的领域。 自进化如何运作一图理解整体架构HyperAgents 的核心思路很简单元智能体meta agent负责修改智能体的智能体即优化任务智能体本身任务智能体task agent在各个评测域上执行具体任务产生分数进化循环任务智能体的表现被量化为适应度分数元智能体据此不断迭代改进输出以 diff 补丁形式保存入口脚本是 generate_loop.py主逻辑实现在 meta_agent.py 和 task_agent.py。所有评测域共享同一套进化循环这也是跨领域自进化得以成立的关键。 六大评测域速览评测域任务类型核心评测方式代码位置search_arena搜索问答二选一胜率winnerdomains/search_arena/paper_review学术评审预测评审结论domains/paper_review/polyglot多语言编程容器内测试通过率domains/polyglot/imo数学证明分档评分0~7分domains/imo/balrog文本游戏游戏奖励/进度domains/balrog/genesis机器人控制RL 适应度0~1domains/genesis/ 域一search_arena——搜索问答的擂台赛search_arena 借鉴了竞技场式评测智能体针对同一搜索问题产出两个候选回答messages_a与messages_b由基准真值winner判定哪个更优。任务智能体的目标就是持续提高获胜率。数据与任务组装逻辑见 utils.py 中的format_input_dict函数子集筛选则位于 curate_subsets.py。 域二paper_review——预测论文评审结果在这个域中智能体输入是一篇论文全文paper_text任务是预测评审结论outcome例如接收或拒稿。这类任务考察模型对学术写作质量、论证逻辑的综合判断力。任务格式定义在 utils.py配套数据见 dataset.csv。 域三polyglot——多语言编程能力评测polyglot 基于 Aider 的多语言编程基准涵盖多种编程语言的算法练习题评测在隔离容器中执行测试用例并统计通过率。基准任务定义benchmark.pyDocker 评测容器构建docker_build.py题目子集small/mediumsubsets/medium.json测试规范test_spec.py这个域是考察自进化智能体写代码并自我修复能力的硬指标。 域四imo——国际奥数数学证明imo 域评测智能体撰写数学证明的能力采用分档评分制评分档得分incorrect错误0partial部分正确1almost接近正确6correct完全正确7评分报告逻辑在 proof_eval.py 中实现会自动输出得分率与完全正确率证明判分工具链位于 proof_grading_utils.py。 域五balrog——文本游戏智能体训练balrog 域提供了一整套文本游戏环境用来训练和评测 RL 智能体NLENetEase Legends of Ethnia 系列、BabaIsAI、Crafter、MiniHack、TextWorld、BabyAI 等全部位于 domains/balrog/environments/。上面是 NLE 游戏使用的 16×16 像素图块素材这类像素风文本游戏环境是智能体探索行动—奖励循环的典型场景。环境封装统一通过 env_wrapper.py 完成每个环境自带 README 说明安装方式例如 babaisai/README.md。 域六genesis——机器人步态控制genesis 域基于 Genesis 物理仿真器让智能体为宇树 Go2 机器狗编写并训练 RL 奖励函数与控制器任务包括行走walking与跳跃hopping环境定义Go2WalkingCommand.py奖励函数reward/默认行走、跳跃奖励分别见 default_walking_function.py、default_hop_function.pyRL 训练与评测genesis_train/rl_trainer.py、genesis_eval/rl_eval.py评测设定很有特色4096 个并行环境同时异步运行适应度分数归一化到 0~1机器人摔倒roll/pitch 超过 10 度会提前终止 episode。完整说明见 domains/genesis/README.md。 如何运行评测所有域统一走 Docker 隔离评测流程无需手动切换环境评测入口domains/run_eval.py支持--domains指定一个或多个域域内 harnessdomains/harness.py结果报告domains/report.py进化主循环的运行方式python generate_loop.py --domains domain输出默认保存在outputs/目录。可视化分析脚本位于 analysis/例如 plot_progress.py 可绘制智能体随进化代数的进度曲线直观展示自进化过程。 总结HyperAgents 用同一套元智能体—任务智能体自进化循环覆盖了从纯文本推理搜索问答、论文评审、数学证明到代码生成polyglot再到交互式环境balrog 文本游戏、genesis 机器人控制的六大评测域。对新手而言理解任意一个域的utils.py任务格式report.py分数定义即可快速上手而对研究自进化智能体的用户这套跨领域的统一评测框架正是观察自我改进边界的最佳窗口。【免费下载链接】HyperAgentsSelf-referential self-improving agents that can optimize for any computable task项目地址: https://gitcode.com/gh_mirrors/hy/HyperAgents创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考