GEPA 实战案例全景解析:反射式提示优化从企业生产到前沿研究的真实落地路径
AI Agent提示工程模型优化【免费下载链接】gepaOptimize prompts, code, and more with AI-powered Reflective Optimization项目地址https://gitcode.com/gh_mirrors/ge/gepa点击查看免费下载导读本文以 GEPA 官方 Showcasedocs/docs/guides/use-cases.md为核心骨架系统梳理反射式提示优化Reflective Prompt Optimization在真实世界中的十余个应用方向——从企业级生产系统、AI 编程 Agent、医疗与 OCR 等垂直领域到前沿学术研究、社区生态与基础设施运维。读完你将理解 GEPA 的典型应用模式、各类场景的关键结果指标以及如何在本仓库内找到对应的可复现示例与源码实现。Showcase 是什么一份持续更新的真实世界档案GEPA 官方文档中专门设有一份Showcase 页面用于收录组织与研究者使用 GEPA 优化 AI 系统的真实案例覆盖从企业生产到学术研究的多个领域。该页面本身被标记为Living Document——随着社区反馈不断增补任何有成功案例的团队都可以向项目方投稿。这份档案的价值在于它展示的不是实验室里的理想化演示而是带有具体量化结果的生产级落地证据。页面将案例划分为十几个类别本文按同样的脉络展开并在每个方向补充仓库内对应的源码、示例与测试佐证方便读者直接对照验证。GEPA 技术底色所有案例共享的核心机制在展开案例之前先明确这些场景共同依赖的优化机制这样后续的指标才有意义。GEPA 的核心是反射式演化用一个通常更强的反射模型阅读评估反馈诊断失败原因再以自然语言提出候选改进方案。整个循环由四个关键环节构成评估Evaluation对候选 prompt/代码运行真实任务产生分数与诊断信息反射Reflection反思模型读取失败样本与可操作辅助信息Actionable Side Information, ASI定位问题变异Mutation生成新的候选可能只针对特定失败案例选择Selection基于 Pareto 前沿而非单一最优选择用于下一轮演化的候选。这些机制在仓库源码中有完整的类型化实现。以面向任意文本工件的optimize_anythingAPIsrc/gepa/optimize_anything.py为例一次调用由三部分组成优化什么seed_candidate单个文本或{组件: 文本}的多组件字典、objective简短目标陈述、background长格式背景说明如何打分evaluator一个返回(score, info)的函数其中info是自由格式诊断字典会被引擎作为反馈呈现给反射模型如何优化OptimizeAnythingConfigsrc/gepa/oa/config.py选择引擎gepa/autoresearch/meta_harness/best_of_n、命名运行并设定预算max_evals评估次数上限、max_token_cost提案成本上限、max_concurrency并发线程数等。仓库示例 examples/blackbox/main.py 展示了经典的评估器 预算控制写法evaluate函数先检查剩余预算再执行候选代码并把 stdout、traceback、预算消耗等全部塞进side_info最后返回(score, side_info)optimize_anything( evaluatorevaluate, seed_candidateSEED_CODE, configGEPAConfig( engineEngineConfig( run_dirfoutputs/blackbox/{problem_index}, max_candidate_proposals20, track_best_outputsTrue, cache_evaluationTrue, ), reflectionReflectionConfig(reflection_lmopenai/gpt-5), ), objectiveEvolve Python code that minimizes a blackbox objective function ..., backgroundBACKGROUND, )类似的配置在 examples/circle_packing/main.py 中出现且额外使用了frontier_typeobjective与RefinerConfig()由 refiner 模型基于评估反馈直接改进候选。这些参数正是 Showcase 中大量案例的共同配方。企业级与生产环境落地Showcase 中分量最重的类别是企业生产特点是优化目标不再是基准分数而是真实服务的成本、延迟、标注效率与可用性。DataBricks90 倍推理成本削减。官方记录显示DataBricks 通过 GEPA 优化企业 Agent实现约 90 倍更廉价的推理且性能保持或提升优化后的开源模型在相关评测中超过 Claude Opus 4.1、Claude Sonnet 4 与 GPT-5各模型类型均有一致的 3–7% 性能增益。其核心洞察是当请求量达到 10 万级时服务成本占 AI 支出的 95% 以上而提示优化让这部分成本变得可持续。Databricks Genie前沿数据 Agent。Databricks AI Research 团队将 GEPA 用于 Genie 的 table search表检索子系统在准确率与成本之间导航专业知识检索本身可带来最高 40% 的性能提升GEPA 则在此基础上针对不同 LLM 后端进一步优化精度与成本。Dropbox Dash相关性判定模型。Dropbox 用 GEPA 优化 Dash 搜索相关性判定器在 gpt-oss-120b 上取得45% 的 NMSE 缩减8.83 → 4.86并把模型适配周期从 1–2 周压缩到 1–2 天对小模型 gemma-3-12b畸形 JSON 从 40% 降到 3% 以下NMSE 从 46.88 改善到 17.26同等成本下可标注的数据量提升 10–100 倍。OpenAI Cookbook自进化 Agent。OpenAI 官方 Cookbook 收录了基于 GEPA 构建自主自愈工作流的教程覆盖诊断 Agent 为何达不到生产就绪、构建自动化 LLMOps 再训练闭环、以及把人工评审、LLM-as-judge 评估与 GEPA 优化组合起来。HuggingFace Cookbook与 DSPy 结合的完整提示优化指南涵盖 LM 配置、数学问题数据集处理、Chain-of-Thought 推理程序构建与基于错误的反馈驱动优化。GoogleADK Gemini Enterprise Agent Platform。GEPA 被 Google 作为官方 Agent 优化引擎内置在开源 Agent Development Kitadk optimizeCLI与 Gemini Enterprise Agent Platform 的Quality Flywheel优化环中其文档描述为该命令应用 GEPA 算法通过针对测试套件的评估迭代精炼根系统指令。配套组件包括LocalEvalSampler与GEPARootAgentPromptOptimizer。Microsoft AIMAI-Thinking-1 预训练数据策管。微软团队在其论文中披露使用GEPA/DSPy 优化 LLM-judge prompt用约 2000 条人工标签调校 Qwen3-30B 评判器用于过滤预训练语料最终得到约 233B token 的高质量数据集——这是 GEPA 进入前沿模型预训练数据管线的公开首例。Nubank1 亿用户客服 Agent。Nubank 在 DSPy 内用 GEPA 优化 LLM-as-a-Judge 提示覆盖五个生产域。优化前后评测准确率从 E1 77.78%→82.00%、E2 68.88%→88.89%评判器跨模型一致性 Cohens κ 从 0.00 提升到 0.745GPT-4.1 vs GPT-4.1-mini优化后 GPT-4.1 vs GPT-4o 达到 κ0.895。其配置细节为autolight约 500 次迭代、反射 minibatch 3、Pareto 选择、GPT-4.1-mini 基础模型 GPT-5.1 反射。由优化后的评估栈驱动下游生产指标包括卡片送达业务37pp 的 AI 交易 NPS与 29pp 自助服务率。生态集成Comet 的 Opik Agent Optimizer 将 GEPA 作为核心优化算法支持 prompt、Agent 与多模态系统BAML 将其集成进baml-cli optimize做多目标准确率、延迟、token提示优化Pydantic AI 教程演示了用Agent.override()注入指令并用 Pydantic Evals 并行评估联系人抽取准确率从 86% 提升到 97%。AI 编程 Agent 与研究工具第二大类围绕代码与 Agent 自身能力的演化Nous Research Hermes Agent以 DSPy GEPA 作为进化式自我改进系统维护解集种群、针对特定失败案例做 LLM 驱动的定向变异、按适应度选择从而自主进化 Agent 的技能、提示与代码。Arc.computer ATLAS用 GEPA 优化后的 Agent 教 LLM 诊断生产故障实现日志、指标与数据库的动态采集减轻值班工程师负担其后续工作ATLAS Augmented进一步显示GEPA 还能增强已经 RL 微调过的教师模型带来142% 的学生性能提升——证明 GEPA 可与 RL 协同而非替代。FireBird Auto-Analyst用 4 个专职 Agent预处理、统计分析、机器学习、可视化覆盖约 90% 的代码运行跨多家模型提供商测试以避免过拟合。安全与对齐社区在 LessWrong 上的研究用 GEPA 优化分类器做 AI 生成代码的后门检测与不安全代码监控以给定误报率下的真阳率衡量安全收益。DeepResearch AgentLangGraph DSPy GEPA 的生产级研究系统对查询规划、并行检索、摘要与差距分析等每个 Agent 角色做模块级 GEPA 优化。RLM-GEPA on AppWorldGabriel Lespérance 将 GEPA 移植为对RLM 技能而非权重的优化未优化的PredictRLM(GPT-5.5 low)已超过公开排行榜0.917 TGC / 0.839 SGC优化后达到0.940 TGC / 0.911 SGC优化器只读取执行轨迹与评估反馈、重写技能指令测试集被保留隔离。这类把技能当作可演化文本的路径与本仓库的 gskill 模块src/gepa/gskill以及自动学习编程 Agent 技能的博客文章方向一致。垂直领域应用医疗多智能体 RAG面向糖尿病与慢阻肺构建双专家子 Agent 向量库检索的 RAG 系统每个 ReAct 子 Agent 用 GEPA 独立优化由主 Agent 编排。OCR 精度Intrinsic Labs 在 Gemini 2.5 Pro / 2.5 Flash / 2.0 Flash 上实现最高38% 的 OCR 错误率下降LanceDB 的 Prashanth Rao 则在低成本gemini-3.1-flash-lite上优化手写药品名 OCR prompt15 分钟笔记本优化使 780 张测试图的归一化匹配从 54.1% 提升到59.4%、平均编辑距离从 1.01 降到 0.87——无需微调或换大模型。该文还专门讨论了 GEPA 指标设计的陷阱编辑距离不应主导目标、验证集大小与探索预算的权衡。市场调研 AI 人设用 GEPA 优化的人设模拟真实焦点小组消除地域限制与场地成本、规避主持人偏差研究周期从数周压缩到数小时。小模型创意写作通过 GEPA 教会 Gemma3-1B 写出有吸引力的虚构故事演示正确的提示可以让小模型胜任创意任务。进阶能力多模态 / VLMOCR通过优化提示策略改善视觉语言模型在 OCR 任务上的表现。Agent 架构自动发现用演化搜索自动发现最优 Agent 设计。仓库配套提供完整的 ARC-AGI 教程docs/docs/tutorials/arc_agi.ipynb与可运行示例 examples/arc_agi/main.py并有博客文章详细拆解 agent 架构搜索过程。对抗性提示搜索GEPA 被用于发现 AI 系统的边界案例与失败模式属于 AI 安全研究的高级应用。不可验证任务Evaluator–Optimizer在缺乏 ground truth 的场景下通过评估器-优化器模式处理主观、非正式的评估目标如创意写作、人设生成这一模式被社区总结为 GEPA 最有价值的使用方式之一。研究与学术界Showcase 记录了密集的学术采用从演讲、基准到同行评审论文关键观点与演讲Berkeley AI Summit 上 Matei Zaharia 的 GEPA 深度讲解其核心论断是FLOPs 越来越便宜但复杂 Agent 任务的 rollout 不会AI 的下一个前沿将受限于 rollout 预算Chris Potts 在 DSPy Meetup 上论证提示优化器为何被低估AI Engineer 大会上则有Judge the Judge工作坊演示从采集 ground truth、用 GEPA 优化到评估 LLM-as-a-judge 的全流程。方法论与基准Veris.AI 的 RAISE 框架用 GEPA 优化 4 轮任务正确率从12.5% 提升到 62.5%在 NeurIPS 2025 展出海报UC San Diego Microsoft 的 DivSkill-SQL 把 GEPA 作为内层技能优化器在 Spider2-Lite 上较 CHASE-SQL 提升 11.1ppSnowflake与 8.3ppBigQuery横滨国立大学的 DD-GEPA 把对话解纠缠 prompt 拆成任务指令、话语表示、输出指令三组件逐一优化F1 从 39.40 提升到 42.52EvoClinician、TRACE、OrchMAS、REVERE、FEM-Bench、AssayBench 等论文则把 GEPA 作为代表性基线或核心方法论。安全 / 对齐 / 控制Biddulph Carroll 发现 GEPA 优化出的 system prompt 会把 reward hacking 策略以明文形式写出来从而让错位可读、可移除Pivotal Research Redwood 用 GEPA 红队化攻击选择提示其优化结果在 BigCodeBench 后门设置中被测为最强攻击之一SecureForgeStanford用 Semgrep CWE 标签奖励作为 GEPA 的核心方法学报告称其在 11 个前沿模型上降低漏洞生成方面统计显著优于 MIPRO。医疗健康临床风险偏倚评估30–40% 关键域提升、临床 NER 零样本提升最高 12.5%IEEE BigData 2025、MEDEC 临床错误检测GPT-5 从 0.669 到 0.785、Stanford 的医学影像 VLM prompt 分诊中位53% 相对提升低零样本任务达 300%–3400%、ASR 错误临床风险评估90% 准确率、κ0.816。编程与硬件Jhaveri Lopes 用小模型生成 OpenACC pragmaGPT-4.1 Nano 编译率从 66.7% 提升到 93.3%、GPT-5 Nano 到 100%还有 Verilog HDL 生成、形式化规格合成、资产定价等扩展方向。新兴应用State of AI Coding 2025 报告Greptile 报告将 GEPA 列为 AI 编码能力的关键进展指出其通过 trace 分析演化 prompt以少得多的 rollout 匹敌 RL 性能。模型迁移工作流社区总结出固定模式——保持 DSPy 程序结构、只更换 LM 初始化、对新模型重跑 GEPA——显著快于手工重调 prompt这对新模型密集发布时代尤其实用。程序合成与 Kernel 优化CUDA kernel、AMD NPU kernel 生成场景中优于 RAG 与迭代精炼尤其适合 rollout 昂贵仿真、长运行时的任务。仓库配套有 examples/circle_packing/main.py几何约束下的程序演化与 examples/blackbox/main.py黑盒数值优化可对照。材料科学探索用 GEPA 优化仿真参数得益于其高样本效率与对昂贵评估函数的兼容性。持续学习与自我改进部署→生产反馈采集→批量反馈再优化→重新部署的闭环模式Letta 的博客进一步讨论了 token 空间中的持续学习。社区集成与生态GEPA 社区生态呈现典型的框架无关特征Weaviate 的播客与手把手 reranker 笔记本、LangStruct 的 Gemini Flash 示例、完整的 Go 实现MIT 协议含 CLI 与示例、Tom Larkworthy 的 Observable JavaScript 笔记本浏览器内直接体验反射式演化、上下文压缩实验、基于 Bandit 原则的安全感知 LLM 开发库 bandit_dspy以及把 GEPA 作为框架无关优化器的 SuperOptiX覆盖 DSPy、OpenAI SDK、CrewAI、Google ADK 等。基础设施与 DevOps多云数据传输成本ADRS 团队用 GEPA 最小化多云数据迁移成本GEPA 自主把朴素复制策略演化为共享树拓扑仅约 5 美元的优化开销就带来 31% 的成本削减。仓库中的 examples/adrs/can_be_late 与 examples/cloudcast 就是这类基础设施仿真实例的落地方案。销售支持多 Agent 路由Databricks 用 GEPA 优化销售支持多 Agent 系统的路由组件路由准确率相对提升75%。自改进 AgentGEPA TRMGEPA 负责编排/prompt 优化TRMTest-time Reasoning Modification负责推理增强形成无需人工干预的持续监控与自动再训练闭环。创意与生成应用AI 声音/人设发现用 8 维评分视角、权威度、节奏韵律等做多目标引导寻找真实的 AI 声音类人回复生成优化 AI 生成更自然、更像人的回复并保持真实人设非显然的 GEPA 经验社区博客专门总结实践中的边界案例、意外行为与进阶模式例如精确反馈你把问候与融洽混为一谈能带来定向修复。数据处理与合成合成数据生成优化查询生成管线以产出高质量合成数据集例如某项目用 GEPADSPy 优化查询生成区分文档对为 Gemma embedding 微调生成 5 万样本Text2SQL把 system prompt由 GEPA 演化与含动态内容的 user prompt 分离或用 DSPy signature 实现 text2sql企业级 Agent 实战社区博客总结了用 GEPA 处理非结构化数据、任务分解与上下文爆炸的经验强调模块化 Agent 设计与低成本部署策略。社区教程与指南Showcase 还收录了大量高质量教程多数在本仓库内能找到同源的可复现路径DSPy 3 GEPA 高级 RAG 框架、MarkTechPost 反射式提示优化教程从 LiteLLM 安装、结构化评估器、多组件 prompt 到留出验证与演化历史分析结构化抽取提升 20 个百分点其关键洞察是优化不仅能提性能还能把能力迁移到更便宜的模型上改善应用成本曲线GEPA 影响分析81% → 90%约 3 小时、约 $0.50 完成销售通话记录分析作者总结我把提示从写出来变成演化出来——我的工作从雕琢完美提示变成定义什么是好让系统去找Decagon 的生产化优化19 组消融实验指出 20–100 个样本的数据效率甜区优于更大数据集并通过长度正则化实现约 4 倍 prompt 压缩零成本可复现示例完全在 OpenRouter 免费层完成的三个端到端运行发现一个反直觉的结论——基线饱和32B/8B 级任务模型在小学算术上零变异被接受没有失败信号就没有反射改用会失败的 1.2B 小模型Liquid LFM 2.5后数学推理从 45% 提升到 70%同时区分了格式问题 vs 知识问题RAG QA 的 18.85pt 来自一致的引用格式而非新知识。静态层 vs 运行时层Quarq Labs 将 GEPA 与递归语言模型RLM视为同一问题的互补路径——GEPA 优化静态层指令、检索查询、Agent 脚手架RLM 处理运行时动态层。国际社区覆盖GEPA 在多个语言社区获得广泛传播日本社区有视频讲解、Databricks Free Edition 上的 MLflow GEPA Qiita 教程、火影风格对话创意应用、GMO 互联网集团 AI Lab 的 DSPy ReAct 示例等中文社区亦有相关技术文章与解读。在本仓库中复现与验证Showcase 记录的是外部结果而本仓库为动手验证提供了完整的一手材料快速上手docs/docs/guides/quickstart.md 提供三条路径——gepa.optimize默认适配器、optimize_anything通用 API、以及推荐用于提示优化的dspy.GEPA强调带文本反馈的 metric 是 GEPA 发挥威力的关键。适配器体系docs/docs/guides/adapters.md 与 src/gepa/adapters 下的 default、dspy、dspy_full_program、langchain、mcp、generic_rag、confidence、terminal_bench、anymaths 等适配器对应 Showcase 中多种集成模式。可运行示例examples/ 目录覆盖黑盒优化blackbox、几何程序合成circle_packing、数学推理aime_math、Agent 架构发现arc_agi、置信度校准confidence_adapter、基础设施仿真adrs、cloudcast等 Showcase 提及的典型场景相关指标卡如 aime、pareto frontier也有对应测试tests/test_aime_prompt_optimization、tests/test_pareto_frontier_types、tests/test_parallel_proposals.py。进阶专题关于优化任意工件、大规模并行提案、评估服务器等机制的深入讨论见 docs/docs/blog/posts/2026-02-18-introducing-optimize-anything/index.md、docs/docs/blog/posts/2026-07-30-parallel-proposals/index.md 与 docs/docs/blog/posts/2026-04-09-gepa-at-scale-with-combee/index.md。API 参考docs/docs/api/index.md 提供GEPAConfig、ReflectionConfig、MergeConfig、optimize_anything等全部组件的签名级文档。小结从这份 Showcase 档案可以提炼出几条贯穿始终的经验第一反馈质量决定优化上限——结构化的、可操作的诊断信息ASI远比裸分数有效第二任务 LM 与反射 LM 需要分层选型——反射模型要够强而任务模型要有足够多的失败信号供 GEPA 反射第三成本是头等公民——GEPA 的典型收益不仅体现在准确率上更体现在以极低成本把能力迁移到小模型、压缩服务成本与缩短模型适配周期第四GEPA 是通用演化引擎而非提示专用工具——它同时作用于代码、Agent 架构、基础设施配置与数据管线正如 examples/ 目录与optimize_anythingAPI 所示。若想深入了解某个案例背后的机制最直接的方式是回到仓库读对应的示例代码、跑对应的测试再对照 API 文档中的配置项逐一调整——这也是 Showcase 页面真正的价值所在它是一张地图而仓库是可随时展开的完整工具箱。赞分享AI Agent提示工程模型优化【免费下载链接】gepaOptimize prompts, code, and more with AI-powered Reflective Optimization项目地址https://gitcode.com/gh_mirrors/ge/gepa点击查看免费下载相关推荐Virgilio 机器学习应用案例全景指南从研究到产业的落地路径与前沿趋势Virgilio 机器学习应用案例全景指南从研究到产业的落地路径与前沿趋势 本文是 Virgilio 开源数据科学学习项目见 项目主页 https://li机器学习教程深度学习Qlib实战案例从研究到生产Qlib实战案例从研究到生产 本文详细介绍了基于Qlib平台构建完整量化投资策略的全流程涵盖从沪深300指数 CSI300 策略设计、多因子模型构建、风险控金融科技人工智能机器学习数据分析强化学习如何快速上手compose-pokedexJetpack Compose新手入门指南如何快速上手compose pokedexJetpack Compose新手入门指南 想要学习现代Android开发技术吗compose pokedex项目移动开发前端上一篇MarkDownload网页内容转Markdown的终极解决方案下一篇数据伦理终极指南隐私保护与合规性实践手册创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考