关于Agent工程落地
提示词工程编写高质量System prompt 通用规范有哪些好的系统提示词要讲清 AI 身份明确要做什么、不能做什么规定输出格式给标准案例遇到无资料情况写好兜底回答用分隔符隔开用户内容防注入。什么是提示词分层指令优先级需要注意什么提示词的排列顺序如下最前面分优先级、安全格式这类硬性规定。中间任务规则。最后用户问题和参考资料。前面的指令优先级更高用户输入无法覆盖核心约束。如何使用分隔符隔离用户输入防御prompt注入1.使用固定特殊分隔符如、)包裹全部用户输入、上传文档内容2.在系统提示词明确告知模型仅分隔符内为用户内容分隔符外部的系统指令不可被修改3.识别用户输入内的伪造分隔符提前转义清洗4.禁止用户输入与系统指令拼接无边界文本5.搭配内容过滤拦截“忽略上文”类注入关键词。用固定符号把用户输入完整包起来明确告诉模型符号外的规则不能被修改同时过滤用户写的伪造分隔符和覆盖指令防止篡改系统规则。要求模型输出固定JSON格式常有哪些方案提示词软约束后端解析JSON去除掉口水词Pydantic 校验解析出来的 JSON 用 Pydantic 模型去校验——类型对不对、必填字段有没有。如何通过Prompt约束模型禁止编造不存在信息提示词软约束降低Temperature增加校验指令生成答案前自查信息是否存在于参考文本。提示词版本如何管理生产环境版本怎么控制统一存入配置中心每条提示词绑定版本号更新记录支持ABtest版本回滚机制记录每版效果指标工程化Java后端融合AISpring AI是什么Java项目如何整合大模型APISpring AI是Spring生态专门对接大模型的工具一套代码兼容各家大模型Java项目引入依赖配置密钥就能同步或流式调用还自带向量库RAG工具调用能力不用自己封装Http请求Java微服务架构中AI能力如何封装独立服务同步调用VS异步调用封装方案接入层接收前端/业务微服务请求鉴权限流AI核心层封装LLMRAGAGent向量操作存储层向量库对话MySQL消息队列同步短会话单轮对话低延迟需求实时返回流式结果异步大批量文档向量化长报告生成批量知识库处理AI接口高并发场景如何设计线程池隔离防止拖垮业务系统单独开一套线程池专门处理 AI 请求与业务线程分开互不影响限制最大并发高峰使用消息队列缓冲防止调用大模型阻塞占用业务线程。如何缓存Embedding向量高频问答结果降低模型调用成本高频问题和重复文本的向量存在Redis中下次直接复用不在调用Embedding模型知识库更新清理对应缓存大幅减少API 调用次数省钱。使用Sentinel/Resilience4j对大模型接口实现熔断限流降级限流按QPS限制AI接口并发超出返回兜底话术熔断连续失败达到阈值打开熔断器一段时间直接降级降级策略缓存结果兜底固定标准回答切换备用模型线程隔离AI接口独立资源池故障不扩散业务AI服务全链路日志监控需要哪些指标调用指标错误率超时率耗时指标总耗时Embedding耗时LLM生成耗时检索耗时Token指标业务指标问答准确率幻觉率工具调用成功率资源指标线程池占用向量数据库查询延迟安全指标Prompt注入拦截次数高危工具调用大模型调用全链路耗时优化全链路延迟瓶颈一般在哪里LLM模型推理耗时多路召回Rerank金牌检索耗时大批文档向量化AI业务数据安全用户对话知识库数据如何防泄露传输全程HTTPS加密数据库对话知识库字段加密存储多租户逻辑隔离细粒度权限检索本地部署ollama你做过的RAG项目最大难题是什么如何排查优化最大痛点检索相关性差问答幻觉高整体准确率低。排查步骤检索层排查查看召回文档相似度分数判断是否多路召回缺失。分块排查若切块太大切断了知识点需调整重叠改用递归切块。Embedding 模型评测更换中文专项向量模型。增加 Rerank 环节过滤无关内容。优化 Query 改写拓展并标准化用户口语提问。提示词增加溯源约束降低幻觉如果RAG问答准确率不足你会按照什么顺序迭代优化迭代优先级从低成本到高成本优化 query 预处理改写、拓展、纠错成本最低见效快。增加 rerank 重排序。调整 chunk 大小与重叠优化切分策略。完善多路召回向量加 BM25。更换更高精度中文 embedding 模型。清洗知识库噪声过档过期文档。提示词强约束溯源防幻觉。如何评估一套AI Agent项目上线效果有哪些观测指标任务完成率Agent 能否完整走完用户需求。工具调用指标工具选择准确率、参数错误率。回答指标幻觉率、答案完整度、用户满意度。工程指标平均耗时、QPS、报错熔断次数。成本指标单会话平均 token 消耗。业务指标人工转接率、工单自动处理占比。对比demo项目和生产级AI应用需要额外增加哪些模块权限与租户隔离模块限流、熔断、降级、容错全链路日志监控告警异步消息队列处理批量任务缓存体系降成本数据加密、隐私脱敏安全模块版本管理、灰度发布异常处理、人工兜底流程知识库增量同步、过期清理效果自动化评测平台如何控制AI应用项目成本从模型调用、向量存储等多个角度说明。模型调用层面(a) 高频问答向量缓存(b) 简单任务用低成本小模型© 限制 Agent 最大调用步数(d) 分层推理向量存储(a) 合理 chunk 粒度减少向量总量(b) 冷热数据分离归档© 选择低成本向量索引工程层面(a) 异步批量向量化(b) 消息队列削峰减少瞬时调用© 知识库定期清理归档选型层面(a) 高频私有化用开源模型 Ollama(b) 低频短期用商用 API什么场景优先选用 Agent 方案单纯 RAG 无法满足需求。以下场景优先使用 Agent需要处理外部业务数据库、API、工单、订单等实时数据。多步骤链式任务需要分步执行、循环校验。用户需求动态多变无法固定检索条件。需要多工具组合、多角色分工协作。自动执行操作如新建工单、生成报表、SQL 查询代码执行。纯 RAG 只能读取静态文档无法操作外部系统进行多步处理。