让插图更好看的3种模式:AutoFigure AI图像增强功能(none/code/code2prompt)完整解析

发布时间:2026/10/11 1:26:44
让插图更好看的3种模式:AutoFigure AI图像增强功能(none/code/code2prompt)完整解析
让插图更好看的3种模式AutoFigure AI图像增强功能none/code/code2prompt完整解析【免费下载链接】AutoFigure项目地址: https://gitcode.com/gh_mirrors/au/AutoFigureAutoFigure 是一个开源的 AI 科学插图生成系统ICLR 2026能从文本描述或论文 PDF 自动生成可发表级别的科学插图。其中最实用的亮点是AI 图像增强Beautification功能——它提供none、code、code2prompt三种增强模式把简单的黑白布局草稿一键变成色彩专业、可直接用于论文和博客的精美科学插图。本文将带你完整看懂这三种模式的原理、区别和选择技巧。 AutoFigure 图像增强是做什么的在生成流程中AutoFigure 会先输出一张黑白布局图基于 mxGraph XML / SVG 的方框 箭头草稿。布局虽然准确但离 publication-ready可发表级别还差一步。图像增强就是在布局定稿后调用图像生成模型按你指定的艺术风格Art Style对草稿进行视觉美化把灰底的[icon]: 描述占位矩形替换成真正的小图标保留草稿中所有外部文字标签一个字符都不改应用你指定的配色、阴影、渐变等风格化效果增强功能的核心实现在 autofigure/enhancer.py 的ImageEnhancer.enhance()方法中input_type参数就对应三种模式none、code、code2prompt默认值在 autofigure/config.py 中定义为code2prompt。 三种模式一图看懂模式给 AI 的参考信息需要的 API适用场景none仅布局 PNG 图片只需图像生成 API快速美化、快速出图code布局 PNG 原始 SVG/XML 代码只需图像生成 API需要严格还原坐标与结构SDK 支持code2prompt布局 PNG LLM 生成的详细提示词需要 LLM 图像生成双 API追求最高质量官方推荐三种模式的提示词构建逻辑都在 autofigure/enhancer.py 的_build_enhancement_prompt()中可以按你的兴趣直接阅读源码。1️⃣ none 模式直接美化最省心none模式不使用任何代码参考直接把布局图片交给图像模型由 AI 视觉理解画面哪些方框要保持位置比例、哪些灰色占位块要换成图标、哪些文字必须原样保留。它的优点是链路最短——只需配置一个图像生成 API无需额外的 LLM。缺点是 AI 只能看图说话对复杂图形的细节还原依赖图像模型自身的能力。适合场景图比较简单、想快速看看美化效果、或者不想多配一套 LLM API 的情况。2️⃣ code 模式让代码当工程图纸code模式SVG code 参考模式会把原始 mxGraph XML / SVG 源码最多 5000 字符作为TECHNICAL REFERENCE技术参考随图片一起提交给图像模型提示它严格按照代码中的坐标、尺寸、连接关系来绘制。可以把它理解为none 给 AI 一张照片code 给 AI 一张工程图纸结构还原度更高。需要注意的是code 模式目前主要在Python SDK中支持在 autofigure/agent.py 的generate()参数里传enhancement_input_typecodeSDK 会自动读取生成的 SVG/XML 文件作为增强输入见 autofigure/agent.py。Web 端美化对话框只提供 none 和 code2prompt 两个选项。3️⃣ code2prompt 模式两步走的推荐方案code2prompt是界面中标注Recommended推荐的模式也是 autofigure/config.py 里的默认值。它分两步走第一步LLM大语言模型逐行分析 mxGraph XML 代码识别占位图标[icon]:前缀、箭头连接、文字标签和空间关系生成一份结构化的详细绘图提示词包含整体场景、视觉元素、需保留文字、风格实现、布局连接 5 个部分。核心函数是 autofigure/enhancer.py 的convert_code_to_text2image_prompt()。第二步图像模型图像模型拿着这份文字说明书 布局草稿 艺术风格来渲染最终插图。因为提示词已经把代码中的每个元素都翻译成了具体的视觉描述图像模型收到的指令远比看图美化精确最终效果最好。代价是需要同时配置 LLM API 和图像生成 API两套密钥。一个贴心的细节如果 LLM 转换提示词这一步失败后端会自动降级回 none 模式继续美化不会直接报错逻辑见 backend/autofigure_routes.py。️ 三步上手如何开启图像增强无论哪种模式都需要先完成布局定稿Finalize。之后的操作很轻量填写艺术风格在美化对话框中描述你想要的风格例如modern scientific illustration with pastel colors所有模式共用这一风格描述art_style参数。选择增强模式Web 界面打开美化对话框二选一Direct Beautification noneCode2Prompt code2prompt对应组件是 frontend/components/autofigure/BeautificationDialog.tsx模式类型定义在 frontend/lib/autofigure-types.ts。Python SDK调用generate()时传enable_enhancementTrue并用enhancement_input_type指定none/code/code2prompt三种模式中的任意一种。配置 API 密钥并选择变体数量所有模式都必填图像生成 APIProvider / API Key / Model / Base URLcode2prompt 额外必填 LLM API Key。enhancement_count参数可一次生成多个候选变体方便对比挑选。增强结果会保存为xxx_enhanced.png多变体时带_1、_2编号与原草稿放在同一输出目录对比查看很方便。❓ 新手常见问题Q1没有 LLM API Key 能用增强功能吗可以。选择 none 模式Web 和 SDK 都支持只配置图像生成 API 即可。Q2code 模式和 code2prompt 模式到底差在哪两者都是拿代码当参考。code 是直接把源码贴给图像模型code2prompt 是先让 LLM 把源码翻译成自然语言绘图指令再交给图像模型。后者指令更明确、对占位图标和文字保留的处理更精细因此官方推荐。Q3文字会不会被 AI 改错三种模式的提示词都明确要求外部文字必须逐字保留、[icon]:说明文字必须替换为图标且不留残余但 AI 生图仍有个别字符误差的可能建议开启多个变体并逐字核对关键标签。Q4支持哪些服务商图像生成侧支持 openrouter、bianxie、gemini 三家见 autofigure/config.py 的默认模型配置代码层面三者由 autofigure/enhancer.py 分别调用不同的 API 格式切换只需改enhancement_provider。 小结none只看图直接美化配置最简单适合快速出效果code附带源码当图纸结构还原更严格SDK 用户优选code2promptLLM 翻译 图像渲染两步走质量最佳是官方默认推荐三种模式共用同一套艺术风格描述与多变体机制配合 AutoFigure 的迭代生成能力从能看懂的草稿到能发论文的插图只差一次点击。想深入了解完整流水线可以继续阅读 autofigure/agent.py 中的生成与增强编排逻辑。【免费下载链接】AutoFigure项目地址: https://gitcode.com/gh_mirrors/au/AutoFigure创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考