AI 画的图改不了字?DrawAI 把一整张位图解压回图层

🧠 大模型影像论文精读 · 2026-09-02 · Image Editing · Multimodal Agent · SVG · Benchmark
arXiv 2026-08 · 图像可编辑化重建:把位图还原成可编辑的 SVG/PPTX 源文件

这篇论文有意思的地方在于它不是又一个「更能修图」的模型,而是反过来:把生成模型吐出来的那张死像素图,重新解压成可以选中、改字、挪动、换色的 SVG / PPTX 源文件。

问题:AI 交得出成品,交不出工程文件

用文生图或 AI 修图做设计的人都撞过同一堵墙。模型给你的永远是位图——每个像素是什么颜色都定了,但「这是一行标题」「这是一个按钮」「这两根线连着同一个框」这些结构性事实全部丢失了。想改个错别字、换个 logo、把海报改成竖版,只能整张重画,或者在像素上硬修。

真实的设计工作流不是这样运转的。做幻灯、海报、电商图、论文配图,交付物是带图层的源文件,改稿就是在图层上动。也就是说,AI 已经能把「成品」做得很漂亮,却没把「工程文件」一起交出来。

那让模型直接生成一个 SVG 行不行?可以试,但一次性把复杂版面写成矢量代码,模型经常顾此失彼:元素漏了、坐标错了、文字压在图形上。这里还有个内在两难——保真和可编辑天生打架:把整张图原样嵌进去最保真,但一个元素都选不中;切成无数碎片最可编辑,视觉细节又容易散架。

https://arxiv.org/html/2608.00548v1/teaser2_model_icons.paper.png

关键转折:把「文件」换成「程序」,再用闭环改稿

DrawAI(arXiv:2608.00548)的转折有三处。

第一,把建模对象从文件换成程序。它不让模型一口气输出 SVG 文件,而是写一段可执行的绘图程序,跑一遍才得到图——作者称之为 image-as-code。程序是可以改的,这正是后面能闭环改稿的前提。

第二,把「看懂图」和「写出代码」拆给两个智能体(agent:让大模型自己规划步骤、调工具、看结果再改)。解析智能体先用分割大模型 SAM3 把图里的候选元素抠出来(SAM3 即把图中每个物体圈成区域的视觉大模型),再用 OCR 认出文字,然后去重、补漏、对齐语义,落成一份明确的重建计划:文字、公式、形状、表格、连接线重建为原生图元;照片和复杂纹理走另一条路——抠出前景直接保留,破损处交给图像生成模型修补。

第三,闭环改稿。重建智能体每写一版代码就渲染一次,和原图对比,诊断结构、语义、风格上的差异,再回改代码,最多迭代五轮。相当于一个不知疲倦的设计师在「改稿—比对—再改」。

为了让「做得像」和「好不好改」能同时打分,作者还建了基准 DrawAI-Bench:39 条标准,一半是规则可算的指标(文字认得对不对、区域对得齐不齐),一半是让视觉大模型按打分表评判的定性项(层次清不清晰、连接线方向对不对),覆盖图表、科研图、幻灯、海报四类版面,测了 13 个前沿模型、5 种 agent 运行框架。

最有信息量的结果是:挂上这套工作流后,可编辑性得分从 56.4 涨到 74.0,保真却只从 75.7 涨到 78.7。多轮 agent 结构补的主要是「结构」这块短板,而不是把像素修得更像——这恰好是单次前向生成的模型做不到的部分。

它可能先进哪些工作流

设计交付:AI 出图直接带图层,海报改尺寸、电商图换文案不再重画。对 Canva、稿定这类模板化设计工具,这是接住 AI 产物的入场券。存量资产:无数只有 PNG 的老海报、老幻灯、别人论文里的图,可以反向拆回图元重排复用。评测口径:「可编辑性」成为独立维度进入图像模型评价——今天几乎没有产品把它当指标,而 DrawAI 的数据说明它才是难点所在。

局限与存疑

照片类内容并没有被真正矢量化,只是「抠出来保留」,可编辑的边界止步于图元层。多轮 agent 循环不便宜:论文给出的成本—质量曲线里,最贵与最便宜的「模型×框架」组合成本差约两百倍,质量只差三十几分,工程落地必须精挑配置。另外,自动评分有一半靠大模型当裁判,作者虽用专家一致性检验做了背书,「用模型评模型」的循环风险仍然存在——这恰恰是接下来这类工作最需要被独立验证的地方。

论文来源:arXiv 原文 ↗

← 返回 大模型影像论文精读