DALL-E 高效工作流:与 AI 协作的最佳实践
我为什么开始认真研究 DALL-E
去年年底,我接了一个独立项目的活:为客户的一款理财 App 做整套宣传物料,包括落地页配图、社交媒体帖子、博客头图。按老办法,我得外包给插画师,预算有限不说,来回改稿至少要两周。当时我刚开始用 ChatGPT Plus,顺手试了试 DALL-E 3,结果第一张图就让我愣住了——虽然不完美,但方向对了七成。
问题来了:为什么有时候一句话就能出好图,有时候改十几遍还是不行?接下来三个月,我在实际项目里摸索出了一套稳定的工作流。这篇文章就是我把踩过的坑和有效的方法整理出来的结果。
第一步:别急着写提示词,先明确“图的任务”
我最初的错误是拿到需求就开始写提示词。比如客户说“要一张体现财务自由感觉的图”,我直接输入:
一张体现财务自由感觉的图片
出来的东西是一堆金币和自由女神像的奇怪混合体,完全不能用。
后来我养成了习惯,写提示词之前先回答三个问题:
- 这张图用在哪?(落地页 hero 图?文章配图?社媒方图?)
- 画面主体是什么?(一个人?一个场景?一个抽象概念?)
- 什么风格是“对的”?(扁平插画?写实照片感?3D 渲染?)
同样是“财务自由”,用在博客头图时我最后用的是:
扁平插画风,一个人坐在山顶的躺椅上看日出,身边放着打开的笔记本电脑,远处是连绵的山脉,配色以橙色和深蓝色为主,留白较多,适合作为博客头图,宽屏比例
这张图客户一次通过。关键不在于词有多华丽,而是把用途、主体、风格全部说死。
我总结的提示词结构模板
用了大概五十多次之后,我把提示词固定成了这个结构:
[风格] + [主体与动作] + [环境/背景] + [构图/视角] + [配色/光线] + [用途约束]
举几个实际用过的例子:
产品场景图:
写实摄影风格,一杯冒着热气的咖啡放在木质书桌上,背景是虚化的笔记本电脑和绿植,晨光从左侧窗户照入,浅景深,正方形构图
App 配图(插画类):
现代扁平插画,一个年轻人用手机查看图表,表情轻松愉悦,背景是简洁的几何图形装饰,主色调蓝绿色,无文字,16:9 比例
注意最后那个“无文字”——这是我踩坑踩出来的。DALL-E 早期版本生成中文基本必乱码,英文偶尔能对但经常拼错。所以现在我所有提示词都会加上“无文字/不含任何文字”,文字后期用 Figma 或 Canva 自己叠上去。
迭代技巧:改提示词,而不是碰运气
新手最常见的问题是一张图不满意就换个完全不同的提示词重抽。我一开始也这样,结果全靠随机的好运气。
正确做法是把 DALL-E 当成一个“理解字面意思、但会过度发挥的合作者”。它每次生成其实都在执行你的描述,所以迭代要做减法和加法,而不是推倒重来。
举个例子,我做一张“远程办公”主题的配图:
第一版提示词:
插画风,一个人在家办公
出图:人物在厨房桌子上,背景太乱。
第二版(加约束):
插画风,一个人坐在整洁的书房书桌前用笔记本电脑办公,背景是书架和一盆绿植
好多了,但人物是背影,缺少情绪。
第三版(只改一个问题):
插画风,一个微笑的年轻女性坐在整洁的书房书桌前用笔记本电脑办公,正面视角,背景是书架和一盆绿植
第三版直接可用。每轮迭代只解决一个明确的问题,这是效率的核心。如果同时改三个问题,你都不知道是哪个改动起效了。
批量生产:用变体思维做整套物料
那个 App 项目后期,客户要 12 张风格统一的社媒图。一张张写提示词肯定风格会飘。我的做法是先打磨出一张“母图”,确认风格,然后固定风格描述部分,只替换主体:
固定部分:
现代扁平插画,主色调蓝绿与橙色,简洁几何背景,无文字,方形构图
可变部分依次换成:查看图表的人、手机支付场景、储蓄罐、上升的箭头与人物……
12 张图的风格一致性大概能做到 80% 以上。剩下不到两成的色差,后期统一加一层调色就解决了。另外一个小技巧:把母图的生成编号记下来,如果某个变体崩了,可以用“参照编号 XXXXXXX 重新生成,把主体换成 XX”(DALL-E 3 在 ChatGPT 里支持通过 gen_id 引用之前的图)。
三个我常踩的坑
1. 它会自作主张加东西。 我让它画“书桌上放着咖啡”,它经常多加一只猫。后来我学会了在提示词末尾加“画面中只有:……”来限定元素清单。
2. 手部和文字依然是弱项。 人物手指数量诡异、文字乱码这类问题,与其反复重抽,不如换个构图(比如人物背影、特写局部)绕开,或者后期修。
3. 别指望一次出图,预算 3-5 轮迭代。 我现在给自己定的预期是:简单图 1-2 轮,复杂场景图 3-5 轮。把迭代时间算进项目排期,心态会好很多。
我的完整工作流总结
- 明确用途、主体、风格(3 个问题)
- 按模板写提示词,带上“无文字”和比例要求
- 生成后逐项检查:风格对不对?主体对不对?有没有多余元素?
- 每轮迭代只改一个问题
- 批量需求先做母图,再复制风格做变体
- 文字和精修放回 Figma/Photoshop 处理
诚实的局限性评估
- 复杂逻辑场景不行:比如“三个人围桌讨论,其中一人指着屏幕上的折线图”,人物关系和视线经常出错。
- 精确构图控制弱:想要“左边 1/3 是产品,右边 2/3 是人物”,只能靠反复描述碰,不如专业设计软件可控。
- 一致性有上限:同一个角色跨图出现,长相很难完全一致,做连续漫画角色还是费劲。
- 版权要注意:商用前确认客户对 AI 生成物料的接受度,别直接拿来当品牌主视觉。
总体来说,DALL-E 对我这种“量大、风格统一要求中等、deadline 紧”的工作是真正的效率倍增器——那个原本要两周的物料项目,实际三天交付。但它替代不了设计师的判断力,它能做的是把你脑子里已经有雏形的画面快速变成成品。提示词写得越清楚,它就越像一个靠谱的执行者。