课程库 › AI 视觉生成 › 生成与提示基础 › 第 2 课
把提示词写成视觉设计说明书
普通课约 50 分钟
本课导读
网上流传的提示词大多是"关键词堆砌":masterpiece, best quality, 8k, ultra detailed...。这套写法在早期模型上确实管用,但对现在的模型基本是噪音——新一代模型理解的是自然语言的完整描述,堆砌反而制造提示冲突。本课教你把提示词升级成结构化的视觉设计说明书:十二个槽位、两类约束、一套冲突排查法,外加四个可复用的场景模板。这是全 Track 复用率最高的一课。预计 50 分钟。
心智转换:你不是在"许愿",是在"下单"
你在主线里学过给大语言模型写结构化提示(角色/任务/格式/约束)。图像提示词是同一件事的视觉版:把"我想要一张好看的图"这种愿望,翻译成模型可执行的规格。
区别在于视觉规格有自己的维度体系。一句"一只猫在窗边"留下了大量空白:什么品种?什么姿态?窗外是白天还是黄昏?镜头离多远?光从哪来?——每一个没写的槽位,模型都会用训练数据里的"平均值"替你填上。提示词写作的本质,就是决定哪些槽位自己填、哪些放心交给模型。
十二槽位结构
把一条完整的视觉提示按下面的顺序组织(不是每条都要写满,而是检查清单——过一遍,确认空着的槽位是"故意留白"而不是"忘了"):
① 目标与用途 这张图拿来干什么(海报/电商图/头像/概念图)
② 主体 谁/什么东西,数量、外观、特征
③ 行为 主体在做什么,姿态、动作、表情
④ 环境 在哪里,背景元素,时间,天气
⑤ 构图 主体在画面哪里,前中后景,留白,画幅
⑥ 镜头 景别(特写/半身/全景),视角(平视/俯拍/仰拍),焦段感
⑦ 光线 光源方向、硬软、色温、氛围(下一课展开)
⑧ 材质 表面质感:皮肤、金属、织物、纸张…
⑨ 色彩 主色调、配色倾向、饱和度
⑩ 文字 画面里要出现的文字内容、位置、风格(没有就明确"无文字")
⑪ 限制条件 不要什么:元素、风格、构图禁区
⑫ 输出格式 比例、分辨率、张数
一个完整例子(产品摄影场景):
电商详情页主图(① 用途)。一只哑光黑陶瓷咖啡杯(② 主体),
杯口有少量热气升起(③ 行为),放在原木桌面上,背景是虚化的
清晨厨房(④ 环境)。杯子位于画面右侧三分之一处,左侧留白
用于后期加文案(⑤ 构图)。产品特写,平视角度,浅景深(⑥ 镜头)。
左侧窗光,柔和自然光,偏暖色温(⑦ 光线)。陶瓷哑光质感清晰,
木纹可见(⑧ 材质)。整体米白+黑的低饱和配色(⑨ 色彩)。
画面中不出现任何文字(⑩ 文字)。不要多余道具,不要人手,
背景不要出现窗框实体(⑪ 限制)。3:4 竖版(⑫ 格式)。
提示
注意 ⑤ 里的"左侧留白用于后期加文案"——把下游用途写进提示是职业用法和玩票的分水岭。模型不知道你要拿图去干什么,除非你告诉它。
两类约束:肯定式优先
- 肯定式约束:描述你要的。"背景干净的纯色摄影棚" 优于 "背景不要乱"。
- 否定式约束:描述你不要的。放在 ⑪,或模型支持的负面提示(negative prompt)里。
经验法则:能用肯定式表达的就不用否定式。原因有二:其一,部分模型对否定句理解不稳定,"不要伞"反而让"伞"这个概念进入生成过程(类似"不要想大象");其二,肯定式描述信息量更大——"晴朗的黄昏"比"不要下雨"多传达了光线、色温、时间三层信息。否定式留给真正的禁区:明确不能出现的元素、版权风险物、品牌禁忌。
提示词的三种失败模式
1. 提示冲突。"极简构图"+"丰富的细节装饰"、"正午阳光"+"漫天星空"——模型不会报错,它会悄悄折中或随机丢弃一边。写完通读一遍,专查互相打架的描述。最隐蔽的冲突是槽位间冲突:⑥ 写了"大特写",④ 却描述了一整条街道的环境——特写镜头里根本装不下。
2. 语义优先级失控。提示词不是所有词权重均等:越靠前、越具体、重复出现的概念权重越高。把最重要的内容放在前三分之一;次要氛围词放后面。如果某个要素总被忽略,把它前移、或单独成句强调,比加十个感叹号有效。
3. 长提示失效。超过一定长度后,模型对中段内容的遵循度明显下降(和你学过的长上下文"中间遗忘"是同一现象)。对策是提示压缩:删掉不影响画面的修饰词("非常""极其""令人惊叹的"几乎都是废字),合并同义描述,一句话只承载一个视觉决定。一条好提示的形态是每句话都对应画面上一个可验证的事实。
四个场景模板
以下模板直接复制后替换【】内容即可用,也是本课作业的起点:
模板 A:产品摄影
【用途:电商主图/详情页】。【产品名+材质+颜色】置于【台面材质】上,
【一个让画面活起来的细节:热气/水珠/光斑】。背景【纯色/虚化环境】。
产品占画面【比例/位置】,【留白方向】留白。平视/微俯视,浅景深,
产品边缘锐利。【光线方向+软硬+色温】。真实商业摄影质感,无文字,
不要人手,不要多余道具。【画幅比例】。
模板 B:电影感场景
电影剧照质感。【角色描述】在【场景+时间+天气】,【正在发生的动作,
带方向性】。【景别+机位角度】,画面遵循三分法,主体位于【位置】。
【光源:霓虹/路灯/月光/窗光】形成【顺光/侧光/逆光/剪影】,
色调【冷暖倾向】。轻微胶片颗粒。宽画幅 21:9 或 16:9。
模板 C:编辑插画(杂志/公众号配图)
概念插画,配合主题「【文章主题】」。用【视觉隐喻:迷宫/天平/齿轮…】
表现【抽象概念】。【扁平/肌理/线条】风格,【2-4 种主色】的有限配色,
大面积留白,构图居中/对称。无文字,无渐变滥用,风格统一。方图或横图。
模板 D:海报设计
【活动/产品】宣传海报。视觉主体是【核心图形】,位于画面【位置】,
为标题预留【顶部/底部】约【比例】的空间。风格【复古印刷/瑞士极简/
赛博霓虹…】,【配色方案】。画面需要的文字仅:「【标题文案】」,
【字体风格描述】,其余文字后期添加。竖版 2:3。
注意
模板 D 故意只让模型生成主标题一行字:当前模型渲染大段文字仍不可靠(第 5 课专门处理图内文字),正文信息交给后期排版工具才是生产级做法——让每个工具干自己擅长的事。
迭代方法:单变量 + 实验日志
写提示词不是一锤子买卖,而是实验循环:生成 → 对照槽位找差距 → 只改一个变量 → 再生成。一次改一处才能知道是哪个改动起了作用——这就是上一课"四层归因"在提示层的落地。
从本课开始建立你的提示词实验日志(推荐直接用本站笔记,或任何你顺手的地方):
## 实验 #003
日期:2026-07-21 模型:___(版本__)
目标:黄昏天台的电影感人物剪影
提示词 v2:(全文粘贴)
相对 v1 的改动:仅将「侧光」改为「逆光剪影」
结果:剪影成立,但人物边缘光晕过强
下一步:v3 在 ⑪ 加「不要强烈光晕」→ 若无效则归因模型,换模型试
坚持记录两周,你会得到一份属于你自己的模型脾气手册——哪个模型吃哪种表述,网上任何教程都替代不了。
动手任务
基础路线(约 50 分钟):从四个模板里挑两个不同场景,各完成一轮三次迭代(v1 → v2 → v3,每次只改一个变量),把过程记进实验日志。验收标准:v3 相对 v1 有肉眼可见的、朝你目标方向的改进,且你能说出每一版改动的归因。
进阶路线(可选):把你 v3 的最终提示词交给另一个层级的模型,观察同一份"设计说明书"在不同模型上的执行差异——你会直观感受到"提示是规格,模型是施工队"的含义。
随堂测验
1. 「背景不要太乱」这条约束,按本课的原则最好改写成?
2. 提示词写了「大特写镜头」,又详细描述了「街道两旁的商铺、行人和远处的天桥」。生成结果总是不对。这属于哪种失败模式?
3. 为什么模板 D(海报)只让模型生成主标题一行字,正文留给后期排版?
4. 「每一个没写的槽位,模型都会用训练数据的平均值替你填上」——这句话对提示词写作的核心指导意义是?
划选正文任意文字可高亮、批注或加入复习卡
讨论
载入中…