课程库 › AI 视觉生成 › 控制与一致性 › 第 1 课
文字、版式与信息图——图里的字是另一门手艺
普通课约 50 分钟
本课导读
L2 的海报模板留过一个悬念:只敢让模型写一行主标题,正文全部推给后期。本课正面处理图内文字:为什么文字渲染是图像模型的特殊难关、什么时候该让模型写字、什么时候必须自己排版,以及信息图这个"文字+数据+图像"的终极考场。还有一条本课反复出现、也是全 Track 最不可协商的铁律:图里的每一个字,发布前必须人工校对。预计 50 分钟。
为什么模型写字总翻车
对模型来说,文字不是"文字",是一种恰好长得像字的图案。它在海量含字图片上学会了"这类画面上通常有这类形状",但它不理解笔画结构和拼写规则。于是出现三类经典翻车:
- 字形错误:多一横少一点、字母凭空变形——图案画得"差不多",但字就是错的;
- 乱码填充:画面需要"一段文字"时,模型生成"看起来像文字的纹理"凑数,凑近看全是无意义符号;
- 排版失控:字距忽大忽小、行没对齐、文字压在主体上。
中文是硬模式:常用字几千个、笔画密度高、差一笔就是别的字。同代模型的中文渲染普遍明显弱于英文。这不是提示词能修的——是 L1 四层归因里的模型能力边界,对策是换任务形态:字少让模型写,字多自己排。
提示
当前版本速览(2026-07,过时请以官网为准):文字渲染是各家迭代重点——Imagen 4 主打改进的文字渲染与 2K 输出;GPT Image 系列的官方示例已覆盖多语言海报、信息图、漫画对白等场景;开放模型中 FLUX 系列的英文渲染也已可用。趋势是"短文字越来越可靠",但"长文本+中文+精确排版"仍未解决——职责划分方法长期有效。
职责划分:三档决策
图内文字的生产方式按文字量和准确性要求分三档:
| 档位 | 做法 | 适用 |
|---|---|---|
| 全交给模型 | 文字直接生成在图里 | 一两个词的大标题、艺术字、字体本身就是视觉主体 |
| 模型写短字,后期排长文 | 主标题生成,正文/小字后期叠加 | 海报、封面、banner(L2 模板 D 就是这档) |
| 模型只留空间 | 提示词里要求预留负空间,文字全部后期排 | 中文正文、数据标注、多语言版本、任何"错一个字就出事故"的场景 |
判断口诀:字越多、越小、越中文、越不能错,越往下档走。下档不是妥协——Figma/PS 排出来的字永远比生成的字锐利、可改、可复用,多语言版本改个文本框就出来了,重新生成则是重新抽卡。
让模型写字的提示词技巧
决定让模型写的那部分字,用这套写法把成功率拉满:
- 引号精确指定:画面中的文字仅为:"夏日限定"——引号内就是全部,防止模型自由发挥加字;
- 说明位置和层级:标题"__"位于画面上方三分之一,字号大;
- 描述字体气质而非字体名:粗壮无衬线、手写毛笔感、复古衬线——模型对气质词的响应远好于具体字体名;
- 控制数量:一张图里让模型写的文字块不超过两处,越多崩得越快;
- 中文短语优先:中文尽量控制在 2–6 字的短语;成语和常用词成功率远高于生僻组合。
生成后立刻放大逐字检查——这就是错误清单(本课作业)的第一个来源。
信息图:文字课的终极考场
信息图 = 信息层级 + 数据 + 图像,三个都是模型的短板叠加,所以它是最需要职责划分的品类。
先说最大的坑:模型会编数据。让模型"生成一张关于全球咖啡消费量的信息图",它会自信地画出柱状图、标上数字、写上国家名——全是编的。这是 L1"幻觉"在数据场景的表现,也直接对应大纲审核框架里的"事实层"。正确分工必须是:
你提供 准确的数据、结论、信息结构(哪条是主信息、哪些是支撑)
模型提供 视觉化的载体:配图、图标、版面风格、装饰元素
排版工具 数据图表本身 + 全部正文文字
信息层级是信息图的骨架,提示词里显式声明三层:
- 一眼层:标题+核心结论——3 秒内看懂这张图在说什么;
- 浏览层:小标题、图标、关键数字——30 秒扫完结构;
- 细读层:说明文字、数据来源——留给真感兴趣的人。
生成时让模型按这个层级做版面(大小对比、区块划分、视觉动线),数据和文字后期填入。这样模型的审美能力用在了它擅长的地方,事实准确性握在你手里。
人工校对:错误清单工作法
大纲对文字类交付的质量要求就五条,直接当验收单用:关键信息准确 / 字体可读 / 层级清晰 / 数据与图像关系合理 / 最终文字人工校对。
落地方法是错误清单——发布前过一遍,每发现一个问题记一行:
## 错误清单 —— 项目:夏日饮品海报 v2
# 位置 问题类型 详情 处理
1 主标题 字形错误 "限"字右半多一笔 inpainting 重生成
2 左下角 乱码填充 装饰性小字全是假字 后期删除,PS 补真字
3 价格区 数据错误 模型自己写了 ¥18 改为真实价格 ¥22
4 副标题 排版 压住了产品主体 下移,缩小字号
注意 #3——模型连价格都会编。任何会进入画面的数字(价格、日期、百分比、电话)都是高危区。清单不只是质检记录,攒多了就是你的"本模型文字翻车模式库",直接指导下一次的档位决策。
动手任务:一张信息图 + 一张海报
基础路线(约 60 分钟):
- 知识型信息图:把你最近学的任意知识点(比如本 Track 的"四层归因")做成一张信息图。流程强制走职责划分:先在纸上写好信息层级三层的内容 → 让模型生成"预留了这些区块的版面+配图"(第三档)→ 用任意排版工具把真实文字填入;
- 商业海报:虚构一个产品做促销海报,用第二档:主标题(2–6 字中文)让模型生成,试三次挑最好,正文价格等后期叠加;
- 两件作品各交付三样:生成稿(模型原始输出)、修订稿(人工处理后的成品)、错误清单(每个问题按四列格式记录);
- 复盘一句话:这次的错误里,哪些是提示能修的,哪些是必须换档位的?
进阶路线(可选):把海报主标题换成同义英文短语重新生成,对比中英文渲染质量差距——亲手标定一次"中文是硬模式"的程度,这个手感决定你以后中文项目的默认档位。
随堂测验
1. 模型生成的图里「咖啡」写成了「加啡」,换了三种提示词写法都偶发同类错误。按四层归因,这属于哪层,正确对策是?
2. 要做一张含 200 字中文正文、6 个真实数据点的公司介绍信息图。最合理的档位是?
3. 「让模型生成一张 2025 年新能源车销量对比信息图」,模型输出了漂亮的柱状图和具体数字。这些数字应该?
4. 错误清单工作法的长期价值,除了当次质检,还有什么?
划选正文任意文字可高亮、批注或加入复习卡
讨论
载入中…