Be Known通知设置

课程库 AI 视觉生成 控制与一致性 › 第 1

文字、版式与信息图——图里的字是另一门手艺

普通课50 分钟

本课导读

L2 的海报模板留过一个悬念:只敢让模型写一行主标题,正文全部推给后期。本课正面处理图内文字:为什么文字渲染是图像模型的特殊难关、什么时候该让模型写字、什么时候必须自己排版,以及信息图这个"文字+数据+图像"的终极考场。还有一条本课反复出现、也是全 Track 最不可协商的铁律:图里的每一个字,发布前必须人工校对。预计 50 分钟。

为什么模型写字总翻车

对模型来说,文字不是"文字",是一种恰好长得像字的图案。它在海量含字图片上学会了"这类画面上通常有这类形状",但它不理解笔画结构和拼写规则。于是出现三类经典翻车:

  • 字形错误:多一横少一点、字母凭空变形——图案画得"差不多",但字就是错的;
  • 乱码填充:画面需要"一段文字"时,模型生成"看起来像文字的纹理"凑数,凑近看全是无意义符号;
  • 排版失控:字距忽大忽小、行没对齐、文字压在主体上。

中文是硬模式:常用字几千个、笔画密度高、差一笔就是别的字。同代模型的中文渲染普遍明显弱于英文。这不是提示词能修的——是 L1 四层归因里的模型能力边界,对策是换任务形态:字少让模型写,字多自己排。

提示

当前版本速览(2026-07,过时请以官网为准):文字渲染是各家迭代重点——Imagen 4 主打改进的文字渲染与 2K 输出;GPT Image 系列的官方示例已覆盖多语言海报、信息图、漫画对白等场景;开放模型中 FLUX 系列的英文渲染也已可用。趋势是"短文字越来越可靠",但"长文本+中文+精确排版"仍未解决——职责划分方法长期有效。

职责划分:三档决策

图内文字的生产方式按文字量和准确性要求分三档:

档位做法适用
全交给模型文字直接生成在图里一两个词的大标题、艺术字、字体本身就是视觉主体
模型写短字,后期排长文主标题生成,正文/小字后期叠加海报、封面、banner(L2 模板 D 就是这档)
模型只留空间提示词里要求预留负空间,文字全部后期排中文正文、数据标注、多语言版本、任何"错一个字就出事故"的场景

判断口诀:字越多、越小、越中文、越不能错,越往下档走。下档不是妥协——Figma/PS 排出来的字永远比生成的字锐利、可改、可复用,多语言版本改个文本框就出来了,重新生成则是重新抽卡。

让模型写字的提示词技巧

决定让模型写的那部分字,用这套写法把成功率拉满:

  1. 引号精确指定:画面中的文字仅为:"夏日限定"——引号内就是全部,防止模型自由发挥加字;
  2. 说明位置和层级:标题"__"位于画面上方三分之一,字号大;
  3. 描述字体气质而非字体名:粗壮无衬线、手写毛笔感、复古衬线——模型对气质词的响应远好于具体字体名;
  4. 控制数量:一张图里让模型写的文字块不超过两处,越多崩得越快;
  5. 中文短语优先:中文尽量控制在 2–6 字的短语;成语和常用词成功率远高于生僻组合。

生成后立刻放大逐字检查——这就是错误清单(本课作业)的第一个来源。

信息图:文字课的终极考场

信息图 = 信息层级 + 数据 + 图像,三个都是模型的短板叠加,所以它是最需要职责划分的品类。

先说最大的坑:模型会编数据。让模型"生成一张关于全球咖啡消费量的信息图",它会自信地画出柱状图、标上数字、写上国家名——全是编的。这是 L1"幻觉"在数据场景的表现,也直接对应大纲审核框架里的"事实层"。正确分工必须是:

你提供    准确的数据、结论、信息结构(哪条是主信息、哪些是支撑)
模型提供  视觉化的载体:配图、图标、版面风格、装饰元素
排版工具  数据图表本身 + 全部正文文字

信息层级是信息图的骨架,提示词里显式声明三层:

  • 一眼层:标题+核心结论——3 秒内看懂这张图在说什么;
  • 浏览层:小标题、图标、关键数字——30 秒扫完结构;
  • 细读层:说明文字、数据来源——留给真感兴趣的人。

生成时让模型按这个层级做版面(大小对比、区块划分、视觉动线),数据和文字后期填入。这样模型的审美能力用在了它擅长的地方,事实准确性握在你手里。

人工校对:错误清单工作法

大纲对文字类交付的质量要求就五条,直接当验收单用:关键信息准确 / 字体可读 / 层级清晰 / 数据与图像关系合理 / 最终文字人工校对

落地方法是错误清单——发布前过一遍,每发现一个问题记一行:

## 错误清单 —— 项目:夏日饮品海报 v2
#  位置        问题类型      详情                  处理
1  主标题      字形错误      "限"字右半多一笔       inpainting 重生成
2  左下角      乱码填充      装饰性小字全是假字     后期删除,PS 补真字
3  价格区      数据错误      模型自己写了 ¥18       改为真实价格 ¥22
4  副标题      排版          压住了产品主体         下移,缩小字号

注意 #3——模型连价格都会编。任何会进入画面的数字(价格、日期、百分比、电话)都是高危区。清单不只是质检记录,攒多了就是你的"本模型文字翻车模式库",直接指导下一次的档位决策。

动手任务:一张信息图 + 一张海报

基础路线(约 60 分钟):

  1. 知识型信息图:把你最近学的任意知识点(比如本 Track 的"四层归因")做成一张信息图。流程强制走职责划分:先在纸上写好信息层级三层的内容 → 让模型生成"预留了这些区块的版面+配图"(第三档)→ 用任意排版工具把真实文字填入;
  2. 商业海报:虚构一个产品做促销海报,用第二档:主标题(2–6 字中文)让模型生成,试三次挑最好,正文价格等后期叠加;
  3. 两件作品各交付三样:生成稿(模型原始输出)、修订稿(人工处理后的成品)、错误清单(每个问题按四列格式记录);
  4. 复盘一句话:这次的错误里,哪些是提示能修的,哪些是必须换档位的?

进阶路线(可选):把海报主标题换成同义英文短语重新生成,对比中英文渲染质量差距——亲手标定一次"中文是硬模式"的程度,这个手感决定你以后中文项目的默认档位。

随堂测验

随堂测验0 / 4 题正确

1. 模型生成的图里「咖啡」写成了「加啡」,换了三种提示词写法都偶发同类错误。按四层归因,这属于哪层,正确对策是?

2. 要做一张含 200 字中文正文、6 个真实数据点的公司介绍信息图。最合理的档位是?

3. 「让模型生成一张 2025 年新能源车销量对比信息图」,模型输出了漂亮的柱状图和具体数字。这些数字应该?

4. 错误清单工作法的长期价值,除了当次质检,还有什么?

划选正文任意文字可高亮、批注或加入复习卡

讨论

载入中…