Be Known通知设置

课程库 AI 视觉生成 生成与提示基础 › 第 1

能力边界与模型地图——先搞清楚"生成"到底能干什么

普通课45 分钟

本课导读

这个 Track 教的不是"怎么让 AI 画一张好看的图"——那件事现在随便一个模型都能做到。它教的是把生成式图像模型当成一套视觉生产系统来用:需求怎么定义、结果怎么控制、系列怎么保持一致、产出怎么批量化、成品谁来负责。第一课先把地基打好:市面上的模型分几类、各自擅长什么、文生图/图生图/图像编辑有什么本质区别、以及最重要的——出了问题怎么归因。预计 45 分钟。

说明

这个 Track 的"代码块"大多是提示词、工作流配置和脚本片段,点右上角复制到对应工具里用。所有动手任务都分两条路线:基础路线只需要浏览器和至少一个能用的图像模型(免费额度即可起步);进阶路线涉及本地部署或付费平台,可跳过不影响后续课程。

你其实已经懂一半了

你在 AI 主线里已经学过大语言模型:它按概率一个 token 一个 token 地续写文本。图像模型是另一条技术路线,但使用侧的心智模型几乎可以平移

大语言模型(你已学)图像生成模型(本课开始)
输入提示词(文本)提示词 + 可选的图像条件(参考图/蒙版/线稿…)
生成方式自回归:逐 token 续写扩散/流匹配:从一张纯噪声图逐步"去噪"成图像
随机性来源采样温度随机种子(seed)+ 采样器
幻觉的表现一本正经地编事实六根手指、错误文字、不存在的物理结构
控制手段提示工程、few-shot、工具调用提示工程、参考图、结构控制、LoRA、工作流

关于"扩散模型怎么从噪声里长出图像"的原理,主线的数学直觉单元里有铺垫,这里只需要记住一个使用侧结论:生成是"采样"而不是"检索"——同一个提示词每次出图都不一样,模型不是从素材库里找图,而是每次从随机噪声出发现场"长"一张。这决定了本 Track 后面所有关于"可复现性"(固定种子、记录参数)的纪律。

模型地图:五个能力层级

具体产品名每几个月就换一轮,但能力层级是稳定的。选型时先问"我需要哪一层",再问"这一层当前谁最强":

能力层级典型用途关键特征
对话式生成与编辑多轮改图、复杂指令、图文排版、信息图挂在大语言模型上,能"听懂人话",改图不用重写提示词
高审美快速生成概念探索、插画、风格开发默认输出就好看,但精确控制较弱
高质量文生图商业视觉、摄影感、广告、含文字的设计提示遵循度高、文字渲染强、企业授权清晰
开放模型与可控生成本地部署、结构控制、定制工作流权重可下载,能接 ControlNet/LoRA,隐私可控
节点式工作流批量处理、多步骤管线、API 自动化不是模型,是把上面各层组装成生产线的工具

提示

当前版本速览(2026-07,过时请以官网为准):对话式——GPT Image 2、Gemini Image;高审美——Midjourney V8.1(默认原生 2K)、Niji 系列;高质量文生图——Imagen 4、Adobe Firefly(已可调用多家模型并输出 Content Credentials);开放模型——FLUX.2、FLUX.1 Kontext、Stable Diffusion 3.5;节点工作流——ComfyUI。本 Track 正文只讲层级和方法,模型名换代不影响结论。

另一条重要的分界线是封闭 vs 开放

  • 封闭模型(网页/API 使用):效果通常更强、上手零成本,但参数不透明、隐私出域、按量付费、平台说改就改。
  • 开放模型(权重可下载):可本地跑、可深度控制、可微调出"专属模型",但需要显卡和折腾精神。

个人学习期的合理策略:用封闭模型学方法,用开放模型学原理。本单元前四课全部可以只用封闭模型完成。

四种任务形态,别混着用

"AI 画图"其实是四件不同的事,输入输出和适用场景都不同:

  1. 文生图(text-to-image):纯文字 → 图像。从零开始探索创意时用。
  2. 图生图(image-to-image):图像 + 文字 → 新图像。保留原图构图/风格做变体时用。
  3. 图像编辑(editing / inpainting):图像 + 指令(+ 蒙版)→ 局部修改后的图像。"就改这一处,别的都别动"时用。
  4. 视觉理解(image-to-text):图像 → 文字描述/分析。反推参考图的风格关键词、做质检时用——这一步经常被忽略,但它是第 4 课"参考图工作流"的地基。

新手最常见的浪费是拿文生图硬做编辑的活:想改人物的衣服颜色,却重写整段提示词重新抽卡,结果构图全变了。任务形态选对,一半的问题消失。

"画面漂亮"不等于"设计有效"

这是本 Track 反复出现的一条纪律。模型的默认输出是"讨好眼球的平均审美"——光线华丽、细节丰富、构图安全。但设计是为目标服务的:

  • 一张电商主图的目标是看清产品——华丽的逆光氛围反而是失败;
  • 一张信息图的目标是准确传达——字体再漂亮,数据错了就是废图;
  • 一张品牌海报的目标是符合品牌——模型不知道你的品牌色和调性,它只会给"好看"。

所以评价生成结果永远问两个问题:这张图好看吗?这张图有效吗?后者才是你作为使用者的核心价值——模型负责好看,你负责有效。

出了问题怎么归因:四层诊断

生成结果不对,先别急着改提示词。错误可能来自四层,对策完全不同:

错误来源典型症状对策
提示问题模型"没听懂":要素缺失、理解偏差、顾此失彼改写提示(第 2 课的主战场)
模型能力边界换十种说法都不行:中文文字乱码、手部畸形、精确计数失败换模型,或换任务形态(如文字后期加)
训练数据偏见不提国籍默认某类长相、某职业默认某性别显式指定被默认掉的属性
工作流问题参数不当:过度锐化、分辨率不足、种子没固定导致无法复现调参数、补流程,跟提示词无关

判断方法很朴素:单变量实验。固定其他条件只改一个变量(同提示换模型 → 归因模型;同模型换表述 → 归因提示)。这个方法贯穿全 Track,也是你在主线学过的调试思维在视觉领域的直接复用。

动手任务:建立你的第一份模型能力对照表

选一个你真实感兴趣的创意主题(比如"一只在雨夜便利店门口躲雨的橘猫,电影感"),完成:

基础路线(约 40 分钟):

  1. 挑至少 3 个不同层级的模型(例如一个对话式 + 一个高审美 + 一个高质量文生图,免费额度够用);
  2. 完全相同的提示词各生成 4 张;
  3. 按下面的维度打分(1–5 分),填成对照表:
模型能力对照表 —— 主题:______
日期:____  提示词版本:v1(原文粘贴在表下)

维度            模型A    模型B    模型C
提示遵循度      _       _       _
画面审美        _       _       _
细节质量(手/字) _       _       _
风格倾向        (各写一句话描述)
生成速度        _       _       _
单张成本        _       _       _
  1. 写 200 字结论:这个主题下你会选哪个模型,为什么?

进阶路线(可选):把同一提示词丢给一个开放模型(本地或云端推理平台),感受"默认参数下开放模型 vs 封闭产品"的差距——这个差距正是第 7、8 课要用工作流补回来的空间。

注意

从这个任务开始养成记录习惯:每次生成都记下模型名、版本、提示词、日期。生成式工具迭代极快,三个月后你的结论会过期,但你的记录方法不会——这就是大纲意义上的"可审计生产"的第一步。

随堂测验

随堂测验0 / 4 题正确

1. 同一个提示词,昨天生成的图今天再也出不来了。从「生成是采样」的原理看,最直接的原因是?

2. 你想把一张已生成的人像图里的红色外套改成蓝色,构图和人物都不能变。最合适的任务形态是?

3. 生成「程序员在办公室工作」的图,十次里九次是男性。这属于哪一层问题,对策是什么?

4. 「这张图很好看,但作为电商主图它失败了」——这句话背后的评价框架是?

划选正文任意文字可高亮、批注或加入复习卡

讨论

载入中…