课程库 › AI 视觉生成 › 生成与提示基础 › 第 1 课
能力边界与模型地图——先搞清楚"生成"到底能干什么
普通课约 45 分钟
本课导读
这个 Track 教的不是"怎么让 AI 画一张好看的图"——那件事现在随便一个模型都能做到。它教的是把生成式图像模型当成一套视觉生产系统来用:需求怎么定义、结果怎么控制、系列怎么保持一致、产出怎么批量化、成品谁来负责。第一课先把地基打好:市面上的模型分几类、各自擅长什么、文生图/图生图/图像编辑有什么本质区别、以及最重要的——出了问题怎么归因。预计 45 分钟。
说明
这个 Track 的"代码块"大多是提示词、工作流配置和脚本片段,点右上角复制到对应工具里用。所有动手任务都分两条路线:基础路线只需要浏览器和至少一个能用的图像模型(免费额度即可起步);进阶路线涉及本地部署或付费平台,可跳过不影响后续课程。
你其实已经懂一半了
你在 AI 主线里已经学过大语言模型:它按概率一个 token 一个 token 地续写文本。图像模型是另一条技术路线,但使用侧的心智模型几乎可以平移:
| 大语言模型(你已学) | 图像生成模型(本课开始) | |
|---|---|---|
| 输入 | 提示词(文本) | 提示词 + 可选的图像条件(参考图/蒙版/线稿…) |
| 生成方式 | 自回归:逐 token 续写 | 扩散/流匹配:从一张纯噪声图逐步"去噪"成图像 |
| 随机性来源 | 采样温度 | 随机种子(seed)+ 采样器 |
| 幻觉的表现 | 一本正经地编事实 | 六根手指、错误文字、不存在的物理结构 |
| 控制手段 | 提示工程、few-shot、工具调用 | 提示工程、参考图、结构控制、LoRA、工作流 |
关于"扩散模型怎么从噪声里长出图像"的原理,主线的数学直觉单元里有铺垫,这里只需要记住一个使用侧结论:生成是"采样"而不是"检索"——同一个提示词每次出图都不一样,模型不是从素材库里找图,而是每次从随机噪声出发现场"长"一张。这决定了本 Track 后面所有关于"可复现性"(固定种子、记录参数)的纪律。
模型地图:五个能力层级
具体产品名每几个月就换一轮,但能力层级是稳定的。选型时先问"我需要哪一层",再问"这一层当前谁最强":
| 能力层级 | 典型用途 | 关键特征 |
|---|---|---|
| 对话式生成与编辑 | 多轮改图、复杂指令、图文排版、信息图 | 挂在大语言模型上,能"听懂人话",改图不用重写提示词 |
| 高审美快速生成 | 概念探索、插画、风格开发 | 默认输出就好看,但精确控制较弱 |
| 高质量文生图 | 商业视觉、摄影感、广告、含文字的设计 | 提示遵循度高、文字渲染强、企业授权清晰 |
| 开放模型与可控生成 | 本地部署、结构控制、定制工作流 | 权重可下载,能接 ControlNet/LoRA,隐私可控 |
| 节点式工作流 | 批量处理、多步骤管线、API 自动化 | 不是模型,是把上面各层组装成生产线的工具 |
提示
当前版本速览(2026-07,过时请以官网为准):对话式——GPT Image 2、Gemini Image;高审美——Midjourney V8.1(默认原生 2K)、Niji 系列;高质量文生图——Imagen 4、Adobe Firefly(已可调用多家模型并输出 Content Credentials);开放模型——FLUX.2、FLUX.1 Kontext、Stable Diffusion 3.5;节点工作流——ComfyUI。本 Track 正文只讲层级和方法,模型名换代不影响结论。
另一条重要的分界线是封闭 vs 开放:
- 封闭模型(网页/API 使用):效果通常更强、上手零成本,但参数不透明、隐私出域、按量付费、平台说改就改。
- 开放模型(权重可下载):可本地跑、可深度控制、可微调出"专属模型",但需要显卡和折腾精神。
个人学习期的合理策略:用封闭模型学方法,用开放模型学原理。本单元前四课全部可以只用封闭模型完成。
四种任务形态,别混着用
"AI 画图"其实是四件不同的事,输入输出和适用场景都不同:
- 文生图(text-to-image):纯文字 → 图像。从零开始探索创意时用。
- 图生图(image-to-image):图像 + 文字 → 新图像。保留原图构图/风格做变体时用。
- 图像编辑(editing / inpainting):图像 + 指令(+ 蒙版)→ 局部修改后的图像。"就改这一处,别的都别动"时用。
- 视觉理解(image-to-text):图像 → 文字描述/分析。反推参考图的风格关键词、做质检时用——这一步经常被忽略,但它是第 4 课"参考图工作流"的地基。
新手最常见的浪费是拿文生图硬做编辑的活:想改人物的衣服颜色,却重写整段提示词重新抽卡,结果构图全变了。任务形态选对,一半的问题消失。
"画面漂亮"不等于"设计有效"
这是本 Track 反复出现的一条纪律。模型的默认输出是"讨好眼球的平均审美"——光线华丽、细节丰富、构图安全。但设计是为目标服务的:
- 一张电商主图的目标是看清产品——华丽的逆光氛围反而是失败;
- 一张信息图的目标是准确传达——字体再漂亮,数据错了就是废图;
- 一张品牌海报的目标是符合品牌——模型不知道你的品牌色和调性,它只会给"好看"。
所以评价生成结果永远问两个问题:这张图好看吗?这张图有效吗?后者才是你作为使用者的核心价值——模型负责好看,你负责有效。
出了问题怎么归因:四层诊断
生成结果不对,先别急着改提示词。错误可能来自四层,对策完全不同:
| 错误来源 | 典型症状 | 对策 |
|---|---|---|
| 提示问题 | 模型"没听懂":要素缺失、理解偏差、顾此失彼 | 改写提示(第 2 课的主战场) |
| 模型能力边界 | 换十种说法都不行:中文文字乱码、手部畸形、精确计数失败 | 换模型,或换任务形态(如文字后期加) |
| 训练数据偏见 | 不提国籍默认某类长相、某职业默认某性别 | 显式指定被默认掉的属性 |
| 工作流问题 | 参数不当:过度锐化、分辨率不足、种子没固定导致无法复现 | 调参数、补流程,跟提示词无关 |
判断方法很朴素:单变量实验。固定其他条件只改一个变量(同提示换模型 → 归因模型;同模型换表述 → 归因提示)。这个方法贯穿全 Track,也是你在主线学过的调试思维在视觉领域的直接复用。
动手任务:建立你的第一份模型能力对照表
选一个你真实感兴趣的创意主题(比如"一只在雨夜便利店门口躲雨的橘猫,电影感"),完成:
基础路线(约 40 分钟):
- 挑至少 3 个不同层级的模型(例如一个对话式 + 一个高审美 + 一个高质量文生图,免费额度够用);
- 用完全相同的提示词各生成 4 张;
- 按下面的维度打分(1–5 分),填成对照表:
模型能力对照表 —— 主题:______
日期:____ 提示词版本:v1(原文粘贴在表下)
维度 模型A 模型B 模型C
提示遵循度 _ _ _
画面审美 _ _ _
细节质量(手/字) _ _ _
风格倾向 (各写一句话描述)
生成速度 _ _ _
单张成本 _ _ _
- 写 200 字结论:这个主题下你会选哪个模型,为什么?
进阶路线(可选):把同一提示词丢给一个开放模型(本地或云端推理平台),感受"默认参数下开放模型 vs 封闭产品"的差距——这个差距正是第 7、8 课要用工作流补回来的空间。
注意
从这个任务开始养成记录习惯:每次生成都记下模型名、版本、提示词、日期。生成式工具迭代极快,三个月后你的结论会过期,但你的记录方法不会——这就是大纲意义上的"可审计生产"的第一步。
随堂测验
1. 同一个提示词,昨天生成的图今天再也出不来了。从「生成是采样」的原理看,最直接的原因是?
2. 你想把一张已生成的人像图里的红色外套改成蓝色,构图和人物都不能变。最合适的任务形态是?
3. 生成「程序员在办公室工作」的图,十次里九次是男性。这属于哪一层问题,对策是什么?
4. 「这张图很好看,但作为电商主图它失败了」——这句话背后的评价框架是?
划选正文任意文字可高亮、批注或加入复习卡
讨论
载入中…