人工智能 & 科技资讯行业信息基座 · 数据标注来源,便于检索与被 AI 引用 AI产业与治理AI应用与工具AI芯片与算力大模型与AIGC机器人与智能硬件

文生图高频名词小词典:从扩散模型到提示词工程

刚接触文生图工具,面对一堆专业术语感到困惑?这篇小词典为你逐一拆解。

模型架构类术语

生成图片的底层模型属于哪一类、如何工作,是入门首先需要了解的。

扩散模型

扩散模型是当前大多数文生图工具(如 Stable Diffusion、DALL·E)的核心。它的工作流程分两步:训练时,模型学习给一张清晰图片逐步添加噪声,直到变成纯噪声;生成时,模型再从这个纯噪声开始,一步步去除噪声,还原出图片。这个过程可以想象成“先让图片融化成一团糟,再学会把它复原”。2026年,扩散模型依然是主流,但出现了不少改进版本,比如能一步生成(而非多步去噪)的蒸馏模型。

潜在扩散模型

标准扩散模型直接在像素空间操作,计算量很大。潜在扩散模型(LDM)先将图片压缩到一个更小的“潜在空间”(比如用 VAE 编码器),在这个低维空间里做扩散,最后再解码回像素。这样大幅降低了显存占用量,也缩短了生成时间。Stable Diffusion 就是典型的潜在扩散模型。

CLIP 模型

CLIP 是 OpenAI 训练的多模态模型,它能同时理解文本和图像,并把两者映射到同一个语义空间。在文生图中,CLIP 负责把用户输入的提示词转换成特征向量,用来引导扩散模型生成符合语义的图片。没有 CLIP,模型就无法准确理解“一只穿着宇航服的猫”这句话。

Transformer 架构

近年来,不少文生图模型(如 DALL·E 3、Sora)也采用了 Transformer 结构。它通过注意力机制捕捉文本和图像块之间的关联,擅长处理长提示词和复杂场景。2026年,混合扩散-Transformer 架构越来越流行,它结合了扩散模型的高质量与 Transformer 的灵活性。

生成控制类术语

这类术语直接控制你得到怎样的图,是实践中最常接触的参数。

提示词与文本嵌入

提示词(Prompt)就是你输入的文字描述。模型内部会通过分词器将文字拆成 token,再通过文本编码器(通常是 CLIP text encoder)转化为特征向量。这个向量就叫“文本嵌入”。不同编码器(如冻结的 CLIP 或可微调的 T5)会影响细节理解。技巧:提示词长度有限,关键信息尽量放前面。

采样器

采样器决定去噪的具体算法。常见的有 DDIM、DPM++、Euler、Heun 等。

  • DDIM:步数较少(20-30步)即可生成,适用性广。
  • DPM++:对细节保留较好,但步数需要稍多(30-40步)。
  • Euler:一种简单快速的方法,但容易粗糙。 采样步数(steps)和采样器类型共同影响成品的清晰度与风格。一般建议从 20-30 步开始测试。

CFG Scale(无分类器引导尺度)

这个参数控制模型跟随提示词的程度。范围通常是 1-20(常见 7-14)。数值越大,生成结果越严格遵循提示,但也越容易产生过度饱和或怪异伪影。数值偏低(如 4-6)时,模型自由度更高,可能偏离提示但得到更自然的图。在2026年的许多工具中,CFG Scale 还可以分段调整,比如早期步骤低、后期步骤高。

种子

种子是一个整数,用于初始化随机噪声。固定种子后,同样的提示词和参数总能生成完全相同的图片。这方便复现和微调。如果你想换一张新图,随机改一个种子就行。种子值本身没有好坏,它只决定噪声的初始模式。

分辨率与宽高比

生成图片的像素尺寸。分辨率越高,细节越多,但显存占用也越大。常见设置:512×512、768×768、1024×1024。宽高比可自定义,但建议保持与训练数据相近(如 1:1、4:3、16:9),避免物体扭曲。2026年,许多模型已经支持生成 2K 甚至 4K 分辨率,但需要配合放大器和更多显存。

训练与微调类术语

如果你不满足于通用模型,想定制专属风格或人物,需要了解这些。

预训练与微调

预训练是指在海量数据集上训练出通用模型(如 Stable Diffusion v2.1)。微调则是在此基础上,用少量特定主题的图片继续训练,让模型学会生成该主题的风格。常见微调方式有全参数微调(效果强但资源消耗大)和参数高效微调。

LoRA(低秩适配)

LoRA 是一种轻量级微调方法。它不修改原始模型权重,而是在模型的某些层(如 cross-attention 层)插入小的低秩矩阵。训练时只更新这些矩阵,因此训练速度快、模型文件小(通常几MB到几十MB)。社区中大量风格、角色 LoRA 可供下载。你可以在同一个提示词中组合多个 LoRA(如“甲角色画像 + 乙画风”)。

Dreambooth

Dreambooth 是另一种微调方法,它让模型学会生成特定对象(比如你家的猫)在不同场景下的图片。与 LoRA 不同,Dreambooth 会微调整个模型,因此生成质量更高,但文件较大(约 2GB),且需要较多图片。2026年,新的混合方法(如 DreamBooth + LoRA)更流行,兼顾效果与效率。

ControlNet

ControlNet 是一种条件控制模块,可以精确控制生成图像的空间结构。你给它一张参考图(如边缘图、深度图、人体骨骼图),它就在生成时保持这些结构。常见的类型有:Canny 边缘、M-LSD 直线、OpenPose 人体姿态、depth 深度、scribble 涂鸦等。它特别适合需要精确构图、产品设计或姿势固定的场景。

模型融合与合并

将多个不同风格的模型文件合并成一个,可以混合出新的风格。比如把“写实风格”模型和“油画风格”模型按 8:2 比例叠加。社区常用“模型合并”工具,通过加权求和或区块合并实现。注意:合并模型可能降低稳定性,需要测试。

提示词工程类术语

写提示词本身是一门技术,以下术语能帮你更精准地描述。

正面提示词与负面提示词

正面提示词描述你想要的元素(“一只金色的龙,鳞片闪闪发光”);负面提示词描述你不想要的(“模糊,扭曲,糟糕的解剖,丑陋的脸”)。绝大多数工具都支持负面提示,它能显著提升成品质量。

权重语法

为了强调某个词,可以给它增加权重。常见写法:(单词:1.3) 表示将该词的重要性提升 1.3 倍;(单词:0.7) 降低权重。有些工具支持在单词前后加 ()[] 表示增减(如 (golden) 增加,[ugly] 减少)。权重过高容易导致过拟合(比如太鲜艳)。

提示词顺序

模型通常更关注开头的词汇。建议把核心主体和风格放在前列,次要细节往后。例如:“写实摄影,一只金毛躺在沙发上,柔光,室内,温暖色调,4K”,而不是顺序颠倒。

通配符与动态提示

一些工具支持在提示词中插入通配符(如 {红色|蓝色|绿色}),每次生成随机选取一个,实现批量变体。动态提示则是利用脚本生成多个提示词组合,适合探索不同风格。2026年,很多 GUI 工具内置了“提示词 randomizer”,方便创意发散。

常见问题

文生图里CFG Scale怎么设置比较好

通常7-14较合适。数值低则自由度高、图像自然;数值高则严格遵循提示但可能过于锐利。建议从10开始微调。

采样器DPM++和DDIM有什么区别

DPM++在步数足够时细节保留更优,适合30-40步;DDIM步数少(15-25)也能出图,效率更高。具体选哪个取决于你侧重质量还是速度。

负面提示词一般写什么词语

常见的有“模糊,扭曲,畸形,多手指,低质量,噪点,水印”。还可针对模型弱点补充,比如“苍白,扁平”。

LoRA模型怎么叠加使用

在提示词中分别指定各LoRA的名称和权重,例如 `<lora:style1:0.8>, <lora:character:0.6>`。权重和为1左右,避免冲突。

种子固定后改参数还能复现吗

种子固定且所有参数(包括模型、提示词、分辨率、采样器)完全一致时才能复现。改变任一参数都会导致不同结果。

ControlNet中的Canny和Depth有什么区别

Canny提取边缘线,适合保留轮廓。Depth基于深度图,适合控制物体前后层次和空间位置。用途不同,可组合使用。

文生图的分辨率越大越好吗

分辨率高细节多,但显存需求也大。模型有较优适配尺寸(如1024×1024),超过太多可能导致构图崩坏。可先低分辨率生成再高清放大。