AI绘画高频术语解析:从扩散模型到提示词
打开AI绘画工具,满屏的专业名词容易让人发懵。这一篇带你逐一弄清,从底层原理到实操参数,不再被概念绕晕。
扩散模型:AI绘画的“底层发动机”
扩散模型是当前主流AI绘画工具(比如Stable Diffusion、Midjourney、DALL·E)背后的核心技术。它的工作方式可以简单理解成“从噪声里慢慢还原图像”。一开始是一张纯噪点图,模型一步步去除噪声,同时根据你给的文字描述修正细节,最终生成符合描述的清晰画面。整个过程就像把一团混乱的灰尘逐步塑造成雕像。
关键特点:
- 每次去噪都依赖“文本指导”,所以提示词写得越准确,结果越贴近预期。
- 不同模型版本(如SD 1.5、SD XL、SD 3.5)在画质、风格理解、资源消耗上有明显差异。
- 模型本身不“认识”物体,而是学习海量图片和文字配对数据后形成统计规律。
实际使用注意:
- 同一个提示词在不同版本模型下输出可能差别很大,新手建议先固定一个主流模型,熟悉后再尝试其他。
- 扩散模型通常需要GPU加速,低显存(低于4GB)设备可能跑不动较大模型,但小模型或优化版本(如TinySD)可以降低门槛。
- 2026年,开源社区推出了更多轻量级扩散模型,让普通电脑也能本地运行AI绘画。
CLIP:连接文字与画面的“翻译官”
CLIP(Contrastive Language-Image Pre-training)是图像和文本之间的桥梁。它把文字和图片都转换成一组数字向量,通过对比学习让语义上匹配的文字和图片向量更靠近。当你输入“一只戴帽子的猫”,CLIP会告诉扩散模型:“这张图应该偏向猫、帽子、站姿等元素”。
为什么重要:
- CLIP的质量直接影响模型理解提示词的能力。同一个模型配合不同CLIP分支(如OpenCLIP、LAION-2B CLIP),对中文或抽象概念的支持程度不同。
- 很多用户发现同样的提示词在不同工具里效果不同,背后可能就是CLIP版本或训练数据的差异。
常见误区:
- 认为CLIP能“理解”人类常识,实际上它只是统计学关联,比如“猫坐在椅子上”和猫的图片向量接近,但不懂“坐”是什么姿势。
- 过于复杂的提示词可能让CLIP困惑,反而削弱效果,建议用简洁、具体的短语。
LoRA:给模型“打补丁”的轻量插件
LoRA(Low-Rank Adaptation)是一种微调技术,它不修改原有扩散模型的所有参数,而是插入少量小模块,通过额外训练让模型学会某个特定风格、角色或物体。比如你想生成某动漫角色的同人图,训练一个LoRA文件(通常几MB到几十MB),然后加载到基础模型上就能生成该角色的形象。
应用场景:
- 角色定制:固定某个虚拟人物或真人的面部特征(真人伦理需谨慎)。
- 风格迁移:动漫风、油画风、像素风等,无需重新训练完整模型。
- 物体控制:生成特定款式的汽车、建筑等。
使用要点:
- 权重(Weight)调节:加载LoRA时可以设置强度(常见0.5~1.0),过高可能破坏画面自然度。
- 多LoRA叠加:可以同时加载多个LoRA(比如人物脸+场景风格),但叠加过多会导致冲突或画风杂乱。
- 训练自己的LoRA需要少量样本(10~100张图)和显卡时间,2026年在线平台已大幅简化流程,普通用户也能操作。
ControlNet:精确控制画面结构的“指挥棒”
ControlNet是一种附加模块,能通过额外输入图(如边缘线、深度图、人物骨架)引导扩散模型在生成时严格遵循特定构图。它像给模型一个“轮廓草图”,后续细节再按提示词填充。常见的控制模式有:
- Canny边缘:根据黑白线条还原,适合固定形状。
- 深度图:依据景深信息控制物体前后关系。
- OpenPose:传入人物骨架,控制姿态(手、脚、身体)。
- Scribble:手绘简单线条,模型填充细节。
价值:
- 解决AI绘画“手部乱长”“构图偏掉”的痛点,尤其适合需要精确控制画面布局的场景。
- 配合多个ControlNet可同时控制不同维度,比如边缘+深度,但计算量倍增。
局限:
- 并非所有模型原生支持ControlNet,需要特定架构(如Stable Diffusion 1.5/XL)。
- 过度依赖控制图可能限制创意,适合参考图修改而非完全自由创作。
采样器与步数:图像生成的“精加工参数”
采样器是扩散模型去噪过程中使用的算法,不同采样器影响生成速度、画质和风格。常见的有DDIM、DPMSolver、DPM++ 2M、Euler A、LMS等。步数(Step)则代表去噪的迭代次数,一般20~50步即可,太多浪费计算,太少细节不足。
选型指南:
- 速度优先:DPMSolver系列(如SDE Karras)能在10~15步内出可接受结果,适合快速试验。
- 画质优先:DPM++ 2M Karras或DDIM通常需要30步左右,细节更丰富。
- 风格倾向:Euler A有随机性,适合艺术化效果;LMS更稳定但略慢。
关键点:
- 步数并非越多越好,超过某阈值(如50步)改善不明显,反而增加计算时间。
- 采样器与模型有隐式关联,某些模型可能对特定采样器更友好,建议同一提示词多试两三种。
- 2026年新采样器(如LCM-LoRA)能实现1~4步超快生成,但画质略降,适合实时生成预览。
提示词与负提示词:AI的“指令语言”
提示词(Prompt)是用户用自然语言描述想生成的画面,负提示词(Negative Prompt)则告诉模型“不要出现什么”。两者共同构成了对扩散模型的约束。
提示词写作技巧:
- 前后顺序: 越靠前的词权重越高(在Stable Diffusion中),把核心元素放前面。
- 权重语法: 使用 (word:1.2) 提高权重,或 [word:0.8] 降低。注意不要过度堆砌,容易引发冲突。
- 质量词汇: 使用“masterpiece, best quality, highres”等标准词有助于提升画质,但不同模型有各自偏好。
负提示词的陷阱:
- 常用负提示词:low quality, bad anatomy, extra limbs, blurry, distorted等。
- 过度使用负提示词可能让画面“死板”,比如禁止“手”可能导致无手人物。
- 中文提示词在部分模型下效果差,建议中英文混合或使用英文。
2026年趋势:
- 自然语言提示词越来越智能,很多平台支持长段落描述,甚至对话式修改。
- 负提示词逐渐被“反向描述”取代,用户直接说“不要红色背景”,模型理解更准确。
常见问题
扩散模型和VAE是什么关系
VAE(变分自编码器)常作为扩散模型的前置图像压缩器,减少计算量。生成时VAE先降噪再解码,两者配合使用,但不是必须分开理解的术语。
CLIP模型中文支持如何
早期CLIP主要基于英文训练,对中文理解较弱。近年有社区训练的中文CLIP,但效果仍参差。建议使用英文提示词加少量中文专有名词。
LoRA训练需要多少张图
通常10~50张高质量图片即可,但要避免背景杂乱。训练轮数20~100 epoch,简单场景可少,复杂细节需多。2026年在线平台可自动优化。
ControlNet和图片到图片生成有何区别
图片到图片(img2img)基于原图加噪后重新生成,保留整体构图;ControlNet则用边缘/深度等控制结构,可以完全改变风格但保持轮廓。
采样器Euler A和DPM++ 2M哪个更好
侧重点不同:Euler A随机性强,适合艺术化风格;DPM++ 2M更稳定细节多,适合写实。建议同一提示词各出几张对比,选喜欢的。
提示词权重怎么写最有效
使用括号加数字如 (cat:1.3),数值1~1.5常见,超过1.5易导致过拟合。也可用交替语法 (cat|dog|bird) 生成组合。优先调整顺序而非乱加权重。
负提示词为什么会导致画面变差
负提示词会抑制模型产生某些特征,如果词汇过多或语义冲突,模型可能忽略合理元素。建议使用常见的5~10个负面词即可,避免长篇否定。