← 返回教程列表 零基础玩转 AI 生图封面
生图2026-08-0612 分钟

AI 学习之路之「零基础玩转 AI 生图:我的白嫖实战笔记」

不充会员、不翻墙,也能搞定 80% 的日常出图需求。一份踩过坑之后总结出来的低成本、高效率提示词方法论。

先交代一下背景:我并不是设计师,也不靠 AI 绘图吃饭,平时只是给公众号配个插图、做张海报底图,或者帮朋友生成一些概念参考图。市面上顶流的 Midjourney 和 GPT Image 2 我至今没体验过——不是因为它们不好,而是因为我懒得折腾「魔法」环境,也舍不得每月掏几十美元。

但这不代表国内工具不够用。这几个月,我陆续试过即梦、LiblibAI(哩布)、通义万象,还有公司内部 WorkBuddy 自带的 Imagen 功能(不知道套的哪家模型)。最后我主力固定在即梦,因为它每天送免费额度,对我这种低频用户来说刚刚好。到现在我一分钱没充,但已经生成了几百张能用的图。

踩过不少坑之后,我总结出一套「低成本、高效率」的提示词方法论。这篇文章不讲晦涩的算法,只讲实操中验证过的技巧,特别适合和曾经的我一样——没设计基础、不想花钱、又希望一次出图就满意的你。


第一章:提示词语言——中文还是英文?我的「灵机一动」时刻

绝大多数国内平台都宣称「支持中文提示词」,实际用下来,人物、风景、静物等常见题材,中文描述确实能正常工作。比如输入「一个穿着白裙子的女孩在向日葵花田里微笑」,即梦 4.5 模型基本能给出构图合理的画面。

但有一个案例让我印象极深:我想生成一张「老茶馆里,一位戴眼镜的老板用长嘴铜壶倒茶」的场景。中文提示词反复调了七八遍——加上了「蒸汽缭绕」「木质桌椅」「复古灯笼」等细节,结果生成的人物要么表情呆滞,要么茶壶形态怪异,甚至背景直接变成现代咖啡厅。我几乎要放弃了,突然想起网上有人提过「英文提示词更稳定」,于是死马当活马医,翻译成:

"An elderly teahouse owner with glasses, pouring tea with a long-spout copper kettle, steam rising, wooden tables and vintage lanterns, warm atmosphere."

结果第一次生成就基本达标,人物动作自然,环境氛围也对味。这当然可能是个例,但后来我在 Liblib 上使用 SD WebUI 时,发现英文提示词的效果普遍优于中文——毕竟底层模型(如 Stable Diffusion)的训练语料以英文为主,英文描述在语义嵌入上更精确。

我的建议是:

国内闭源模型(即梦、通义万象)优先用中文,方便快捷;

如果中文反复试都不满意,花 30 秒翻译成英文再试,不亏;

如果在 Liblib 等平台用 SD 1.5/XL 或 ComfyUI 工作流,直接写英文,不要用中文翻译插件,那样反而会损失细节。

另外注意:英文提示词不必追求语法完美,关键词堆叠 + 逗号分隔就足够,比如 tea house, old man, copper kettle, steam, warm light, cinematic,模型反而更容易抓住核心。


第二章:负面提示词——不是万能药,别把它当「橡皮擦」

现在主流工具都支持输入负面提示词(Negative Prompt),用来告诉模型「我不要什么」。比如画人时,很多人会填「畸形手指,多出来的手臂,模糊,模糊背景」。这确实能降低翻车率,但它不是万能的。

我遇到过两次典型的「负面词失效」:

我想生成一只「橘猫趴在窗台上,窗外下雨」,为了不让猫变成奇形怪状的怪物,我加了 extra legs, missing eyes, deformed,结果猫是正常了,但窗外雨丝完全没了,变成了晴天。因为模型把「模糊」「变形」这类词过度泛化,连带把雨丝这类「动态细节」也抑制了。

另一回我想画「一位老人脸上有皱纹」,负面词里写了 smooth skin, young,但生成的人依然皮肤光洁。后来换了一个模型(从即梦 4.7 换成 5.0),问题自然消失——说明负面词的生效与否,很大程度上依赖于模型本身的训练数据分布。有些模型对「年龄」特征敏感,有些则更关注「光影」。

我的实战心得:

负面提示词只填最基础、最通用的缺陷,比如「低画质,畸形,多余肢体」,不要贪多;

如果特定问题(比如人物总是闭眼)反复出现,负面词加 closed eyes 试三次,如果无效,放弃纠结,转而修改正面提示词,比如换成 open eyes, looking at viewer

更极端的情况——负面词无效且正面词也调不动,那大概率是模型能力边界的问题,这时候果断换模型,比死磕效率高得多。


第三章:模型选择——别追新,够用就是王道

很多新手有个误区:觉得版本号越大越好,非最新版不用。以即梦为例,我一开始也直奔 5.0/5.1,结果经常遇到「生成失败」「超时」「内容违规」等莫名其妙的问题(免费用户可能被限流,但也可能是模型不稳定)。而且新模型通常消耗更多积分或额度,对我这种白嫖党很不友好。

后来我退回到 4.5 和 4.7,发现:

出图速度快(几乎 10 秒以内);

风格偏写实,色彩舒服,符合我的日常需求;

很少翻车,几乎每次都能出可用的图。

举个真实案例:我要做一张「深夜便利店门口,一只流浪猫蹲在路灯下」的图。5.0 模型试了三次都报错,换成 4.7 一次过,而且灯光氛围很有电影感。从此我就把 5.0「雪藏」了。

其他平台也类似——Liblib 上的 SD 模型,有些「老版本」(如 SD 1.5 的精调版)在特定风格(二次元、水墨)上反而比最新的 SDXL 更稳定。通义万象的早期版本对人脸表情的处理更柔和。

我的选型准则:

先试用平台默认推荐模型,如果效果满意,就固定下来;

如果出图率低(超过 3 次失败),立刻降版本,而不是升级;

不要被「最新」「最强」「4K 超清」等营销词汇忽悠,最终看生成的样图是否符合你的审美,而不是看参数。


第四章:参考图生图——AI 不懂「生活常识」,你得替它补上

现在的工具几乎都支持图生图(Image-to-Image),即上传一张参考图,让 AI 基于它修改或延展。这功能看起来强大,但 AI 对「物理世界逻辑」的理解极其薄弱——它只会像素级模仿,不会「推理」行为背后的情境。

我踩过的一个经典坑:我想根据一张「成年男性站立全身照」的参考图,生成「他躺在床上熟睡」的画面。结果 AI 直接把人原封不动搬到了床上——衣服还是那套外出服,皮鞋还穿在脚上,甚至手里还握着手机。这显然不合常理,但 AI 觉得「人」和「床」放在一起就够了,至于脱鞋、换睡衣、盖被子,它根本想不到。

后来我在提示词里明确加上:

wearing pajamas, barefoot, blanket over body, eyes closed, sleeping posture

才终于得到一张合理的睡觉图。类似的生活逻辑盲区还有很多:

「做菜」场景:AI 不会自动给人物系围裙,锅铲可能悬在空中;

「跑步」场景:AI 经常让人物穿着拖鞋或高跟鞋;

「下雨天打伞」:AI 可能让人握着伞柄,但伞面是收起来的。

解决方案:

在提示词里显式写出「应该有的物件/状态」,比如 wearing apronholding an open umbrellashoeless

如果参考图本身特征太强(比如特定服装),AI 会过度保留,这时可以降低「参考强度」参数(如有),或者用「重绘」模式只保留构图,不保留细节;

实在不行,放弃参考图,纯文字描述反而更容易获得正确的生活逻辑。


第五章:进阶之路——SD + WebUI/ComfyUI,适合「较真」的人

如果你需要 AI 图片用于商业设计——比如产品包装、服装款式图、建筑效果图——那么前述的闭源模型(即梦、通义等)往往不够精准,因为它们的随机性太强,风格不可控,也无法精细调节。

这时,Stable Diffusion(SD)搭配 WebUI 或 ComfyUI 是行业主流方案。它们的优势是:

可精确控制姿势(OpenPose)、深度(Depth)、构图(Canny);

可使用 LoRA 微调特定角色或画风;

可自定义采样器、步数、CFG 权重,出图质量上限极高。

但代价是学习门槛:你需要理解「潜空间」「VAE」「CLIP」等概念,还要会安装插件、管理模型文件、调试报错。我自己目前也还在摸索阶段,在 Liblib 上租用云端显卡跑过几个工作流,确实感受到了自由度,但每次调整参数都像在「编程」,不适合只想快速出图的场景。

给普通用户的建议:

如果你不靠 AI 吃饭,完全没必要急着学 SD,先把即梦这类工具用透;

如果你确实有商业需求,可以先用闭源模型做「创意草图」,确定方向后,再用 SD 精细打磨,降低前期试错成本;

网上教程很多(B站、知乎都有完整系列),但不要贪多,先跟着一个「从零到一」的完整案例走一遍,比碎片化看几十个视频更有效。


第六章:我的日常出图流程(附小抄)

最后,分享一下我每次出图的标准操作,供参考:

确定需求:这张图用来做什么?配图、头像、参考、打印?决定分辨率和风格(写实/插画/3D)。

写初版提示词:先用中文写一个「主体 + 环境 + 氛围」的短句,比如「一只柴犬在樱花树下打盹」。

添加修饰词:加入光线、视角、色彩、情绪,比如「夕阳侧光,低角度仰拍,暖色调,宁静」。

选模型:优先用自己熟悉的旧版本(我用即梦 4.7),出图快且稳定。

首先生成 2~3 张,看构图和颜色是否满意。如果完全跑偏,调整提示词顺序——把最重要的主体词放最前面,模型会更关注它。

如果 3 次都失败:换英文重写一遍,或换一个模型版本,或干脆简化提示词(去掉部分修饰词)。

出图后微调:如果有小瑕疵(比如手指畸形),我会用手机自带的修图工具简单涂抹,不依赖 AI 二次生成,因为二次修改费时且不可控。

我的「提示词小抄」常驻备忘录:

[主体] + [动作/状态] + [环境] + [光线/色调] + [视角] + [氛围词]

例:女孩 坐在窗边 读书 雨天 室内 冷色调 俯视 忧郁

结语:AI 是工具,不是魔术师

回顾这几个月的体验,我最大的感悟是:AI 生图并不神秘,它更像一个「非常听话但缺乏常识的实习生」。你给的指令越具体、越符合它训练数据里的表达方式,它就越能交出好作品。反之,指望它「猜中你的心思」,只会浪费额度。

至于要不要充值会员、要不要追新模型——完全取决于你的使用频率和收益。对我这样的轻量用户,免费额度 + 旧模型 + 英文备用方案,已经覆盖了日常需求。而如果你真的想深入,SD 这条路径值得花时间,但请保持耐心,它是一场马拉松,不是冲刺。

希望这篇「野路子」教程能帮你少走一些弯路。下次当你对着生成失败的图抓狂时,不妨先停下来,重新读一遍自己的提示词——也许问题就藏在那个你没写出来的「脱鞋」里。


本文由 kuzhang 整理