你以为AI在画画?醒醒,它只是在玩"马赛克消消乐"
刷短视频的时候,总能看到那种AI生成的美女。
光影细腻,发丝根根分明,眼神里甚至带着情绪。评论区永远有人惊叹:"这跟照片有什么区别?""AI已经这么恐怖了吗?"
每次看到这种评论,我都想隔空喊一句:兄弟,你被骗了。
AI不仅不懂艺术,它甚至是个"盲人"。它压根不知道"美女"俩字是什么意思,不知道眼睛长在鼻子上面还是下面,更不知道什么叫"好看"。
那它是怎么画出来的?
答案会让你大跌眼镜:它只是在玩一场极其无聊的"像素消消乐"。
01. 先复习一下:文字AI是"接龙大神"
要理解AI怎么画画,得先从"文字AI怎么说话"说起。
你还记得上一期我们聊过的吗?ChatGPT这类东西,本质上就是个超级输入法。你打"床前明月",它接"光"。你问"怎么减肥",它接"少吃多动"。
它说的每一个字都是"蒙"的,只不过蒙得准。
那好,现在问题来了——如果给AI的任务不是"接下一个字",而是"接下一张图"呢?
这就变成了AI画画。
你给它一句"一只戴着墨镜的柴犬",它要干的事,跟你手机输入法干的事,底层逻辑一模一样:根据上文,补全下文。
只不过它的"下文"不是文字,是几百万个像素点的颜色数值。
02. 先有雪花,后有画
这里有个反直觉的地方。
你以为AI画画是"从空白画布开始,一笔一笔勾勒"?就像人类画家那样,先打草稿,再上色,再细化?
完全不是。
AI画画,是从一团完全的雪花噪点开始的——就是老式电视机没信号时那种"滋啦滋啦"的雪花屏。
对,你没听错。AI拿到你的提示词之后,做的第一件事是:生成一张纯随机的马赛克雪花图。
然后,它开始玩"反向消消乐"。它拿着你的文字提示词当"攻略",一步一步地把雪花里的"噪点"消掉。每一轮消一点,每一轮消一点……经过几十轮,那团混沌的雪花,竟然慢慢长出了耳朵、鼻子、墨镜,最终变成一只活灵活现的柴犬。
这个过程叫"去噪",学名"扩散模型"。
你可以想象你在玩一个极端无聊的手机游戏:屏幕上全是乱码,你每次划一下,乱码就清晰一点点。划几百下之后,乱码变成了一张照片。
AI干的就是这事儿,只不过它划得比你快几万倍。
03. "墨镜"在AI脑子里长啥样?
那问题来了:AI怎么知道"墨镜"对应的是黑色块,"柴犬"对应的是毛茸茸的棕色块?
这就要回到我们反复念叨的那个概念:高维空间嵌入(Embedding)。
在AI的"字典"里,"墨镜"这个词不是一个词,而是一个坐标——一个几千维空间里的点。
这个点周围有什么?有"黑色"的坐标,有"圆形"的坐标,有"戴在脸上"的坐标。这些坐标都是从几十亿张图文配对里"挤"出来的。
更夸张的是,图片本身也是坐标。
AI把"戴着墨镜的柴犬"这张图的每一个像素,也映射到这个空间里。在训练的时候,它被喂了几十亿张"文字+图片"的对子——"狗"配一张狗图,"夕阳"配一张夕阳图,"赛博朋克"配一堆赛博朋克图。
经过这种训练,AI的坐标系里形成了一个恐怖的能力:你给它一个文字坐标,它能在图片坐标区里找到最匹配的那片区域。
这就好比你有一个超级巨大的图书馆,每本书都有编号。你告诉管理员"我要一本关于狗和墨镜的书",管理员不用理解书的内容,只需要查编号索引,就能把那本书薅出来。
AI画画,就是在它的"编号系统"里做检索和重组。它不懂狗,但它知道"狗"的编号附近都是毛茸茸的东西。
04. 追光灯怎么打?
再来一个灵魂拷问:如果你输入的提示词是"一个穿红裙子的女孩在雨中奔跑",里面有"红裙子""女孩""雨""奔跑"四个关键要素,AI怎么分配注意力?哪个更重要?
这就轮到注意力机制(Attention)出场了。
你可以把它想象成一个"追光灯操作员"。AI在处理这句提示词的时候,追光灯在不同词之间来回扫射:
- 扫到"红裙子" → 给图片中央区域施压:"给我变红!"
- 扫到"雨" → 给全图施压:"给我变灰蓝,加模糊线条!"
- 扫到"奔跑" → 给腿部位置施压:"给我加动态模糊!"
这个过程是同时发生的,而且是几十层同时进行。每一层都在执行不同的"灯光指令"。第一层可能只管"颜色",第二层只管"形状",第三层只管"纹理"……
最终,所有的"灯光压力"叠加在一起,硬生生把一团雪花"压"成了一幅画。
05. 那些藏在背后的"旋钮"
你可能已经猜到了——跟文字AI一样,绘画AI背后也有几十亿个"旋钮"(参数)。
文字AI的旋钮拧出来的是"下一个字的概率",绘画AI的旋钮拧出来的是"下一个像素的颜色值"。
如果你问我,这两者谁更难?
我会说绘画AI更惨。
文字AI猜一个字,只需要算一个概率。绘画AI猜一张图(比如1024×1024分辨率),需要同时猜超过一百万个像素的颜色。每个像素有RGB三个通道,也就是要猜三百万个数值。
这就好比让你蒙着眼睛,去拧一台拥有十亿个旋钮的收音机。你的任务不是让它出声,而是让杂音恰好组成《蒙娜丽莎》。
这就是AI的训练过程:一遍又一遍地"加噪→去噪",拧动那些旋钮,直到雪花变成名画。
训练数据是啥?是几十亿张从网上扒来的图——名画、自拍、电影截图、表情包……不管好坏,通通喂进去。AI不需要理解"这幅画好不好看",它只需要记住:在这张图里,这个像素旁边,大概率是那个颜色。
它不懂构图,不懂配色,不懂光影,它只是把几十亿张图的"像素邻居关系"硬背了下来。
06. 所以,这是不是人类的想象力?
说到这儿,你可能有点沮丧——原来AI画画这么"笨",纯粹是数学游戏。
但你有没有想过一个问题:人类的想象力,本质上是不是也是这套东西?
你听到"独角兽"这个词,脑子里瞬间浮现出那个画面——马的身体,角的螺旋,彩虹色的鬃毛。
你见过马,见过角,见过彩虹。你从来没亲眼见过独角兽,但你的大脑自动组合了这些见过的元素,生成了一张你从未见过的"假图"。
这个过程,跟AI把"马"的坐标和"角"的坐标叠加,有什么区别?
区别可能只有一个:你有肉身,你有被火烧过的痛觉,你有摔跤后的眩晕感,你有活了二三十年积累的"具身经验"。
AI没有。它的"想象力"建立在纯文本和纯像素之上,没有汗水的咸味,没有心跳的加速。
但抛开这些感官体验,在"把旧元素组合成新画面"这件事上,你跟AI干的活儿,底层逻辑一模一样。
所以,别再用"AI没有想象力"来安慰自己了。
它可能真的没有"想象"这种主观体验,但它产出的结果,已经让大多数人类画师感到后背发凉。
当一台没有眼睛的机器,能把你脑子里模模糊糊的梦,渲染成一张高清大图甩在你面前时——
你该追问的不是"AI怎么做到的",而是:
"我这个每天在脑海里放电影的'我',该不会也是个高级点的扩散模型吧?"
❤️ 如果你喜欢这篇文章,请点赞支持! 👍 同时欢迎关注我的博客,获取更多精彩内容!
本文来自博客园,作者:佛祖让我来巡山,转载请注明原文链接:https://www.cnblogs.com/sun-10387834/p/22303670

浙公网安备 33010602011771号