从"视觉与语言打通"到电商营销内容生成落地
一、视觉和语言的打通
1.1 什么是"打通"?
所谓打通,就是一个模型能同时看懂语言和视觉——输入端既能读文字也能看图;进阶能力是输出端也不限于文字,还能输出图片、视频。
1.2 打通之后有什么好处?
- 视觉转译:把看到的内容翻译成文字(或反过来),例如看图说话、根据描述改图;
- 融合推理:视觉信息和语言信息放在一起做推理,而不是各算各的;
- 视觉编辑:用自然语言直接驱动图片/视频的修改。
可以理解为:视觉和语言一旦进入同一个模型,二者就从"两种孤立的数据格式"变成了"可以互相翻译、互相推理的统一信息"。
二、视觉识别 与 视觉推理
这一部分的核心是传统视觉识别模型与多模态模型的对比。
2.1 传统视觉识别模型:Yolo、UNet
- Yolo:负责目标物体的识别(图里有什么、在哪里);
- UNet:负责具体区域的分割(每个像素属于谁)。
2.2 多模态模型
代表产品:Gemini、GPT、Qwen VL、豆包 Seed 等。
2.3 对比总结
| 维度 | 传统视觉识别模型(Yolo / UNet) | 多模态模型(Gemini / GPT / Qwen VL / 豆包 Seed) |
|---|---|---|
| 优势 | 模型小、部署和使用成本低、识别精度高 | 无需标注、无需训练、直接使用、有推理能力 |
| 劣势 | 需要单独标注数据、训练模型 | 部署和使用成本较高,精度中等 |
选型思路(个人总结):
- 场景固定、精度要求高、调用量大、对成本敏感 → 传统专用模型更合适;
- 需求多变、需要理解+推理、想快速验证想法 → 直接上多模态模型。
三、视觉生成
3.1 模型能力不足时的综合方案
现实情况是:只是写一段提示词丢给模型,生成的内容往往无法满足业务需求。课程举了三个典型例子:
- 海报生成
- 漫剧视频
- 电商视频
解决思路不是"等模型变强",而是用工程化 + 流程化 + 人机协作的方式补齐模型能力。下面两个案例非常典型。
3.2 案例一:用 AI 做海报
普通人的用法:
- 打开豆包、即梦等 App;
- 写提示词;
- 反复抽卡,不满意就改提示词再来。
这种方式本质上是"单轮博弈",质量完全看运气。
AI 应用的用法(红颜草莓海报案例):
搭建一个新的 AI 应用,把任务拆开:将海报分成多个图层、把生成任务分解成多轮,运营人员只需要操作软件、发起需求,在关键节点做选择题:
- 从商品库中找到"红颜草莓",生成 4 张第一版图片;
- 软件提醒"请选择更倾向的风格"→ 4 选 1;
- 匹配特效模版、生成临时文案,生成 4 张第二版图片 → 4 选 1;
- 生成多版本广告文案、不同字体效果,生成 4 张第三版图片 → 4 选 1;
- 输出最终海报。
这背后其实是三个"新":新的 AI 应用、新的工作流程、新的人机协作——AI 负责批量生成,人负责在每一轮做决策,质量和效率都有保障。
3.3 案例二:电商视频生成(FancyTech)
这个案例来自 FancyTech(商业视频生成方向),展示了营销内容生成的完整技术架构。
整体架构:
- 触达渠道:公域、私域、电商、本地;
- 场景层:需求发起 → 商品录入分析 → 脚本生成 → 原生内容生成 → 混剪生成 → 渠道发布 → 数据回流;
- 功能层:外部素材调用、商品信息采集、营销素材与投放数据分析、内容理解、智能标注、智能抠图、文本分割、视频切片等;
- 数据资产:超 2 年持续积累,分钟级持续更新,500w+ 商品信息,亿级图、文、视频素材;
- 底层模型库:内容理解模型(自研 LLM、多模态理解、LLM+NER+OCR、百万级对齐数据)、脚本生成模型(商品理解、Lora SFT+DPO、百亿参数量级)、文案生成模型、图片生成模型(场景重绘、材质增强、千万级训练数据)、视频生成模型(UNET & DiT、多模态输入、极高还原度)、工具调用模型(API 调用、外部工具链接、自动参数构造)、视频打分模型(机器学习、投放数据训练、持续强化)。
营销内容的主体思路:视频片段组合
- 视频由多条视频片段拼接而成;
- 视频片段的来源:品牌视频切片、产品展示切片、模特展示切片、直播切片等;
- 关键洞察:如果每条视频片段都有足够丰富的文字描述,那么 LLM 就有能力去组合这些视频片段。
探索有效的切片方式(六步法):
- AI + 人工切片,切成 1~10 秒的短视频;
- 通过代码或工具,将视频中的音频分离;
- 从音频中提取文字;
- 通过多模态模型对画面进行文字描述;
- 人工补充修改文字描述;
- 整理成结构化信息。
切片示例(欧莱雅紫熨斗全脸淡纹眼霜):
| 视频内容 | 视频形式 | 时长 | 音频文字(转写) | 视觉描述 |
|---|---|---|---|---|
| 痛点描述 | 真人演绎、特效动画 | 6 秒 | "这是侧睡时的你,就像 4 千克的哑铃在脸上挤压,压垮肌肤弹簧" | 女性侧躺睡觉,跳出白色 4kg 哑铃,把侧睡比喻为皮肤承受哑铃重量,动画特效表现肌肤弹簧被压垮 |
| 痛点描述 | 真人演绎、特效动画 | 10 秒 | "肌肤压力警告,侧睡纹生成中。侧睡压力 4 公斤" | 女人的脸贴在玻璃上表现侧睡时肌肤状态,电脑、咖啡杯、文件夹、绿植等物品加起来的重量表现 4 公斤 |
| 痛点描述 | 直播切片 | 10 秒 | "侧着睡觉就相当于在 8 个小时的时间里,脸上压了 5 公斤重左右的哑铃……" | 男性主播,形象清秀穿白色衣服,在直播台前介绍产品 |
| 痛点描述 | 直播切片 | 5.2 秒 | "就会比同龄人老个 5-6 岁……我们要比同龄人年轻个 5-6 岁" | 男性主播在直播台前介绍产品 |
| 品牌介绍 | 直播切片 | 8 秒 | "欧莱雅做玻色因做了 20 多年,没有平替。抗皱、淡纹、提拉紧致、补水保湿、修护肌肤" | 男性主播在直播台前介绍产品 |
| 产品介绍 | 直播切片 | 6.2 秒 | "全新升级的第三代紫熨斗眼霜,一觉淡褪侧睡纹,一支全脸淡纹" | 男性主播在直播台前介绍产品 |
| 痛点描述 | 真人演绎、特效动画 | 3.4 秒 | "知道么,睡觉也是会压出细纹的哦" | 品牌代言人钟楚曦,长发,侧躺沙发,提出睡觉压出细纹的观点 |
| 痛点描述 | 真人演绎、特效动画 | 6.5 秒 | "我们的肌肤是有许许多多的小弹簧的,一直这样子挤压着它们的话,肌肤会失去弹性" | 品牌代言人钟楚曦,白色吊带背心、卷发,面对镜头表述,穿插动画特效 |
| 代言人展示产品 | 真人演绎、特效动画 | 3.5 秒 | "然后这一支呢,现在又、又、又升级啦" | 品牌代言人钟楚曦面对镜头表述,穿插动画特效 |
| 产品特性展示 | 真人演绎、特效动画 | 5.7 秒 | "多添加了一个功效放大器,能够把肌肤里的小弹簧通通都撑起来" | 品牌代言人钟楚曦面对镜头表述,穿插动画特效 |
可以看到,每条切片都被整理成了"视频内容 / 视频形式 / 时长 / 相关产品 / 音频文字 / 视觉描述"的结构化信息。有了这种粒度的文字描述,混剪就从"人工找素材"变成了"LLM 按脚本组合素材"。
3.4 没有模特视频的商品怎么办?
现实问题:大量商家 95% 以上的商品没有拍过模特展示视频。
先看两个技术前提:
- 文生视频:可控性普遍还不够;
- 图生视频:生成几秒钟的展示视频,效果是可用的;
- 商品如何上身到模特?Flux 是很强的开源生图模型,而且有很多基于 Flux 或 Stable Diffusion 的变体模型。
基于以上前提,从电商商家视角梳理一个 AI 产品的完整步骤:
第 1 步:商家有什么?缺什么?
- 商家有很多商品图片,但缺版权模特;
- 解决方案:用 Flux 模型帮商家生成足够多的模特,且没有版权问题。
第 2 步:把服饰穿到模特身上
- 需要一个换装模型;
- 解决方案:调研大量开源模型、闭源模型 API,找到合适的换装模型,这里使用 CatVTON;
- 经验之谈:如果测试得足够多,就能找到这类模型的特点。
商品上身范围:服装、帽子、鞋子、包、配饰、首饰、手表等。前提是要梳理和标注所有的商品图、模特图,例如:
- 上衣类别:连衣裙、T 恤、衬衫、外套、针织衫、风衣、西服、卫衣、马夹、大衣、皮衣、皮草、毛衣、羽绒服等;
- 上衣款式:贴身款、修身款、合身款、宽松款、超宽松款;
- 上衣长度:超短款、短款、常规款、中长款、长款、超长款;
- 上衣袖子:长袖、半袖、短袖、无袖;
- 下衣类别:连衣裙、半身裙、休闲裤、牛仔裤、短裤、直筒裤、工装裤、西裤、运动裤等;
- 下衣款式:紧身款、修身款、合身款、宽松款、超宽松款;
- 下衣长度:拖地、长、7 分、膝盖、短、超短。
再整理一套模特与商品的可用关系规则,例如:
- 长配长、短配短;
- 外套配外套、裙子配裙子;
- 修身配修身、肥大配肥大;
- 等等其他有效规则。
第 3 步:给图片增加合适的场景
不同类型的商品和模特适合配不同的场景:
- 服装类型:正式商务装、休闲运动装、日常休闲装、晚礼服、度假装、复古风、街头潮流装、夏季轻装、婚纱礼服、秋冬款;
- 场景库:办公室环境、城市商务街区、健身房/运动场、公园/户外、咖啡店/餐厅、街头/城市街区、宴会厅/高端酒店、豪华酒吧/夜店、海滩/度假胜地、热带植物园、古老咖啡馆/复古街区、博物馆/艺术馆、工业区/仓库、雪地/山区。
第 4 步:让商品图、模特图动起来
用图生视频工具(如海螺)生成视频片段,套模版。
第 5 步:给文案配音,并且配上音乐
最终混剪出完整的电商营销视频。
3.5 千人千面与数据闭环
- 更好的生成效果 → 带来更多用户和数据;
- 流程完全自动化:Prompt → 分镜脚本(镜头 1/2/3……)→ 外部素材库匹配 → 自研模型内容生成 → 投放数据回流,无需客户投入精力;
- 每日数据回流,持续优化出更匹配商品特点、热点趋势、用户偏好的技术方案;
- 实现 T+1 反馈、T+1 优化生产:视频内容播放量提升 30%,视频内容平均点击率提升 50%。
四、总结与思考
这节课给我印象最深的三点:
- 多模态的本质是"打通":一个模型同时理解视觉和语言,进而能输出文字、图片、视频,由此带来视觉转译、融合推理、视觉编辑三类能力。
- 识别任务要会选型:传统模型(Yolo/UNet)便宜精准但要标注训练;多模态模型开箱即用、有推理能力,但成本高、精度中等。没有银弹,只有场景匹配。
- 生成落地的关键不是模型,而是工程方法:模型能力不足时,用"拆"来补——海报拆图层、视频拆片段、素材拆成结构化描述。尤其是"把视频切片转成丰富的文字描述,再让 LLM 去组合"这个思路,本质上是把非结构化数据结构化,让大模型得以参与内容生产。配合投放数据回流的 T+1 闭环,才真正形成了可规模化的商业方案。

浙公网安备 33010602011771号