从"视觉与语言打通"到电商营销内容生成落地

一、视觉和语言的打通

1.1 什么是"打通"?

所谓打通,就是一个模型能同时看懂语言和视觉——输入端既能读文字也能看图;进阶能力是输出端也不限于文字,还能输出图片、视频

1.2 打通之后有什么好处?

  • 视觉转译:把看到的内容翻译成文字(或反过来),例如看图说话、根据描述改图;
  • 融合推理:视觉信息和语言信息放在一起做推理,而不是各算各的;
  • 视觉编辑:用自然语言直接驱动图片/视频的修改。

可以理解为:视觉和语言一旦进入同一个模型,二者就从"两种孤立的数据格式"变成了"可以互相翻译、互相推理的统一信息"。


二、视觉识别 与 视觉推理

这一部分的核心是传统视觉识别模型与多模态模型的对比

2.1 传统视觉识别模型:Yolo、UNet

  • Yolo:负责目标物体的识别(图里有什么、在哪里);
  • UNet:负责具体区域的分割(每个像素属于谁)。

2.2 多模态模型

代表产品:Gemini、GPT、Qwen VL、豆包 Seed 等。

2.3 对比总结

维度 传统视觉识别模型(Yolo / UNet) 多模态模型(Gemini / GPT / Qwen VL / 豆包 Seed)
优势 模型小、部署和使用成本低、识别精度高 无需标注、无需训练、直接使用、有推理能力
劣势 需要单独标注数据、训练模型 部署和使用成本较高,精度中等

选型思路(个人总结):

  • 场景固定、精度要求高、调用量大、对成本敏感 → 传统专用模型更合适;
  • 需求多变、需要理解+推理、想快速验证想法 → 直接上多模态模型。

三、视觉生成

3.1 模型能力不足时的综合方案

现实情况是:只是写一段提示词丢给模型,生成的内容往往无法满足业务需求。课程举了三个典型例子:

  1. 海报生成
  2. 漫剧视频
  3. 电商视频

解决思路不是"等模型变强",而是用工程化 + 流程化 + 人机协作的方式补齐模型能力。下面两个案例非常典型。

3.2 案例一:用 AI 做海报

普通人的用法

  1. 打开豆包、即梦等 App;
  2. 写提示词;
  3. 反复抽卡,不满意就改提示词再来。

这种方式本质上是"单轮博弈",质量完全看运气。

AI 应用的用法(红颜草莓海报案例)

搭建一个新的 AI 应用,把任务拆开:将海报分成多个图层、把生成任务分解成多轮,运营人员只需要操作软件、发起需求,在关键节点做选择题:

  1. 从商品库中找到"红颜草莓",生成 4 张第一版图片;
  2. 软件提醒"请选择更倾向的风格"→ 4 选 1;
  3. 匹配特效模版、生成临时文案,生成 4 张第二版图片 → 4 选 1;
  4. 生成多版本广告文案、不同字体效果,生成 4 张第三版图片 → 4 选 1;
  5. 输出最终海报。

这背后其实是三个"新":新的 AI 应用、新的工作流程、新的人机协作——AI 负责批量生成,人负责在每一轮做决策,质量和效率都有保障。

3.3 案例二:电商视频生成(FancyTech)

这个案例来自 FancyTech(商业视频生成方向),展示了营销内容生成的完整技术架构。

整体架构

  • 触达渠道:公域、私域、电商、本地;
  • 场景层:需求发起 → 商品录入分析 → 脚本生成 → 原生内容生成 → 混剪生成 → 渠道发布 → 数据回流;
  • 功能层:外部素材调用、商品信息采集、营销素材与投放数据分析、内容理解、智能标注、智能抠图、文本分割、视频切片等;
  • 数据资产:超 2 年持续积累,分钟级持续更新,500w+ 商品信息,亿级图、文、视频素材;
  • 底层模型库:内容理解模型(自研 LLM、多模态理解、LLM+NER+OCR、百万级对齐数据)、脚本生成模型(商品理解、Lora SFT+DPO、百亿参数量级)、文案生成模型、图片生成模型(场景重绘、材质增强、千万级训练数据)、视频生成模型(UNET & DiT、多模态输入、极高还原度)、工具调用模型(API 调用、外部工具链接、自动参数构造)、视频打分模型(机器学习、投放数据训练、持续强化)。

营销内容的主体思路:视频片段组合

  1. 视频由多条视频片段拼接而成;
  2. 视频片段的来源:品牌视频切片、产品展示切片、模特展示切片、直播切片等;
  3. 关键洞察:如果每条视频片段都有足够丰富的文字描述,那么 LLM 就有能力去组合这些视频片段。

探索有效的切片方式(六步法)

  1. AI + 人工切片,切成 1~10 秒的短视频;
  2. 通过代码或工具,将视频中的音频分离;
  3. 从音频中提取文字;
  4. 通过多模态模型对画面进行文字描述;
  5. 人工补充修改文字描述;
  6. 整理成结构化信息。

切片示例(欧莱雅紫熨斗全脸淡纹眼霜)

视频内容 视频形式 时长 音频文字(转写) 视觉描述
痛点描述 真人演绎、特效动画 6 秒 "这是侧睡时的你,就像 4 千克的哑铃在脸上挤压,压垮肌肤弹簧" 女性侧躺睡觉,跳出白色 4kg 哑铃,把侧睡比喻为皮肤承受哑铃重量,动画特效表现肌肤弹簧被压垮
痛点描述 真人演绎、特效动画 10 秒 "肌肤压力警告,侧睡纹生成中。侧睡压力 4 公斤" 女人的脸贴在玻璃上表现侧睡时肌肤状态,电脑、咖啡杯、文件夹、绿植等物品加起来的重量表现 4 公斤
痛点描述 直播切片 10 秒 "侧着睡觉就相当于在 8 个小时的时间里,脸上压了 5 公斤重左右的哑铃……" 男性主播,形象清秀穿白色衣服,在直播台前介绍产品
痛点描述 直播切片 5.2 秒 "就会比同龄人老个 5-6 岁……我们要比同龄人年轻个 5-6 岁" 男性主播在直播台前介绍产品
品牌介绍 直播切片 8 秒 "欧莱雅做玻色因做了 20 多年,没有平替。抗皱、淡纹、提拉紧致、补水保湿、修护肌肤" 男性主播在直播台前介绍产品
产品介绍 直播切片 6.2 秒 "全新升级的第三代紫熨斗眼霜,一觉淡褪侧睡纹,一支全脸淡纹" 男性主播在直播台前介绍产品
痛点描述 真人演绎、特效动画 3.4 秒 "知道么,睡觉也是会压出细纹的哦" 品牌代言人钟楚曦,长发,侧躺沙发,提出睡觉压出细纹的观点
痛点描述 真人演绎、特效动画 6.5 秒 "我们的肌肤是有许许多多的小弹簧的,一直这样子挤压着它们的话,肌肤会失去弹性" 品牌代言人钟楚曦,白色吊带背心、卷发,面对镜头表述,穿插动画特效
代言人展示产品 真人演绎、特效动画 3.5 秒 "然后这一支呢,现在又、又、又升级啦" 品牌代言人钟楚曦面对镜头表述,穿插动画特效
产品特性展示 真人演绎、特效动画 5.7 秒 "多添加了一个功效放大器,能够把肌肤里的小弹簧通通都撑起来" 品牌代言人钟楚曦面对镜头表述,穿插动画特效

可以看到,每条切片都被整理成了"视频内容 / 视频形式 / 时长 / 相关产品 / 音频文字 / 视觉描述"的结构化信息。有了这种粒度的文字描述,混剪就从"人工找素材"变成了"LLM 按脚本组合素材"。

3.4 没有模特视频的商品怎么办?

现实问题:大量商家 95% 以上的商品没有拍过模特展示视频

先看两个技术前提:

  1. 文生视频:可控性普遍还不够;
  2. 图生视频:生成几秒钟的展示视频,效果是可用的;
  3. 商品如何上身到模特?Flux 是很强的开源生图模型,而且有很多基于 Flux 或 Stable Diffusion 的变体模型。

基于以上前提,从电商商家视角梳理一个 AI 产品的完整步骤:

第 1 步:商家有什么?缺什么?

  • 商家有很多商品图片,但缺版权模特;
  • 解决方案:用 Flux 模型帮商家生成足够多的模特,且没有版权问题。

第 2 步:把服饰穿到模特身上

  • 需要一个换装模型;
  • 解决方案:调研大量开源模型、闭源模型 API,找到合适的换装模型,这里使用 CatVTON
  • 经验之谈:如果测试得足够多,就能找到这类模型的特点。

商品上身范围:服装、帽子、鞋子、包、配饰、首饰、手表等。前提是要梳理和标注所有的商品图、模特图,例如:

  • 上衣类别:连衣裙、T 恤、衬衫、外套、针织衫、风衣、西服、卫衣、马夹、大衣、皮衣、皮草、毛衣、羽绒服等;
  • 上衣款式:贴身款、修身款、合身款、宽松款、超宽松款;
  • 上衣长度:超短款、短款、常规款、中长款、长款、超长款;
  • 上衣袖子:长袖、半袖、短袖、无袖;
  • 下衣类别:连衣裙、半身裙、休闲裤、牛仔裤、短裤、直筒裤、工装裤、西裤、运动裤等;
  • 下衣款式:紧身款、修身款、合身款、宽松款、超宽松款;
  • 下衣长度:拖地、长、7 分、膝盖、短、超短。

再整理一套模特与商品的可用关系规则,例如:

  1. 长配长、短配短;
  2. 外套配外套、裙子配裙子;
  3. 修身配修身、肥大配肥大;
  4. 等等其他有效规则。

第 3 步:给图片增加合适的场景

不同类型的商品和模特适合配不同的场景:

  • 服装类型:正式商务装、休闲运动装、日常休闲装、晚礼服、度假装、复古风、街头潮流装、夏季轻装、婚纱礼服、秋冬款;
  • 场景库:办公室环境、城市商务街区、健身房/运动场、公园/户外、咖啡店/餐厅、街头/城市街区、宴会厅/高端酒店、豪华酒吧/夜店、海滩/度假胜地、热带植物园、古老咖啡馆/复古街区、博物馆/艺术馆、工业区/仓库、雪地/山区。

第 4 步:让商品图、模特图动起来

用图生视频工具(如海螺)生成视频片段,套模版。

第 5 步:给文案配音,并且配上音乐

最终混剪出完整的电商营销视频。

3.5 千人千面与数据闭环

  • 更好的生成效果 → 带来更多用户和数据;
  • 流程完全自动化:Prompt → 分镜脚本(镜头 1/2/3……)→ 外部素材库匹配 → 自研模型内容生成 → 投放数据回流,无需客户投入精力;
  • 每日数据回流,持续优化出更匹配商品特点、热点趋势、用户偏好的技术方案;
  • 实现 T+1 反馈、T+1 优化生产:视频内容播放量提升 30%,视频内容平均点击率提升 50%。

四、总结与思考

这节课给我印象最深的三点:

  1. 多模态的本质是"打通":一个模型同时理解视觉和语言,进而能输出文字、图片、视频,由此带来视觉转译、融合推理、视觉编辑三类能力。
  2. 识别任务要会选型:传统模型(Yolo/UNet)便宜精准但要标注训练;多模态模型开箱即用、有推理能力,但成本高、精度中等。没有银弹,只有场景匹配。
  3. 生成落地的关键不是模型,而是工程方法:模型能力不足时,用"拆"来补——海报拆图层、视频拆片段、素材拆成结构化描述。尤其是"把视频切片转成丰富的文字描述,再让 LLM 去组合"这个思路,本质上是把非结构化数据结构化,让大模型得以参与内容生产。配合投放数据回流的 T+1 闭环,才真正形成了可规模化的商业方案。
posted @ 2026-07-17 23:21  coderliu_cn  阅读(5)  评论(0)    收藏  举报