Generate AI手册 -- 第IX部分:多模态模型

在网上读到一篇非常不错的博客,特意将其翻译为中文,分享给大家。原文可以引用:
@misc{Brown24GAIHB,
author = {Brown, William},
title = {Generative AI Handbook: A Roadmap for Learning Resources},
year = 2024,
url = {https://genai-handbook.github.io}
}

第IX部分:多模态模型

目标:调研模型如何同时使用多种模态的输入和输出(文本、音频、图像)。

注意:这是我最不熟悉的主题集,但我想为了完整性而包括它们。我在这里的评论和建议会较少,当我认为自己有一个更紧密的故事要讲述时,我会回来添加更多内容。Chip Huyen 的“Multimodality and Large Multimodal Models (LMMs)” 的帖子是一个很好的广泛概述(或者 Kevin Musgrave 的 “How Multimodal LLMs Work” 的更简洁版本)。

第51章:超越文本的Tokenization

Tokenization的概念不仅适用于文本;音频、图像和视频也可以“tokenized”以用于 Transformer 风格的架构,并且需要在标记化和其他方法(如卷积)之间考虑一系列的权衡。接下来的两个部分将更多地探讨视觉输入;这篇来自 AssemblyAI 的博客文章涉及音频tokenization和序列模型表示的相关主题,适用于音频生成、文本到语音和语音到文本等应用。

第52章:VQ-VAE

VQ-VAE 架构近年来已经成为图像生成的流行选择,并且是 DALL-E 最早版本的基础。

资源:

第53章:视觉Transformer

视觉Transformer将Transformer架构扩展到图像和视频等领域,并已成为自动驾驶汽车以及多模态大型语言模型(LLMs)的流行应用。d2l.ai书籍中有一节 很好地介绍了它们的工作原理。

Lilian Weng的“Generalized Visual Language Models” 讨论了一系列不同的方法,用于训练多模态Transformer风格的模型。

Encord博客的 “Guide to Vision Language Models” 概述了几种混合文本和视觉的架构。

如果你对视觉Transformer的实际大规模训练建议感兴趣,苹果的MM1论文检查了几种架构和数据权衡,并提供了实验证据。

Distill.pub的“Multimodal Neurons in Artificial Neural Networks”有一些非常有趣的多模态网络中概念表示的可视化。

posted @ 2024-07-29 16:10  不秃头的程序员不秃头  阅读(51)  评论(0)    收藏  举报