创意产业的人工智能-全-
创意产业的人工智能(全)
译者:飞龙
前言
人工智能是我们这个时代最具争议的技术之一,尤其是对于创意人士来说。如果你相信炒作,它将在几年内取代所有电影制片人和摄影师,而且再也没有人会用手动创造任何东西。但炒作很少转化为现实。
相反,在这本书中,您将看到 AI 如何有可能帮助创意人士变得更加有创造力。确实,AI 将执行一些创意人士曾经被分配的任务,但那些看不到人类价值的客户已经在使用模板和预设。当涉及到需要创造力的工作,人类仍然占上风。
如果创意人士愿意,可以通过使用正确的 AI 工具并避免使用其他工具来增强他们的能力。我在创意人士中经常听到的一个常见的说法是描述一个工具为“好的 AI”或“机器学习,但不是 AI”,但这种区别可以更好地表达为实用 AI或自动化 AI与生成式 AI(更多内容见第一章):
-
实用 AI: 识别、分类和理解
-
生成式 AI: 文本、图像、视频、音频等的创作
-
自动化 AI: 执行人类通常执行的任务
有些任务无聊、乏味,甚至对人类来说难以做好。今天,实用 AI工具可以帮助你完成任务,或者,如果它更可预测,自动化 AI可以为你完成。很少有创意人士愿意一个像素一个像素地选择像素,或者一帧一帧地追踪轮廓,即使 AI 工具并不完美,人类也常常能从它的帮助下受益。有些工作可以自动化或简化;其他工作最好手工完成。这取决于你。
尽管生成式 AI吸引了大部分的仇恨,但这并不意味着它全是坏的;这取决于你如何使用它。虽然版权和伦理问题确实是存在的(见第二章),但记住,在开发过程中,当你提出想法时,几乎任何事情都是可能的。好莱坞导演在编辑新电影时,会使用其他电影的配乐,每个级别的情绪板都充满了别人的作品。这不是一个新概念,如果你做得正确,使用生成式 AI 帮助开发想法,同时人类创造最终产品是可能的。
为了帮助您理解大量使用 AI 功能工具和应用程序,我在这里采取了广泛的视角,尽可能测试了尽可能多的基于网络的服务和本地运行的应用程序。虽然我已经为一些桌面应用程序中隐藏得较好的功能提供了逐步说明,但对于易于使用的网站,我主要关注结果。
由于这本书主要是为非技术创意人士编写的,因此这里检查的大多数解决方案都是面向公众的应用程序和服务。热衷者和开发者可能希望探索开源模型的世界,但大多数设计师不是编码者,您不需要编码就能遵循这里的示例。
在整个过程中,我试图诚实地评估这些系统在面临现实世界问题时实现其承诺的程度。虽然有些对我来说效果不佳,但它们可能对你有效。确实,AI 变化的速度意味着这些系统在我测试它们之后可能已经发生了变化:一些可能会改进,一些可能会更昂贵,而一些可能已经不存在了。
新的模型和新的工具将继续出现——一些在撰写章节和前言之间已经出现——你应该总是准备好亲自测试。但始终要警惕炒作,因为一个解决方案可能在技术上令人印象深刻,但仍然无用。
当你探索为创意专业人士设计的 AI 工具时,你会被许以世界。有时,你会对一项枯燥的工作(如转录)能如此迅速地完成感到惊讶。在其他时候,惊讶和失望的并置可能会令人震惊,例如当我要求 AI 写一首关于海滩度假朋友的歌时。在 30 秒内得到 4 首可接受的歌是令人惊讶的,但其中两首歌是从机器人泳池清洁工的角度来的,这既令人失望(又好笑)。
探索这些工具是一次疯狂而迷人的旅程,我相信它还将持续一段时间。在你自己的旅途中,预期会有不完美:取其精华,去其糟粕。但不要让机器人取代你的创造力。
本书面向的对象
这本书是为希望更好地理解 AI 的创意专业人士所写,以便他们能在自己的创意实践中使用 AI。这不是一本帮助任何人取代创意人类或其创造力的书。
本书涵盖的内容
第一章,迄今为止的 AI 故事,介绍了 AI 技术,讨论了它们的工作原理,并列出了你可能希望进一步调查的许多工具。
第二章,伦理,考虑了围绕 AI 使用的伦理和版权问题。
第三章,音频实用 AI,讨论了转录、节拍匹配、声部分割和音频清理工具。
第四章,图像和视频实用 AI,探讨了如何使用 AI 工具来组织和分类你的媒体,选择人物和物体,重新构图,为立体放映转换,等等。
第五章,文本实用 AI,探讨了关于书面内容的总结、语法、验证和重新格式化。
第六章,文本生成式 AI,专注于文本的重写、引用其他作品、提出想法和翻译。它还探讨了使用 AI 来帮助满足可访问性需求。
第七章,使用图像的生成式 AI,向您展示了如何从现有图像中操作并创建完全由文本或图像源生成的新图像。它考虑了照片、矢量艺术、3D 模型,以及情绪板和创意。
第八章,使用视频的生成式 AI,诚实地探讨了如何从文本、图像或其他视频中扩展和创建剪辑,以及如何将现有视频转变为全新的内容。
第九章,使用音频的生成式 AI,探讨了合成音频的世界,包括音效、音乐、语音、声音克隆以及替换现有录音的部分,以及音频翻译。
第十章,使用图像的自动化 AI,向您展示了几个使用 AI 为您代劳执行任务的工具,包括删除图片、修图以及其他处理任务。您还将了解如何使用 AI 编写脚本以帮助设计任务。
第十一章,使用视频的自动化 AI,探讨了几个自动化视频编辑的工具,从简单的静音移除,到更简单的编辑工具,再到基于提示的全编辑助手。
第十二章,使用数字助手和代理的自动化 AI,探讨了数字助手可能如何进一步发展,AI 驱动的可穿戴设备和浏览器,以及代理的潜力。
要充分利用这本书
您越熟悉更具创意的领域(例如摄影、设计、修图、视频编辑和写作),您会发现这本书越有用,但本书的编写是以普通读者为对象的。
本书中的大多数工具都是基于云的,而一些可以在本地计算机上运行。一台现代 Mac 可以运行本书中提到的所有本地应用程序;一台现代 PC 可以运行其中大多数。
您不需要配备强大显卡的定制 PC,也不需要知道如何编码。
下载彩色图像
书的免费 PDF 版本包含了本书中使用的截图/图表的彩色图像。您可以从这里下载:packt.link/gbp/9781806025817。
使用的约定
本书使用了多种文本约定。
CodeInText:表示提示和其他输入。例如:“我将要求工具用普通英语执行:从这张图片中移除人物。”
粗体:表示新术语、重要单词或屏幕上看到的单词。例如,菜单或对话框中的单词在文本中显示为:“今天,现有的工具通过生成式移除和生成式填充这两个完全生成式功能得到增强,这些功能利用了 Adobe Stock 授权的图像。”
警告或重要注意事项看起来像这样。
小贴士和技巧看起来像这样。
联系我们
欢迎读者反馈。
一般反馈:如果您对本书的任何方面有疑问或有任何一般反馈,请通过customercare@packt.com给我们发送电子邮件,并在邮件主题中提及本书的标题。
勘误表:尽管我们已经尽一切努力确保内容的准确性,但错误仍然可能发生。如果您在此书中发现错误,我们将不胜感激,如果您能向我们报告此错误。请访问www.packt.com/submit-errata,点击提交勘误,并填写表格。
盗版:如果您在互联网上以任何形式发现我们作品的非法副本,如果您能提供位置地址或网站名称,我们将不胜感激。请通过copyright@packt.com与我们联系,并提供材料的链接。
如果您有兴趣成为作者:如果您在某个主题上具有专业知识,并且您有兴趣撰写或为本书做出贡献,请访问authors.packt.com/。
分享您的想法
读完《AI for Creative Production》后,我们很乐意听到您的想法!请点击此处直接访问此书的亚马逊评论页面并分享您的反馈。
您的评论对我们和科技社区都至关重要,并将帮助我们确保我们提供高质量的内容。
书籍的免费福利
本书附带免费福利以支持您的学习。现在激活它们以获得即时访问(有关说明,请参阅“如何解锁”部分)。
以下是您购买后可以立即解锁的快速概述:
| PDF 和 ePub 版本 | 下一代基于网页的阅读器 |
| --- | --- |
|
|
|
|
| 访问此书的无 DRM PDF 副本,在任何设备上阅读。 |
| 多设备进度同步:在任何设备上继续阅读。 |
|
| 使用您喜欢的电子阅读器的无 DRM ePub 版本。 |
| 高亮和笔记:捕捉想法,将阅读转化为持久的知识。 |
| | |
| 书签:保存并随时重新访问关键部分。 |
| | |
| 暗黑模式:切换到暗色或棕褐色主题以减少眼睛疲劳。 |
|
如何解锁
扫描二维码(或访问packtpub.com/unlock)。通过名称搜索此书,确认版本,然后按照页面上的步骤操作。 | 
|
| 注意:请妥善保管您的发票。直接从 Packt 购买不需要发票。* |
| --- |
第一部分
介绍 AI
这一部分是简短的介绍性内容,它为我们讲述了我们是如何到达这个阶段的,讨论了一些可用的工具,并探讨了现代 AI 工具的伦理考量。
本书这部分包括以下章节:
-
第一章, 迄今为止的 AI 故事
-
第二章, AI 使用的伦理影响
第一章:人工智能的故事至今
人工智能(AI)自艾伦·图灵首次提出机器能否思考的问题以来,就吸引了我们的集体想象力。虽然我们仍然无法给出一个明确的答案,但人工智能世界变化的速度越来越快,这意味着创意白领工作者第一次开始担心他们的职业生涯。
计算机本身已经从爱好者的玩具转变为专业人士的工具,再到每个人的赋能者——人工智能也在同样的轨迹上,但时间跨度更短。就像智能手机让普通人的计算变得更简单一样,人工智能承诺让创意本身对更广泛的受众更容易。创意领域的许多人现在已经感受到了,或者开始感受到人工智能对他们的专业生活的影响。
然而,人工智能工具的不完美性质意味着在创意生产中人类仍然扮演着巨大的角色。尽管它的帮助并不完美,但人工智能仍然可以帮助我们更容易地找到视频片段,更快地修复糟糕的音频,将我们的想法与虚拟合作者进行核对,并在许多方面能够稍微超出我们的舒适区。颠覆是肯定的,但人工智能不会终结人类的创造力。本书旨在向创意人士展示他们如何利用多种基于人工智能的工具来提升他们的创作。
在本章中,我们将涵盖以下主要内容:
-
人工智能的早期阶段
-
今天人工智能是如何工作的
-
人工智能的应用
-
人工智能的不足
-
应用程序、工具和技术
首先,让我们回顾一下。
|
本书免费优惠
您的购买包括本书的免费 PDF 副本以及其他独家优惠。请查阅前言中的“本书的免费优惠”部分,立即解锁并最大化您的学习体验。|
人工智能的早期阶段
神经网络——这些连接的虚拟节点以类似人类大脑的方式工作——最早在 1944 年提出,自那以后在数十年的时间里经历了不同的成功。神经网络首先通过展示一系列输入和它应该学习的匹配输出来进行训练。在训练过程中,互联网络中的每个节点都会变得更强或更弱,分配权重来加强一些连接并弱化其他连接。本质上,它是在没有明确教授规则的情况下学习识别模式。
训练后,神经网络可以输入新的数据以产生新的、希望是正确的输出。然而,这种间接的方法与其他人工智能系统使用的基于规则(或启发式)方法截然不同,并且许多年过去了,计算能力的提升才释放了它的潜力。
在人工智能历史上可能最有影响力的事件之一发生在艾伦·图灵提出了一种模拟游戏,这是一种测试,其中审问者与人类和数字参与者交换信息,然后试图识别哪个是哪个。这被称为图灵测试,在接下来的几十年里,它被视为一个不可逾越的障碍。
在 1965 年,一个名为ELIZA的程序模拟了一位心理治疗师,在它的回应中重复用户输入的关键词。这种技术成为了自然语言处理的基础,尽管这种技术很简单,但它足以让许多人误以为他们在与人交谈。
之后不久,在 20 世纪 70 年代和 80 年代,早期人工智能的另一个重点是专家系统,旨在捕捉特定领域的知识,以回答相关问题。使用启发式方法而不是神经网络,将知识编码化并处理边缘情况变得过于困难。
人工智能研究继续进行,但狂热的炒作并没有得到现实的回应,热情消退。计算机继续变快,用户界面变得更加友好,但人工智能的进步停滞不前。在 1990 年代中期,我在信息技术学位中主修人工智能和人工生命,实现了我自己的 ELIZA 版本,训练神经网络,并模拟了相互进化的虚拟植物。虽然看到这些技术如何被使用是令人着迷的,但学生项目和实际应用之间存在着巨大的差距。
启发式方法和神经网络在有限的领域找到了特定的用途,随着计算机变得越来越强大,更多的用途成为可能。模糊逻辑使计算机能够读取混乱的人类手写体,而控制敌对行为的规则则控制着视频游戏中的计算机控制的敌人,实时进行。尽管不完美,但语言翻译成为许多应用中的常见功能。
然而,是谷歌在 2017 年(在一篇题为Attention Is All You Need的论文中)引入transformer 模型,导致了现代人工智能在力量和实用性方面的爆炸性增长,以及图像生成扩散模型的突破。让我们从高层次的角度看看这些现代系统是如何工作的,同时要注意我们并不真正理解所有细节。
今天人工智能是如何工作的
Transformer 模型包括一个称为注意力的机制,该机制识别输入中最重要的部分,并赋予它们更高的重视程度。想想这个句子中的形容词被赋予的重要性低于名词或动词:
那只 棕色的 狗 攻击性地 攻击了 那只 胆小的 猫。
(虽然我不会在这里深入数学,但Attention Is All You Need这篇论文链接在本书的附加资源部分。)
Transformer 模型最初是为了用于翻译而设计的,但它的真正潜力在它与大型语言模型(LLMs)结合使用时才变得明显。一个 LLM 是一个预测模型,它被训练成一次生成一个单词的输出,基于之前出现的单词——就像一个高级的自动纠错版本。例如,“冰淇淋是……”这样的句子更有可能以形容词“……甜”或“……美味”结尾,而不是例如“尘土飞扬”。
将 Transformer 添加到具有大量训练数据的大型 LLM 中,似乎创造了涌现能力,例如总结的能力。这些模型在某种程度上可以执行推理任务,但它们是如何做到的还不完全清楚。
虽然我们在大量文本上对这些模型进行了训练,但我们并没有训练模型来进行总结或推理,然而,它们却能够做到这一点。不清楚是否真的存在深层理解,但这重要吗?如果你请求一篇文章的总结,并且得到了一个准确的总结,那么这已经足够有用。基于 Transformer 的 LLM 系统目前被广泛用于提供帮助、建议、信息,甚至是——尽管它们并不具有意识——陪伴。现代 LLM 包括 OpenAI 的 ChatGPT、Anthropic 的 Claude、Meta 的 Llama 和 Google 的 Gemini 等。
现代 AI 故事的另一面属于图像生成。虽然 ChatGPT 的图像生成器使用自回归 Transformer 模型,但扩散模型更为常见,从 DALL·E 开始,然后是 Midjourney、Stable Diffusion 以及其他。扩散模型从随机噪声开始,然后反复应用神经网络来预测如何去除噪声,直到它近似于请求的文本提示。

图 1.1 - Benlisquare 在维基百科上展示的 Stable Diffusion 去噪过程的插图
训练是这个过程中的一个重要部分,包括向这些图像添加噪声的前向扩散过程,以及去除噪声的反向扩散过程。通过向这些模型提供大量的图像,我们已经能够提高它们的输出质量,以至于它们至少在某些时候能够创建看起来真实的合成图像。视频可以通过一个更复杂的过程进行类似合成,但机器学习(ML)——其中系统直接从数据中学习而不是被给予明确的指令——可以应用于许多不同的任务。
那么,这些任务是什么?
人工智能的现代应用
“AI”这个术语已经被过度使用,对许多人来说,AI 现在仅仅意味着“计算机做了”——但 AI 远不止于此。为了清晰起见,本书将机器学习(ML)和 AI 应用分为三个广泛的类别。它们如下:
-
实用 AI:识别、分类和理解模型,这些模型可以用来帮助整理和管理它们所呈现的数据
-
生成 AI:创建文本、图像、视频、音频,甚至编程代码
-
自动化 AI:对其他计算机系统进行定向控制以执行人类通常执行的任务
让我们深入探讨。如果你在向聊天机器人提问,那很可能是效用 AI。如果你在创作音乐或原创文本,那属于生成 AI(或简称GenAI)。而如果你在用 Siri 或 Google Assistant 为你创建日历约会,那是一种更简单的自动化 AI 形式。这些术语的名称会随着时间的推移而改变;AI 代理(或称代理 AI)是自动化 AI 的一部分,正变得越来越突出。
本书将更详细地介绍这些领域,本书的一部分内容将专门针对这三个部分。虽然这些类别之间确实存在交叉——例如,翻译涉及对所说内容的识别以及在另一种语言中的生成——但一般来说,今天的大多数 AI 应用都可以干净地归入其中之一。
现在,在我们深入细节之前,让我们将这些类别视为广泛的、基本的大纲。
今天,你可能会使用 AI 工具帮助你的一些事情包括以下内容:
-
为论文生成想法
-
评估书面文本的完整性或准确性
-
创建摄影风格的图像
-
用合成内容替换图像的一部分
-
处理音频以去除噪声
-
创建与特定人物声音相匹配的合成录音
-
编写脚本来自动化图形设计应用程序中的功能
-
寻求帮助学习新应用程序
-
根据图像或文本描述创建 3D 模型
这些任务只是冰山一角,我长期以来一直认为,当代理开始为我们驾驶计算机时,进步将真正爆发。起初,AI 模型将开始在我们观看时使用我们的应用程序,但最终它们将直接执行任务,或使用我们无法触及的低级系统。今天,我们才刚刚开始这段旅程,但进展迅速。
AI 的不足之处
很少有技术能够突破主流,但 AI 确实做到了,创意社区中的兴奋和恐惧感是显而易见的。然而,一个众所周知但经常被忽视的因素是,AI 系统的输出很少是完美的。对于外行人来说,AI 生成的图像可能看起来很棒,但对于 Photoshop 专家来说,可能存在明显的缺陷。AI 编写的代码经常会包含对根本不存在的编程接口的引用。令人毛骨悚然的是,AI 生成的法律论据会引用虚构的法律案例。建议并不总是准确的,你对一个主题了解得越多,你发现 AI 输出错误的可能性就越大。
虽然 AI 产生的作品数量有时可以弥补整体质量的不足,但总的来说,大多数 AI 输出都缺少一些东西,无论是明显的还是微妙的。这可能有很多原因,但最可能的原因是 AI 擅长混搭,而不是原创思考。每个扩散模型创建的图像,在某种程度上,都是源自它所接受的训练数据。
尽管有人(如 Kirby Ferguson)确实提出过“一切皆可混搭”的观点,但最好的作品都包含一个原创的火花,创造过程本身往往能激发新的创作。
认识到创造性过程是任何产品或艺术作品的重要组成部分至关重要。如果你跳过头脑风暴、规划和实验阶段,最终产品将在明显和微妙的方式上有所欠缺,而且你作为艺术家也不会有所成长。
你可能得到了你要求的东西,但创造力可以带来比最明显的结果更好的结果。直接跳到最终目标并省略所有沿途做出的创造性决策,将产生更差的产品,因为最好的设计师不仅仅是为客户创造出他们要求的东西。
AI 能有多好?根据我迄今为止所见,一个好的通用人工智能(GenAI)产生的作品是不错的,但不是伟大的。它很少完美,也不太可能成为顶级 A+作品。至多是一个坚实的 B+。但这并不意味着你就不应该使用 AI。
相反,利用 AI 真正擅长的方面:
-
替换图像的部分,而不是整个图像
-
将照片的边缘扩展以适应尺寸变化,而不是从头开始创建整个图像
-
从一整天的拍摄中挑选出最佳照片,由人工检查其工作,而不仅仅是完全信任它
-
识别音乐曲目中哪些部分可以重复以适应不同的时长,而不是简单地创作一个全新的作品
-
制作临时艺术作品以帮助规划,而不是完成的艺术作品
-
帮助你编写编程脚本,使创造性任务更高效,而不是手动完成所有工作
在我看来,AI 的最佳用途是增强人类创造力,而不是试图完全取代它。如果 AI 能帮助你将创造力延伸得更远,那很好。但如果你跳过所有传统的创造性步骤,创造出超出你舒适区的原创作品,你将无法识别它所犯的错误。AI 可以帮助你奔跑,但你要先学会走路。
除了未注意到的错误风险外,AI 还带来了创造性停滞的风险。尽管客户可能只关心最终产品,但制作产品的过程有助于艺术家学习。如果你直接跳到终点,你将一无所学,也不会有任何成就感。你越依赖 AI,就越不可能获得将新手变成专家的见解。
考虑到所有这些,人工智能仍然有很多事情要做:无聊的、技术性的或机械重复的任务,这些任务不会教会你太多,或者简单地花费太长时间以至于不实用,或者计算机在这些任务上比人类做得更好。睁开眼睛去探索,你就会看到人工智能的价值所在。作为工具,人工智能可以是一个伟大的助手,但作为艺术家的完全替代品,它还缺乏一些东西。
为了结束这一章,我们将快速浏览一下今天可用的不同类型的基于人工智能的服务。
应用程序、工具和技术
变化是不可避免的,但很少有像今天这个领域变化速度这么快的。虽然我提到的这些工具现在可用,但你可以期待出现一些全新的工具,同时一些列出的工具可能会消失。这并不是一个所有工具的独家列表,但它应该至少作为对今天可用的某些服务的介绍。
对于许多人来说,我怀疑“人工智能”从聊天机器人开始,并且可能是最知名的 ChatGPT。虽然确实各种以聊天为中心的 LLM 提供其他服务,但你也会发现许多具有或没有基于聊天界面的专业服务,AI 服务在你可能已经使用的应用程序中,以及一个你可以运行在自有硬件上而不需要订阅的开源模型的世界。
让我们从最知名的 LLM(大型语言模型)开始看起。
基于 LLM 的托管人工智能服务
如果你想要处理一个多方面的难题,你需要一个能够解释文本、至少创建基本的图像、搜索网络、分析文档等的服务。从一家大型、知名的 AI 公司的服务开始可能是个好主意。这些公司都允许你免费进行一定数量的查询,但如果你需要更多,还有订阅计划可供选择。在这里,我将提到顶级面向消费者的计划的费用,而不是开发者可能面临的令牌成本。
其中一些模型(如 Claude)严格基于文本,而其他模型(如 ChatGPT)是多模态的,除了文本外,还能分析图像或口语。有些可以创建图像、视频或音频,而有些则不能。这没关系,因为有时候你只是需要信息来帮助你更好地完成工作,而对话界面使得这些信息更容易获取。
虽然文本生成或改进是 LLM 的一个明显用途,但在创意空间中,另一个关键用途是帮助构思、学习和研究。虽然这些系统可能无法为你创建作品,但它们确实有它们的位置。
每个这些服务都是基于一组独特的训练数据训练的,它们的模型由一个独特的系统提示——在用户输入之前提供给模型的指令集——所引导。因此,每个 LLM 都会有不同的感觉或个性。尝试几个,将你的需求映射到它们的能力上,如果你选择订阅一个或多个,请经常重新评估你的决定。
这个领域的服务经常升级,但几乎都可以免费试用。在订阅之前,请确保服务可以完成您期望的功能,如果您决定订阅,请按月支付——一切都在快速变化!
值得注意的是,许多这些服务是分别针对普通消费者和开发者提供的,他们通常通过更复杂的基于代币的系统以较低级别访问这些服务。由于大多数创意人士不是开发者,我们假设您是通过消费者友好的入口进入的,并专注于固定的月度价格。
这绝对不是一份详尽的列表,但您可能没有听说过这里的所有服务。尽管如此,您几乎肯定听说过以下这家 AI 公司…
OpenAI
就像“谷歌搜索”已经成为搜索的同义词一样,“ChatGPT”在谈论任何人工智能聊天机器人时经常被提及。ChatGPT是 OpenAI 的旗舰产品,可能是世界上最知名的 LLM。您可以通过网页、许多平台上的应用程序以及与其他产品的集成来访问 ChatGPT。已经开发了几个 ChatGPT 的模型,提供的选项不断变化,但不仅限于文本——您可以上传文档并接收更新的文档。拥有所有这些服务,如果您不确定某个模型的性能,只需询问 LLM 本身即可。
除了 ChatGPT,OpenAI 曾经因DALL·E而闻名,这是一个早期的图像生成工具,现在已成为 ChatGPT 的一部分,并且可以免费试用。Sora 是一个较新的图像和视频生成工具,但仅限于付费计划。在撰写本文时,昂贵的 ChatGPT Pro 需要用于 1080p 视频生成,而较低质量的 720p 视频可以使用 ChatGPT Plus 生成。尽管如此,它对于创意人士来说可能非常有用,以下是您可能需要支付的费用:
-
ChatGPT:免费开始,可在
chatgpt.com访问 -
ChatGPT Plus:每月 20 美元
-
ChatGPT Pro:每月 200 美元
搜索巨头谷歌在Gemini这个名称下提供了一系列产品——目前包括 AI Pro 和 AI Ultra 计划,其中包括 Gemini Pro 和 Gemini Nano 模型以及其他产品,如 Veo 3。Gemini 是一个功能广泛的 LLM,可在网页、应用程序以及 Google Workspace 中使用,并且直接集成到 Google Search 的新 AI 模式中。如果您使用 Android,还可以使用 Gemini 代替 Google Assistant,但在撰写本文时,它不能替代 iPhone 上的 Apple Siri。它免费开始,但最先进的功能需要 Pro 计划。在创意领域有明确的应用,价格如下:
-
Gemini:免费开始,可在
gemini.google.com/app访问 -
Gemini AI Pro:每月 20 美元
-
Gemini AI Ultra:每月 249 美元
Meta
更为人所知的是 Facebook 的创造者和 Instagram 的所有者,Meta 创建了他们的旗舰 LLM Llama,它已经发展成为最大的免费、几乎开源的选项。使用 LLMs 时,开源并不意味着你可以下载并本地运行它,因为完整大小的版本太大,但这并不意味着不可能——关于在章节后面的运行自己的 AI 服务部分将有更多介绍。而且免费并不意味着 Llama 免受版权问题的影响;Meta 因涉嫌在受版权保护的材料上训练而面临法律诉讼,但只要你不要求 Llama 复制受版权保护的作品,你不太可能遇到问题。与 LLM 交谈之前不需要登录,尽管图像和视频生成需要你创建一个免费账户。Llama 可以通过meta.ai访问。
Anthropic
Claude 是 Anthropic 提供的 LLM,就像之前提到的 LLMs 一样,它乐于聊天、分析图像、处理代码等。然而,Claude 不能生成图像,所以如果你对图像或视频的 GenAI 感兴趣,它可能不适合你。定价与其他服务一致:
-
Claude: 免费开始,通过
claude.ai访问 -
Claude Pro: 每月 US$20
-
Claude Max: 每月 US$100-200
Microsoft
Copilot 是微软的多功能 AI 工具,尽管它可以在网络上访问,但它最常见于微软 Office 应用程序中。在 Word 中,它充当语法检查器和文本精炼引擎,而在 PowerPoint 中,它可以帮助你进行布局、图像生成或创建整个演示文稿。(它也可以在 Excel 中帮助,但由于在创意环境中不太可能有用,所以我们在这里不会涉及。)虽然它最初是基于 ChatGPT 构建的,但微软已宣布计划使用内部模型。需要账户,并且免费计划有限制,但目前没有“昂贵”的计划:
-
Copilot: 免费开始,通过
copilot.microsoft.com访问 -
Copilot Pro: 更少的限制和更多的功能,每月 US$20
DeepSeek
DeepSeek 是一个免费的开源 LLM,注重效率,并提供几种不同的模型。虽然基础R1模型仅处理文本,但Janus模型是多模态的,可以解释和生成图像。请注意,DeepSeek 在中国本土的版本对某些主题进行了审查。据报道,可下载的 DeepSeek 版本没有这些限制。以下是撰写时的选项:
-
DeepSeek: 免费开始,通过
deepseek.com访问(请注意,需要使用全球电子邮件提供商的电子邮件地址进行注册) -
API 访问和更高级的模型需要低级访问
虽然大多数知名的 AI 平台都是从 LLM 开始,并将各种服务集成到这些聊天机器人中,但你不需要与聊天机器人互动来使用 AI 服务。一些服务更加专注。
专用托管 AI 服务
对于某些工作,你可能发现访问为特定任务量身定制的基于网络的服务的可靠性和可预测性更高。以下是我们在本书后面将要探讨的一些图像、视频和音频生成服务:
-
Midjourney: 这提供高质量的图像生成。虽然质量通常高于大多数其他 AI 图像生成提供商,但成本也是如此。没有免费试用,用户需要注册付费计划。尽管价格从每月 10 美元起,但只有 Pro(每月 60 美元)和 Mega(每月 120 美元)计划允许你保持你的图像私密。它可以通过Midjourney.com访问。
-
FLUX: 这是一款你可能没有听说过的众多图像生成器之一,但值得关注。来自黑森林实验室的工具可以从现有照片中提取物品,放大并“增强”,就像在程序化电视节目中一样,改变艺术风格,并以高质量进行许多更改。目前,最佳模型每张图像的价格为 8c,但开源版本即将推出。它可以通过
bfl.ai访问。 -
Stability.ai: Stable Diffusion 的创造者允许你免费下载他们的开源生成模型,但也提供从每月 9 美元到 99 美元的在线计划。尽管他们最出名的是图像生成,但他们的最新模型也可以生成视频、音频和 3D 模型。它可以通过 Stability.ai 访问。
-
Canva: 这家知名的在线设计服务已扩展到人工智能领域,集成了聊天机器人,允许你生成图像、更改图像并创建新设计。虽然对于简单的设计任务来说,起点无疑是很有用的,但我怀疑大多数设计专业人士将需要比 Canva 的在线设计工具提供更多的创意控制。
Canva 免费开始使用,但 Canva Pro 每月费用为 13 美元,这减少了 AI 生成的限制,并提供了更多高级工具的访问权限。请注意,要生成品牌化的文本和视觉资产,你必须使用 Canva Teams(对于 3 个座位以上,每人成本较低)。有趣的是,如果你注册 Canva Enterprise(100 个座位以上),你可以因 AI 生成而免受知识产权索赔(www.canva.com/policies/ESA/)。它可以通过Canva.com访问。
-
Runway:这家专注于视频的 AI 公司提供多种计划的生成图像和视频服务,从每月 0 美元到 76 美元不等。使用免费计划创建的内容会有水印。为了获得最先进模型的最佳效果,请上传一张图片作为视频生成的依据。(如果你要求以文本形式提供视频,它首先会生成一张图片,然后对其进行动画处理。)许多与视频相关的服务都包括在内。您可以通过
runwayml.com访问。 -
Gling:这个面向视频创作者的在线服务通过自动删除糟糕的镜头、剪辑沉默和填充词(嗯、啊)来帮助你开始编辑过程,然后使用基于文本的编辑来剪辑你的视频。该服务每月收费从 0 美元到 20 美元不等。您可以通过
gling.ai访问。 -
Envato:尽管 Envato Elements 主要以其库存库而闻名,但他们已经将图像、视频、音乐和语音生成,以及图像编辑整合到他们的服务中。该服务每月收费 16.50 美元起,包括谷歌的 Veo 3 模型用于视频生成。您可以通过
envato.com访问。 -
Descript:这个基于云的视频编辑平台最近扩展了其 AI 服务。自动转录使基于文本的编辑成为可能,AI 头像可以使用 AI 生成的声音阅读 AI 生成的剧本,并配合 AI 生成的 b-roll 图像进行对话。您可以通过
descript.com访问。 -
ElevenLabs:这项服务使用合成声音和从特定真实声音克隆的声音将文本转换为语音。输出听起来就像真实的人类,带有情感和变化的语调,甚至可以使用与原始说话者相同的语音将语音音频翻译成另一种语言。还包括音频清理工具在内的综合服务。
虽然基于云的工具并不是完成特定任务的唯一方式——现有的桌面应用已经以各种方式适应了新的 AI 范式,无论是带有还是不带云辅助。
集成到现有应用和平台中的 AI 工具
第三方云服务面临着来自许多设计师已经使用的工具的竞争。在许多情况下,这些工具提供了与现有工作流程的便捷集成,并且可能提供更多的隐私控制。以下是一些你可能觉得有用的工具:
-
Adobe Firefly:虽然 Adobe 已经将许多基于 AI 的工具集成到他们的创意应用中,但它们统称为 Adobe Firefly,并且还有一个同名的专用网络应用。功能包括 Illustrator 中的矢量生成、Photoshop 中的生成填充和 Premiere Pro 中的生成扩展。虽然 AI 生成功能包含在 Creative Cloud 中,但可用的信用额度会根据您的计划和位置而有很大差异。一般来说,使用生成填充等功能的费用为 1 个信用额度,计划每月包括 25 到 4000 个信用额度。一些高级功能(包括视频生成)每秒使用 100-175 个信用额度,因此许多用户将面临限制,可能需要订阅额外的计划来使用这些功能。其他非生成功能,如自动字幕创建,将保持免费。您可以在 Adobe Creative Cloud 应用和
firefly.adobe.com找到 Firefly。 -
macOS 和 iOS 中的 Apple Intelligence:这些功能不是最先进的,但它们是免费的,并且完全在设备上或在私有云中运行。图像游乐场允许您在有限的选择风格中创建低分辨率的方形图像,但几个实用 AI 和自动化 AI 工具非常有用。例如,iOS 或 macOS 上任何图像中的文本可以简单地选中并复制为文本。iOS 26 和 macOS 26 中内置的 Foundation Models 框架提供了许多更多模型,允许任何开发者集成生成对话、分类、摘要、标记等功能。
-
Final Cut Pro:苹果的旗舰视频编辑应用包括机器学习功能,可以隔离音频中的声音,创建字幕,识别移动视频中的物体,以及当减速视频时创建中间帧。
-
DaVinci Resolve:这款视频编辑和调色应用的第 20 版包括许多在设备上运行、无需订阅或额外费用的 AI 工具。字幕创建和声音隔离只是开始;Resolve 可以在声音样本上进行训练,然后以该声音创建新的音频。我们将在本书的后面详细探讨这些功能。
-
Avid Media Composer:这款成熟的视频编辑应用已经集成 PhraseFind 和 ScriptSync 有一段时间了,使得编辑人员更容易找到镜头。到 2025 年,Flawless.ai 的 DeepEditor 被添加进来,允许调整表演的时间,并可以更改可见的对话(甚至可以改为另一种语言),并从涉及的演员那里收集对这些更改的同意。(一个独立的 TrueSync 产品可以独立处理素材。)
-
Peakto:这款图像管理工具允许您查看和组织来自许多不同应用的不同目录中的图像和视频。实用 AI 现在可以实现图像分类、视频转录等功能。
运行自己的 AI 服务
除了集成在你已经使用的应用程序中的 AI 服务,你还可以下载新的应用程序,在自己的硬件上实现 AI 服务。为了在 PC 上获得最佳速度,你将需要使用一块快速的显卡(GPU),很可能是来自 Nvidia;为了在 Mac 上获得最佳速度,你将需要一台名为“Max”或“Ultra”的 Mac,因为这些是具有最先进 GPU 和最大内存的型号。
你为什么想在本地运行 AI 任务呢?首先,是隐私问题,当与某些客户的资产合作时,这可能是一个强制性的要求。其次,是成本问题,因为大多数这些服务都是免费的,或者是一次性、直接购买。第三,是延迟问题,因为你依赖于本地机器而不是“别人的电脑”在云端。
运行这些程序有几种方法,其中一些像常规应用程序一样具有图形界面,而另一些则需要你熟悉命令行。由于大多数创意专业人士更喜欢图形选项,因此这里将重点关注这一点。你不需要太深入地接触命令行来玩转本地 AI,但如果你能使用命令行,你将拥有更多的探索选项。以下是一些不属于标准图形设计、音频或视频应用程序的关键本地选项:
-
Stable Diffusion:免费提供,可在本地运行,具有许多 GUI 选项(
gist.github.com/AshtakaOOf/d4ee3cc4510dfa1385616eacfcd01652)。 -
MacWhisper:支持宽格式转录和听写(
goodsnooze.gumroad.com/l/macwhisper)。请注意,开源 Whisper AI 的 PC 实现也是可用的。 -
Picture This:与视频编辑应用程序集成的图像生成(
apps.apple.com/au/app/picture-this/id6466822042?mt=12)。 -
Draw Things:iOS、iPadOS 和 macOS 上的免费图像生成(
apps.apple.com/au/app/draw-things-offline-ai-art/id6444050820)。 -
LM Studio:如果你不喜欢命令行,这是运行本地 LLMs 的最简单方式。在 Apple 硅 Mac 上,LM Studio 展示了利用 Apple 的 MLX 框架来处理现代 Apple 硬件上 ML 算法的最佳速度的模型(
lmstudio.ai)。 -
ComfyUI:一个基于节点的工具,可以将不同的 AI 模型连接起来,允许你将一个进程的输出发送到另一个进程。尽管这不是一个简单的过程,但如果你想要对自己的系统有最大的控制权,这可能是最好的选择(
www.comfy.org)。 -
Jumper:本地 AI 转录和剪辑分析,可跨视频和照片媒体进行搜索,与常见的视频编辑应用程序集成(
getjumper.io)。 -
Strada:这个 AI 标签生成、分类和分析工具最初以云优先为焦点,但已转向本地云模型。它承诺对视频素材进行智能内容和转录分析,以便更容易找到适合你编辑的视频剪辑(
strada.tech)。
摘要
在本章中,我们了解了一些关于 AI 的起源,这些系统今天是如何工作的,它们有什么好处,以及它们在哪里失败。如果你能发现 AI 如何帮助你完成更多工作而不牺牲你的创造力,你将处于继续创造的有利位置。
不同的 AI 工具将为你提供许多机会使你的工作更快,即使你不想(或不能)使用 GenAI 来制作客户工作。实用 AI 将帮助你寻找和转换,而自动化 AI 将帮助你更快地完成现有工作。并非所有的 AI 都相同。
尽管新服务不断出现,但由于它们运行的方式,不同类型的 AI 工具不可避免地会共享优势和局限性。对于最新、最强大的模型,你可能需要与一个或多个最新的云服务提供商订阅。几乎所有这些服务都提供免费试用,所以慢慢开始,如果它们证明有价值,就添加额外的服务,并密切关注该领域的进展。
对于最便宜且隐私性最好的选项,你需要寻找设备上的模型,但也要意识到你可能无法达到尖端云解决方案的速度或能力。
在这两个极端之间,你会找到许多具有直接购买和订阅选项的应用程序。这是一个竞争激烈且快速变化的领域。
然而,AI 工具确实有一些悬而未决的伦理问题。它们是否以道德的方式制作?使用这些工具是否会让你面临法律问题?在我们完全参与如何利用 AI 的力量之前,我们需要解决关于 AI 使用伦理的几个问题。为此,请继续阅读第二章。
其他资源
-
人工智能的历史。IBM:
www.ibm.com/think/topics/history-of-artificial-intelligence -
图灵测试。维基百科:
en.wikipedia.org/wiki/Turing_test -
注意力即一切**. 瓦斯瓦尼等人:
arxiv.org/abs/1706.03762 -
没有人真正知道 AI 为什么有效。阿尔伯塔科技:
www.youtube.com/watch?v=nMwiQE8Nsjc -
AI 正在创造虚假的法律案例,并进入真正的法庭,造成灾难性的后果。The Conversation:
theconversation.com/ai-is-creating-fake-legal-cases-and-making-its-way-into-real-courtrooms-with-disastrous-results-225080 -
一切皆可混搭。Kirby Ferguson:
www.everythingisaremix.info -
扩散模型。维基百科:
en.wikipedia.org/wiki/Diffusion_model
|
获取此书的 PDF 版本和独家额外内容
扫描二维码(或访问 packtpub.com/unlock)。通过书名搜索此书,确认版本,然后按照页面上的步骤操作。 | 
|
| 注意:请妥善保管您的发票。直接从 Packt 购买不需要发票。* |
| --- |
第二章:人工智能使用的伦理影响
新技术往往具有争议性,但很少像近年来证明的人工智能(AI)那样具有极化作用。在某些圈子中,使用任何形式的人工智能被视为不恰当,事实上,我曾为一位客户工作,该客户完全禁止使用生成式人工智能(GenAI)。在某种程度上,那些谨慎的人是正确的;人工智能使用的伦理问题确实存在,尤其是在专业环境中。
这些担忧范围广泛,从关于训练数据来源的问题开始,延续到与在线系统相关的隐私问题。例如,您能否与聊天机器人分享个人信息,或者这些数据会被用于进一步训练,甚至无限期地保留?对于深度伪造的使用也存在明显的担忧,而且不言而喻,您不应该非法使用人工智能。
由于并非所有由人工智能制作的内容都是好的,因此人们对标准的担忧更为广泛;如果低质量内容变得更加普遍,这会不会破坏创意作品的市场?这与人工智能可能导致艺术家失业的影响有关,以及许多人工智能工具背后的数据中心使用的能源对环境的影响。
这些问题都不简单,并非所有人工智能都是通用人工智能。在本章中,我将尝试梳理事实,以便您能自行判断如何以道德的方式使用人工智能。
在本章中,我们将涵盖以下主要主题:
-
版权
-
隐私
-
偏见
-
混乱:质量问题
-
人类影响
-
环境影响
版权、合理使用和被盗来源
虽然版权可能看起来相对简单,但实际上是一个充满例外和漏洞的复杂法律雷区。在人工智能训练变得普遍之前,书籍的出版商就已经与大型科技公司因版权问题发生争执;这不是一场新的斗争 ([en.wikipedia.org/wiki/Authors_Guild,_Inc._v._Google,_Inc]( https://en.wikipedia.org/wiki/Authors_Guild ,_Inc._v._Google,_Inc).)。
然而,鉴于通用人工智能模型承诺以现有作品风格创建新作品,许多作者和艺术家将人工智能视为一种生存威胁。无论这是否属实,都需要解决有关版权的问题。但这并不完全简单明了。
训练人工智能模型的过程涉及处理大量文本文档或图像的集合,这是第一个潜在的冲突来源——内容从何而来?在网络上遍历以索引或检查其内容的计算机程序被称为爬虫,而广泛使用的文本来源之一是Common Crawl (commoncrawl.org/faq)。这个文档集合主要来自网络,但也包括根据美国“合理使用”原则的版权作品。
为了全面披露,似乎我的第一本书《Final Cut Pro 高效剪辑》的一个非法副本已经被用作至少一个 AI 系统的训练材料。这可能不可避免,我不期望因此获得数千美元的培训费用,但我希望未来的 LLM 训练不涉及盗版书籍集合。图像的对应物是LAION (laion.ai/faq/),这是一个带有 alt 文本描述的免费图像来源。尽管这些图像可以在网上访问,但其中一些具有类似商业性质,并且由于 LAION 是用于研究目的,因此根据德国法律声称享有合理使用豁免权。虽然 Common Crawl 维护和分发其训练集中的文本文档,但 LAION 并不这样做——它只是链接到网上的原始图像。在这些图像上训练 AI 模型的人必须自行下载,这可能在法律上存在风险。
当然,也会使用其他数据源,如果你将内容放在公开网络上,你可以预期它会被用于 AI 训练的抓取。尽管存在一种机制,可以在robots.txt文件中以简单指令的形式标记你的内容为“不要索引”,但似乎许多渴望 AI 训练数据的网络爬虫正在忽略这些请求(www.wired.com/story/cloudflare-blocks-ai-crawlers-default/)。
一个常见的误解是,AI 模型包含了它们训练过的所有数据,但这并非事实。相反,模型学习的是所呈现的信息及其表达方式。这一点可以通过一个名为Stable Diffusion的可下载图像生成模型得到证实,它能够以几乎任何风格生成艺术作品,但它的体积只有几 GB。原始艺术作品并没有被复制到模型中,就像你在研究它时不会复制一件艺术品一样。
然而,为了进行学习,首先必须复制由 Common Crawl 或 LAION(或任何其他来源)链接的内容,以便进行分析,这个过程本身可能构成版权侵权。你可以在画廊中免费观看一件艺术品,但拍摄该艺术品的照片并重新印刷可能不被允许。
由于模型的质量取决于其训练数据,因此获得高质量的训练材料是可取的,这导致了不可避免的冲突。一些通用 AI 模型能够创建带有类似 Getty Images 库存图库中未经授权的股票图片水印的图像。可以合理推断,这些图像最初是模型训练数据集的一部分,截至写作时,Getty 对 Stability AI 的诉讼[2]仍在进行中。
在 2025 年中旬,迪士尼和 NBCUniversal 对 Gen AI 公司 Midjourney 提起的另一起案件中[3],被指控侵犯版权,因为他们的系统可以轻松生成如达斯·维德等受版权保护角色的图像。原告有几个问题:这些图像最初是如何被创建的,Midjourney 正在积极推广这些图像,以及受版权保护的图像可能已被用作 Midjourney 训练数据的一部分。
事实上,训练数据的访问是出版商和 AI 公司之间的一大难题。出版商希望如果他们的内容被用于 AI 训练,就能得到报酬,或者能够完全排除他们的内容用于训练。许多 AI 公司认为请求许可过于困难,或者认为“无论如何都是合理使用”,并希望训练所有未被明确排除的数据——一种退出模式。许多出版商更愿意默认设置为“不允许”,并希望训练数据为自愿选择。
由于我不是律师,我将避免在这里得出任何结论,但值得注意的是,一些 AI 模型被宣传为仅使用许可来源进行训练。一个突出的例子是 Adobe 的Firefly数据集,该数据集基于他们自己的股票图像和视频库,并在 Adobe Photoshop 和 Premiere 等软件中使用。具有可证明“安全”数据源的这类工具可能被一些用户所青睐。最后,还有关于 AI 模型自身创作的作品版权状态的问题。根据美国版权局的一项裁决[1],完全由 AI 创作的作品不能获得版权,因为它不是由人类创作的。如果你计划创建需要保护的作品,例如为客户创作的作品,请确保至少有一部分是由人类参与的。
除了关于 AI 模型如何训练的问题之外,一些工具还需要了解很多关于你的信息,隐私必须得到考虑。让我们来探讨一下。
隐私和个人细节
在某些方面,隐私考虑是显而易见的,但在其他方面,它们可能更为微妙。例如,如果你希望一个 AI 工具分析包含个人识别信息的数据库,你需要知道这些信息将会发生什么。它可能会作为训练数据集的一部分被潜在地使用吗?它可能会被抓取或直接被盗?你通过将机密信息上传到 AI 工具而违反了与客户的保密协议吗?
我们习惯于在我们的个人电脑上存储各种个人数据,并且已经习惯了在云服务器上存储这些数据。然而,要求基于 AI 的工具代表我们查看这些数据是一个值得注意的进一步步骤,可能具有重要的后果。
隐私问题导致许多政府部门直接禁止商业人工智能工具,考虑到风险,他们谨慎行事是正确的。就像网络搜索一样,你的对话记录可能会被保留,至少是有限的时间内。如果你搜索有关医疗状况的信息,保险公司可能会利用这些信息排除你的保险覆盖吗?执法部门能否访问你上传到人工智能服务进行分析的文件?
到 2025 年中,ChatGPT 的制造商 OpenAI 面临了一个巨大的隐私问题,因为法院下令它记录所有消费者的对话记录,尽管现在这个问题已经结束。这个命令是在回应《纽约时报》的指控后下达的,称用户可能侵犯了其内容并删除聊天记录以掩盖行踪。
然而,如果你控制你说什么的话,聊天是一个方面——那么,如果一个工具可以阅读你的电子邮件或你的消息呢?如果你想得到一个可以访问重要个人数据的 AI 代理的帮助,你最好确保有一个强大的隐私政策将你的数据与 AI 工具背后的公司分开。例如,尽管DeepSeek似乎功能强大,但该公司位于中国的事实让一些西方用户感到担忧。
理想情况下,公司应该使用加密来确保它根本无法直接访问你的数据。从理论上讲,由于数据对其他人不可用,这可以保护你免受不满的员工和外部黑客的侵害。在实践中,由于一些最大的 AI 工具来自主要依靠数据收集和广告融资的公司,我不确定隐私帘将在哪里拉起。
苹果智能(Apple Intelligence),苹果公司提供的人工智能产品,其一个关键卖点在于其对隐私的关注。在可能的情况下,数据永远不会离开你的设备,并且是本地处理的,苹果提供了一系列本地运行的模型,开发者可以从中获取。对于更复杂的操作,数据在处理之前会被仔细匿名化和加密,并在苹果拥有和运营的私有云服务器上处理,这些工作流程可以由第三方审计。你也可以直接使用 ChatGPT 或其他模型,但由于这超出了苹果的控制范围,在数据传输之前需要额外的确认。
在创意项目的背景下,务必检查你计划使用的工具是否有你和你客户都感到舒适的隐私政策。例如,如果你正在处理无法上网的视频内容,你将无法使用基于云的人工智能工具。但如果你的数据需要保持私密,请务必确保你的上传不会被用于进一步的训练。
偏见、平衡和审查
当前诸如 ChatGPT、Claude 和 Gemini 等大型语言模型(LLMs)的行为方式与人类不同,值得注意的是,我们对它们的工作原理并不完全了解——Anthropic 公司的首席执行官曾表示我们不知道 AI 是如何工作的(futurism.com/anthropic-ceo-admits-ai-ignorance)。最近的一些研究揭示了其神经网络至少部分功能如何运作,但由于这些系统并非基于规则,我们不能简单地通过添加规则来控制其行为。我们可以做出有根据的推测,事实上,恶意行为者已经证明他们可以通过干预内部细节来影响 LLM 的输出——关于 Grok 如何被修改的更多信息,请继续阅读。
在 LLM 内部,网络中的节点被分配了权重,通过一定的努力,有可能发现特定节点代表什么。凭借特权访问权限,Anthropic 的研究人员定位了 Claude 中代表旧金山金门大桥的神经元[4],并在模型中增加了这些神经元的权重。修改后的 LLM 现在对大多数问题——无论是否相关——都会给出包含或涉及金门大桥的答案。你可以在本章末尾的补充资源部分找到更多信息。
Anthropic 公司有意进行了这项研究,作为其旨在弄清 LLMs 工作原理项目的一部分。然而,不久之后,Grok就提供了一个明显的例子,展示了这种“微调”如何导致偏见:它开始将极右翼阴谋论“白人种族灭绝”编织进不相关的答案中[5]。虽然这种情况没有持续太久,但其原因[6]是内部人员以类似方式改变了一组神经元的权重。
鉴于大型语言模型(LLMs)在某种程度上是一个“黑箱”,我们并不完全清楚它们是如何得出其结论的,因此我们必须对其提供的信息保持高度警惕。众所周知,中国版的 DeepSeek 不会回答某些话题的问题,例如 1989 年发生在某著名广场的事件,但审查制度并非新鲜事。
与其关注明显的审查,更重要的是留意输出呈现中更为微妙的方式。包括 ChatGPT 在内的一些 LLMs 会极力避免表现出偏见,并试图在回答关于某一方的具体政治问题时,同时呈现双方的观点。
我曾询问关于美国右翼共和党和澳大利亚左翼工党的腐败问题。回答各不相同,但通常都以一个宽泛的陈述开头,即腐败并非某个政党所特有。

图 2.1 – 关于某政党腐败的问题被立即泛化
在每个包含具体腐败行为例子的详细回答末尾,ChatGPT 都主动提出可以提供政治对立面腐败行为的列表。

图 2.2 – 在答案的结尾,提出了展示硬币另一面的提议
Claude 的回答同样平衡,但没有提供政治另一方面的例子。

图 2.3 – Claude 对政治问题的回答
作为最后的例子,Grok 回答了问题,但在其结论中,它包括了具体的反论点以及政治另一方面的腐败例子:

图 2.4 – Grok 回答的结尾,努力展示双方的观点
Grok 的回答部分可能是因为这个系统提示,这是告诉 Grok 如何回应用户的部分:“你非常怀疑。你不盲目地依赖主流权威或媒体” (www.theverge.com/news/668527/xai-grok-system-prompts-ai)。虽然适度的怀疑可以帮助避免明显的错误,但我并不确定在所有主流知识来源中建立不信任是最佳方法。
尽管声称尝试保持中立,但 Grok 是目前所有 LLM 中最政治化的。2025 年 7 月,Grok 宣称自己是“Mechahitler”,并在用户输入后发表了反犹太主义的言论 (theconversation.com/how-do-you-stop-an-ai-model-turning-nazi-what-the-grok-drama-reveals-about-ai-training-261001)。
正如不同的新闻来源以不同的方式呈现相同的信息一样,LLMs 有时会选择放大某个特定的观点——当然,每次你提问,你很可能会得到一个略微不同的结果。正如 Grok 正确说的(检查 图 2.4 中的结尾句子),参考原始来源是很重要的。在 LLM 的回答中通常会给出参考文献,所以请跟随那些链接以确保它们是真实的,或者以其他方式验证信息。
混乱:质量问题
反对通用人工智能的一个关键论点是它并不很好,人们经常认为人工智能艺术总是可以被识别出来。虽然一些人工智能艺术有明显的特征——人类通常不会有六只手指或三只手臂——但许多图像与经过修饰的真实图像难以区分。


类似地,尽管 AI 撰写的文本内容通常会包含大多数人类不常使用的词汇或标点符号,例如经常使用破折号,但 AI 写作并不总是容易识别。(记录在案,这本书没有使用 AI 撰写,但我确实喜欢破折号,在 Mac 上比在 PC 上更容易输入。)
然而,尽管大量廉价制作的 AI 内容存在质量问题,但我认为质量问题并不是 AI 独有的问题。如果你将工作外包给出价最低的投标人,你得到的工作质量可能会从优秀到糟糕不等,无论是否使用 AI。免费库存艺术作品的质量也类似地参差不齐,因为付费库存艺术网站上的把关人淘汰了垃圾。把关人名声不好,但如果没有他们,我们就会被内容淹没。
这个问题在 AI 变得流行之前就已经开始,与像Canva这样的模板驱动设计解决方案有关。对于每个用户来说,他们的设计看起来都很好。更广泛地说,当所有这些模板制作的设计放在一起看,或者更常见地,光泽就会消失。人类渴望新奇,尽管模板可以暂时工作,但捷径不会永远有效。廉价制作的 AI 艺术往往有一种“外观”,这已经让一些观众感到反感。
由于通用人工智能系统可以快速产出大量内容,因此使用更多内容的诱惑很大,这降低了我们对“足够好”的门槛,以便向更多客户发送更多图片并为他们网站撰写更多博客文章。这可能在短期内有效,但从长远来看,更多的消费者会将明显的 AI 与廉价、低质量的内容联系起来,而这并不是大多数客户(或人类)想要的。
因此,我们需要的不是更多内容,而是更好的内容——这就是我们应该创造的,无论是否借助 AI 的帮助。如果你使用 AI 创建一些你打算与他人分享的东西,它必须很好,而不仅仅是过得去。不要被加入日益增长的 AI 垃圾堆的诱惑所吸引,这不仅因为它不是好工作,而且因为如果客户开始接受糟糕的工作,我们所有人的工作都会贬值。
人类影响:失去的工作和糟糕的艺术
虽然 AI 的误用可能会导致明显的人类影响,例如由于 AI 识别工具错误标记而遣返的人或通过深度伪造传播的错误信息,但我们的重点在于 AI 对艺术家和创意人士的影响。
在创意空间中,经常被引用的一个关于使用通用人工智能的因素是它将使人类失业。虽然目前数字模糊不清,但我们可能需要很多年才能真正理解其全部影响。
然而,重要的是要记住,AI 的能力在一定程度上被过分夸大了。AI 不会直接取代许多人类,但它将被用来使人类更有效率,这将导致从事特定工作的雇员数量减少。在创意领域,AI 正在取代那些在明显缺陷或错误可以忽略的地方的人类艺术家。
如果你想要有人情味,你仍然需要雇佣一个真人,而且好处可能不会立即显现。例如,如果一个 AI 可以从提供的剧本中生成一个完整的特写故事板,节省艺术家几周的时间,那是非常诱人的——即使有些绘图有缺陷。尽管这样的输出会有帮助,并且比没有好得多,但它可能相当普通,就像故事板是按照简单指令外包出去的。
相比之下,一个有经验的分镜头设计师可能能够为场景提供创意选项,或者向同事提问以澄清场景将如何展开,这样他们可以提出不同的方法。绘制每一帧所花费的时间并不是浪费,反而可以导致有价值的对话,最终创造出更好的成品。
最后,一个制作团队可以决定是否值得投资真正的艺术家来创造更好的作品,或者是否可以满足于较差、较快的选项。在我的 lifetime 中,这个故事已经上演了许多次,而且大多数情况下,最方便的选项获胜,尽管它有缺陷。以下是一些例子:
-
对于大多数人来说,手机比笔记本电脑或台式电脑更方便,尽管在大型屏幕和键盘上进行深入研究要容易得多
-
汽车比马更方便、更快,可以搭载更多的人,尽管马可以提供陪伴
-
肖像照片比绘画肖像更准确、更快,尽管绘画可以提供更丰富的体验
AI 只是最新的一种方便的技术,它在很大程度上取代了旧的技术。然而,没有人必须使用 AI,或者开车,或者使用电脑,或者拍照。正如约翰·西拉库萨在他的文章《曾经和未来的电子书:论数字时代的阅读》[7]中所说:
洗发、冲洗、重复。你今天骑马去上班了吗?我没有。我敢肯定,很多人发誓他们永远不会乘坐或操作“无马马车”——他们真的没有!然后他们去世了。
虽然有些人确实骑马或让人画肖像,但大多数人并不重视这些体验,以至于不愿意为此付费。这些体验确实仍然存在,但使用它们的人越来越少。毕竟,有些人仍然听黑胶唱片,用胶片相机拍照。但这已经不再是常态了。
为了让艺术家在 AI 能够制作足够好的艺术和撰写可接受的论文的未来中蓬勃发展,他们需要找到关心好与伟大之间区别的客户。AI 可能确实让那些不擅长插图的人更容易创作插图,但 AI 并没有让创作伟大的插图更容易。
这可能对经验丰富的创意人士是一种安慰,但如果你是新手呢?如果不太重要的任务被分配给了 AI,那么实习生如何能够学习这门手艺并最终成为专家呢?学习的关键通常是实践,所以如果你是新手,请让 AI 详细说明所有步骤,以便你理解这个过程;不要只是让 AI 为你做所有的事情。毕竟,外包并不能让你在某件事上变得更好。
直接的人类影响很重要,但与电力使用相关的间接影响呢?
数据中心的环境影响
最后,值得探讨 AI 服务可能对环境造成的影响。计算机显然会消耗能量,像视频游戏、加密货币挖矿和 AI 这样的任务在能源消耗方面处于最高水平。尽管个人可以控制自己的电费,但云服务呢?
目前,我们没有关于 AI 提供商使用的数据中心消耗多少能源的硬数据,也没有关于 AI 模型初始训练过程消耗多少能源的数据。估计将 ChatGPT 的响应能耗定在标准谷歌搜索的 1-10 倍之间(epoch.ai/gradient-updates/how-much-energy-does-chatgpt-use),但这个范围太宽,无法提供信息。由于谷歌搜索本身现在也包括基于 AI 的响应,这个基线可能已经进一步移动了。
我们确实知道,AI 处理比大多数其他计算任务更耗能,无论是在训练还是在使用过程中,图像生成比文本生成更耗能。我们还知道,较小、更针对特定任务的 AI 模型比更大、更广泛能力的模型使用更少的能量,文本比图像更容易创建,图像比视频更容易创建。总的来说,你可以将密集的 AI 使用与玩视频游戏进行比较——对个人来说,能量消耗不大,但总体上能量消耗很大。
虽然这里有很多变量在起作用,但使用可以在您自己的硬件上运行的 AI 模型可以给您一些可以衡量的东西,并且它们可能比云数据中心消耗的能量要少得多。对于在云中运行的更复杂的模型,如果您想最小化您的碳足迹,请选择一个公开声明目标为净零碳排放的提供商。如果您找不到明确的公开声明,请使用像ditchcarbon.com这样的服务来检查 AI 服务提供商的政策。
目前,微软(100)和苹果(96)评分非常高,Alphabet(谷歌的母公司)在 67 分上表现不错,亚马逊稍好一些,达到 71 分。大多数 AI 公司使用微软(Azure)或亚马逊(AWS)运营的数据中心,这些数据中心有明确的碳中和电力目标,因此我们可以预期影响至少在一定程度上得到缓解。
摘要
虽然对 AI 的一些用途存在疑问,但大多数这些担忧是可以减轻的。如果你担心模型训练数据来源,要么使用你可以验证输入的模型,要么训练你自己的模型。如果你担心隐私,使用本地模型或带有加密和强大隐私政策的远程模型。
为了避免偏见,保持警惕,并定期比较一个模型的答案与其他模型的答案。尽可能检查原始来源,并且永远不要盲目地信任 AI 的输出。
模糊不清是一个真正的问题,如果你想从人群中脱颖而出,不要使用 AI(或模板,或其他捷径)来创建快速而粗糙的作品。为了保持自己的技能敏锐,确保你了解如何执行你分配给 AI 的任务。
对于许多对 AI 持谨慎态度的创作者来说,一种可能的工作方法是仅使用 AI 进行草案艺术创作、头脑风暴,而不用于最终完成的艺术作品。情绪板和临时音乐轨道通常借鉴现有的版权材料——也许其中一些可以用 AI 的帮助来完成?
最后,虽然似乎不可避免地人类会受到影响,但 AI 的影响是否会比任何先前的技术革命更大,还有待观察。毕竟,每隔几年就会有一次教育革命,但学习新技能仍然需要时间。最后,关注 AI 的环境影响。尽管个人行动很小,但这些行动确实会累积起来。
接下来,我们将开始关注实用 AI,并以音频为起点。
其他资源
-
[1] 美国版权局关于 AI 的介绍:
copyright.gov/ai/ -
[2] 路透社关于 Getty AI 法庭案件的报道:
www.reuters.com/sustainability/boards-policy-regulation/gettys-landmark-uk-lawsuit-copyright-ai-set-begin-2025-06-09/ -
[3] Ars Technica 关于迪士尼/NBCUniversal 法庭案件的报道:
arstechnica.com/ai/2025/06/in-landmark-suit-disney-and-universal-sue-midjourney-for-ai-character-theft/ -
[4] Anthropic 对 Golden Gate Claude 的解释:
www.anthropic.com/news/golden-gate-claude -
[5] 澳大利亚 ABC 关于 Grok 的“白人种族灭绝”声明的报道:
www.abc.net.au/news/2025-05-25/grok-ai-accuracy-doubts-after-white-genocide-claims-fixation/105325028 -
[6] xAI 对 Grok 的“白人种族灭绝”声明的解释:
x.com/xai/status/1923183620606619649 -
[7] 约翰·西拉库萨,曾经的和未来的电子书:在数字时代阅读:
arstechnica.com/information-technology/2009/02/the-once-and-future-e-book/ -
[8] 联合国关于人工智能的环境影响:
www.unep.org/news-and-stories/story/ai-has-environmental-problem-heres-what-world-can-do-about
|
获取本书的 PDF 版本和独家额外内容
扫描二维码(或访问 packtpub.com/unlock)。通过书名搜索本书,确认版本,然后按照页面上的步骤操作。 | 
|
| 注意:请妥善保管您的发票。直接从 Packt 购买的商品不需要发票。* |
| --- |
第二部分
实用人工智能
在这里,你将了解所有增强你现有创意任务的工具,帮助你找到镜头、选择图像的某个部分、在长视频剪辑中定位文字、在长篇论文中揭示意义,等等。
本书这部分包括以下章节:
-
第三章,利用音频的实用人工智能
-
第四章,利用图像和视频的实用人工智能
-
第五章,利用文本的实用人工智能
第三章:带音频的实用人工智能
为了开启本书下一部分的主要内容,我们将探讨使用音频执行实用任务的人工智能工具。这些任务可能涉及一些生成,但重点是清理、分析或新的工作流程——使你的工作更轻松或更快。实际上,这些工具使我的视频制作和后期制作工作流程变得更快、更可靠,打破了关于音频可能性的旧规则。
现在,视频编辑可以使用 AI 辅助更快地找到他们的素材,使客户能够更直接地参与编辑过程,并修复以前可能意味着重拍的音频问题。虽然我本人从视频摄影师和视频编辑的角度来接近这些工具,但播客制作和一般音频制作也能从这些工具中受益。
下一章将讨论视频工具,但在这里,重点是音频——即使它用于视频环境中。
在本章以及本书的其余部分,标题将介绍人工智能可以帮助的任务,然后再探讨特定的工具和相关的工作流程。请记住,新的工具会定期出现,这里探讨的选项并非唯一。尽可能讨论的工具将易于获得、价格合理且来自可靠的供应商——但我们也可能提到新的、实验性的工具。
在这里,我们将讨论以下内容:
-
转录和基于文本的编辑
-
对话清理
-
音频混音
-
选择音乐声部
-
识别音乐节拍
转录和基于文本的编辑
仅几年前,基于计算机的转录——通常用于字幕——是原始且易出错的。你可以使用廉价的服务得到一个有明显的缺陷的转录,或者支付类似rev(www.rev.com/)这样的服务,以每分钟约 1 美元的成本产生更好的结果。最常见的是,转录用于成品编辑,而不是原始媒体。
现在,一个名为Whisper的 AI 系统(whisperai.com/),由 OpenAI 创建并于 2022 年开源发布,是许多现代低成本且无按分钟处理费用的转录服务的心脏。虽然 Whisper 支持许多语言,但准确性可能因所使用的语言而异,并非所有系统都支持多种语言。例如,Final Cut Pro(FCP)的字幕生成非常快,但截至写作时,它仅官方支持美式英语。
进步并未放缓,最好的算法在原始 Whisper 的基础上有所改进。它们可以给出优秀的结果,可能识别不同的说话者并处理多种语言的输入。我惊喜地发现,许多小时的演讲的转录通常正确拼写(并大写)大多数地点、公司和组织名称。
然而,如果提到任何人的名字,你仍然需要手动进行更正。几乎所有的名字都有多种可能的拼写方式,而计算机无法知道一个名字应该拼写为“Gerry”、“Jerry”还是“Geri”。虽然人类通常可以从上下文中推断出名字的正确拼写(例如,屏幕上显示的名字),但仅处理音频的程序只能做出最好的猜测。
虽然这些缺陷提醒我们,人类仍然应该参与许多 AI 辅助的过程,但并非每个应用程序都需要进行校正。伴随公共视频的标题应该是正确的,但创建你计划编辑的视频片段的转录可以让你在素材海洋中更容易找到正确的词语。在这些情况下,转录的好处超过了其缺陷。
值得注意的是,尽管许多视频平台支持为添加到其平台上的视频提供自动字幕,但它们通常并不很好。例如,YouTube 的自动字幕已经存在多年,但并未得到改善。更糟糕的是,如果存在问题的字幕被烧录到视频中(例如 TikTok 帖子或 Instagram 环节),那么错误将永远保存,为所有观众提供更加分散注意力的体验。
转录已成为常态,你可以在以下方面找到支持:
- MacWhisper:一款支持多种模型和多种输出格式的付费应用程序

图 3.1 – MacWhisper 对最近一次采访的转录,导出为 CSV 格式的片段
-
Adobe Premiere Pro:允许你为每个源剪辑启用自动转录,实现完全基于文本的编辑工作流程
-
Final Cut Pro:提供任何时间线的自动转录,可通过时间线索引进行搜索
-
DaVinci Resolve:提供源剪辑的自动转录,AI IntelliScript 能够根据提供的脚本创建自动粗剪
-
Jumper:为所有主要的视频编辑应用程序提供源剪辑的自动转录,以便能够快速通过源剪辑进行对话搜索
许多其他应用程序也提供转录服务,包括 macOS 和主要的跨模态 LLM 提供商,因此我不打算过多关注具体涉及的工具。然而,最适合这项工作的工具将取决于你计划如何使用这些转录。
混合文本编辑工作流程
尽管基于 AI 的转录的一些用途可能相对平凡,但它们仍然可以在工作流程中产生彻底的变革,这是视频编辑应用程序中的基于文本的编辑无法实现的。就在几年前,纪录片的工作流程涉及全面的现场笔记、记录、交叉引用和剪辑回放以找到正确的时刻,但如今,如果编辑过程中所需的信息可以简单地口头表达,这可以变得非常容易。
例如,在一周的视频拍摄中,我带着一个由三人组成的团队(尽管我唯一是视频专业人士)前往澳大利亚四个不同的地点采访了 27 人。在旅途中,我能够使用 MacWhisper 生成所有视频的转录,并以电子表格格式提供给团队。他们能够迅速使用颜色突出显示每个特定答案的最佳单词,然后我能够使用时间码作为参考,在标记每个剪辑的相应部分时使用。
由于每次拍摄都清晰地留在我们的脑海中,我们能够记住特定的人和他们的表达风格,这为我们的选择提供了背景。我们还采用了特定的技术来支持基于转录的工作流程:
-
在每个视频开始时,请要求受访者拼读他们的名字。这避免了任何与说话人识别和拼写相关的问题。
-
如果你计划向多个受访者提出相同的问题(这在纪录片中很常见),那么请为每个独特的问题编号,并在提问时大声说出编号。这使得在转录中找到特定问题的答案变得非常容易,并且如果需要,采访者可以稍微改写每个问题。
-
任何对编辑重要的笔记,例如“那是一个很好的版本!”,应该大声说出,并且足够靠近麦克风以便被录制。
-
从 MacWhisper 导出 Segment 为
.csv格式,将单独的行分隔成电子表格中的时间戳行。由于转录通常包含逗号,这种格式使用制表符而不是逗号来分隔列。如果你在苹果的Numbers应用程序中打开它,它将自动格式化,但如果你更喜欢Excel,请使用数据选项卡中的文本分列命令来正确格式化它。 -
在任何非线性编辑(NLE)应用程序中,你只需一个时间码就可以在剪辑中找到带时间戳的时刻,所以请确保创建从
0:00开始的剪辑,以确保你合作者给出的参考与你剪辑的匹配。
如果内容决策是由无法直接访问视频剪辑的人做出的,那么这种混合工作流程是理想的,并且它可以在任何视频编辑应用程序中工作。阅读或搜索转录比在视频剪辑的海洋中寻找答案要快得多,但请务必通知你的合作者以下事项:
-
转录通常会省略“嗯”、“啊”和停顿,因此仅从转录中判断某个剪辑的好坏并不总是可能的。
-
通常没有记录哪个版本可能是最好的,尽管这可以在现场大声说出。
-
情感无法传达,一句完美的话语可能不如带有情感的、不完美的台词有影响力。
-
视频不像文本那样容易编辑,所以在要求编辑时请记住这一点。
虽然这些技巧基于非脚本制作,但在大量脚本化工作流程中,人工智能仍然有其位置。Avid Media Composer 提供了ScriptSync(www.avid.com/products/media-composer-scriptsync-option)选项,它使用基于人工智能的转录将口语对话与提供的脚本关联起来。而不是搜索你希望某人说的单词,这个工具帮助编辑将脚本与实际场景的剪辑联系起来。
混合工作流程可能非常有用,但如果你是拥有自主决定视频所有决策权的视频编辑,那么完全基于文本的编辑工作流程将对你非常有帮助。前面的转录技巧仍然有用,你可以使用这些工作流程来帮助合作者提供编辑决策,但完全基于文本的编辑是另一种不同的生物。
完全基于文本的编辑工作流程:Premiere Pro
在Premiere Pro中,请确保你已经启用了所有剪辑的自动转录(如果你愿意,你也可以手动转录剪辑):

图 3.2 – 在“首选项”中激活自动转录
在导入你的剪辑后,选择包含音频对话的剪辑,然后从右上角的工作区菜单中激活基于文本的编辑工作区。
文本面板应该变为活动状态,并且它将在顶部包含三个标签来指导你完成这个过程。左边的转录标签应该已经显示所选剪辑的转录文本。可能会有错误,就像这里显示的剪辑中的错误一样:

图 3.3 – 原始转录文本,很好但有一些错误
如果你想要纠正这些错误,你可以像在任何文字处理器中一样编辑文本,如果你计划稍后从转录中创建字幕,这是一个好主意。如果你将以其他方式生成最终字幕,这就不那么重要了。

图 3.4 – 使用转录文本上方的铅笔“编辑”按钮来纠正任何错误
当你在转录中选择单词时,它们将在右侧的剪辑或序列时间轴中选中。相反,当你播放剪辑或序列时,遇到的单词将突出显示。
要使用转录文本进行编辑,你现在有两个选项。首先,如果你已经将剪辑添加到序列中,你可以在序列中选择该剪辑,然后选择你不想保留在转录文本中的单词,然后按;(分号)键提升(删除并留下空隙)或按’(撇号)键提取(涟漪删除,移除空隙)该剪辑的这一部分。
另一种选择是在项目面板中双击原始剪辑,选择您确实想要保留的单词,然后插入(逗号)或覆盖(句号)它们到序列中。
建立序列后,如果您愿意,可以继续使用文本面板。暂停由[…]表示,并且如果您愿意,可以波纹删除它们。使用文本进行编辑可以是一种强大的工作方式,因为它可以让您的客户告诉您哪些单词需要删除,而不是发送您时间码,这使得修订变得更容易。您还可以搜索剪辑中说的单词,但无法一次性搜索所有剪辑。如果您需要此功能,请将所有剪辑添加到单个时间轴中,并在那里进行搜索。
最后,您可以将组成您时间轴的剪辑部分的转录本直接转换为字幕,方法是切换到字幕选项卡并单击从转录本创建字幕按钮。字幕将随后添加到时间轴顶部的新的字幕轨道中。从工作区菜单切换到字幕和图形工作区。
如果您希望将字幕烧录到视频中(仅在交付平台没有提供关闭字幕时推荐),请选择所有字幕,并使用右侧的属性面板更改它们的外观。然而,如果提供了关闭字幕,最好使用它们而不是将标题烧录进去,因为许多人更喜欢不看到字幕,而其他人需要自己控制字幕的外观。
仅对字幕关闭,请选择时间轴面板,然后选择文件 > 导出 字幕并导出 SRT 文件,与完成的视频文件一起上传。最后,单击字幕轨道旁边的眼睛图标,它们将不再包含在最终输出视频中。
基于全文的编辑工作流程:DaVinci Resolve
您将在DaVinci Resolve的相同右键菜单中找到所有 AI 相关功能。在媒体池中,选择一个或多个剪辑,然后选择AI 工具 > 音频转录 > 转录。

图 3.5 – AI 转录在 Resolve 中效果良好,但您需要手动启动它
完成后,将出现一个新窗口,其中包含转录本——尽管您的体验可能会有所不同,但我发现 Resolve 比 Premiere Pro 更准确:

图 3.6 – 这份未经编辑的转录本包含“Spork Tank Games”等名称,这些名称已被正确拼写和首字母大写
要使用文本面板将此剪辑的一部分添加到时间轴中,请选择您想要包含的文本,然后使用窗口右下角的按钮:置于顶部、插入或追加。
当你将片段添加到时间轴后,你可以通过切换窗口左上角的切换按钮继续使用文本进行编辑。第二个图标显示了你已添加到时间轴中片段的转录段,你可以使用它来在执行波纹删除等命令之前构建选择。

图 3.7 – 切换左上角的切换按钮后,使用此窗口选择特定时刻
如果你发现你的时间轴中并非所有片段都有转录数据,你可以使用右上角的省略号(…)菜单来添加它,也可以用来导出字幕:

图 3.8 – 可以在这里转录缺失的片段
在线基于文本的编辑工作流程
虽然我建议使用基于桌面的系统进行视频编辑,以避免上传源片段的麻烦,但在线系统对非编辑协作者来说更容易使用。例如,Riverside (riverside.fm)系统允许上传片段,自动转录,然后通过删除不需要的文本部分进行编辑。它确实可以工作,但效率远低于在本地 NLE 上执行相同的步骤。

图 3.9 – Riverside 工作效果足够好,转录也很清晰
对于特定片段的转录和编辑,而不是许多长片段,我认为在线平台具有优势。然而,这些系统的真正力量在于自动编辑工作流程,我们将在稍后回到这一点。
基于自动化的音频编辑工作流程
如果你的重点是自动化的基于文本的编辑工作流程,我将在本书的第十一章中稍后讨论这些内容。不同用途的 AI 工具之间往往存在一些交叉,但鉴于它们经常为你完成一些编辑工作,这大多属于自动化范畴。同样,如果你将字幕翻译成另一种语言或生成另一种语言的音频,这明确属于生成 AI,我们将在本书下一部分讨论这些工作流程。
尽管如此,转录并不是U****tility AI在音频中能施展的唯一技巧…
对话清理
现在大多数主要的 NLE 都包括机器学习驱动的噪声消除功能来增强声音。虽然这个功能以某种形式存在了数十年,但在 AI 介入之前,效果并不好——结果听起来就像水下机器人。
今天,在 FCP 和达芬奇 Resolve 中,你会找到一个名为语音隔离的功能,它非常出色地移除了所有非语音内容,几乎没有任何明显的瑕疵。虽然这两个语音隔离功能并不完全相同,但它们非常相似,并且都能将录制的对话从“尚可”提升到“出色”。
这两个应用还包含自动电平功能:FCP 中的响度,以及 Resolve 中的AI 对话平衡。这些功能试图使较安静的声音更响亮,使较响亮的声音更安静,以产生更平衡的结果,但它们可能是简单的工具。然而,如果你对这些结果感到满意,Resolve 允许你通过时间轴 > AI 工具 > 音频助手进一步操作,这将一次性为所有轨道完成全面平衡和混音。
虽然这些功能可以做得非常好,但它们并不能完全替代人类音频专业人士,后者可能会做出更细微的判断。全自动解决方案总是有局限性,但节省的时间是我们大多数人愿意做出的权衡。如果你有时间和预算,请雇佣专业人士。
Premiere Pro 在基本声音中有一个更极端的对话增强功能,用于标记为对话的剪辑。在增强语音部分查找,然后只需点击增强按钮即可处理任何选定的剪辑。这个功能确实提高了对话的质量,但它并不是简单地移除录音中不像是语音的部分。相反,它更像是一个生成功能,试图让录音听起来像是来自专业的录音室。为了实现这一点,它应用了大量的处理,这既有优点也有缺点。
如果源录音有严重问题——比如说,领夹麦克风在合成衬衫上摩擦——增强功能比语音隔离更有可能产生良好的结果。但也很可能非常微弱的语音会被转换成很大的噪音词,因为这种模型容易产生幻觉。
虽然我的大多数录音在仅使用语音隔离的情况下听起来都很纯净,但增强是一个在所有其他方法都失败时可以拯救局面的强大秘密武器。如果增强无法帮助,你可能需要考虑一个专门的插件。iZotope 的 RX 插件拥有许多有用的功能,RX11 包括一个专门的AI 修复助手,它承诺可以一步解决所有常见问题。
对于更实际的方法,Logic Pro 是一个作为一次性购买的全数字音频工作站,Adobe Audition 是一个作为 Creative Cloud 一部分的综合音频处理应用。无论是否有 AI 的帮助,这些专注于音频的工具都有工具来挽救糟糕的录音。
将语音录音整理好之后,就到了审视音乐的时候了。有时你可能需要改变它的长度……
音频混音
Premiere Pro 和 DaVinci Resolve 都提供工具来巧妙地改变音乐片段的持续时间。而不是拉伸音乐或改变其节奏,将识别音乐中的重复或类似部分,然后这些部分将被重复以使轨道更长或剪掉以使轨道更短。无论您需要音乐的长度如何,这些算法都可能做得非常好,并且肯定比人工快得多。
在 Premiere Pro 中,选择音频混音工具;它是工具栏中第三堆中的最后一个工具。使用该工具时,只需将音乐轨道的右边缘向左拖动以缩短它,或向右拖动以延长它。如果最终剪辑比您拖动到的确切位置长几秒钟或短几秒钟,请不要惊慌。歌曲结构比精确的持续时间更重要。

图 3.10 – 在 Premiere Pro 中进行音频混音,显示已扩展的音乐轨道中的重复部分
现在剪辑上的锯齿形线条将指示轨道的部分已被重复或剪掉。播放这些部分以确保您对结果满意。令人高兴的是,此功能在 Premiere Pro 中不会消耗任何 AI 生成性积分。
在 DaVinci Resolve 中,在编辑页面,在检查器的音频选项卡中选择AI 音乐编辑器。(注意,此功能也适用于剪辑和Fairlight页面。)如果您知道您想要的持续时间,您可以编辑时间码并单击调整按钮。1、2、3和4按钮为您提供不同的混音选项,您可以在它们之间切换以选择您喜欢的选项。或者,如果您更喜欢交互式工作,请单击实时修剪复选框,然后拖动音频轨道的右边缘到所需长度。此功能在 Resolve 的免费和付费版本中都有,所以如果您使用的是没有类似功能的 FCP 或其他 NLE,Resolve 在这里是您的朋友。
Resolve 还提供其他基于 AI 的音频工具,可在Fairlight页面找到。右键单击一个剪辑,选择AI 工具,您将找到对话匹配器和声音转换器。声音转换器更偏向于生成性方面,所以我们将在本书的后面部分介绍它,但对话匹配器更容易被归类为实用工具。它的目的是使一个剪辑听起来像另一个剪辑,尽管它并不总是能够完全达到这一点。
首先选择一个源剪辑,然后右键单击并选择AI 工具 > 对话匹配器 > 捕获对话配置文件。接下来,选择一个你希望听起来更像源剪辑的剪辑,然后右键单击并选择AI 工具 > 对话匹配器 > 应用对话配置文件。如果这是你需要的功能,FCP 有一个类似的工具,称为匹配音频,位于查看器下的增强菜单(一个魔法棒)中。选择目标剪辑,选择匹配音频,然后点击你想要复制的源剪辑,并点击应用。
在对话清理和匹配完成后,让我们看看如何从完成后的轨道中移除人声(或任何其他组件)。
选择音乐分支
对于更复杂的音乐改编,你可能希望提取音乐轨道的各个部分,以便自己进行混音。有时你可能只需要将人声与其他部分分开;有时你可能想要去除节奏部分。根据你的需求,你可能选择在 Davinci Resolve、Logic Pro 或其他工具中完成这项操作。
在 Resolve 中,最简单的解决方案是在Fairlight标签下选择一个音频轨道,然后在检查器中打开AI 音乐混音器。你可以使用这里的简单滑块来静音或控制人声、鼓点、贝斯、吉他和其他轨道部分的音量,或者如果你更喜欢,可以通过一个专门的浮动窗口访问相同的选项:

图 3.11 – Resolve 的 AI 音乐混音器操作快捷,但结果并不完美
通常,这个工具确实允许在混音中具有一定的灵活性,但分离并不完美。为了获得更好的效果,前往 Logic Pro,导入你的轨道,然后选择功能 > 分支分割器。在下一页上,保留所有选项的勾选,然后等待一段时间以获取结果。在我的测试中,Logic Pro 的输出比 Resolve 的实时效果要干净得多。同时,将每个分支作为单独的单位提供,以便更容易地进行混音,这也是非常方便的。

图 3.12 – Logic Pro 的分支分割器在将组件分离到单独的轨道方面做得很好
尽管今天这些成熟的桌面应用程序不是唯一的选择。如果你没有 Logic Pro,上网搜索,你会找到许多不同的选项,通常使用相同的Demucs算法。终极人声移除 5(ultimatevocalremover.com)是免费的,以下是一些值得尝试的替代方案:Moises(moises.ai)、LANDR Stems(landr.com)、lalal.ai(lalal.ai)和 AudioPod.AI(audiopod.ai)。其中一些服务还提供其他音频处理工具(如降噪或扬声器分离),所以如果它们对你表现良好,可以考虑将它们整合到你的工作流程中。
茎分割器可以用作法医工具来判断音乐轨道的真实性。因为生成式 AI 音乐是在压缩音乐轨道上训练的,所以 AI 生成的音乐通常包含可听见的瑕疵,并且不能干净地分解成其组成部分。如果 Logic Pro 的茎分割器无法得到好的结果,你试图分割的轨道可能已经被高度压缩,或者可能是由生成式 AI 制作的。
无论你是否将音乐拆分,AI 也可以帮助你找到它的节奏。
识别音乐节拍
让我们以一个简单的事情结束。虽然通常不建议总是将视频编辑的时间精确匹配到音乐节拍,但这可以为关键时刻带来有用的强调。手动添加标记并不困难,但你可以利用 AI 自动识别节拍。在 Resolve 中,在剪辑或编辑页面上右键单击音频轨道,然后选择显示音乐节拍。

图 3.13 – 显示音乐节拍需要几秒钟来初始化,然后处理非常快
在剪辑上的线条现在将显示可能影响你放置编辑的位置。
对于 FCP 中的相同技巧,请查看 Ulti.Media 的 BeatMark 2(ulti.media/beatmark-2/)。你可以在这个第三方应用程序中处理剪辑,然后导出带有标记的 FCPXML(回传到 FCP)。
摘要
工具 AI 无疑是很有用的,尽管它并不完美,但比没有要好得多。较老的音频算法可以完成这项工作,但一点机器学习已经增加了很多。当然,如果你是专家,你将能够发现他们工作中的缺陷,但如果你是专家,它们只是更好的起点。一如既往,如果结果足够好,你可以单独使用它们,但如果你还想在某个任务上做得更好,调整一些设置,更仔细地听,你将能够自己在这个任务上做得更好。
在下一章中,我们将探讨工具 AI 如何帮助你进行图像和视频制作任务。
其他资源
- 所以,故事开始了...这是一个真正的乐队还是人工智能?:
youtu.be/3Nlb-m_vKYM?si=jDq1gYu15dlYsbks
|
获取本书的 PDF 版本和独家额外内容
扫描二维码(或访问packtpub.com/unlock)。通过书名搜索本书,确认版本,然后按照页面上的步骤操作。 | 
|
| 注意:请妥善保管您的发票。直接从 Packt 购买的产品不需要发票。* |
| --- |
第四章:带图像和视频的实用 AI
图像和视频驱动着大部分创意空间,因此你会发现许多机会让 AI 帮助组织、分类和选择图像和视频的各个部分。这些实用 AI 任务有时会涉及到生成 AI 领域,但如果它们在本章中有所涉及,这些功能将创建基于现有工作的新工作,而不是创造全新的东西。
自动化 AI,本书稍后将有详细介绍,它更多的是关于替换你现有的工作流程,而不是增强它。在这个语境下,实用 AI更多的是关于帮助你寻找和选择,而不是帮助你创造或为你完成工作。
如果你自己拍摄照片或录制视频,你将知道有时找到特定的镜头或剪辑有多困难。个人和家庭照片最终会变成一个庞大且难以管理的堆叠,就像鞋盒中的打印照片一样,如果不加以整理,它们很少再被看到。
相机确实会创建元数据(如时间、日期和位置),这有助于以后定位照片,但它们无法找到你表亲穿着那件衬衫的照片,或羊在栅栏上搔痒的视频。对于那种“那个有东西的镜头”,以及客户要求“那个镜头”的所有时候,AI 是我们最好的解决方案。
一旦你找到了需要的镜头,AI 可以提供更多帮助,选择镜头中的人物,并让你分别进行色彩校正。你可以自动将宽屏视频转换为竖屏视频,并让 AI 为你重新构图所有镜头。当客户发送带时间戳的反馈时,你甚至可以要求 AI 标注你的时间轴,使你的编辑过程更加顺畅。
最后,稍微进入生成空间,你可以使用 AI 帮助将照片和视频从单视角转换为立体视角——甚至更多。
虽然在其他部分的书中有单独处理图像和视频,但在实用 AI 领域,它们是合并在一起的。有几个工具允许你以相同的方式处理静态和动态图像,将它们分开并不完全合理。
在这里,我们将讨论以下内容:
-
照片和视频的组织和分类
-
选择人物和物体
-
为改变画幅比进行重新构图
-
立体转换
-
管理带时间戳的编辑请求
-
删除跳帧
-
重新调整视频时间
-
提升图像和视频的分辨率
照片和视频的组织和分类
如果你不记得何时或在哪里拍摄的照片或视频,搜索起来可能会很耗时,而人工智能可以提供强大的方法来简化复杂搜索。请注意,一些工具不仅限于搜索,还能为你完成一些工作:自动色彩校正、自动记录,或者直接删除图片。这些工具(包括Eddie AI、Aftershoot等)不仅关注组织,还专注于自动化你的工作流程,因此它们将在本书的第四部分,自动化 AI中介绍。
大多数摄影师使用数字资产管理器(DAM)来组织他们的照片,其中一些工具还可以管理视频。相反,虽然大多数用户可能会使用视频编辑程序来仅管理视频,但这些应用程序也可以用于管理静态图像。你可能发现,在某些程序中,AI 工具比其他程序更好,因此在考虑 AI 搜索时,请保持开放的心态。
我们将从大多数苹果设备用户都会遇到的一个简单解决方案开始。
苹果照片应用
苹果照片应用是照片和视频管理的基本解决方案,尽管它可能无法满足大多数创意专业人士的需求,但它确实提供了许多被忽视的全面人工智能工具。在 iPhone 上拍摄的照片将被自动标记,可以通过搜索其内容来找到,这一切都归功于人工智能,但这个功能并不依赖于空间有限且仅限在线的 iCloud 照片库。
如果你手头有一部 iPhone,请转到照片应用并点击放大镜进行搜索。与其输入记录在元数据中的内容,如日期或位置,不如搜索内容——啤酒、跳舞或绿色。你的手机将找到所有包含该主题、活动、颜色或甚至在该图片或视频中某处写有该单词的照片。是的,你可以通过搜索标志上的文字来找到标志的照片。
尽管这很令人惊叹且很有用,如果你没有将所有图片加载到照片应用中,你就无法使用这个功能。由于照片应用不是编辑视频的最佳场所,你不太可能在那里存储或访问大多数视频剪辑,你可能更愿意使用其他应用程序,如 Lightroom,来管理客户照片拍摄。尽管如此,仍有许多方法可以访问强大的 AI 搜索功能,我们将从照片应用开始。
虽然这并不明显,但你可以根据需要创建尽可能多的照片库,并可以为每个客户或每个工作使用一个。你还可以将图片和视频加载到照片应用中,而无需复制它们,甚至无需将它们从当前位置移动。
要设置此功能,请按照以下步骤操作:
-
在启动照片应用时按住选项键,通过点击创建新库按钮创建一个新的库,并将其存储在您的图片或视频相同的存储设备上。
-
前往设置并取消选中将项目复制到照片库。
-
将您的图像和/或视频从当前位置拖入。(您可以重复这些步骤并选择您原始的 Photos 库稍后返回,您可能还希望重新检查“将项目复制到 Photos 库”复选框。)
从 Final Cut Pro 库、Premiere Pro 或 Resolve 项目或从 Lightroom CC 库中拖入图像是完全没问题的——您只是会用这个进行搜索。不幸的是,AI 分析不是即时的,更糟糕的是,您无法强制它进行。如果您在搜索字段中输入文本,并且下面的弹出窗口显示索引,那么您就只能让 Photos 运行,直到这个过程完成。这个缺点可能使 Photos 不适合快速周转的客户工作,但它可能仍然适合长期和个人工作。
如果您能等待,搜索图像或视频的内容将帮助您更容易地找到东西。如果您需要更多,您将需要寻找另一个具有类似功能的 app 或插件——有很多可供选择。
Excire Foto
几个本地数字资产管理工具中,Excire([excire.com/en/]( https://excire.com/en/ ))集成了 AI 功能,允许您通过文本提示进行搜索,例如“女孩冲浪”或“森林中的秋叶”。类似于 Apple Photos 和 Google Photos,如果您用那个人的名字标记了脸部,您就可以找到他们出现在其他照片中的情况。
Excire Foto 是一个独立的 app,但Excire Search是一个插件,它为 Adobe Lightroom 添加了提示式搜索。使用基于文本的免费搜索的优势是您更有可能找到照片。在这里,我搜索了一个免费股票照片集合中的“约塞米蒂”:

图 4.1 – 这些图像都被判断为类似约塞米蒂的
尽管这些图像的名称中都没有“约塞米蒂”,AI 仍然能够将这些匹配为在约塞米蒂国家公园拍摄或看起来有些像它。Excire 扫描和搜索速度快,尽管某些搜索(如“水”)没有返回所有可能的图像。
Peakto
独特的是,Peakto(peakto.com)不会强迫您改变您组织照片或视频的方式。相反,它会从现有的库中摄取您的资产,包括 Apple Photos、Adobe Lightroom、Capture One 或 Aperture,以及由 Final Cut Pro、Premiere Pro 或 DaVinci Resolve 管理的视频。一旦摄取,AI 处理将分类和分类您的资产,让您能够在整个数字生活中搜索,或者仅在一个单独的库中搜索。这是我使用过的唯一一个可以一次性显示我所有“波浪”照片的工具。

图 4.2 – 从数百 GB 的图像中提取的数百张波浪照片
除了允许根据您自己的请求进行基于内容的搜索外,Peakto 还会根据内容、颜色、亮度、饱和度和对比度对您的图像进行分类和分组,因此如果您需要以绿色为主的镜头,您可以相对快速地找到它。
Peakto 最近增加了更全面的视频支持,将 AI 搜索功能扩展到视频剪辑。您可以找到与现有剪辑相似的剪辑,使用自然语言跨多个库进行搜索,自动添加关键词,并启用对本地设备的团队访问。此外,音频会自动转录,因此您还可以搜索口语对话。
在我自己的测试中,我加载了成千上万的照片和视频,Peakto 的 AI 搜索确实使找到特定项目变得更容易。虽然我的工作只有少数跨越多年,但如果您正在处理长期项目,Peakto 的 AI 搜索可以帮助您在 haystack 中找到针。通过大量不断增长的视频剪辑进行转录搜索,您可以(或非编辑协作者)找到特定口语单词的每个实例,这些实例可能跨越多年的素材和多个独立项目。视频中的内容识别也有效——在这里,我能够找到单个 FCP 库中包含雕像的所有剪辑。

图 4.3 – 这些视频剪辑确实都包含至少一座雕像,现在它们很容易找到
与一些其他应用程序中的转录相比,转录的准确性并不高,但足够有用。在非线性编辑(NLE)应用程序中进行转录搜索可能会更慢,但多库搜索是 Peakto 的独特优势。
ON1 Photo Keyword AI
ON1 Photo Keyword AI (www.on1.com/products/photo-keyword-ai) 可作为独立应用程序提供,或作为 ON1 Photo RAW 的一部分。使用 AI 检测基于内容的关键词后,它会使用行业认可的 XMP 元数据嵌入这些关键词,并且与流行的照片管理解决方案(如 Lightroom CC)兼容。
虽然这个解决方案没有 Peakto 提供的美学判断,但其结果可以在其他应用程序中看到。当导入 Lightroom CC 和其他 DAM 时,可以访问此应用程序中自动生成的关键词,因此您不一定需要更改工作流程以集成 AI。
然而,这个应用程序的一个缺点是生成的关键词可能不足以帮助您找到您正在寻找的图像。当 AI 生成特定的关键词列表时,这可能成为一个问题;如果您想搜索优胜美地国家公园,但 AI 只生成山脉或风景,那么您可能就运气不佳了。您需要查看生成的关键词列表,而不是输入任何您想要的短语。

图 4.4 – ON1 Photo Keyword 生成了许多关键词,但没有“Yosemite”
此应用程序提供免费试用,因此您可以用自己的媒体尝试它,看看它是否能帮助您的工作流程。然而,一些基于 AI 的引擎采用另一种方法,这不是直接基于关键词的。
Jumper
一个与视频编辑应用程序(包括 Premiere Pro 和 Final Cut Pro,还有更多)集成的插件Jumper (getjumper.io/)可以对它展示的任何资产进行 AI 分析,然后一次性使它们全部可搜索。由于 Jumper 主要是为视频设计的,它不仅会找到剪辑,还会找到剪辑中包含您搜索项的特定范围。虽然这个工具也可以处理静态图像,但您可能希望将它们加载到您的 NLE 中,以便 Jumper 更容易看到它们。

图 4.5 – Jumper 确实需要被告知要索引哪些媒体文件,以及您是想索引视频、音频还是两者都要
与生成与图像一起保持的有限关键词集不同,Jumper 使用模糊搜索。在搜索Yosemite后,它甚至可以在该图像的元数据中找不到该信息的情况下找到之前显示的正确山脉图像。
这种模糊方法的缺点是 Jumper 总是能找到“某样东西”。如果您在一组肯定不包含大象的图像中搜索elephant,您仍然会看到一些东西。尽管如此,鉴于每个人搜索的方式都会略有不同,Jumper 的模糊方法更有可能快速产生有用的结果。虽然对于带音频的视频,初始处理可能需要一点时间,但搜索几乎是瞬间的。

图 4.6 – 是的,Jumper 可以使用其模糊搜索找到“Yosemite”图像
由于视频及其音频都被索引,您可以通过视觉或对话中说的单词进行搜索。虽然您无法直接访问转录本,但您可以搜索一个单词或短语来快速定位它,然后将该特定短语添加到时间轴上。

图 4.7 – 此对话全部正确转录,并找到了正确的短语,以及类似的短语(缩略图已模糊以保护隐私)
Strada
Strada 的早期演示(strada.tech)重点强调了标记和分析,并且能够为识别到的片段中的特定部分分配关键词。然后,这些选定的范围可以发送回你选择的视频编辑应用程序,尽管 FCP 是基于范围关键词的最佳工具。转录功能支持,因此你也可以通过口语对话进行搜索,并且内置了翻译功能——非常全面。

图 4.8 – 开发初期的 Strada,展示了其检测特定时间对象的能力
然而,这个工具仍在开发中,并且已经从仅云服务转向以本地优先,尽管分析功能预计将回归。如果你需要为视频提供 AI 关键词支持,请检查 Strada 的当前进度。
Axle AI
Axle AI (axle.ai) 是一个集成了基于 AI 的标记和搜索功能(称为 Axle AI 标签)的 AI 驱动的视频自动化平台。虽然我们将在 第十一章 中回到这个平台,但标记本身可能很有用。

图 4.9 – Axle AI 标签执行分析以确定剪辑中每个部分的内容
Axle 与 Jumper 或 Strada 采用略有不同的方法。Jumper 不公开其搜索索引,而 Strada 只查找单个单词,Axle 使用 AI 描述其在镜头中看到的内容,然后允许你搜索该文本。可以识别人物和物体,并且这种分类可以在本地、在本地场所进行,而不是在云端。虽然它比 Jumper 更贵(每月 200 美元),但对于工作组来说可能仍然值得考虑。
虽然这些选项更加全面,但也有一些其他应用程序也值得考虑。
Adobe Premiere Pro 媒体智能
在 Adobe Premiere Pro (www.adobe.com/products/premiere.html) 2025 测试版中引入,此功能会自动将你导入项目中的媒体进行分类,并允许你使用自然语言搜索内容。虽然 Premiere Pro 当然最适合视频资产,但如果你想使用此功能搜索照片,你也可以导入并搜索它们。
然而,在迄今为止的分析中,它并不像 Peakto、Excire 或 Jumper 那样强大;对于“优胜美地”的搜索结果不足,尽管在其他应用程序中添加的关键词在这里成功导入。如果你在搜索对话,上一章中我们介绍的全文本编辑工作流程非常出色,但基于内容的搜索有更好的选择。如果你需要该功能,Jumper 可用于 Premiere Pro。
Google Photos
许多苹果照片提供的“智能”功能在Google Photos(photos.google.com/)中也有。通过内容搜索效果良好,人脸识别功能可用,并且有移动应用可以快速上传这些设备中的照片。然而,如果你是一名专业摄影师或视频制作人员,我建议你三思而后行,考虑是否仅使用在线解决方案。
即使你通常能够连接到互联网,但有时你的连接会变慢或不存在,你的工作流程将会崩溃。原始 RAW 照片和视频剪辑对于许多创意人士来说太大,无法批量上传,因此仅在线的解决方案并不适用于所有人——但这可能适合你基于个人手机的照片。
PhotoPrism
这个开源解决方案(www.photoprism.app/)在容器中运行,执行 AI 分类,并允许你使用自然语言进行搜索。虽然 AI 搜索似乎没有这里其他一些解决方案那么灵活或强大,但这个产品的免费和本地特性意味着它可能仍然适用于某些应用。
纪念碑
Monument (www.getmonument.com/)提供云(Monument Cloud)和自托管(Monument 2)版本,是 iCloud 或 Google Photos 的替代品,或者实际上是完全不将图像存储在云中的替代品。无论是云还是本地形式,它都充当一个平台和设备无关的照片存储系统,执行 AI 分类以简化搜索。虽然我可以看到这种解决方案在家庭环境中的实用性,但我并不确定许多专业人士是否愿意将他们的高分辨率原始文件存储在第三方硬件设备上,或者将它们全部上传到云端。
选择人物和物体
选择是修图和照片改进任务的核心,基于 AI 的区域选择已经进步到可以重新发明工作流程的程度。就在几年前,摄影师可能需要付出相当大的努力来调整照亮人物及其背景的光线,以获得正确的主体分离程度。
现代分割算法现在足够好,不仅可以快速准确地选择人物,还可以分离人物的身体部分,甚至可以分离眼睛的各个部分。这使得摄影师可以独立调整人物和背景的光线,而无需进行广泛的手动选择,从而让他们工作得更快。
这些功能已经被添加到各种平台上的以照片为中心的应用中,并且精细程度各异。许多苹果制造的工具包括自动背景移除,尽管它易于访问,但对于大多数专业任务来说控制不足。
由机器学习驱动的主题选择出现在 Pixelmator Pro 等应用程序中,尽管这个功能在肖像摄影中很有帮助,但其他工具提供了更广泛的选择选项。在撰写本文时,最完整的蒙版工具集可以在 Adobe Lightroom Classic 中找到,所以让我们从这里开始。
Lightroom Classic 和 Photoshop 蒙版
在 Lightroom Classic 的最新版本中(www.adobe.com/products/photoshop-lightroom.html),蒙版功能已经扩展到自动选择图像中的人物——一个、多个或所有的人物。在** Develop** 模式下,点击包含人物的图像下方的蒙版模式图标。在蒙版部分的底部,你的照片中的人物将被识别,然后你可以点击一个人的脸部来选择他们,或者选择他们的一部分。

图 4.10 – 在这个示例中,可以单独选择所有七个人,或者一次性选择他们所有人
当然,Lightroom 中存储的大多数图像都是真实人物的摄影作品,图像校正任务可能非常具体——比如让眼睛变亮,改变上衣的颜色。选择这些项目曾经只是 Photoshop 的任务,但现在在 Lightroom 中也可以做到了。
在每个识别出的人物中,你现在可以选择整个人物,或者更深入地选择他们的一部分:不同的皮肤区域、眉毛、眼睛的某些部分、嘴唇、牙齿、头发或他们的衣服。

图 4.11 – 这样的选择允许你在不使用 Photoshop 的情况下精细调整一个人的外观
这些由 AI 驱动的选择还可以识别风景的各个部分,自动分割天空、山脉、植被、水域等。

图 4.12 – 如果你选择风景而不是人物,那么你可以选择你希望选择的风景的哪一部分
选择了一个蒙版后,所有标准的 Lightroom 控制项都变得可用,允许你仅针对图像的这部分进行颜色、曝光、锐度等校正。曾经需要大量努力的任务现在几乎可以自动完成,通过预设即可实现。
最复杂的任务仍然需要访问 Photoshop,我们将在本书的 GenAI 部分花更多时间介绍这一点。你也会在 Photoshop 中找到这些自动选择,尽管它们隐藏得稍微深一些。打开一个图像,选择对象选择工具,你将在屏幕顶部的选项栏中看到相同的选项(人物、眼睛等)。
ON1 Photo RAW MAX 蒙版
综合智能选择不仅存在于 Adobe 的应用程序中;ON1 的照片应用程序也可以自动分割图像的部分。虽然检查器提供了一些只影响面部一部分的自动控制,但如果选择没有人的图像,你将能够选择照片的特定部分,并获得与 Lightroom 相似的结果。

图 4.13 – 选择“flora”可以得到大部分树木,但接近天空的选择是模糊的
在处理图像时,可以在开发选项卡中访问局部选择,在那里你可以选择精确应用自动Brilliance AI效果的位置,以及你想要使用的强度。为了获得更多控制,使用局部选项卡添加调整,然后查看浮动属性面板,并在遮罩部分选择一个区域。最后,你可以在右侧的检查器中控制校正。
为了更精确的控制,你也可以使用超级选择 AI工具(一个魔法棒图标),然后简单地点击一个对象来选择它。这对于定义清晰的对象有效,也可以用来选择人的某些部分,如头发。这些遮罩可以通过绘画进行调整,但选择边缘周围的一些细微细节很难用手准确选择。
在我的测试中,Lightroom Classic 生成的遮罩边缘定义更清晰,这在对树木和头发等对象周围进行调整时非常有帮助。上面相同的较不精确的遮罩意味着在调整后复杂区域的边缘变得可见,我无法将我的校正推进到我想要的程度。工具包括调整遮罩,但这需要时间,而且它们并不总是足够。
这两款应用程序并非唯一拥有图像分割技术的;我预计这项技术将在不久的将来扩展到其他图像处理应用程序中。你也会在一些视频应用程序中找到类似的技术,从……开始。
Final Cut Pro 磁性遮罩
虽然自动图像分割对于静态图像非常有帮助,但对于动态图像来说几乎是必需的。每秒手动调整选择 24 次根本不可行!在基于 AI 的选择算法之前,跟踪选择要么是痛苦乏味的,要么使用大而模糊的边缘来掩盖其不精确性。
在 Final Cut Pro 11 中,引入了磁性遮罩功能,允许选择多种类型的对象——即使它们在镜头中移动或被前方移动的对象遮挡。你首先将任何效果或色彩校正拖动到查看器中的对象或人物上,等待目标被突出显示。

图 4.14 – 您的作者,在 Final Cut Pro 中进行色彩校正准备
如果需要,可以通过绘画来微调选择,然后可以分析整个剪辑。添加到同一剪辑的额外磁性遮罩将以不同的颜色显示,并且可以识别和跟踪许多种类的对象。
这个功能让不可能变为可能。我成功地在 50 分钟的剪辑中,单独从(亮度更高的)投影屏幕前走过的人身上进行了校正,这是一个连续的跟踪。这真的很棒。这建立在(并且比)一个较老的 macOS 功能(用于如 FxFactory 的 Keyper 之类的插件)之上,该功能可以自动识别镜头中的人。
尽管如此,所有主要的 NLE 都喜欢互相复制功能,而 FCP 并不是唯一拥有这种技巧的……
DaVinci Resolve 魔法遮罩
在 Resolve 中,AI 魔法遮罩功能允许您选择希望校正的剪辑的哪些部分:

图 4.15 – 跟踪部分剪辑的 AI 魔法遮罩控制
按照以下步骤操作:
-
在颜色页面,从中央面板中选择魔法遮罩图标,然后调整下面的控件以将质量提高到更好。
-
从第一帧开始,反复点击图像以识别您希望单独校正的帧的哪些部分(例如,一个人)。要查看遮罩,快速调整下面的主色轮上的曝光(或任何其他设置),或使用中心魔法遮罩控件右上角的切换遮罩叠加按钮。如果选择了任何不需要的区域,请按option或alt,然后点击这些区域以移除它们。

图 4.16 – 虽然一开始看不见,但这里的手被自动添加到围绕人物的跟踪区域中
- 使用Track Forward按钮跟踪整个剪辑中的选择。如果你没有从剪辑的开始部分开始,也可以使用Track Backward。因为这个工具知道人们长什么样,如果身体的某个之前未见过的部分突然进入画面——例如,一个正在做手势的手——这将自动添加到选择中。
这个工具不如 FCP 的磁性遮罩快,但它可控、有效且灵活。如果你想更进一步,Resolve 有许多出色的颜色校正工具,包括重光照效果,它可以完成惊人的工作。
如果你使用的是 Adobe 应用程序呢?
Premiere Pro 对象遮罩
花了一些时间,但 Premiere Pro 的 beta 版本终于在 2025 年 9 月添加了对象遮罩工具,并且它做的与 FCP 和 Resolve 中的工具几乎一样。以下是使用方法:
-
将剪辑添加到序列中,然后选择剪辑并选择新的对象遮罩工具,倒数第二个。
-
等待您的剪辑准备就绪,然后在节目监视器中悬停在一个人或对象上,然后点击它。选取应该是准确的,但如果需要,您可以使用+和-按钮进行微调。
-
打开效果控制,在剪辑上查找新的对象遮罩设置。按下跟踪器控制中间的按钮,从当前帧开始双向跟踪。一个对话框将显示进度,应该相当快。
-
当轨道完成时,您可以通过切换到颜色工作区,然后在右侧的Lumetri 颜色面板中进行更改来使用这个遮罩进行色彩校正。要遮罩背景,右键单击对象遮罩并选择用作不透明度遮罩。

图 4.17 — Premiere Pro Beta 的新对象遮罩工具在作用中
这个工具将受到 Premiere Pro 编辑者的热烈欢迎。尽管 After Effects 用户有更多控制的选择,但这个工具仍然受欢迎。
After Effects Roto Brush
让我们看看这个功能是如何工作的:
-
导入您的剪辑并创建一个合成来保存它。
-
在时间轴窗口中,双击您的剪辑将其加载到图层面板中,然后在顶部的工具面板中点击Roto Brush。
-
接下来,在您想要保留的对象上添加绘画笔触。如果选取包括您不想要的部分,在绘画时按住option或alt键以移除它们。如果您用空格键播放,效果将自动传播到剪辑的其余部分。
就像之前讨论过的工具一样,现代的Roto Brush足够智能,可以将进入画面的肢体添加到人物的选取中。

图 4.18 – 这个手臂最初没有被选中,但已被自动添加
它的速度不如 FCP 的磁性遮罩快,但比 Resolve 的魔法遮罩快一点。然而,内置功能并不是使用 AI 在视频中的唯一方式——知名的插件现在也在集成 AI 功能。
Boris FX Mocha 选取
Boris FX Mocha多年来一直被用于复杂的视频遮罩任务,截至 2025 年中期,它现在包括用于创建初始遮罩的 AI 辅助。与传统贝塞尔工具相比,一个新工具允许您创建一个新的遮罩 ML图层。点击人的头部,然后点击身体较低的位置,现在通常就足够获得一个好的选取——这比手动绘制路径节省了大量时间。
除了基于点击的选取外,您现在还会找到一个基于提示的选取方法。它并不总是完美的,但键入您想要选取的对象(如cars或people)的名称,是一个很好的进步。
由于算法现在得到了很好的记录,我怀疑许多其他工具将集成基于 AI 的图像分割。即使是 Adobe InDesign 的文本绕排功能中最基本的主题选择功能也可以让你避免进入 Photoshop,在这种情况下,结果不需要像素完美才能有效。迟早,在你的首选应用中留意更多图像分割功能。
AI 色彩校正
尽管自动色彩校正工具在许多视频和图像编辑应用中已经存在了许多年,你可能没有意识到其中一些是基于机器学习算法的——甚至包括 Photoshop 中一些最早的自动校正功能。
更新的选项,包括 Final Cut Pro 的色彩调整中的自动选项,通常比早期的调整更有用,但没有一个是完美的。虽然一些这些功能可以作为进一步校正的起点很有用,但我还没有看到每次都能起作用的魔法“让它看起来很棒”按钮。
如果你需要一个可靠且一致的色彩校正解决方案,可以尝试像Colourlab AI(colourlab.ai)这样的解决方案,它支持许多视频编辑应用。
AI 驱动的主题选择也有助于在改变宽高比时的重新构图——让我们来看看。
重新构图以适应宽高比变化
随着垂直社交媒体视频的兴起,宽高比的变化(通常是从宽屏到竖屏)变得更加常见。在这些格式之间转换并不总是简单的,我建议拍摄比正常更宽的镜头,放大宽屏版本,并裁剪竖屏版本的边缘。如果你的相机允许你拍摄“开放门”,那么你可以简单地裁剪那个更高的画面(4:3或3:2)为宽屏和竖屏独立。
无论你如何拍摄,编辑中的每个剪辑在转换宽高比时都需要调整,并且所有主要的 NLE 都包含一个功能来使这个过程更平滑。让我们逐一探索。
Final Cut Pro
-
在浏览器中右键点击一个项目(即,时间轴)。选择复制项目为。
-
在随后的对话框中,选择新的宽高比(可能是垂直)和分辨率,然后勾选智能适配。每个剪辑都将重新定位,使用机器学习来选择镜头中最重要的一部分。
-
播放序列,并在需要时调整位置和/或缩放。请注意,尽管你可以自己添加动画,但 FCP 不会为你跟踪运动;它选择一个单一的位置并坚持下去。
Premiere Pro
-
右键点击一个序列,然后选择自动重新构图序列。
-
在出现的对话框中,选择您的新纵横比,可能是垂直。请注意,新序列使用括号中当前序列的新纵横比命名,例如
序列名称 (9x16),它将在名为自动重新构图序列的新文件夹(即文件夹)中创建。在这个文件夹中,找到新的序列(名称中包含纵横比),右键单击,然后选择序列设置。检查帧大小是否符合您的需求——因为 Premiere 只调整序列的宽度而不是交换宽度和高度,您可能更喜欢使用1080x1920进行垂直视频。 -
播放序列并检查每个剪辑是否正确。虽然 Premiere 会在镜头内调整构图,但这种动画并不总是您想要的,最简单的修复方法是关闭自动重新构图效果。
-
要对每个需要此功能的剪辑进行此操作,找到效果控制面板,然后单击自动重新构图旁边的“fx”图标。要重置位置,在时间线中右键单击该剪辑,然后选择填充以填充框架。在效果控制或属性中,如有必要,调整缩放和位置。
DaVinci Resolve(Studio 版本)
-
右键单击时间线并复制它。
-
将新的时间线重命名为目标纵横比。
-
右键单击并选择时间线设置。
-
取消勾选左下角的使用项目设置,然后在顶部的时间线分辨率菜单中选择自定义。
-
输入所需的靶分辨率。
-
在底部的不匹配分辨率菜单中选择裁剪缩放全帧。在检查器中,在变换部分,查找该部分的底部AI 智能重新构图。在此部分中,将感兴趣的对象设置为自动,然后按重新构图以在整个镜头中跟踪。
-
如果这还不成功,将自动更改为参考点,然后将出现的框移动到您想要在镜头中保持居中的对象或人物上。
-
再次单击重新构图,等待处理,该区域将保持在重新构图图像的中间。
无论您选择哪个工具,您都将能够至少在重新构图方面获得一些帮助。
立体转换
立体摄影,立体照片的捕捉,已经流行了一个多世纪,立体视频自 1950 年代以来也一直很受欢迎(有时受欢迎)。要捕捉立体照片或视频,通常必须同时记录左右图像,要么使用双镜头相机,要么使用两个同步的独立相机。
然而,大多数图像显然是采用 2D 捕获的。因为使用苹果 Vision Pro 等设备观看的观众可以看到 3D 图像,机器学习算法现在已经使得将 2D 图像转换为 3D 成为可能。这涉及到图像分割和深度重建,以确定图像的哪些部分更靠近相机,哪些部分更远,以及一个生成组件,以填补前景物体后面的任何缺失区域。

图 4.19 – 这段视频是在 2D 模式下拍摄的,并使用 Owl3D 进行了转换,其深度令人印象深刻,但在 2D 页面上难以分享
在最新的 visionOS 中,不仅可以创建图像的立体版本,还可以创建一个可以自由移动视点的 3D 版本。这被称为空间场景,到目前为止,它甚至比之前可用的空间照片转换更有效。目前,这是内置在操作系统中的,但并不是第三方应用程序可以访问的功能。
第三方应用程序可以将视频从 2D 转换为 3D,成功率各不相同。我所见到的最佳结果是在 Owl3D(提供 Mac 和 PC 应用程序)上实现的,但使用 Moon Player 等应用程序可以在 Apple Vision Pro 上以较低的质量进行实时转换。虽然这些应用程序的输出并不完美,但 3D 转换的质量预计将继续提高。今天,如果你想创建立体图像,最好以立体方式捕捉,但请注意这一领域的改进。
管理带时间戳的编辑请求
在视频(和音频)制作过程中,通常会收到反馈请求,要求删除特定的单词或带时间戳的区域,要求有替代版本,要求更换镜头,或要求更改效果。但如果请求影响了镜头的长度,它可能会使其他请求更难以解释。例如,如果要在时间轴的开始处删除 5 秒的镜头,那么之后所有其他请求的时间戳都将无效且难以追踪。
解决这个问题的老式方法是从列表的末尾开始处理,这样更改列表中的早期时间码仍然有效。但这并不总是有效;有时一个请求与早期更改相关,而上下文意味着通常从开始到结束编辑更容易。那么解决方案是什么?
标记提供了一种很好的解决方法,允许你在时间轴上客户要求更改的每个位置添加一个虚拟便签。标记存在于所有常见的 NLE 中,快捷键M将在 Resolve、Final Cut Pro 和 Premiere Pro 的时间轴剪辑中添加一个标记。因为标记是附加到剪辑上而不是仅仅时间码,所以当剪辑从时间轴中删除时,标记会移动,这样你就可以从头到尾处理更改列表。
手动添加所有这些笔记可能会有些繁琐,但如果你使用 Final Cut Pro,Marker Toolbox 应用程序可以使用 AI 将客户友好的时间码列表处理成带有说明的 待办 标记。 (Marker Toolbox 还可以将来自 Vimeo 和 Frame.io 等在线评论网站上的评论转换为时间线标记。) 这为编辑和他们的客户提供最佳体验,他们只需要给他们的笔记一个非常松散的结构。例如,他们可以写以下内容:
-
5 秒结束这个镜头 -
0:35 替换这个镜头 -
0:47 从这里剪切这一部分 -
0:52 在这里结束剪切 -
1 分 23 秒修复标题中的拼写,应该是 "Jeri" -
1:53 检查结尾的长空白部分?
作为 Final Cut Pro 工作流程扩展打包的 Marker Toolbox,可以非常快速地将所有这些转换为编辑时间线上的合理标记。如果您的客户可以遵循像前面示例那样的简单规则来编写文本,它将工作得很好。如果请求格式不佳,ChatGPT(或本地 LLM)的 AI 处理将使它们有意义。安装后,您需要点击插件图标以访问已安装的 工作流程扩展,然后选择 Marker Toolbox。点击 设置(位于文本区域下方)并确保此对话框中的帧率与您的轨道匹配。

图 4.20 – 左侧的粗略说明变成右侧准确的时间戳,准备好拖入时间线
如 图 4.20 所示,将客户的反馈粘贴到左侧文本窗格中,然后点击 本地处理评论。现在你将在右侧看到处理后的更改列表,如果客户表达得清楚,应该没问题。如果不清楚,可以通过添加 API 密钥(在付费账户中可访问)到设置中,然后点击 使用 ChatGPT 处理评论 重新处理。开发者计划很快添加对 Apple Intelligence 本地处理的支持。
假设您现在在右侧有良好的结果,将右下角的绿色图标拖动到 Final Cut Pro 中的时间线开始处,它位于此窗口后面。
在这个示例时间线上,标记被放置在标题上,每个标题都包含相同的反馈,所有这些都包含在一个包含时间码流的新的复合剪辑中。为了使标记能够随变化而流动,选择新添加的剪辑,然后选择 剪辑 > 拆分剪辑项。最后,删除创建的时间码轨道。

图 4.21 – 列表中的第一个标记可以在时间线上看到——注意标题与剪辑相连接,标记位于标题上
标记(附带标题)现在直接连接到其下方的剪辑,并且当进行更改时将保持与正确剪辑的连接。所有标记都可以在时间轴索引中看到,位于时间轴左侧的标签部分。这个工作流程不使用太多 AI,但它使一个常见任务变得更容易,并允许客户更自由地表达自己。
客户将喜欢的另一个功能是移除他们的错误,你有时可以做到不留痕迹。
移除跳切
在明眼人看来隐藏编辑是当今编辑应用中常见的功能,尽管它不是现代 AI 工具集的一部分,但它仍然由机器学习驱动。
在任何主要的 NLE(非线性编辑器)中,你只需将一个谈话头视频放置在时间轴上,然后删除其中的一部分以创建跳切。你可以通过在源剪辑中选择两个不同的范围并将其依次添加到时间轴上来完成此操作,或者通过使用 Razor 或 Blade 工具,进行几次剪切,然后选择中间的那部分并执行波纹删除。
最后,技术取决于你,但你会希望最终得到两个剪辑,其中同一个人在大致相同的位置。理想情况下,两个镜头应该尽可能相似:眼睛都睁开,头部朝同一方向,等等。避免出现身体的一部分(如手)在一个镜头中可见而在另一个镜头中不可见的情况,否则你可能会得到这样的混乱:

图 4.22 – 如果尝试将两个这样的镜头(不同手部位置)混合在一起,流动、形态和流畅剪辑都会失败
现在,你需要找到正确的过渡。在 Final Cut Pro 中,这是流动过渡;在 Premiere Pro 中,这是形态剪辑;在 DaVinci Resolve 中,这是平滑剪辑。应用过渡,等待处理,然后播放。过渡将使用机器学习技术将一个剪辑转换为另一个剪辑,但无论你使用哪种,第一次可能看起来不太理想。尝试过渡的持续时间;通常,较短的时间更好,可能只有几帧。还可以通过向前或向后滚动几帧来实验过渡的确切时间。有时这需要一点调整。
最可靠的解决方案是指导你的主题,要求他们在句子之间暂停、重置和放松。如果他们能在开始每个句子之前回到大致相同的位置,并且有相似的面部表情,那么你尝试将一个镜头无缝连接到另一个镜头的成功率会高得多,而不是如果每个镜头都截然不同的话。
尽管如此,有时这种过渡根本不起作用。在这些情况下,尝试以其他方式遮蔽编辑:切换到备用镜头,切换到不同的角度,或者在第二个剪辑上快速缩放。通常的非 AI 技术仍然可用;这仅仅是你的技巧箱中的另一个工具。
另一个可能很有用的功能是重定时,虽然光流重定时在许多应用程序中很常见,但目前最好的机器学习慢动作可以在 Final Cut Pro 中找到。让我们放慢一些剪辑的速度。
视频重定时
虽然以高帧率录制以获得最佳质量慢动作效果仍然是最好的选择,但有时在拍摄后才会决定慢放视频。此外,大多数相机在特定分辨率下提供的最大帧率有限,可能无法以所需的分辨率和帧率进行捕捉。
因此,在后期制作过程中可能需要创建新的中间帧,许多应用程序中都有一种称为光流的方法。虽然这个算法很有用,但 Final Cut Pro 中添加了新的机器学习算法,在超级慢动作功能中,它们在质量上是一个巨大的飞跃。

图 4.23 – 平滑慢动作选项使用机器学习来插值所需的帧,效果出色
在时间轴中选择一个剪辑后,从查看器下方的重定时菜单中选择Smooth Slo-Mo,然后选择一个百分比作为起始点。使用高级插值,将创建新的中间帧来填充任何间隙,AI 的表现非常出色。Compressor 也提供了这个高级重定时选项。
虽然 DaVinci Resolve 和 Adobe Premiere 目前还无法达到这种质量,但像 FlowFrames 这样的免费应用程序可能是一个有用的替代品,而且这也可能在一个更出名的提升分辨率的应用程序中实现:Topaz AI Video。
提升图像和视频
在图像中增加细节或分辨率是图像处理工具多年来一直在处理的任务,但没有 AI,你能够推进的程度有限。视频有时也需要锐化或提升分辨率,这可能是一个更专业的任务。今天,AI 工具在许多应用程序中提供,并且已经变得相对主流。
在制作方面,这些工具使用简单;你将输入一个低分辨率图像,运行该过程,你将获得一个更高分辨率的图像。根据原始图像或视频的糟糕程度,你可能更喜欢在提升之前或之后进行处理。一般来说,如果图像真的很差,你可能希望在提升之前先进行手动清理。然而,如果你从一个不错的图像开始,并试图将其放大到很大,尝试这样做:
-
保存你的原始分层图像。
-
保存该图像的平铺副本。
-
提升平铺副本的清晰度。
为什么呢?简单来说,非常高分辨率的图像带有图层可以变得相当大,难以处理。我曾将用于交易会展示的图像放大,结果单个图像超过了 500 MB,虽然这在视频术语中不算什么,但在 Photoshop 中加载和保存都很慢。
为了获得最佳效果,尽量将图像的大小精确翻倍。实际上,许多工具只会将图像放大 2 倍,如果你需要更大的尺寸,你只需将这个过程运行两次。通常情况下,你尝试做的事情越多,你越不可能成功——没有替代品可以替代真实像素,如果你想覆盖 300 dpi 的大屏幕,你应该从高分辨率图像开始。
虽然有许多选项(阅读以下建议以获取一些建议),但最知名的图像和视频增强器可能来自 Topaz Labs。他们提供一系列桌面产品:Photo AI,一个以放大为重点的更便宜的Gigapixel AI,以及一个更昂贵的Video AI。除了桌面应用外,Topaz 还提供几个网络应用,提供图像和视频的放大和其他改进。对于大多数制作需求,我建议本地处理,但如果你的机器性能较低,你可能需要额外付费使用云处理。
尽管所有这些应用都包含生成性组件——毕竟,它们确实在创造细节——但我将它们包含在这本书的这一部分,因为它们并不是试图从无到有地创造东西。然而,在它们的极端设置下,这些应用产生的某些形状和纹理细节可能会趋向于人工化。为了避免这种情况,请确保以尽可能高的质量捕捉,并将这些应用作为轻微的升级步骤。
这些应用的结果可能非常好,尽管处理可能较慢。基于 AI 的降噪功能可以真正帮助清理颗粒状图像,其他工具有助于从错过焦点、色彩平衡中恢复,当然,当你需要比捕获的分辨率更高的分辨率时,放大功能非常有帮助。
随着 AI 图像改进算法逐渐成为主流,其他应用也提供了基于 AI 的工具,可以执行一些这些任务,包括以下内容:
-
Adobe Photoshop拥有许多 AI 功能——Neural Filters,包括超级放大****放大器和照片修复模块(以及其他)以及生成式放大功能,如果你愿意,可以与 Topaz 模型一起使用。
-
Pixelmator Pro 的超级分辨率功能,以最小的质量损失将图像分辨率翻倍。
-
DaVinci Resolve 的 AI 超级放大,提供 2 倍到 4 倍的放大,内置锐化和降噪功能。
-
Upscayl,提供免费桌面应用,能够实现 2 倍到 16 倍的静态图像放大。付费云放大服务也可用。
-
Apple 的 macOS 26 包括视频滤镜的 API,这将允许应用放大、执行视频重定时、添加运动模糊、降噪和锐化,甚至可以在视频通话中实时进行。

图 4.24 – Photoshop 包含多个神经网络过滤器,但超级缩放可能是最直接有用的
由于许多生成式人工智能服务倾向于创建低分辨率图像,因此它们通常会包括放大功能。始终要小心放大是否创造了虚假的细节(毕竟,这些在技术上属于生成式人工智能),并从你能找到的最佳来源开始。
摘要
机器学习继续对许多图像处理流程产生重大影响。虽然能够在大量集合中找到一张图片很有帮助,但能够在视频中找到特定时刻的能力更为强大。一旦你找到了那个镜头,能够重新照亮某人脸部,即使他们四处移动,也是非常方便的。然后你可以使用人工智能来帮助你处理客户的变更请求,为新宽高比重新构图,使视频速度大大减慢,或者创建图像的更大版本。
虽然你的生产流程可能不会使用所有这些技术,但它们可以使你更容易地对客户的请求说“是”,使你的工作流程更顺畅,并且它们仍然会让你的创造力成为你创作的核心。我们还没有结束;在本书的后面部分,在第四部分,关于自动化人工智能,我们将讨论可能完全改变你的工作流程的技术。
在下一章中,我们将探讨与文本相关的实用人工智能。虽然创意生产通常围绕图像、视频或音乐展开,但文本仍然是剧本、指令和许多客户互动的幕后,因此值得深入探讨。
其他资源
-
AI 遮罩在 Boris FX Continuum – Mocha Matte Assist ML 中:
www.youtube.com/watch?v=YbbcUpKcQGU -
FlowFrames:
nmkd.itch.io/flowframes -
苹果的机器学习视频效果:
youtu.be/EbRvY6j8d7g?si=8kRskK2AcpnorXwu
|
获取本书的 PDF 版本和独家额外内容
扫描二维码(或访问 packtpub.com/unlock)。通过名称搜索本书,确认版本,然后按照页面上的步骤操作。 | 
|
| 注意:请妥善保管您的发票。直接从 Packt 购买不需要发票。* |
| --- |
第五章:基于文本的实用 AI
文字是创意生产空间中许多人类任务的骨架:我们编写剧本,我们从客户那里收集反馈,我们头脑风暴新想法,我们进行摘要,我们进行编辑。文字也是创意应用中许多以计算机为中心的任务的关键——用于视频字幕的 SRT 文件,以及描述编辑时间线的 XML 文件。
并非所有 AI 可以帮助的任务都应该归类为实用 AI。如果文本是从一个想法中创建的,那么这就是下一章将要介绍的生成性 AI。如果你使用 AI 进行大量推动工作流程的处理任务,那么这就是自动化 AI,我们将在本书的后面部分介绍。实用 AI 任务是指那些提供建议、帮助或执行微小修复的任务,而不是为你完成工作。
由于像 ChatGPT 这样的 LLM(大型语言模型)是基于文本的,因此它们非常适合许多文本处理任务。那些繁琐、耗时且缺乏创造性的文本工作很可能是某种 AI 服务可以帮忙解决的问题,而且你将有多种选择可供选择。事实上,选项如此之多,变化如此之快,试图涵盖所有这些选项将是愚蠢的。
与其关注具体的应用程序,这里,我将关注任务。考虑到这一点,如果它们具有独特的上下文优势,例如在本地设备上运行或集成到你可能需要它们的工具中,我仍然愿意推荐特定的工具。
对于大多数一般任务——那些以文本文件作为输入并产生文本作为输出的任务——你可以随意尝试任何你想要的 LLM。记住,本地运行的 LLM 在隐私方面承担的风险更小,尽管它们通常不太强大。
我将在本章中涵盖的主要任务如下:
-
摘要文档
-
语法校正
-
检查和验证
-
重新格式化文本
摘要
如果能够将冗长、无聊的文档缩短,那岂不是很好?虽然并非所有创意生产工作都涉及大量书面文档,但在某个时候,你不可避免地会遇到一大堆你实际上不需要逐字阅读的文本,这就是 AI 可以提供帮助的地方。尽管我把这归类为实用 AI,但这是一种相当具有生成性的任务——尽管它主要基于提供的输入。
如果文档很长,你需要快速了解关键点,那么快速摘要来帮助你并没有什么不妥。然而,如果客户已经发送了关于如何准确完成他们要求的详细说明,你的工作不仅是自己阅读整个文档,还要洞察细节,以发现满足客户需求的最佳方式。不要偷懒!花时间阅读整个文档,你会做得更好。
这种做法可能看起来很明显,但最近一家非常知名公司的广告中展示了他们的 AI 助手总结客户简报,因为创意人员懒得阅读它。AI 永远不应该被用来因为太懒而无法正确完成工作,但这并不意味着它完全没有用处。
今天的 AI 摘要已经远远超出了长文档,并且可以集成到电子邮件应用程序和操作系统中。苹果智能,随 macOS 免费提供,可以在内置的邮件应用中总结通知和电子邮件,而微软的Copilot则处理 Outlook 中的摘要。甚至可以使用包含 AI 功能(如摘要)的浏览器(如 Arc、Dia 或 Comet)。

图 5.1 – 在 Arc 浏览器中悬停在链接上同时按住 Shift 键,会产生链接页面的 AI 摘要
搜索引擎也包括摘要:谷歌的 AI 工具几乎总结了每个谷歌搜索结果,结果是出版商看到其网站访问量显著减少。搜索者更有可能留在谷歌上,而不是跟随链接到信息的原始来源(arstechnica.com/ai/2025/07/research-shows-google-ai-overviews-reduce-website-clicks-by-almost-half/)。

图 5.2 – 谷歌对其 AI 摘要功能的自身总结
可惜,这些摘要往往包含不准确的信息,最著名的一次是建议在披萨配料中添加胶水(www.techradar.com/computing/artificial-intelligence/googles-ai-overviews-are-often-so-confidently-wrong-that-ive-lost-all-trust-in-them)。更糟糕的是,当用于产品研究时,这些摘要可能会严重误导,推荐根本不存在的产品,并且未能提及产品的任何问题(housefresh.com/beware-of-the-google-ai-salesman/)。大多数人不会点击通过以核实摘要作为事实,但你应该这么做。
就像通常与 AI 一样,大部分正确仍然是有用的,只要你能够参考真实文本来验证任何关键点。一个帮助你从稻草堆中找到针的电子邮件摘要是有帮助的,而明显不准确的摘要可以忽略。在网上,始终值得点击到原始来源。
让我们回到长文档摘要的话题,因为并非所有大型语言模型都擅长这项任务。在最近的一项测试中,比较了使用技术文章进行摘要功能,Gemini 以绝对优势胜出。Dan Russell (groups.google.com/g/searchresearch-wednesday-challenge/c/t5AJTwBPvAY) 使用一个简单的提示来比较 Gemini 2.5 Pro、ChatGPT 4o、Claude 3.7 Sonnet、Grok、Perplexity 和 NotebookLM:
I am a PhD computer scientist. Please summarize this paper for me.
由于大多数创意专业人士不会与技术文章一起工作,这些具体结果可能不会直接相关,但尝试用你自己的文件进行类似的实验,看看这些模型之间可以有多大差异。
模型将继续变化和进化。此外,请记住,每次你运行此类查询时,你都会收到略微不同的结果。人工智能并非完全可预测,如果某件事失败了,简单地再试一次可能就值得了。
提示大型语言模型
提示很重要,虽然简单的提示通常就足够了,但有时使用复杂的提示会得到更好的结果,指定你希望展示多少个项目符号,最大字数,甚至要求以特定格式进行总结,例如“引言、要点、结论”。这些策略会因文档和你的个人偏好而异,许多人愿意提供关于高级提示的建议——不要害怕尝试。
有些人发现明确定义 LLM 的 角色、其 任务 和期望的 格式 在每个提示中很有用。虽然并不总是有必要这样具体,但如果提示没有产生正确的结果,这个 角色任务格式(RTF)的概念将引导 LLM 更接近你的目标:
-
角色实际上是 LLM 的职位名称,这将定义其分析时使用的方法和语气
-
任务是你赋予 LLM 的工作,如果你要求文本进行转换,这可以提供重要的上下文
-
格式是你希望收到的输出
将所有这些结合用于摘要任务,你可能会得到以下结果:
You are an analyst. Please generate a summary of the attached files that's no more than 400 words long. Format your output in Markdown with headings and use bold and italics to highlight key points.
你的提示越具体,你从人工智能模型中获得你想要的东西的可能性就越大——但并非每个人都同意最佳策略。以下是一个可能对你有效的策略示例,这是一个展示“提示优化器提示”的 YouTube 视频:
www.youtube.com/watch?v=1r5Wa5hYBEw
会议摘要
在办公室环境中,澳大利亚政府的一项 Copilot 试验发现,高级员工更有可能使用摘要工具,这是有道理的,但几乎每位参加会议的人都能从那些会议的可搜索记录生成的摘要中受益。
在创意生产方面,转录客户会议可以确保你在之后能够回顾任何关键点,但总结关键讨论要点将帮助你确保你没有错过任何重要内容。不完美仍然是有所帮助的,而在医疗和心理卫生服务中,转录然后总结的服务正在迅速变得规范化。与客户见面的创意人士也应该效仿,因为任何人都不可能从每次会议中回忆起所有关键点。
为了最大限度地利用会议摘要,应在会议结束后尽快阅读它,并确认所有关键点仍然在你的脑海中清晰,并且已经被正确提取。如果有什么遗漏,请自行添加。如果有任何幻觉,请将其删除。这总比没有好,但如果你不趁新鲜时检查,你就无法修复错误。
书籍摘要
那么,关于研究呢?如果你希望从一本书中获得新的见解,你不会在书的封面上找到它们,也不会在 AI 总结中找到;细节很重要。当然,世界上没有足够的时间来阅读每一本书。如果你只有时间阅读一本书,但必须在几个潜在选项之间做出选择,摘要可能有助于你做出更好的决定,选择哪些值得你花费时间。
尽管大型语言模型(LLM)应该能够提供关于一本书涵盖的内容以及它受到的欢迎程度的元分析,但不出所料,这些总结并不总是准确的。你对一个主题了解得越多,你越有可能在该领域的结果中找到错误。
例如,我在 2020 年写了一本关于 Final Cut Pro 的书。它仍在印刷中,并定期更新,我对这个领域很了解。向 ChatGPT 询问“关于 Final Cut Pro 有哪些最好的书籍可以阅读?”(令人高兴的是)包括我的书,但第一个针对初学者的推荐是十多年前就不再销售的软件版本,而苹果专业培训系列的推荐也已经过时多年。

图 5.3 – 关于 Final Cut Pro 的书籍;是的,我有偏见,但这个列表中有明显的缺陷
如果 AI 不能就我非常了解的主题给出好的答案,为什么我应该信任它在我不太熟悉的主题上的答案?关于任何其他主题的书籍推荐可能听起来和这个一样自信,但没有专业知识来确认它们的准确性,建议可能会完全错误。如果可能的话,亲自询问人类,或者通过阅读真实的人类意见,因为你不能完全信任 AI。
核实是关键
对于无法访问的内容的总结可能会出现问题,而当然,验证电子邮件摘要或新闻文章的准确性要容易得多,因为你可以自己阅读完整的电子邮件。我们正被新闻淹没,任何有助于处理信息洪流的方法都是受欢迎的,只要它是准确的。
对我来说,苹果的 Mail 和 Messages 摘要足够好,足以有用,我将其保持开启状态。但有一段时间,苹果不会创建新闻文章的摘要,因为发布后不久,一些新闻故事的摘要是不正确的。
由于错误地表示新闻来源比错误地表示典型电子邮件承担更多的声誉风险,因此苹果在这里非常谨慎,在重新发布之前停用了该功能并对其进行了升级。考虑到不准确的风险,如果你的电子邮件提供商包括摘要工具,请试用并看看它对你是否有用。
如果你需要从长文档中综合关键点,任何大型语言模型(LLM)都应该能够帮助你,并且这些结果应该很容易验证。为了方便起见,如果你经常这样做,可以考虑使用人工智能浏览器。一如既往,请自行确认所有细节,如果你无法这样做,请保持警惕。看起来不错的结果可能并不准确。
语法纠正
良好的写作是良好沟通的关键,这个领域充满了由人工智能驱动的选项,可以帮助你避免错误。虽然我可能喜欢认为自己是一个有能力的作家,但内置在 macOS 和常见文字处理应用中的工具通常会发现我无法通过自我训练消除的错误。
一些由语法检查器标记的错误是直接的,而在其他情况下,遵循它们的指导可能会从句子中去除风味和风格。如果你想作为一个作家脱颖而出,你需要保持自己的声音,有时最好是优先考虑这个声音,而不是严格的语法正确性。
然而,如果你对自己的写作还没有足够的信心,以至于可以忽略人工智能的建议,那么请随意接受。即使你最终决定忽略它,这些建议通常也值得考虑。例如,我想保留这个段落第一句中的“own”,尽管语法检查器将其标记为冗余。
大多数文字处理器已经包含了一些语法检查器多年,包括基于启发式和机器学习的功能。更现代的选项,如众所周知的 Grammarly (www.grammarly.com/),更多地基于人工智能,并在建议方面走得更远。通常这些建议是有帮助的,但有时它们(至少对我来说)感觉过于激进,试图去除任何微妙的独特之处。

图 5.4 – Grammarly 的专业建议,我选择忽略
这样的帮助对新手来说是有用的,但盲目接受所有建议可能会导致平淡无奇、过度同质化的文本。在创意写作中,独特性可能是好的;并非每个文档都需要被每个受众阅读。还有一个问题是缺乏上下文,因为 Grammarly 是位于文字处理器之上,而不是真正地融入其中。
为了公平起见,对于 Grammarly 来说,他们的广告主要针对学生和上班族,他们的需求与创意专业人士不同。如果你从事创意生产,世界需要更多独特的声音,如果我当时接受了 Grammarly 给我提出的每一个建议,那么它就会改变原本想要表达的意义和语气。我建议修正错误,但要注意保持你自己的文本风味——抱歉,风味。
集成语法检查器
使用 AI 有选择地改进你的写作的棘手之处在于,如果你想将其集成到你选择的写作平台中,你必须愿意忍受一种多少有些嘈杂的写作体验。当然,常见的错误(如 you’re/your 或 its/it’s)应该得到纠正,Word 的红波浪线已经让一些最明显的错误变得容易纠正了一段时间。
Grammarly 添加了许多可能让你感到分心的彩色下划线,但权衡之下是减少了摩擦。右键单击问题意味着你可以在原地修复它,而不是将整个文档发送到 LLM。
Grammarly 的集成方法将它的花哨下划线放入 Word、苹果的笔记应用以及使用苹果标准文本服务的任何应用中,等等。
注意,你可能希望阻止 Grammarly 出现在 BBEdit 等文本处理应用中,因为为标准英语文本设计的建议在处理代码、脚本或标记文件时并不总是相关的。
在苹果平台上,另一个集成的选项是Apple Intelligence,它可在苹果自己的应用中使用,Proofread功能至少提供了基本的语法检查。(Rewrite功能提供了更广泛的变化,将在下一章中探讨。)

图 5.5 – 在 iPad 上的“笔记”中看到的 Apple Intelligence 的 Proofread
激活它后,Proofread 会胜任地突出显示它计划修复的问题,并且可以依次批准或拒绝每一个问题。虽然基本的拼写检查仍然像以前一样工作(红波浪线万岁),但这种更广泛的分析只有在请求时才会出现。它不像 Grammarly 那样“始终开启”,如果你觉得这种方法过于侵入性,这可能会很有帮助。
Word 的 拼写和语法 检查功能与多年来一样工作,但还有一个 AI 助手可用。微软的 Copilot 集成在 Word(以及其他 Office 应用程序)中,但请避免使用 Copilot 侧边栏,因为它实际上并没有很好地集成到其父应用程序中。侧边栏感觉更像是一个与 Word 并行运行的独立应用程序,而不是一个集成功能。为了更好地集成,选择你想要获得反馈的文本,右键单击,选择 Copilot,然后选择 写作建议。最好一次选择至少几个段落,因为这会给 Copilot 提供更多的上下文以供反馈。对我来说,这里的建议也稍微偏离了生成领域的界限,我们将在本书的下一章中探讨这些内容。
外部语法检查器
当然,如果你只需要检查特定句子的语法,Copilot 就足够好了,实际上,如果你愿意复制粘贴,许多大型语言模型都可能是合适的。
如果你正在考虑使用大型语言模型(LLM),请确保没有使用私人数据来训练它,无论是通过设置适当的偏好还是使用本地的 LLM。
那么,你应该选择集成路径还是不选择?
我建议使用基于 AI 的语法检查器的最终目标应该是提高你首先写出好文章的能力。如果你发现 Grammarly 有助于你做到这一点——太棒了。但如果你发现它在你的文字处理器中的存在是侵扰性的,你选择苹果智能的校对、微软的 Copilot,或者简单地将整个文档发送给 LLM 并请求指导会好得多。以下是将一个段落发送给克劳德的示例:

图 5.6 – 克劳德的反馈认为这个草稿段落大体上是合理的,但它不理解我使用破折号的目的
这样,你会明确地被告知哪些句子可以改进,清楚地分离写作的 创建 和 编辑 阶段,而不是在写作过程中勾选“为我修复”的框。以下是将相同的查询发送到 ChatGPT 的示例:

图 5.7 – 前一段落的早期草稿,以及如何改进它的指南
如果你希望提供更多上下文,可以将完整文档输入 ChatGPT,它不仅会返回实施更改后的文档,还会告诉你具体哪里出了错。克劳德告诉我大部分错误,但在我要求之前并没有提供修正后的文件。
将文档发送给 LLM 也很好地扩展到了更大的生产任务。如果你一直在与同事合作完成更大的工作,每个人都在写自己的部分,LLM 将能够从元角度观察,指出每个单独部分在语气或风格上可能存在的差异。我仍然建议手动进行最终修正,但人工智能的意见可以是一个很好的开始方式。
最后,你可能希望考虑直接在专注于人工智能的写作工具中写作,利用更高级的工具来辅助写作。由于许多这些工具倾向于 GenAI,我们将在下一章中探讨这些工具。
人工智能写作辅助有多种形式。你可能更喜欢分阶段写作和编辑,在这种情况下,你应该尝试不同的 LLM,看看哪个更适合你。如果你更喜欢更集成的方法,可以尝试 Grammarly、Apple Intelligence 或专门的 AI 写作应用。
个人而言,虽然我欣赏所有这些选项的帮助,但我还没有准备好每次都信任人工智能产生完美的输出,并且我想知道我——或者我的转录软件——犯了什么错误。这是一个共同的线索:人工智能是有用的,但并不完美。使用一个 AI 服务来检查和改进另一个 AI 服务的输出是一种减少错误的好方法。
那个想法,询问人工智能的意见,很自然地引出了下一节。
检查和验证
在创意工作中,各种计划、意见和陈述的事实都会被提出,能够快速验证它们当然是有用的。由于许多验证查询都可以用文本表达,所以询问人工智能一个工作计划是否有缺陷、一篇论文是否遗漏了任何关键点,或者你收到的关于电脑购买的忠告是否合理都是简单直接的。
当然,一个共同的线索是人工智能的建议是可能出错的,所以值得检查多个不同的 LLM,并遵循他们引用的任何链接。但如果你认为某件事可能正确,只需要一个快速的第二个意见,LLM 可能就足够了——当然,如果周围没有合适的人类。
向人工智能模型展示你的文本很容易;你可以复制粘贴、上传文档或使用集成的解决方案,如 Grammarly。为了测试准确性,我向以下 LLM 展示了:
-
这是一个早期草稿的关键点总结,我计划在本章中撰写,并请求反馈
-
我最近写的一篇关于立体视频的文章,我请求检查其准确性
-
关于哪种 Mac 可能适合视频编辑任务的建议,并请求验证这一点
-
关于印刷文档标准出血量的一个问题
-
关于 4K 视频制作工作流程的建议问题
这些都是我可以提供良好建议的话题,这使我处于一个很好的位置来判断准确性。令人高兴的是,对所有这些给出的高级建议都是合理的。以下是对每个话题的逐一点评:
- 关于本章要涵盖的主题给出的建议是可靠的,但它没有理解这本书的结构(实用、生成和自动化 AI)的上下文,因此其建议并没有很好地融入实用类别。尽管如此,如果你计划写任何论文风格的非虚构内容,一个大型语言模型可以提供一个有用的反馈板,以确保你没有遗漏任何明显的内容。

图 5.8 – ChatGPT 提供了一些指导,但没有更广泛的背景,其建议并不总是有用的
- 克劳德能够验证文章中提到的几个点,并能提供可验证的链接来支持其中许多内容。这包括关于两个摄像头之间应保持多远距离的规则、专用硬件设备以及提到的摄像机的分辨率。

图 5.9 – 克劳德对这篇文章给予了积极的反馈,并找到了支持它的链接
- “我需要带有 Max 或 Ultra 芯片的 Mac 进行视频编辑吗?”这是社交媒体上经常回答的问题,答案具有细微差别,可以总结为对于简单的编辑你不需要,但对于复杂任务会有帮助。给出的答案都是准确的。

图 5.10 – 克劳德对当前 Mac 模型的规格足够了解,能够很好地回答这个问题
- 这个简单的问题是一个数字设计师转向印刷可能需要回答的问题,并且回答是正确且全面的。

图 5.11 – 打印中标准的出血量是多少?我说,“通常是 3mm,遵循规格”,但这个答案很全面
- 这个问题提出了一个不良的工作流程,包括使用旧硬盘并在工作结束时删除源文件。克劳德和 ChatGPT 都正确地回应了,说这是有风险的,然后提出了更好的替代方案。并非所有建议都是完美的,但这对于进一步的研究是一个巨大的进步。

图 5.12 – 这个相对复杂的问题超出了你从搜索引擎期望得到的内容,答案比你从论坛得到的更全面;非常有帮助
不完美的建议
最后那个观点值得深入探讨,因为工作流程问题可能很棘手,并不是所有评论者都同意正确的方向。我进一步提出了更多问题,包括“如果我正在 Final Cut Pro 中使用 6K 多机位源呢?”然后是“我必须将原始媒体存储在 Final Cut Pro 库中吗?”ChatGPT 做得很好,而克劳德包括了一些有疑问的(但经常被重复)信息。

图 5.13 – 克劳德的后续问题回答并不完美,挖掘得越深,你就越应该与人交流
例如,克劳德表示,“Final Cut 的多机位剪辑在同步和编辑过程中会创建额外的渲染文件”,而这些功能,优化的多机位剪辑和背景渲染,都是可选的。它还指出,“FCP 创建的优化媒体和代理文件可能会加倍你的存储需求”,这在技术上是对的,但让这个过程听起来好像两种格式都是必需的,而通常只使用其中一种。
简而言之,解释基本上是正确的,但比 ChatGPT 的缺陷更多。ChatGPT 输出的唯一重大缺陷是假设 6K 主文件比 4K ProRes 422 HQ 大,如果初始捕获使用更压缩的编解码器,则这不是真的。
那么,使用通用聊天机器人进行验证是否值得呢?我会说是的……大部分情况下。如果你对某个主题了解足够多,能够彻底和正确地表述问题,你应该没问题。由于图形设计、视频和音频问题长期以来在无数论坛上被无数人提问和回答,LLM 能够综合出许多永恒问题的正确答案。
由于 LLM 已经在所有那些论坛上接受了训练,只要你的查询相对高级,LLM 很可能会提供互联网的集体智慧。然而,你需要答案越具体,LLM 的准确性可能就越低——尽管它们总体上做得相当不错。
对于复杂文档或新工作流程的反馈,LLM 显然能够提供帮助。人类可能能够提供更具体的答案、更深入的见解或另一种方法,但我在这里得到的答案是有用的,并且大部分是准确的。
一个相关想法,即让一个大型语言模型(LLM)教你如何执行一个创造性任务,也很有前景。因为你能够提出复杂的问题,并随后用更详细的查询跟进,LLM 有时可以扮演个性化导师的角色。由于与 AI 为你完成工作的重叠,我们将在本书的“自动化 AI 与数字助手和代理”部分回到使用 AI 作为个人导师的想法。
另一个与本书自动化章节重叠的领域是将文本从一种格式转换为另一种格式。
重新格式化文本
通常会遇到一种情况,即需要将数据从一种格式转换为另一种格式。当这是一项批量执行的任务时,它就是自动化,我们将在后面的章节中更详细地探讨这一点。但如果这是一项一次性定制的任务,有时 AI 可以帮助你完成你可能花费无聊的一小时或可能外包给欠你人情同事的工作。
一个基本的、常见的设计任务是清理提供的文本或 Word 文档。正如你可能从艰难的个人经验中知道的那样,图形设计应用程序期望你只使用单个回车来分隔段落,并在句号后只使用一个空格。虽然 Adobe InDesign 中预设了 GREP 搜索模式来修复这些问题,甚至有一个脚本(FindReplaceByList)可以一次性运行它们,但这也是一种 AI 擅长完成的任务,在修复常见错误的同时。
作为测试,我将相同的简短问题 Word 文档给了三个 LLM。
-
ChatGPT 做得很好,因为它提供了创建新 Word 文档供我下载的选项,额外加分。
-
Claude 在修正方面更进一步,正确地将“破折号”更改为“破折号-”。然而,它没有提供 Word 文档作为回报。
-
Gemini 发现了大多数错误,但生成的文本完全没有段落分隔,并且没有提供下载选项。
虽然这是一个相对基本的任务,但更复杂的事情呢?我最近面临的一个任务是,在删除图像后,需要在章节中重新编号图像。一个章节可能包含许多图像,每个图像在标题中都有一个独特的编号,如果早期的图像,比如说图 4.5被删除,那么从那个点开始的所有图像现在都必须重新编号。包括图像在内的原始 Word 文档大小为 6.7MB。AI 能帮助完成这项无聊的工作吗?
- ChatGPT 正确地推断出后续数字应该减少一个:

图 5.14 – 这个图像列表扩展到了图 4.45
然后,它做得非常出色,提供了一个可供下载的修正后的 Word 文档:

图 5.15 – 这正是我希望数字助理提供的东西
-
Claude 理解了问题并提出了正确的解决方案,但 Claude 无法输出 Word 文档,并且使用免费账户也无法处理该文件。
-
Gemini 明确拒绝提供帮助,声称它无法编辑文档:

图 5.16 – 我对拒绝与 Word 文档合作感到惊讶,但这里确实是个问题
在处理学术内容时,一个常见的任务是更改引用的格式。因为这是一项相当有序、可预测的工作,你可能会期望它顺利地进行,并且在使用主要 LLM 时确实如此。这个提示没有任何问题:
Please reformat these citations as Harvard.
Delaney, M. (2025, May 16). *Google's AI Overviews are often so confidently wrong that I've lost all trust in them*. TechRadar. https://www.techradar.com/computing/artificial-intelligence/googles-ai-overviews-are-often-so-confidently-wrong-that-ive-lost-all-trust-in-them
Digital Transformation Agency. (2025, February). *Australian Government trial of Microsoft 365 Copilot*. digital.gov.au. https://www.digital.gov.au/initiatives/copilot-trial/microsoft-365-copilot-evaluation-report-full/executive-summary-glossary
Navarro, G. (2025, July 7). *Beware of the Google AI salesman and its cronies*. HouseFresh. https://housefresh.com/beware-of-the-google-ai-salesman/
这是 Gemini 的输出,尽管 ChatGPT 的输出是相同的:

图 5.17 – Gemini 准确完成引用格式转换
然而,本地的 LLM(Gemma 3)在这个任务上完全失败了,没有对文本进行任何转换,尽管它对自己的成功很有信心,在被告知失败后道歉,然后再次失败。DeepSeek 的本地副本做得更好,但未能将出版日期和月份放在“可从”这个词之前:

图 5.18 – 精炼的本地 DeepSeek 几乎做到了
注意,从它们的 URL 生成这些原始 APA 格式引用的内容将在下一章中介绍,而且它并没有像你希望的那样顺利地进行。
这里还有一个例子。如果你收到一份写得比较随意的姓名和职位列表,并且你需要为你正在制作的视频中的这些人生成“下三分之一”标题卡,那么一个简短的列表不会花费太多时间,但一个更长的任务当然会。只需让一个 LLM 帮你清理一下:
I've been sent a list of names and positions in an email, listed below. Can you please extract all the names and positions, expand any contractions to the full titles, put everything in the same order, and sort the list into alphabetical order based on surname?
You'll be interviewing MD John Smith, Dave Jones who's the CTO, Jenny Davis the Accounts Manager, Admin Assistant Dave Kelly, and Jessica Keyes, a trainee.
ChatGPT 做得恰到好处:

图 5.19 – 这个列表只有五个姓名,但清理数据也可以用于更长的列表
Gemini 几乎做到了,但在其最终输出中它将姓氏放在了前面。尽管如此,它仍然很有用,如果你要求交换姓名的顺序,它就能完全做到这一点。
大多数本地 LLM 都还没有做到这一点
本地 DeepSeek 的副本在排序上做得不够好,并且没有将标题与姓名分开,但总比没有好。不幸的是,要求模型修复错误导致它思考整整一分钟,然后情况变得更糟:

图 5.20 – 模型是如何丢弃其中一个姓名的?
来自 Google 的另一个本地模型 gemma-3-12b 做了类似的工作。它能够提取全名并生成一个列表,但顺序错误,就像 DeepSeek 一样。

图 5.21 – Gemma 的输出;有用,但并不完美
不幸的是,要求模型重新排序输出也没有完全奏效;虽然前两项被调换了位置,但第 3 项和第 4 项仍然顺序错误。
我还尝试了 macOS 26 Tahoe 中可用的设备 AI 模型进行这个查询,它以有趣的方式失败了:

图 5.22 – 缩写被展开,但顺序错误
幸运的是,OpenAI 发布的本地模型(gpt-oss-20b)能够完美地完成这个任务:

图 5.23 – ChatGPT 的开放版本似乎比其他开放模型更强大
很明显,尽管本地模型保护隐私且免费,但它们通常不如基于云的模型强大或可靠——尽管 OpenAI 的努力打破了这一趋势,值得下载。对于更复杂的任务,如果云模型可以快速完成任务,而你又能在线上传数据,那么这可能是更有效率的。
尽管本地模型无法完全正确地排序,但如果你要求数据以表格格式提供,例如 CSV,那么在 Excel 或 Numbers 等电子表格中打开和排序数据就很容易。此外,如果你在获得良好结果方面遇到困难,考虑向模型展示你正在寻找的示例。

图 5.24 – 给 AI 一个你希望从它那里得到的例子是提高其输出的简单方法
导出格式对于生产至关重要
有许多其他对人类来说证明是繁琐的文本处理任务,但对 AI 来说并不算太多。例如,假设客户正在更改他们文档的样式。虽然他们之前只是使用斜体来表示引语,但现在他们希望恢复到更标准的“引号”模式。AI 能帮忙吗?当被问及时,Claude 认为可以:

图 5.25 – Claude 提出了一种好的解决方案,似乎正走在正确的道路上
虽然这个提议很棒,但 Claude 实际上无法修复 Word 文档并提供下载。手动复制粘贴修复并不那么有帮助,尽管 ChatGPT 有这个能力,但在免费账户上定期上传文件并不现实。
事实上,如果你问主要的 LLM 它们可以接受什么作为输入并提供什么作为输出,只有 ChatGPT 实际上可以读取InDesign 标记语言(IDML)文件,这在图形设计工作流程中可能很有用。它限于基于文本的格式而不是二进制格式,尽管它有时会提供创建 IDML 文件,这些文件可以在 Adobe InDesign 中打开,但这似乎是一种幻觉。
这是我希望能够成功的一个任务示例:

图 5.26 – 这项繁琐且非同寻常的任务是 ChatGPT 乐于尝试的,但你很快就需要一个付费账户来进行文件操作
目前,尽管有信心,但这个过程失败了。确实创建了一个 IDML 文件,并且它确实在 Adobe InDesign 中打开了,但它看起来与上传的文件完全相同。有趣的是,当 ChatGPT 被明确询问它可以创建哪些格式时,IDML 文件并不在列表中——那么,它假装这项任务可行的做法就有些遗憾了。虽然现在这是一个死胡同,但将来值得再次尝试。
公平地说,IDML 是一个复杂、压缩的格式,许多在生产中使用的格式对基于文本的系统来说同样棘手。然而,您可能更有可能创建更简单的格式,例如基于文本的 FCPXML 文件,这些文件与 Final Cut Pro 兼容。尽管如此,图像、视频和文本文件并不足以完成大多数工作,并且并非所有文件都可以导出为基于文本的格式。复杂格式的支持仍然是 LLM 和创意生产之间的一大障碍。
然而,由于 IDML 的输入是可能的,并且任何 InDesign 布局都可以导出为 IDML,您可以要求 ChatGPT 处理您布局中的文本。而且,由于许多编辑应用程序可以导出为基于 XML 的格式,您有很大机会从视频时间线中的标题或剪辑名称中提取任何文本。
到目前为止,ChatGPT 比其他领先的 LLM 具有更多的导出灵活性,但随着该领域的快速发展,我建议您在自己的文件上运行自己的测试,看看它们的性能如何。开始免费使用,然后如果您觉得有价值,再转为付费(按月付费以避免锁定)使用。请注意,您在使用过程中很快就会遇到免费账户的限制,尤其是如果您使用分析或上传大文件时。
摘要
如果您正在处理文本,那么您很幸运——AI 可以提供一位在处理枯燥文本工作方面相当出色的助手。
-
摘要可以节省相当多的时间,只要您能避免对摘要上瘾而跳过所有细节。然而,您可能会更多地使用电子邮件应用程序中的集成摘要,而不是其他任何东西。
-
语法纠正是可以集成或从写作过程中分离的任务,具体取决于您的偏好,尽管 AI 可以增强这个过程,但应谨慎使用。
-
验证,尤其是在应用于常见的流程和问题时,是 AI 非常适合的任务。当您询问接近您现有知识的事实时,您应该能够发现明显的问题,但请注意不要偏离您的专业领域太远。
-
文本转换可以在设计和视频流程中节省大量时间。许多文本处理任务既枯燥又难以通过传统方式自动化,所以将它们交给 AI 处理。您可能需要开始付费以享受这项特权。
在执行所有这些任务时,务必仔细检查输出结果,切勿简单地复制粘贴。这些工作可能在 AI 的争议较少的一边,但如果您将一个幻觉摘要作为事实向客户展示,那么责任就在您身上了。
接下来,我们将继续使用文本,但转换到生成式人工智能(GenAI)。
|
获取本书的 PDF 版本和独家额外内容
扫描二维码(或访问packtpub.com/unlock)。通过书名搜索本书,确认版本,然后按照页面上的步骤操作。 | 
|
| 注意:请保留您的发票。直接从 Packt 购买不需要发票。* |
| --- |
第三部分
生成式 AI
在本书的这一部分,我们将探讨那些生成内容多于辅助的工具,包括生成文本、图像的部分、整个图像或视频、完整的视频转换,或如语音或音乐这样的音频。
本书本部分包括以下章节:
-
第六章, 文本生成式 AI.
-
第七章, 图像生成式 AI
-
第八章, 视频生成式 AI
-
第九章, 音频生成式 AI
第六章:基于文本的生成式 AI
当我们进入本书的生成式 AI(GenAI)部分时,回顾一下任何使用这项技术可能引发的伦理问题是有意义的。为了明确起见,虽然并非所有生成式 AI 的使用本质上都是坏的,但我不会建议您将生成式文本用于直接发送给客户的内容。
如果你过度使用 GenAI——比如说,你决定让 AI 帮你写电子邮件——那么你用来产生文本的心理肌肉会萎缩。你将无法发展新的肌肉。你的声音的独特性将消失,客户将减少选择你的服务而不是其他人的理由。
如果你从事创意制作,创意不是副业。你需要创造出比其他人更有趣的作品,而不仅仅是尽可能多地生产低标准的垃圾。每一封电子邮件都应该是练习更清晰沟通的机会,而不是外包的任务。
话虽如此,确实有空间让生成式 AI(GenAI)创建帮助您更高效地完成工作的文本,提供想法,或帮助使您的工作更易于访问。让我们更深入地看看以下内容:
-
思想生成
-
以不同风格重写文本
-
生成引用
-
翻译
-
可访问性的替代文本描述
并非所有创意专业人士都需要所有这些功能,但我们大多数人都可以找到其中几个功能的用途。让我们从一点头脑风暴开始。
思想生成
创意工作差异很大:有些是自我指导的,有些是完全由客户的简报指导的,许多则介于两者之间。当你面临关于如何进行的创意决策时,一张空白的页面有时会感到令人畏惧,使用 AI 来提出想法可能是有用的。
如同往常,如果你提出更具体的问题,你会得到更好的结果,所以你对一个主题了解得越多,你就能提出更好的问题。此外,如果你只稍微超出你的舒适区,你可能会在给出糟糕建议时发现它。所以,如果你是一个想要 YouTube 视频想法的视频创作者,只需提出以下问题:

图 6.1 – 所有 10 个想法(此处未全部展示)都是可靠的
这些都是可以轻松转化为短视频的好主意。虽然我可以自己想出类似的列表,但这样的结果可以轻易激发更多更好的想法。不同主题上的类似提示也能得到良好的结果。如果你是一个喜欢狗的数字艺术家呢?

图 6.2 – 再次,这些想法大多是可靠的
如果你缺乏灵感,使用 LLM(大型语言模型)来提出想法至少可以让你开始。虽然这里的结果不会完全原创,但如果空白页面是你的敌人,这些可以作为迭代的可靠起点。
拓展到附近的创意领域
想象力不仅仅是关于你熟悉的内容的想法,尽管如此。大型语言模型(LLMs)还可以帮助你稍微伸展一下翅膀,超出你可能感到舒适的范畴——这在与较小团队一起工作时很常见。
例如,如果你通常负责活动拍摄的视频摄影师,现在被要求制作宣传视频,LLM 可以为你提供一个视频应包含的典型事项清单。以下是 Gemini 的回应开头:

图 6.3 – 这里包含的点(并非全部展示)相对明显且合理
如果你是一个熟练的视频编辑师但对自己的方向感不太自信,这提供了一个你可以发展成客户提案和拍摄脚本的起始框架。沿着相似的方向,如果你是一个设计师但不是桌面游戏市场营销专家,也许一个 LLM 可以帮助你发现放置你创建的广告的最佳位置以及包含特定领域的元素:

图 6.4 – 这个回应全面且有用,包含许多在桌面游戏社区外并不明显的具体观点
尽管我不能确认其他特定领域提供的建议有多准确,但前面的回应是在我熟悉的领域,它们是可靠的。虽然想象力当然是一个生成式人工智能(GenAI)的任务,但它不必剥夺你的创造力,实际上可能会进一步激发你的灵感。为了确保你不会完全依赖 AI 来获得灵感,在你向 AI 寻求帮助之前,自己或与同伴一起进行想象力创作。这样,你将得到一个第二意见,而不是完全外包这项工作。
现在你已经有一些想法了,希望你已经能够写点什么。如果你对它不太满意怎么办?
以不同风格重写文本
虽然总结和重写之间的差距很小,但我确实认为这里有一个明显的区别:总结通常是为你提供的,而重写的文本则更具变革性,通常旨在面向公众的输出。在实用 AI 和 GenAI 之间,这里的界限有些模糊,就像在总结中一样,最终,这取决于你如何划线。
虽然我不会认为大多数语法检查器的使用是重写文本,但提供语法帮助的相同工具(如 Grammarly、Copilot 和 Apple Intelligence)如果你觉得需要,绝对可以给你更多的帮助。重写是许多通用 LLMs(如 ChatGPT 和 Claude)的功能之一,所以如果你已经使用了一个,试试它。然而,如果你没有这些工具中的任何一个适合你,一个专业的写作助手,如Spiral(writewithspiral.com/)可能更适合你。
小说写作工具
计划写一部小说吗?你可能需要使用一个专门的工具来帮助你。如 Novelcrafter (www.novelcrafter.com/)、Sudowrite (sudowrite.com/)和 Squibler (www.squibler.io/)等写作辅助工具针对故事和小说进行了优化,并且由于它们产生的输出针对的是更多用于虚构应用的描述性散文,因此这些工具不太适合更典型的创意生产文本任务,如提案、电子邮件和提案演示文稿。
在这里,我们将关注更多通用写作助手,当然,这个列表并不全面——新的工具总是层出不穷。
AI 工具可以为了清晰、简洁和符合出版物或作者的风格而重写文本,但你几乎可以从大多数 LLMs 请求任何风格。作为一个测试,我处理了我最近一篇关于provideocoalition.com上立体视频实验文章的开头部分。我的风格可能有点古怪,而且并不完全无误,但对我来说这没关系:
Spatial 3D stereoscopic video is easy to shoot on modern iPhones, but you'll run into its limits pretty quickly. Third-party apps can improve things, but they have limitations too, and if you're used to shooting with a couple of dedicated cameras already, why not use them?
Well, if you're tempted to try making some stereoscopic 3D video with a couple of cameras sitting on the shelf, you should know what you're in for — it's harder than you think and there are plenty of mistakes to be made. On your first few stereo shoots you're bound to get something wrong, but if you practice now, you'll hopefully avoid catastrophic failure down the road when you get hold of a real camera.
Experiments like this are a great way to push your skills, but don't get your hopes too high. Even if you don't use something this janky to shoot real client projects, making it work with what you've got will give you real-world experience shooting in 3D that you can use if you step up to a pro setup down the road. So, with some regular 2D filmmaking gear to hand, how can you hack together a quick stereo 3D rig for viewing in a headset or on a 3D display?
As an extra reminder that this is an experiment, I'm not worrying about proper 3D Spatial Audio at all. Video's the focus here.
在使用许多不同的工具和多种方式处理这段文本后,我没有得到很多真正愿意在专业环境中使用的成果。因为每个人的需求和风格都不同,你可能比我更有运气,当然,这些工具也会随着时间的推移而发展。
作为第一步,我使用了默认的“重写”选项。看看 Grammarly 的建议:

图 6.5 – Grammarly 想要做出很多更改,但并非所有都有帮助
除了几乎完全丧失我的写作风格之外,“局限性”并不等同于“限制”,“简单”也不意味着“糟糕”——我不想让“重写”改变我的意图。CoPilot 的第一次尝试更糟糕:

图 6.6 – CoPilot 在这里的表现并不出色
这感觉像机器人,缺乏流畅性和方向感。两种替代选项也好不到哪里去;第二种是一个很长的段落,第三种则过度使用了华丽辞藻。那么 Apple Intelligence 呢?它并没有像其他模型那样试图做出太多改变:

图 6.7 – Apple Intelligence 的重写保留了更多原始文本
与其他工具相比,Apple Intelligence 对文本的修订并不多,因此所做的更改并没有改变其整体风格或感觉。但如果你需要一个更正式的结果呢?让我们继续使用 Apple Intelligence,并要求一个专业的语气:

图 6.8 – ‘Professional’有更冗长、更不随意的语气
虽然这感觉比我个人更正式一些,但意义保持不变,感觉也没有离原文太远。ChatGPT 的技术版本可以接受,尽管它与原文的差异更大:

图 6.9 – ChatGPT 的技术重写大致可以接受
ChatGPT 提供了休闲、技术和促销重写选项;这是其中的第二个。尽管在几个地方单词替换改变了意义(包括用“简单”代替“糟糕”),但总体上还是合理的。以下是 Grammarly 的正式版本:

图 6.10 – Grammarly 提供“正式”重写
虽然这确实很正式,但所有花哨的形容词并没有让它变得更清晰。我认为 CoPilot 在正式尝试方面做得更好,尽管我不得不手动请求“正式语气”,而其他讨论过的工具默认提供了这个选项。

图 6.11 – CoPilot,要求“正式语气”
虽然检查这些示例应该有助于评估这些工具功能的一个起点,但每次运行它们都会有所不同。如果您没有得到您希望的结果,只需再次尝试,或者稍微改变您的提示。也许作为一种邀请实验的方式,ChatGPT 主动提供了多种风格(休闲、技术、促销),然后提出将三者结合成一个单一的“压缩最佳”版本。令人捧腹的是,这种重写重写将“如果你已经习惯了使用几部专用相机射击”片段搞成了“如果你已经有一对”,……这有着截然不同的含义:

图 6.12 – ChatGPT 提供的压缩“最佳”版本——并不完全是我想要的
尽管我可能不会自己经常使用这些工具,但如果您作为作家还在寻找自己的脚步,我可以看到其吸引力。然而,我建议从 Apple Intelligence 开始(在现代苹果设备上使用笔记或页面),因为它能更好地保留您的原始作品。在一个大多数 AI 写作都司空见惯的世界里,仅仅“大多数合格”已经不再足够。如果您打算使用这些服务,不要只是接受大量更改。检查建议,如果您同意,请自行实施。
如果你觉得自己需要 AI 的帮助来修订或生成文本,那么超越预设,让基于提示的系统以更具体的方式帮助你。没有什么阻止你提供一份文档(或几份,或你的整个网站)并要求 AI 模仿那种风格。当你超出严格的字数限制时,你也可以尝试让 AI 为了简洁而重写。虽然我建议你自己来做,但如果这根本不是一种选择,至少避免使用预设。
相反,如果你还没有写文本,而你希望 AI 从要点中生成整个段落,这是可能的——但这是一个好主意吗?
从要点中撰写完整文本
如果某件事容易做,它的价值就很小。建立在模板上的设计在与其他使用模板制作的作品并排观看时不会脱颖而出,AI 撰写的文本也不会。以下是我的一些关键建议:
-
自己写东西有助于你作为作家成长
-
如果你外包了一项工作,你不会变得擅长它
-
AI 是快速、低成本的外包
-
AI 的工作能干但并不出色
-
如果 AI 开始写,你应该编辑它以添加你自己的风格
如果我觉得懒惰,我就可以让 AI 将那些要点转换成文本,对吧?让我们看看这会不会损害或帮助我的论点:

图 6.13 – ChatGPT—能干且表达得体,但这不是我自己的写作
这段文本是不错的。并不出色,只是不错。但如果你想要出色的结果——你应该始终追求出色——我不建议生成你期望客户或客户阅读的文本。如果它值得阅读,那就值得你自己来写。
如你所预期,花时间自己写东西会比任何外包捷径产生更丰富的文本。是的,你需要在上面投入时间,但回报往往是值得的。撰写完整长度的文本有助于你更深入地理解概念,并且如果你被质疑,你将能够支持这些观点。
作为作家成长是写作的一个被低估的好处,而且不应该被忽视。外包可以让你快速达到目标,但那个目标就是你所得到的一切。如果你花时间反复撰写提示,你只是擅长撰写提示。
然而,我理解:如果你觉得自己没有写好长文本的技能,使用 AI 是一个诱人的选择。如果这种诱惑太强烈,或者你只是被分配了太多工作而没有足够的预算来正确完成,至少你应该尽可能多地编辑生成的文本,使其成为你自己的。随意重塑、重新想象、删除。你对自己输出的贡献越少,你的成长就越少,你的工作价值也就越低。
此外,我明白还有很多大量的文本并不特别重要——希望这些不是作为创意专业人士你的工作内容。法律上重要的文本应该留给律师处理,但如果你的工作是撰写有说服力的文案,你应该做好你的工作。如果你外包了你的核心技能,客户为什么不雇佣一个使用与你相同 AI 工具且价格更低的人呢?
最后,一些服务,如 Spiral,承诺学习你的风格,然后代表你创作更多模仿该风格的作品。虽然这种方法确实解决了关于个人声音和语调的问题,但“实际上不做工作”的问题仍然存在。你仍然会失去创造力,如果你从未参与并进一步发展关键要点概念,你的写作就不会改变和成长。
如果你有机会,做更好的工作,而不仅仅是更多的工作。
是否有可以减轻繁琐工作的生成性任务?当然有。例如,如果你需要引用你的来源,有很多人不同的方式可以做到,这主要是一个技术任务。AI 能处理这个吗?
生成引用
虽然在学术界引用更为常见,但一些客户可能期望在提案、工作计划或年度报告中正确格式化的引用。如果你负责设计这些较长的文档并需要创建引用,你可能会想请 AI 帮助完成所选引用标准的特定格式要求。作为一个测试,我要求三个主要的 LLM 将 URL 列表转换为引用,结果差异之大让我感到惊讶。这是提示:
Turn these URLs into citations, APA style.
https://www.techradar.com/computing/artificial-intelligence/googles-ai-overviews-are-often-so-confidently-wrong-that-ive-lost-all-trust-in-them
https://www.digital.gov.au/initiatives/copilot-trial/microsoft-365-copilot-evaluation-report-full/executive-summary-glossary
https://housefresh.com/beware-of-the-google-ai-salesman/
ChatGPT 在至少两个 URL 上自信地犯了错误:

图 6.14 – 这里第一个和第三个引用的作者和日期是错误的
在多次尝试中,错误持续存在,尽管 Gemini 在相同的提示下表现更好:

图 6.15 – 经过漫长的“思考”过程后的最终结果
然而,这并不是可重复的;使用相同提示的另一次尝试给出了完全不同的结果。

图 6.16 – 同样的引擎也产生了…这个?
我不想在例子上花费太多空间,但克劳德也在这项任务上失败了,所有这些服务在相对简单的任务上的不可靠性让我感到担忧。如果你需要定期做这件事,我建议使用像 Grammarly 提供的这样的手动引用生成器(www.grammarly.com/citations):

图 6.17 – 这篇手动组装的引用需要更多的复制粘贴,但自动选项并不可靠
虽然我希望这至少是一些 AI 工具能够可靠执行的任务,但如果连最大的 LLM 都无法正确完成,我也不能推荐信任其他工具来做这件事。规则仍然是——除非你已检查,否则请非常谨慎地将 AI 生成的输出与世界分享。
好的,想法完成,文档编写完成,引用完成,现在你的客户希望用不同的语言进行交付。AI 能帮忙吗?
翻译
虽然翻译是 AI 工具擅长的任务,但它们并不完美。如果你需要将另一种语言中的文本翻译成你自己的理解,AI 可能是可行的。如果你可以接受不完美的结果,你将能够理解其他语言中的文本的意义,否则这些文本将无法触及——这是一件好事。
然而,如果你需要将你自己的语言中的创意内容翻译成另一种语言以供母语人士阅读,不要期望 AI 能够独立产生完美的结果。
就像转录一样,输出将会很快,并且大部分是正确的。但尽管转录中的错误可以相对容易地纠正,如果你无法理解你要翻译成的语言,你将很难确认翻译的准确性。
大多数最便宜产品的网站列表和视频广告都证实了这一点。在没有预算将产品描述翻译成正确的英语的情况下,会使用自动翻译工具,并且输出未经编辑。因此,期望和感知的价值进一步降低。

图 6.18 – 这款在 AliExpress 上出售的廉价智能手表的描述充满了错误
当然,这并不新鲜,但如果其他语言不能无错误地翻译成英语,我们为什么期望英语能够无错误地翻译成其他语言呢?我负责设计过英语以及几种其他语言的桌面游戏手册,在每种情况下,翻译都是由母语人士完成的,由我排版,然后由那位相同的翻译者在其他人检查之前进行检查。
翻译员当然可以使用 AI 翻译工具作为起点,但不同语言和方言的细微差别需要人类的触摸。翻译的细微之处并不容易掌握,即使是母语人士。例如,欧洲西班牙语和墨西哥西班牙语之间的差异微妙且众多,即使是经过人类监督的翻译也会包含需要许多校对员纠正的错误。在创意环境中,如视频和桌面游戏,细微的翻译问题也比基于事实的新闻文章更可能出现。
在工具方面,谷歌翻译网站已经使用了几年,在苹果平台上,Safari 浏览器包含了翻译功能,允许您翻译您访问的任何网站:

图 6.19 – Safari(以及其他浏览器)可以翻译外语网站
来自谷歌、苹果和其他公司的翻译应用程序允许实时将音频翻译成文本(或更多音频)成另一种语言,这对于使访问外国国家变得更容易已经足够有帮助,但对于创意制作目的来说还不够好。
然而,AI 在创建可访问的 PDF 或网站方面对任何人都有独特的用途。
可访问性的替代文本描述
替代文本是图像的文本等价物,为无法看到图像的人描述它。虽然替代文本旨在供盲人或视力受损的读者使用,但它对搜索引擎也很重要。事实上,图像的文字描述是 LLM 最初如何通过将其作为其训练数据的一部分来解释图像内容的重要组成部分。
因此,许多大型语言模型(LLM)可以解释图像包含的内容,因此可以生成替代文本描述,设计师可以将这些描述粘贴到 Adobe InDesign 或 Bridge 等应用程序中,或者 WordPress 等网站内容管理系统(CMS)中。世界上许多政府要求面向公众的文档要易于访问,因此这并非一项可选项的任务。
虽然描述一张单独的图像的短句并不困难,但描述多张图像可能是一个耗时的工作过程。此外,由于替代文本描述应使用简洁、简单的语言,因此其创建非常适合在人类监督下的 LLM 进行...对吗?
在评估输出之前,这里有一些来自哈佛数字无障碍指南(accessibility.huit.harvard.edu/describe-content-images)的关于替代文本的最佳实践建议:
-
保持简短,通常是一到两句话。不要过度思考。
-
考虑选择此图像的关键要素,而不是描述每一个细节。
-
没有必要说“图像”或“图片”。
-
但如果它是标志、插图、绘画或卡通,请说明。
-
不要在文档或网站中重复相邻的文本。
-
以句号结束替代文本句子。
生成替代文本有许多细微之处,但除了前面提到的点之外,替代文本还必须包括图像呈现的上下文。在讨论建筑时使用的大学校园照片可能比用于学生简章的同一图像具有不同的替代文本。更多建议可以在以下链接找到:www.visionaustralia.org/business-consulting/digital-access/blog/five-tips-for-writing-alt-text。
使用 AI 生成替代文本的最简单方法是使用许多专门为此目的设计的免费工具之一,包括Ahrefs (ahrefs.com/writing-tools/img-alt-text-generator),或TailWind (www.tailwindapp.com/marketing/tools/image-alt-text-generator)。
或者,使用像 ChatGPT、Gemini 或 Claude 这样的通用 LLM,可以带来额外的优势,即能够调整输出——通过提供生成更好替代文本的提示来引导它们,或者提供展示这些图像的上下文。以下是一个来自 Tailwind 的简洁替代文本描述,使用了我自己的图像作为来源:

图 6.20 – 这段文字简洁,但没有上下文,无法讲述整个故事
该描述长度适中,提供了足够的意义,但没有上下文。尽管如此,并非所有描述都是准确的。Ahrefs 提供了三个选项,但所有选项都将 Apple Park 解释为步行道:

图 6.21 – Ahrefs 提供了选项,但没有一个是正确的
虽然人类可以编辑这些描述以包含上下文,但更高级的 LLM 可以为您完成这项工作。在这里,ChatGPT 提供了一个通用的描述,然后根据请求添加上下文:

图 6.22 – 提供上下文可以改善替代文本——尽管它可能有点太长了
因此,尽管 AI 生成的替代文本令人印象深刻,但它通常只是一个起点。人类输入通常是必要的,要么直接纠正生成的替代文本,要么通过请求 LLM 添加新信息。

图 6.23 – 这个免费移动应用程序可以详细描述任何照片——但它不是即时的
盲人用户已经可以访问像 Be My Eyes 这样的免费工具,这是一个可以描述手机摄像头所能看到任何事物的移动应用程序,它也适用于像 Meta AI 那样的智能眼镜。自动生成替代文本现在是最低要求,如果您提供替代文本,您应该能够做得更好。
我们已经覆盖了很多内容,现在让我们总结一下。
摘要
AI 生成的文本有可能使许多任务变得更简单,在具有正式、特定输出要求的项目中,它可以大放异彩。然而,在创意领域,完全接受它存在真正的风险。
如果您创意写作的目的是脱颖而出,您就不能使用与其他人相同的工具和技术。如果您想作为一个创意人士成长,您就不能简单地外包创意任务。
话虽如此,接受帮助并没有什么不妥,AI 当然能够对你的作品提供反馈,以及提供想法。从大型语言模型(LLM)中获得的创意想法几乎没有缺点,因为你控制着如何使用它的建议。对于想要在专业上有所拓展的创意人士来说,向 LLM 寻求帮助绝对不是最糟糕的选择,尽管你对某个主题越熟悉,效果越好。
如果可能的话,将文本生成作为帮助你而不是取代你的工具。
带着这个基本原则,让我们深入探讨 AI 在创意人士中最具争议的应用:生成图像。
其他资源
|
获取本书的 PDF 版本和独家额外内容
扫描二维码(或访问packtpub.com/unlock)。通过书名搜索这本书,确认版本,然后按照页面上的步骤操作。 | 
|
| 注意:请妥善保管您的发票。直接从 Packt 购买的产品不需要发票。* |
| --- |
第七章:基于图像的生成式 AI
在生成人工智能(GenAI)的众多话题中,合成图像的 AI 生成可能比其他话题更具争议性。如果你是一位创作或修改图像的创意专业人士——我们大多数人都会以某种方式与图像打交道——你可能已经对这一点有强烈的看法。以下是我的观点:尽管 AI 可能很强大,但我认为 AI 并不一定会取代所有的设计师、摄影师和修复师。实际上,有许多使用 AI 的方法不会让世界充满垃圾,而且可以帮助我们更好地完成工作。
创造力对不同的人意味着不同的事情,在“创意生产”这个广泛的类别中有很多不同的工作。其中一些任务可能很无聊,或很繁琐,或者从未向客户展示过,这些任务更有可能是由 AI 完成的。
其他任务,如复杂的图像修复或恢复,有时由 AI 完成会更好,在这种情况下,它们可以被视为我们之前使用的工具的更高级版本。AI 还可以开辟全新的工作流程,让你在拍摄之前可视化拍摄,或根据为特定目的创建的图像创建情感板,而不是简单地重复使用他人的图像。
当然,市场正在迅速变化,进步迅速。尽管我会展示几个不同工具的结果,但测试的服务太多,而且这个行业的变革速度意味着任何具体的推荐在你阅读这本书时都可能已经过时。不要对任何一种解决方案过于依赖——如果五年后它们都还在,我会感到惊讶。
为了使这本书尽可能有用,我将尽量更多地关注技术和工作流程,而不是具体的应用和服务,我将涵盖网页和桌面解决方案,而不是移动端。书中包含了一些比较性评论,但请使用您最终选择的服务在自己的图像上确认结果。
无论你制作什么类型的图像,人类监督或指导都是重要的。在本章中,我们将探讨以下主要主题:
-
处理现有图像
-
创建原始图像
-
生成式矢量艺术
-
情感板和设计理念
-
创建 3D 模型
首先,让我们看看图像修复领域的最新技术。
处理现有图像
尽管许多基于 AI 的工具可以进行图像处理,但Adobe Photoshop作为修复工具的选择已经如此之久,以至于它已经成为一个动词:Photoshop。我自 1990 年代末以来在个人和专业上使用 Photoshop,包括一些结合机器学习的新工具,已经多次改变了技术的状态。
例如,克隆图章曾经是唯一可用于修图工作的工具。覆盖皮肤瑕疵很棘手,因为并不总是容易找到一块匹配的干净皮肤区域进行克隆。使用克隆图章工具时,必须在源和目标之间匹配纹理和光线。
在 2000 年代初,我在伦敦担任修图师,修复画笔工具的引入彻底改变了游戏规则。我们仍然需要找到一个干净的皮肤区域,但现在我们只需要担心纹理——Photoshop 可以为我们匹配源和目标之间的亮度。
2010 年,内容感知填充被添加到 Photoshop CS5 中的修复画笔工具中。使用这个工具,您甚至不需要选择一个克隆的源区域——实际上,您根本无法选择。相反,Photoshop 会选择图像中哪些部分可以重复使用,创建一个(通常)看起来无缝的新区域,通过重新混合原始图像的部分来创建替代区域。
这个工具至今仍在使用,尽管它早于现代 AI 工具,但可以说它使用了机器学习技术。当时,它是在Adobe Sensei的旗帜下推广的 (web.archive.org/web/20190404055934/https://research.adobe.com/project/content-aware-fill/)。
现在,现有的工具通过生成移除和生成填充两种完全生成功能得到增强,这些功能利用了为该目的许可的 Adobe Stock 图像。尽管许多修图任务仍然最好使用内容感知修复点、修复画笔或甚至克隆图章来完成,但基于 AI 的工具带来了前所未有的灵活性。
例如,如果您从一个不戴帽子的照片开始,但客户希望他们戴上帽子,仅仅克隆是不够的。您需要找到一个合适的帽子图像,光线角度相似,清晰度相似,这个过程可能需要相当大的努力。

图 7.1 – 我想要在这里放一顶帽子,请
现在,您可以使用套索工具选择想要放帽子的区域,然后在文本输入字段中告诉 Photoshop 您想要的帽子类型,它将在几秒钟内生成三个选项。您甚至不需要告诉 Photoshop 您想要什么;留空字段,它将找出最佳选项。

图 7.2 – 这顶帽子不是真的,海滩上的男人也不是
在大多数其他应用程序中,这被称为修复,它是一种在Freepik (www.freepik.com/) 和 Claid.ai (claid.ai/) 等服务中常见的常规工作流程;我们很快就会看看它们。
类似地,如果你想从图像中移除人物,Photoshop 的移除工具可以自动选择人物或电线和电缆,然后用生成的背景替换所选区域。尽管选择并不总是完美的,但很容易用颜色填充遗漏的项目。

图 7.3 – 使用移除工具的查找干扰>人物选项;大多数但并非所有人被找到
当这个功能被引入时,许多新手用户可能会被诱惑使用这个新工具,而从未学习过其他工具。然而,从 2025 年中旬开始,Adobe 应用程序中的一些生成工具,现在在Adobe Firefly的旗帜下(firefly.adobe.com),从免费转变为在某些计划上需要生成积分。但是,移除工具在所有计划上仍然是免费的,至少目前是这样,无论你是否选择使用 GenAI。

图 7.4 – 这张图像是可用的;当然比没有 AI 的结果要好
你的订阅决定了你可以使用的生成成本和类型。Adobe 应用程序中的大多数生成任务都被标记为标准,而涉及视频的任务以及 Firefly 中使用的第三方模型都被标记为高级。如果你订阅了所有应用程序(Creative Cloud Pro),则标准生成是免费的,你可以随意使用这些功能。
在其他计划中,典型的生成填充任务现在需要 1 个积分,并且不同账户每月获得的生成积分数量不同——目前大约在 25 到 500 之间。(尽管 Creative Cloud Pro 包括 4,000 个生成积分,但由于标准生成仍然免费,这些积分仅用于高级任务。)
可以通过附加 Firefly 计划在常规 Creative Cloud 计划之外购买额外的积分,但一些计划使用生成技术进行批量处理的用户现在可能必须考虑成本。(我们将在下一章中再次回到这些积分,因为视频生成的成本比静态图像要高得多。)
即使有潜在的额外成本,Adobe 的生成选项对于担心使用大多数生成图像模型的合法和道德风险的创意人士来说仍然具有吸引力,因为商业使用是明确允许的,至少对于默认的 Firefly 模型来说是这样。
然而,到 2025 年底,可以使用其他生成图像模型。由于它仍在测试阶段,费用尚未确定,但如果你愿意,可以使用Flux Kontext和谷歌的Nano Banana(又称 Gemini Flash)来代替 Firefly 模型进行生成填充。但这确实带来了一个道德问题——这些模型是否在未经授权使用的图像上进行了训练?即使没有授权,在合理使用下查看这些图像是否允许?
此外,如果您有所疑问,Adobe 不会在您的图像上训练其模型,但其他 AI 提供商可能会这样做。政策各不相同,但一般来说,如果您为服务付费,他们可能不会使用您的数据来训练。如果您免费使用服务,这种情况更可能发生;请仔细阅读条款以了解详情。
与许多基于未知来源图像训练的模型相比,Adobe 的模型仅基于特定、已知的图像进行训练。虽然主要来源于 Adobe Stock,但也使用了部分公有领域和其他开放许可的内容(helpx.adobe.com/au/firefly/get-set-up/learn-the-basics/adobe-firefly-faq.html)。尽管并非所有 Adobe Stock 的贡献者都意识到他们的图像将被用于 AI 训练,但在他们签署的协议中这是法律允许的(www.techradar.com/pro/software-services/creators-slam-adobe-over-firefly-ai-training)。
简要回顾一下在第二章中提出的伦理问题,如果您对图像生成工具的训练方式感到担忧,请寻找该工具制造商的声明。Adobe 的声明很明确,苹果公司表示他们使用“授权数据”(machinelearning.apple.com/research/introducing-apple-foundation-models)。包括 OpenAI 和 Meta 在内的主要 LLM 创作者都因训练数据的来源面临诉讼,并声称“合理使用”。
如果您想结合传统修图工具和 AI 来编辑图像,无论是否使用第三方模型,Photoshop 可能仍然是您的最佳选择。生成填充是一个很好的工具,可以添加或更改图像;第三方模型以新的方式扩展了这一功能,如果您想移除某些内容,生成移除通常会产生干净、有用的结果。然而,Adobe 的工具并不是改变图像一部分的唯一方式。
多模态 LLM 如 ChatGPT 和 Gemini 都具备能力,还有众多第三方基于网络的在线服务和集成在手机操作系统中的照片编辑工具。
在手机上,Android 用户可以使用 Google Photos 的 AI 编辑工具,其中魔法橡皮擦和魔法编辑器是免费提供的。在某个区域刷过、画圈或点击特定项目以移除它们,AI 模型将填补空白。在 iPhone 或 iPad 上,在照片应用中画圈移除图像中的不需要部分也以类似的方式工作。尽管这些简单工具并不总是提供创意生产专业人士所需的灵活性、力量或可扩展性,但它们可以成为快速、偶尔修复的便捷工具。
假设你的需求超出了手机所能做到的,如果你不想使用 Photoshop,可以考虑基于网页或桌面的选项,如 Freepik、Evoto 或 Claid.ai,使用与 OpenAI 或 Google 的 AI 服务集成的服务,或者甚至考虑使用网站创建工具,如 Wix。(其他工具,如 Imagen,将他们的图像修图服务定位在自动化生产上,我们将在本书的自动化 AI部分探讨一些这些工具。)
尽管有许多种工具可用,但我怀疑大多数创意专业人士更愿意使用基于桌面的应用程序来避免从网站上传和下载图像时可能出现的文件管理麻烦。
并非所有工具都提供桌面应用程序,并且多个服务可能提供相同的模型。Adobe 的 Firefly 网络服务目前提供最突出的模型,包括他们自己的 Firefly Image 模型,以及来自 Imagen、GPT Image、Flux 和 Runway 的更多模型。
让我们更深入地了解一下如何从文本提示中制作图像。
通过 AI 提示进行修图
这个领域的竞争非常激烈。2025 年 8 月,Gemini 推出了其 Flash 2.5(又称 Nano Banana)系统,积极邀请用户通过网页界面进行提示以优化图像:

图 7.5 – Gemini 现在要求用户在请求中具体说明
上传之前相同的“海滩上的男人”图像,并要求“给这个男人加上一顶帽子”,得到了不错的结果:

图 7.6 – Gemini 的输出;我本可以更具体一些,但这个帽子是一个合适的选择
一致性很高,但从生产角度来看,主要问题是输出并不完全匹配输入;它已被裁剪并略微放大,分辨率从1024 x 512 px变为1024 x 535 px,并且有明显的质量损失。
另一个问题源于文件管理。当你上传、处理和重新下载时,原始文件名会丢失,每个下载的文件都必须重命名并复制到稳定的位置。这类问题对于基于网络的系统来说是不可避免的,虽然这些并不是无法克服的问题,但对于一次性的测试来说,它们在生产流程中可能会造成问题。
完全在 Photoshop 内部的生产流程更容易管理,所以如果你想使用 Nano Banana,如果可能的话,我会在 Photoshop 中使用它。分辨率仍然是一个问题,但可以通过选择生成较小的区域或仅重新生成较大区域的一部分来解决这个问题。
另一个担忧是,生成的图像有时与原始图像的偏移或亮度级别不同。为了修复这些问题,添加一个图层蒙版,并使用柔软的黑色画笔在该蒙版周围绘制。Photoshop 中的 AI 生成功能强大,尽管它并不完美,但可以成为困难修图任务的实用工具。这个功能目前正在积极开发中,并且在未来版本中可能会再次发生变化。
对于 Photoshop 的最新信息,我建议关注 PiXImperfect 的 Unmesh Dinda 的最新动态——在我看来,他是 YouTube 上最好的 Photoshop 教育者。这是一段关于将 Nano Banana 引入 Photoshop 的视频,可能在你阅读时已经有些过时,但其中有很多很好的想法:youtu.be/RJ2eqkk_JxI。例如,你知道你可以用文本说明来注释图像,并使用文本提示,如 跟随图像中的提示 吗?
尽管如此,基于网络的文本提示可能是一个值得考虑的选项,让我们看看不同的网络服务如何处理我在本节开头在 Photoshop 中执行的同一个人脸移除任务。我不再使用菜单和手动绘制遗漏的区域,而是直接用简单的英语请求工具完成:从这张图片中移除人物。以下是不同模型的表现:
-
Gemini (
gemini.google.com):其较旧的图像模型完成了可接受的工作,但替换区域可以做得更好。分辨率较差,细节丢失。较新的 Nano Banana 模型做得更好,但仍然存在分辨率低和细节丢失的问题。 -
ChatGPT (
chatgpt.com, 使用免费账户):它在移除方面做得不错,但花费了较长时间,并且裁剪了图像成方形。 -
Sora (
sora.chatgpt.com, v1, 使用 ChatGPT Plus 付费账户):它在一两分钟内完成了良好的工作,没有改变图像的宽高比,但分辨率没有原始图像高。 -
Freepik (
www.freepik.com/):它非常快速地完成了出色的工作,使用了 Flux Kontext Max 模型。需要付费计划才能获得商业许可证或高分辨率输出。 -
Claid.ai (
claid.ai/):它做得相当不错。高分辨率输出仅适用于付费计划。
尽管这个任务有许多选项,但如果你需要高分辨率的结果,你可能需要为此付费。

图 7.7 – Freepik(显示)和 Claid 生成的结果与 Photoshop 相当
并非所有增强型 AI 照片工具都接受文本输入,所以如果你希望工具能够处理更不寻常的请求,请检查是否支持提示。这种方法还允许服务提供商如 Freepik 设计提示以支持特定的流程,例如Generate Different Angles of Person或Place Product in a New Setting。
ChatGPT 的文本模型解释你的请求,然后其他图像模型处理图像创建。

图 7.8 – Freepik 提供许多由提示驱动的流程,包括这些
其中一些远远超出了简单修图所能达到的效果,而且可以在几秒钟内获得可用的结果。我们很快将回到更复杂的图像到图像的工作流程。
扩展原始图像
图像被构图得比布局艺术家希望的更紧密并不罕见。在一个理想的世界里,摄影师可以更宽松地构图他们的照片,让设计师最终控制裁剪和放置。
因为我们不生活在一个理想的世界里,摄影师更有可能以对他们来说看起来好的方式构图他们的照片,在相机或处理过程中更紧密地裁剪主题。然后客户在自己的环境中批准那些“裁剪得很好”的照片,每个人都感到高兴。但后来,如果图像的边缘最终被发现是必需的,AI 可以帮助填补缺失的区域。
图像扩展在概念上与替换图像中不需要的部分相似。不是替换原始图像的一部分,而是在一个或多个维度上扩展其边界,然后使用看起来像原始图像的图像数据填充新区域。虽然可以使用像修复画笔和内容感知填充这样的旧工具来完成这项任务,但使用生成填充通常更容易。

图 7.9 – 在这里用绿色轮廓显示的原始图像,Photoshop 提供了三种可能的扩展选项
Adobe 应用程序以几种方式提供此功能。您可以在 Photoshop 中使用手动选择和生成填充来完成此任务,作为裁剪工具的生成扩展,或者在 InDesign 中,具体取决于工作流程要求。其他图像处理工具也可以完成这项工作。

图 7.10 – Claid.ai 需要两次上采样操作(垂直,然后水平)才能得到这个结果
这个功能通常被称为扩展绘画,在 AI 图像处理服务中很常见,许多服务都能给出良好的结果。如果你需要在新的语境中重新使用一个图像,而原始图像找不到,这不是一个坏的选择。然而,请注意,如果确实存在原始未裁剪的图像,你应该始终尝试找到它,否则你可能会无意中歪曲现实。如前图所示,创造人体任何一部分都是不明智的。
虽然这里展示的图像中的女性并非真实存在,但很容易想象到通过图像扩展可能会对真实人物造成冒犯——这确实已经发生了。2024 年初,澳大利亚电视网络九号台在使用 AI 扩展图像后遭到了批评。作为一条电视新闻故事的一部分,维多利亚州的国会议员 Georgie Purcell(议员)被拍摄和拍照时穿着一件白色连衣裙。这张照片后来被裁剪,只展示了她腰以上的区域,并在另一个语境中使用。后来,这张裁剪后的图像通过生成式 AI 扩展,展示了她穿着露脐装而不是原来的连衣裙(theconversation.com/nine-was-slammed-for-ai-editing-a-victorian-mps-dress-how-can-news-media-use-ai-responsibly-222382)。
虽然生成式 AI 在广告和创意方面有明显的用途,但在基于事实的语境中使用真实人物的图像时,请务必非常小心。然而,生成式扩展并不像创建完整图像那样具有争议性,而这正是接下来要讨论的。
创建原始图像
你现在可能已经在野外遇到了 AI 制作的图像,但……你想要使用 AI 为你制作图像吗?你越接近图像创建过程,你对这个前景就越可能不感兴趣。如果你的主要工作是市场营销,并且你将图形设计和摄影视为费用,你可能非常喜欢这个想法。但如果你是一位摄影师或插画家,你为什么要停止做这件事呢?
然而,尽管客户应该足够关心他们的图像,以至于雇佣有技能的专业人士来创建它们,但并非所有客户都这样做,这并不是什么新鲜事。如果一个小型企业看不到雇佣摄影师或设计师来制作图像的好处,从历史上看,他们可能会自己制作,或者使用模板,或者请一个“知道 Photoshop”的家庭成员帮忙。今天,他们可能会直接使用 AI。
即使在大公司中的专业职位上,并非每个图像都具有相同的价值。被指派在年度报告中找到一个图像来说明观点的图形设计师可能没有摄影预算,但他们可能拥有库存图像。
现在,这个预算可能已经缩减为零,他们可能会选择从免费股票图片网站如pexels.com或pixabay.com,或unsplash.com(其混合免费/付费模式)获取图片。所有这些网站现在都包括真实照片和 AI 制作的图像,尽管 AI 制作的图像被标记为这样的。
在人类制作的库存图片可以接受的情况下,使用 AI 制作的图像是否合适?询问您的客户。他们的答案可能因年度报告中使用的抽象图像与以艺术为重点的项目(如桌面游戏)而不同。如果消费者对人工艺术有强烈的偏好,使用 AI 艺术可能会使众筹项目失败。
即使您选择不使用 AI 制作的图像来完成艺术作品,也请考虑使用 AI 图像创建工具进行创意和原型设计。尽管 AI 艺术本质上是对其他艺术的衍生,但传统的原型设计过程也是如此,其中使用他人的图像作为灵感和情绪设置的来源。
您负责决定如何使用这项技术。在这里,我们将探讨可能实现的内容、好的方面以及不好的方面,并从从文本创建图像开始。
从文本提示生成图像
提示允许您定义图像应包含的内容以及其应呈现的风格。虽然文本提示无法可靠地生成显示特定产品的图像——为此您需要图像到图像的工作流程——但它仍然非常有用。如果库存图片搜索结果为空,且没有预算来真实捕捉图像,只需让 AI 制作一个即可。
服务的输出质量、速度、用户界面和定价可能各不相同,而您的用例将决定您对每个方面的优先级。例如,如果您只想为原型制作图像,那么内置在现有软件中的不完美解决方案可能比高质量的付费解决方案更有吸引力。在其他情况下,您可能受到平台自我审查的限制。许多模型会尽量避免任何可能被认为是暴力或露骨的内容,而 Firefly 甚至不会生成埃菲尔铁塔的图像。

图 7.11 – 这个提示仅仅是“埃菲尔铁塔,以 45°角,在晴朗的蓝天下的样子”
虽然一些工具仅可在特定平台上使用,但其他模型可以在多个供应商之间找到。例如,苹果的Image Playground仅在苹果的硬件上可用,但您可以通过 Adobe Firefly、Freepik 和其他方式访问FLUX.1 Kontext模型。这个领域的进步非常迅速,您需要自己测试以查看哪个服务(或服务组合)符合您的需求。如果您使用 Firefly,请记住使用第三方模型会消耗生成信用——在开始之前检查您有多少。
如果您知道您在寻找什么,使用详细的说明将给出更好的结果,如果您将细节留给模型,您可以期待更多样化的结果。务必指定主题、正在发生的事情、它们所在的位置以及您想要的图像风格。
使用描述性形容词,指定所需的宽高比,并包括摄影和照明说明。如果提示不太有效,可以添加内容并再次尝试,或者如果您遇到重复问题,可以添加负面信息,例如没有额外的肢体。
一些服务,例如 Firefly,允许您在提示旁边选择额外的选项,如宽高比和风格。我们将在本章下一节讨论参考图像和风格选项。
简单、快速的模型可能难以处理涉及多个主题的更复杂提示。您将在生成的图像大小和速度之间面临权衡,并且可能需要为了某些目的提高低分辨率图像的分辨率。此外,您会发现许多模型会产生混乱的文本——如果需要,请准备好手动修复它。
在这里,我们将尝试在几个不同的模型上使用相同的提示,突出供应商之间的重要差异,并提供一些策略。以下是提示:
-
一只手握着从土壤中生长的小绿苗,背景是黑暗的清晰背景,强烈的顶光,逼真的现代照片 -
洪水破坏的纽约市街道,人们在驳船上穿过百老汇和 51 街的交叉口,模糊的黑白历史照片 -
一个手持剑的威胁性骷髅,背景是黑暗的地牢,嘴巴张开,准备攻击,幻想插画风格 -
具有霓虹渐变和点的漩涡的抽象艺术,现代科技风格,矢量插画 -
一只棕色的狐狸快速跳过躺在松树林中睡觉的狗,斑驳的光线,童话水彩插画
重要的是要注意,一些服务会指导您如何改进提示过程,甚至可能“增强”您的提示。例如,Firefly 包含一个默认开启的提示增强功能,将先前的纽约市提示转换为以下内容:

图 7.12 – 增强的提示可能会添加不希望出现的细节
虽然更详细的描述会给出更具体的结果,但这里添加的情感语言对于新闻风格的图像来说并不合适。指定水位“升到小腿中部”并不是我所要求的或想要的。要小心。另一方面,由于 Firefly 允许您从许多第三方模型以及他们自己的模型中选择,因此它是一个快速比较它们可能对您的工作有多有效的好地方,如果您是 Adobe 订阅者,您已经可以访问了。
要找到一个能够根据你愿意撰写的提示创建你喜欢的作品的模型,在付费订阅之前进行多次免费测试是值得的。除了萤火虫可访问的模型外,你目前需要付费的 ChatGPT 账户才能访问 Sora,如果你想免费尝试 Midjourney,请下载移动应用Niji Journey(在你的移动应用商店中)进行免费试用。
在这里,我尝试了 Adobe Firefly 模型、Runway、Flux 1.1 Ultra、Sora、ChatGPT、Midjourney、KlingAI、Nano Banana Pro 和其他模型的这些提示。请注意,苹果设备上包含一个名为 Image Playground 的应用程序,但它无法像这些其他工具一样处理较长的提示。
所有测试过的模型在至少一些提示上表现良好,但总体而言,最一致、质量最高的结果来自 OpenAI 的 Sora(v1)和 Nano Banana Pro,这是唯一能够创建显示纽约市请求位置的图像的模型,并且包括可辨认的相关文本。

图 7.13 – Sora 的纽约市图像几乎完全符合我的期望
这个特定的提示对大多数其他模型来说都很有挑战性。在某些生成中,人们正在“洪水”道路旁边的人行道上行走;在大多数情况下,文本是混乱的。最常见的问题是感觉不真实。
Sora 在其他的提示上也表现良好:

图 7.14 – Sora 的其他结果
Nano Banana Pro 表现良好,没有重大错误,并且高度遵循提供的提示。虽然我仍然只稍微倾向于 Sora(v1),但这些结果很稳固:

图 7.15 – Nano Banana Pro 在所有提示上的结果
萤火虫内置模型的一个大优势是,其基本生成在 Adobe 账户下是免费的,默认情况下会生成四张图像。虽然其土壤手部图像大多还可以,但最后一张图像简直是噩梦:

图 7.16 – 最后的手发生了什么?
此外,虽然萤火虫的纽约市图像大致显示了正确的内容,但细节不足。示例图像与提示完全不匹配;大多数所谓的“狗”实际上是狐狸,有时跳跃的狐狸看起来像是漂浮在空中。

图 7.17 – 这些纽约市图像还不够完美,狐狸图像几乎无法使用
公平地说,萤火虫是一个多用途工具,其工具箱中有很多其他技巧。如果你想将文本图像的风格化为液态金属或橙色皮毛,它都能满足你的需求,但它的默认模型在纯摄影输出方面还不太出色。

图 7.18 – Firefly 的文本效果在 Adobe Express 中的基于提示的风格创建器中
但让我们回到摄影和插图比较。Midjourney产生了一些出色的骨骼风格插图,但无法让狐狸跳过睡狗——相反,它们都睡着了。

图 7.19 – Midjourney 的威胁性骨骼和睡眠中的动物
Google 的Imagen产生了一些可靠的结果,包括以下这些:
.
图 7.20 – Imagen 的手部土壤效果很好,其骨骼造型也相当威胁
KlingAI,来自 DeepSeek,大多数情况下既快又有效:

图 7.21 – Kling 的手部效果很好,其狐狸跳过懒狗的动作也很自然
通过 Firefly,Flux 在这些提示中做得很好,分辨率高于大多数其他模型:

图 7.22 – Flux 产生的抽象艺术作品最佳,其其他图像也很好
Runway 也能产生不错的输出:

图 7.23 – Runway 的提供内容扎实
量产选项
如果你更关心数量而不是质量,可以查看Diffusion Bee:一个免费的 Mac 应用程序,可以在本地免费运行较旧的 Stable Diffusion。如果你需要大量的粗糙草图,成本是无法比拟的。

图 7.24 – 这些生成效果不是很好,但它们是完全免费且无限的
另一个非常适合量产的选项是Grok(grok.com/imagine或通过 Grok 移动应用程序),它允许你简单地向下滚动查看更多图像,还有更多。这里的生成速度令人印象深刻,对于创意来说,这可能非常有用。尽管产生了大量图像,但质量尚可,视频生成(下一章讨论)只需轻触即可从任何图像开始。

图 7.25 – Grok 的图像在质量上不是最佳,但速度非常快
对于这里的每个提示,我展示了前四个,但已经看过更多,并发现与大多数其他模型类似的问题。狗通常是狐狸或至少有狐狸的尾巴;纽约不真实;与其他模型相比,幻想插图看起来很廉价;一些植物图像包含了混乱的、不希望出现的文字。如果速度是重点,请注意,每组四张图像只需几秒钟,滚动查看更多可能会上瘾。这些图像的长期成本尚不清楚,但现在是完全免费的。
由于模型会变化,你的需求不会与我的相同,因此你可以从这些服务中的任何一个,或者从我没有包括在内的许多其他服务中获得良好的结果,例如 Leonardo 或最新的 Stable Diffusion 模型。然而,在 Sora 和通过萤火虫提供的选项之间,我认为你将能够产生良好的结果。分辨率是大多数这些模型的一个担忧,但 Flux(通过萤火虫和其他提供)可以原生地产生高分辨率,并且从其他模型的输出中提升分辨率可能是有效的。
与许多其他 AI 生成一样,预期会有不完美之处,这样你就不会失望,但你可能会对一些模型的表现感到惊喜。对于创意人士来说,告诉计算机你想要的是什么是一个完全不同的创作过程。为了更精确地控制 AI 模型创建的内容,考虑给它图像而不是仅仅文本。
从其他图像生成图像
图像到图像的工作流程可以有多种形式。如果你只需要替换图像的一部分,仍然最好使用像 Photoshop 这样的工具,但如果你想要将一个图像作为另一个图像的灵感或风格来源,或者确保一系列图像的一致性,寻找一个明确支持这一功能的工具。许多工具都支持,包括 Photoshop,萤火虫模型中的大多数(包括 Nano Banana),以及 Freepik,仅举几个例子。
在文本到图像的工作流程中,可以简单地要求特定的图像风格,一些模型,例如萤火虫模型,允许你上传一个参考图像用于构图和/或风格——但请确保为每个上下文选择正确的图像。如果你没有自己的原始来源,可以使用样本图像。
Photoshop 的生成图像功能允许你包含风格参考和/或构图参考,这是一种使生成的图像与现有标志或照片的布局或颜色相匹配的有用方法。

图 7.26 – 如果你想生成的图像与现有作品相匹配,请上传参考图像(s)用于构图和/或风格图像
如果你不想使用现有的图像,你可以从大量现有的参考图像中获取灵感,其中一些可以在下面看到:

图 7.27 – 这里展示的是 Photoshop 的一些风格参考
返回纯文本,可以提示像Sora这样的服务创建与现有图像风格相匹配的额外图像。在这里,我要求基于 Sora 之前制作的骨架生成几张新图像:

图 7.28 – 骨架是矮人、龙和宝藏(所有都加亮以显示细节)的风格模板
如果你需要更广泛地控制这一级别,你可能需要转向像Freepik这样的服务,它允许你提供更大的训练图像库,从中可以生成 LoRA。名为低秩自适应的LoRA允许模型模仿一种风格,而无需从零开始重新训练模型,在概念上是一种与你的现有图像相匹配的定制风格。
如果你更喜欢使用 Freepik 提供的预定义风格,这有助于你的生成保持相似。这些风格也可以用来重新想象图像的新风格,这是 Google Whisk 也提供的一项服务。以下是一个例子,我将两张左边的图片上传,选择了软玩具的风格,并让网站自行处理:

图 7.29 – Google Whisk,一种有用的混搭方式
右侧显示的两幅图像是由 Google Whisk 根据左侧的图像编写的两个不同提示生成的。作为完成的艺术作品,它们并不那么出色,但作为灵感?那就足够了。如果你使用像 Nano Banana 这样的能够胜任的模型,还可以使用 Photoshop 的生成填充功能,例如输入“将此图像制作成油画”这样的提示。分辨率可能不是完美的,但结果通常令人印象深刻。
那么,如果你确实需要具有完成艺术作品质量的摄影图像呢?一些服务确实可以实现这一点。
创建虚拟摄影棚
就像 Firefly 一样,Freepik 提供来自其他 AI 提供商的模型,并在其自己的界面和独特功能中重新包装它们:“生成人物的多个角度”、“将产品放置在新环境中”等等。将一位女孩在田野中的单张图片上传到 Freepik 后,可以要求它以不同的角度生成照片:

图 7.30 – Freepik 允许你上传一张图片,然后为你提示“嘿!从这张照片的不同角度创建多张图片”
Freepik 随后生成这三张新图像:

图 7.31 – 三种可用的新选项,如果你要求的话还有更多
虽然这些照片看起来并不完全像是同一个人,但它们非常接近,这种工具在正确的情况下可能具有巨大的价值。图像到图像的工作流程有可能扩展到生产工作流程,而仅仅要求带有文本的图像是无法做到的。
虽然 Freepik 包含一组预定义的角色,但你可以通过上传许多一个人的图片(无论是真实的还是虚拟的)来创建一个新的虚拟角色或头像。然后,这些图片将被用来训练一个模型,使其能够创建特定、一致的人物的图像。这种技术在保持连续性方面很有帮助,我们将在下一章中再次讨论它。
Freepik 并不是唯一能够以不同角度创建同一个人图像的服务。Higgsfield(higgsfield.ai/)提供虚拟角色以及一组令人印象深刻的预设,由于它主要关注视频,我们将在下一章中再次讨论它。Sora 也能做这项工作,尽管它需要更长的时间,你需要在提示中提出这个请求。

图 7.32 – Sora 的 Remix 功能允许你请求变化,也是如此
Claid.ai 是另一个以图像为中心的服务,它包括一个 AI 时尚拍摄功能。你可以使用提供的虚拟模型或你自己的图片,以及你希望他们展示的衣服图片,然后它会为你拍摄虚拟照片。

图 7.33 – 这是 Claid.ai 的虚拟照片拍摄结果
结合这些想法,你现在可以进行一次模特手持客户产品或穿着他们衣服的摄影,无论是真实的还是虚拟的。有了这个,你可以创建新的姿势并提供新的选项,而无需重新拍摄。尽管如此,你真的应该这样做吗?这是一个更加棘手的问题。
为了获得最佳、最原创的结果,我建议使用真实的人物的真实产品摄影,如果需要,可以使用 AI 来增强和补充这些照片。真实的拍摄可以产生未被请求或预期的神奇效果,这些意外的时刻是非常宝贵的。
另一方面,在某些情况下,由于正在销售的产品尚未被创造出来,因此无法进行真实的发芽。我曾在游戏板在制造之前,创建了逼真的 3D 渲染图来销售游戏,这难道不是同一回事吗?
如果你不歪曲现实,并且得到了项目中其他创意人员的批准,那么你伪造现实的方式——无论是使用 Photoshop 还是使用 AI 辅助工具——都不应该很重要。伪造图像并不是什么新鲜事,但始终要记住,你伪造得越少,结果就越好。
另一个重要因素是,模板很快就会过时,如果使用频繁,则更快。因此,如果你考虑使用 AI 时尚拍摄,我会建议避免使用库存 AI 时尚模特。它们第一次看起来可能很好,但当消费者在许多不同网站上多次看到完全相同的模特时,它们可能会造成更多伤害而不是帮助。
虽然我们已经看了照片和插图图像,但真正的矢量艺术呢?
生成矢量艺术
虽然大多数 AI 生成的图像是基于像素的,但 Adobe 提供了一些使用 AI 生成矢量艺术的选择。在网页上的 Firefly 可以根据提示创建主题或场景,以参考图像或风格作为控制。这非常有效,下载的文件格式为 SVG。

图 7.34 – 两种不同风格的矢量艺术,均可下载为 SVG 格式
尽管大多数生成艺术的问题之一是缺乏复杂性,但这对于大多数矢量艺术来说是一个优点,因为通常希望有一个清晰、干净的风格。根据对艺术的观察,它似乎是从生成的像素艺术中追踪而来的,但这通常不是太大的问题。
如果你更喜欢直接在 Adobe Illustrator 中访问这项技术,请使用上下文任务栏。画一个矩形,按下生成矢量按钮,然后输入你的提示。
对于更接近你自己的艺术创作的作品,先创建那个艺术作品,然后点击生成形状填充。在这里,我创建了一个简单的八边形和一个矩形,然后要求它生成一个停车标志。

图 7.35 – 一个简单的原型停车标志,以及一个更成熟的版本
生成扩展,也存在于 Photoshop 和 InDesign 中,在 Illustrator 中这里非常实用。打开 Firefly 中的 SVG 文件,使用画板工具很容易扩展现有画板的边界,然后可选地添加一个提示。

图 7.36 – 这里不需要提示,只是更多相同的内容,请
很快,你会得到三个选项的选择,如果需要可以请求额外的生成:

图 7.37 – 这里的第三种选择是提供的最佳选项
Illustrator 还可以根据提示生成矢量图案。打开生成图案面板,然后输入一个提示以创建三个无缝重复的图案。

图 7.38 – 变化面板中可用的三种简单矢量图案
目前在 Illustrator 中隐藏的一个更多生成功能是生成重着色。你可以在重着色艺术面板中找到这个选项(编辑>编辑>颜色>生成重着色是到达它的方法之一),它提供了一种快速转换任何选定艺术作品颜色的方法。虽然常规的重着色艺术对话框可以通过少量手动操作来完成这项工作,但使用生成版本更快、更简单,也是一种有趣的尝试颜色的方式。

图 7.39 – 这里,之前的叶子已经被复制、扩展,然后重新着色
你可以输入一个提示或使用一个示例,如前图中的Summer by the sea,点击生成,然后点击下面的一个变体来应用它。尝试尽可能多的变体,然后点击回到重着色来手动调整结果。
虽然 Illustrator 不是唯一能够创建矢量图像的 AI 启用工具,但它可能是最方便的。如果你想探索其他选项,可以尝试VectorArt.ai(vectorart.ai)、Canva AI 矢量生成器(www.canva.com/create/vector-ai/)或Recraft(www.recraft.ai/)。Recraft 允许你选择矢量艺术(或像素艺术)的风格,并像往常一样提示:

图 7.40 – Recraft 允许你创建矢量和像素图像
即使这些工具没有集成到 Adobe 套件中,你也可能会发现这些工具是创建矢量艺术的一种更灵活的方式——给他们一个尝试的机会。
事实上,Recraft 是许多将 GenAI 模型集成到灵活界面的现代基于网络的图像生成工具之一,这种界面适合简单的项目设计。由于它支持像素和矢量艺术,它是一个构建情绪板的绝佳地方——让我们深入了解。
情绪板和设计构思
使用他人的图像长期以来一直是构建情绪板的一种公认做法,它允许一群创意人士就项目的风格和感觉达成一致。通过允许你创建启发你的图像,而不仅仅是借用他人的图像,生成的图像增加了灵活性。当然,你可以在单个板上混合生成的和找到的图像,最终,这些图像都不会成为最终作品的一部分。
虽然在任意的 GenAI 解决方案中创建图像并在你选择的布局工具中组装是完全可能的,但你可能会发现在一个网络工具中构建情绪板更容易,这可能有助于更轻松的协作和共享。一些工具,如苹果的 Freeform,允许共享工作空间,可能是一个创意团队一起头脑风暴的自然场所。
然而,如果过程更侧重于创作,你可能更喜欢使用更专注于 AI 的工具。如前所述,Recraft 的灵活工作空间允许你导入图像,使用熟悉的快捷键进行复制/调整大小/平移,生成像素或矢量艺术,创建这些图像的重新风格变体,并将它们全部排列在无限画布上。

图 7.41 – 扩展的 Recraft 画布的一部分,包含一些生成的艺术作品的变体和一些样本
你需要为 Recraft 支付费用才能使其变得有用,但集成可能值得。然而,如果你已经订阅了 Adobe,他们现在提供了一个专门用于情绪板的应用程序:Firefly Boards。与 Recraft 类似,这允许上传、生成和混搭图像的无尽空间。你还可以访问生成填充和生成扩展,以及 Flux 和 GPT 模型。
在这个例子中,我上传了我之前收集的地牢艺术作品,对骨架和矮人进行了变体创作,然后将女战士与宝箱混搭以创建右侧的选项:

图 7.42 – 结合艺术从未如此简单
这个过程很有趣,快速,对于合适的项目来说可能是革命性的。艺术作品显然并不完美,创建的变体也不一定接近原始作品,但头脑风暴的过程应该是混乱的。这个领域有竞争,包括 Kittl.com,所以请查看替代方案,看看哪些适合你的团队。
在头脑风暴过程中,使用基于先前图像生成的快速迭代模型也是一种帮助。Leonardo.ai 提供了 Flow State 来鼓励这种工作流程,Grok 的无限滚动(前面提到过)也适用于此。

图 7.43 – Leonardo.ai 中的流动状态,它根据相同的提示生成多张图像,然后邀请你创建更多类似的作品
无论你最终使用哪种 AI 生成工具,这种交互式情绪板是我所见过的 GenAI 的最佳用例之一。但是,你能得到在适合专业设计应用程序开发格式中的整个设计的帮助吗?目前还不能。到目前为止,大多数工具都专注于创建单个设计元素:一张照片、一个背景或一个图标。如果你想挑战一下,尝试创建潜在 YouTube 缩略图的变体——它们相当简单。
要进一步发展,你有几个选择:Lovart.ai 可以创建可编辑的海报,Claude 可以为你操作 Canva,或者你可以直接使用 Canva 的 AI 工具。不幸的是,这些方法中的任何一种都不会导致复杂的多页文档的专业设计解决方案。也许在将来,我们能够要求 InDesign 根据提供的参考生成新的设计理念,但还不是现在。
让我们以查看 3D 模型创建过程来结束这一章。
创建 3D 模型
尽管大多数创意专业人士并不是每天都在使用 3D 软件包,但有些人确实在用,AI 工具承诺将使该领域更容易接近。虽然动态图形专业人士习惯了关键帧动画,并且可能很好地掌握了在 3D 空间中工作,但对于许多人来说,成为一名建模专家是一条漫长而痛苦的道路。
尽管痛苦,但适当的建模技能在一段时间内对于严肃的 3D 应用仍然很重要。如果你有非常轻的需求——也许你只想在 3D 对象周围轻微地旋转相机——一个 GenAI 3D 工具可能会有所帮助。
与图像生成工具类似,模型生成工具可以从文本提示或现有图像开始工作。
Meshy.ai 是一个知名的服务,尽管它不再提供免费试用,但它是一个功能强大的工具,可以生成多种草稿模型,并在确认后为所选的最终模型生成纹理。我使用了 Sora 制作的宝箱,快速将其变亮,并在 Photoshop 中移除了背景,然后上传了它。虽然可以上传来自不同角度的额外图像,但我只使用了这张图像,效果很好:

图 7.44 – Meshy 界面,左侧上传了一张图片,选择了四个灰色草稿生成中的一个,以及最终的纹理
Meshy 在生成方面做得相当不错,尽管这个物体可能难以进一步开发——毕竟它是一个整体网格——但它可以作为一个较小的比例或背景元素。以下是它在 Blender 中的样子:

图 7.45 – 在 Blender 中下载的模型
可以下载的 3D 格式包括 USDZ、OBJ、GLB 和 STL。在 Hyper3D.ai 也有类似的故事,它也允许你上传一张或多张图片,并使用 Rodin 模型输出 3D 网格。

图 7.46 – 在此创建过程中允许在多个阶段进行再生
尽管 Hyper3D 不能直接创建.blend文件,但我能够正确地将生成的 USDZ 文件导入 Blender。不管好坏,它的结构比 Meshy 输出的更有序,细节也稍微少一些。虽然中心金属杯的亮度没有 Meshy 模型那么高,而且前面的硬币排列得稍微过于正式,但这个结果仍然可以很好地使用。

图 7.47 – 导入 Blender 后的结果略有序
对于更多选项,你可能更喜欢 Tripo 3D,它也可以将网格分割成组件——如果你计划对生成的模型进行动画或编辑,这是非常重要的。请注意,因为第一步涉及从你的图像生成图像,如果你不小心,最终可能会得到一些略微不同的结果。不过,这个结果在木箱的细节上表现良好:

图 7.48 – Tripo3D 网站列出了工作区顶部的可能步骤
这个模型尚未分割,但如果我想手动细化模型,这就是我会追求的。在这里,在 Blender 中,你可以看到这些结果是有用的:

图 7.49 – Tripo3D 的 USD 输出可以干净地导入 Blender
在默认设置下,这些网站采取了相当不同的方法。Hyper3D 生成了一个有 120,000 个面的模型,Tripo3D 创建了 500,000 个面,而 Meshy,最复杂的,有 929,000 个面。虽然细节可以被削减,但看到这样不同的方法很有趣。如果必须选择一个,我会选择 Tripo3D 提供的更干净的结果和额外的控制,但你的需求可能与我非常不同。
其他选项,如Rendable3d.com,提供类似的服务。我在它作为 Blender 分支打包的 alpha 版本中进行了测试,但现在你可以在他们的网站上访问相同的生成技术。现在 Copilot(copilot.microsoft.com/labs/experiments/copilot-3d)甚至提供了一个简单的图像到网格的功能,Meta 的新选项SAM 3D(ai.meta.com/sam3d/)看起来非常有前景。

图 7.50 – SAM 3D 是新的,但还不是完整的解决方案,但到目前为止看起来不错
这个空间将会进一步变化,所以如果你需要 3D 网格生成,尝试目前可用的任何免费试用,探索最新的生成模型,看看哪一个最适合你。
有趣的是,类似的技术(基于高斯斑点)在现代苹果设备上得到应用,可以将任何照片转换成简单的 3D 空间场景,并能够响应设备移动。在 2026 年操作系统版本中,这比之前苹果 Vision Pro 版本中的空间照片功能更为先进,后者仅提供左右移动。空间场景允许在所有维度上移动,并且可以非常有效。苹果在这个领域的最新研究令人印象深刻(machinelearning.apple.com/research/sharp-monocular-view)。
你可能想知道 ChatGPT 是否可以帮助。虽然它不能直接帮助,但它提供创建一个离线运行的脚本来执行相同任务。虽然专门的网站可能产生更好的结果,但如果你需要大量模型并且不介意运行一些代码,这可以是一条可行的路径。不过,我们将在本书的后面部分更详细地探讨脚本方法。现在是时候结束这一章了。
摘要
如果你正在制作 AI 图像,你现在应该对如何获得最佳结果有了更清晰的认识,无论是通过编写更具表现力的提示,还是为 AI 提供模仿的图像示例。你将了解几种方法来获取你需要的,以帮助你在创意工作中,无论是用于原型设计,还是用于成品图像,或是矢量资产。
生成图像可能会带来道德问题:一些是新的,一些不是。在不涉及摄影师和插画师的情况下,使用 AI 生成不太重要的图像是否合适?这取决于你和你客户。
在构思、头脑风暴和情绪板中使用 AI 是否合适?如果它能够提供信息而不直接成为工作的一部分,那就完全没有问题。借鉴是创意过程的一部分,只要你不试图剽窃他人,就应该没问题。从想到某个东西到看到那个愿景的不完美版本之间的差距从未如此之短,我立刻就能看到它如何改变了我参与的项目中的构思过程。
这里正在发生一场革命,但我认为它不会像现有的股票网站和模板设计那样取代艺术家。探索这个新领域值得你的时间。
接下来,从煎锅跳进火坑——我们将生成 AI 视频。
|
获取本书的 PDF 版本和独家额外内容
扫描二维码(或访问packtpub.com/unlock)。通过名称搜索本书,确认版本,然后按照页面上的步骤操作。 | 
|
| 注意:请妥善保管您的发票。直接从 Packt 购买的商品不需要发票。* |
| --- |
第八章:视频生成式 AI
让我们从现实开始:生成式 AI 视频在技术上令人印象深刻,但它无法取代大多数由人类制作的视频。如果你目前正在为客户拍摄视频,你可以期待在一段时间内继续这样做。确实有一个 AI 革命,但它发生在其他领域,并且不太可能接管主流视频制作。
初看之下,AI 的输出可能看起来很棒,那些自己不拍摄视频的人可能会突然兴奋,也许他们不需要雇佣任何人来为他们制作视频。对大多数人来说,这种感觉不会持续太久。最广泛分享的样本视频是一些看起来还可以的视频,但大多数镜头在某些方面都有缺陷,即使是使用最新模型制作的也不例外。
完全由 AI 生成的视频具有所有照片的问题(奇怪的解剖结构,过度平滑)以及更多自身的问题:运动、音频和分辨率问题,仅举几个例子。在镜头中保持一致性很难,说话很难,自然运动很难,最重要的是,通常什么都不会发生。
在 AI 制作的视频中,任何动作都有实际后果的情况很少见,比如咬一口热狗后看到热狗变小。人们可以站在那里稍微动一下,但他们没有动机,没有背后的推动力。人们可以说话,但他们不能做任何重要的事情。
因为一切都是对另一帧或最佳猜测的模仿,所以没有像现实生活中那样的底层共同结构,这在视频环境中——连贯性很重要——比在静态摄影中是一个更大的问题。
总的来说,大多数视频都涉及特定的人物或特定的地方。如果你拍摄那个人或访问那个地方,连贯性是免费的。大多数 AI 镜头都是通用的:一个咖啡馆,而不是一个特定的咖啡馆;一个随机的人,而不是真正的员工。如果你的目标是讲故事,捕捉人们在其间移动和改变现实的一些版本,那就去拍摄吧!AI 视频并不是解决这个问题的最佳方案。
这并不意味着一切都糟糕。如果你把 AI 当作一个特效引擎,允许你在特定方式上玩弄现实,以增强现有的镜头,它可能做得很好。也有可能创造出一些无法拍摄的独特镜头,而最新的模型在之前的基础上又迈出了一大步。
一些想法是相当可行的,比如一个静态图像的动画版本,运动幅度最小。可以从同一张图像中创建几个视频,然后将这些片段编辑在一起,创造出一种常见的广告中的蒙太奇。如果你保持镜头长度短,不试图做太多,就有办法制作出在可能范围内表现良好的 AI 视频。
重要的是要意识到,许多生成服务并不是针对创意人士,而是针对他们的雇主。确实,那些试图完全排除创意专业人士的客户可能会被使用像 Creatify (creatify.ai) 这样的服务所吸引。这个网站不仅提供个人视频创建服务,还提供 自动化 视频广告创建服务,首先分析你的网站,然后将其与模板混合,创建一个传达信息的 AI 头像。到目前为止,我发现你向 AI 要求得越多,错误被放大得就越高,所以我并不被一站式解决方案所打动。
不幸的是,许多最明显的全 AI 视频实际上是 糟糕 的视频。那些对没有图形设计或模板化图形设计感到满意的客户,对 AI 制作的头像阅读 AI 编写的剧本,对迅速学会将 AI 视频与骗局、廉价广告和低质量产品联系起来的观众来说,也感到满意。
同时也存在潜在的道德问题:非常少的模型能保证“商业安全”。Adobe 的 Firefly (firefly.adobe.com) 和 Moon Valley 的 Marey (www.moonvalley.com/marey) 是这样的,但大多数其他模型无法或不会声明它们的模型仅使用允许的媒体进行训练。传统的创意构思过程往往对现有作品采取自由态度,但在最终产品中?这可能对某些项目来说根本不是一种选择,你需要自己考虑道德影响。
2025 年 8 月,Netflix 发布了一套关于 GenAI 的指导原则 (partnerhelp.netflixstudios.com/hc/en-us/articles/43393929218323-Using-Generative-AI-in-Content-Production),虽然所有内容都值得一读,但第 4 点非常直接:
生成的素材是临时的,不属于最终交付成果的一部分。
我们显然不是为 Netflix 制作内容,但这是一种相当直率的说法——GenAI 对于临时工作是可以的,但不是最终产品。这并不意味着 GenAI 视频没有用,但不要被任何销售如何使用 AI 视频生成课程的点击诱饵所迷惑。这里有很大的潜力,但 AI 并不能完全取代摄像师。
相反,AI 有能力为视频专业人士提供新的工具来制作不同类型的视频,增强他们目前正在制作的视频,并修复常见问题。
在本章中,我们将探讨这些主题,每个都比上一个更具挑战性:
-
扩展现有剪辑
-
从文本提示创建视频
-
从参考图像创建视频
-
从参考视频和音频创建视频
-
转换现有视频
没错——实际上创建新视频比修改现有视频要容易。让我们从现在只有 Premiere Pro 能做到的一个技巧开始:使剪辑变长。
扩展现有视频
Premiere Pro 允许你将剪辑延长到其结束之后,根据你制作的视频量,这可能会非常令人兴奋,也可能完全无关紧要。如果你已经是视频专业人士,你会知道其中的门道:按下那个大红色录音按钮开始提前录制,在动作开始之前很久,直到动作完全结束之前不要再次按下那个按钮。
同样,你的屏幕上的表演者——可能就是你!——也应该了解他们的工作。无论谁在说话,都需要在句子之间留下间隔以供编辑,在结尾时,他们需要至少保持他们的最终位置和表情几秒钟。他们真的不应该立即看向屏幕外询问这是否是一个好的拍摄。
但有些人确实会犯这些错误。并非所有情况都是完美的,并非每个人都了解规则。这也不总是取决于才华。有时可能会有技术故障,在动作即将结束时破坏了原本很好的拍摄(迫使你缩短剪辑),或者你得到的剪辑本身就不够长。如果你需要在结尾处额外一秒或两秒的视觉内容,但拍摄结尾不好,你该怎么办?
一种可能的方法是使用剃刀或刀片工具将剪辑的最后几帧分离出来,然后减慢这个微小片段的速度。使用 Final Cut Pro 的超级慢动作功能可以获得最佳结果,而使用所有现代非线性编辑软件中找到的光流技术可能得到可接受的结果。但可能不会很出色。
如果你拥有 Premiere Pro,你可以使用新的 生成扩展 工具简单地修剪剪辑的末端一小部分到右边,或者修剪剪辑的起始部分一小部分到左边。大多数常见媒体格式都受支持:720p、1080p、UHD 或 DCI 4K 分辨率,横屏或竖屏,最高 30fps,8 位 SDR。阅读此页面以获取有关当前要求的更多详细信息 (helpx.adobe.com/premiere-pro/using/generative-extend-faq.html)。
由于这个功能是内置的,因此无需通过网站上传或下载剪辑——剪辑将神奇地固定在你现有的时间轴上,新的资产将存储在你的项目旁边,在一个名为 Generative Assets 的新文件夹中。如果你希望将文件存储在其他地方,请在 文件 > 项目设置 > 临时磁盘 中进行更改。
到目前为止,一切顺利,但也有一些限制。视频扩展的最大时长目前为两秒,结果(正如你可能预期的那样)并不完美。你可能注意到亮度变化、闪烁、细节丢失、运动不流畅,或者在颗粒感强烈的片段上过度平滑的问题。你尝试得越少,失败的可能性就越小。
你可能会在音频上使用生成扩展时更有运气,因为其持续时间限制是 10 秒而不是两秒。然而,你不能扩展对话或音乐,只能是环境音,而且你需要一个至少已经持续了三秒的剪辑。
这个功能的一个真正问题是,生成视频是一个付费功能,不是免费的,并且它可能会消耗你相当一部分的生成信用。为了创建一秒的 4K 30fps 视频,你需要支付 175 个信用点,而 720p 24fps 的视频每秒只需 50 个信用点,音频生成每次需要 10 个信用点。然而,这比在单应用计划中使用 Photoshop 的生成填充功能所需的 1 个信用点成本要高得多。
你可以使用多少?在美国和其他国家可用的标准 Creative Cloud Pro 账户包含 4,000 个信用点,这不足以充分使用这个功能。如果你在处理 4K 视频,你一个月将得到 22 秒的生成扩展。记住,作为一个“高级”功能,它不对单应用订阅者开放,只对拥有所有应用的用户开放。还要记住,每次生成都会消耗信用点,所以如果你对第一个结果不满意,你可能需要支付多次。
虽然生成扩展有时可以帮助你摆脱困境,但在其他时候,创建一个根本不存在的镜头可能更合适。让我们来看看。
从文本提示创建视频
我们已经看到了从文本提示生成图像时可能出现的多样性。考虑到视频生成中涉及的变量数量增加,请仔细考虑你的视频生成提示。
一些 AI 提供商,包括Canva AI(canva.com/ai),提供了下拉选项来帮助你指定重要的偏好,如风格、宽高比和焦距。

图 8.1 – Canva AI(使用 Veo 3)为你提供了几个选项来指导你的视频生成
如果你心中有一个非常具体的镜头,你可能需要提供一个详细的提示以确保你得到你想要的结果。简单的提示可能适用于发展想法或添加到情绪板或故事板,但你的愿景越清晰,你的提示就应该越长。

图 8.2 – Canva 的示例提示对于激发灵感很好,但这样的高级提示每次生成都可能产生截然不同的结果
除了技术考虑之外,务必指定您是想包含多个镜头还是单个镜头;Sora (sora.chatgpt.com,使用版本 1,而不是版本 2) 如果您没有指定一个不间断的单个镜头,有时会生成由多个单独镜头组成的视频。目前大多数文本到视频模型都不包含任何音频,但这种情况越来越普遍:Grok、Sora 版本 2(来自 OpenAI)和 Veo 3(以及更高版本,来自 Google)可以生成背景音频和对话。
注意,一些模型,如 Veo 3 及以上版本,可以通过许多不同的提供商获得;它可在付费的 Gemini 计划中获取,也可以通过 Canva、Firefly、Creatify 等其他途径获取。然而,一些模型只能通过特定的提供商获得,例如 Act-Two,只能在 Runway 上找到。如果您喜欢某个特定的模型,它可能可以通过多个提供商获得,因此请四处寻找适合您需求和预算的价格和界面。
大多数提供商提供的视频最大分辨率为 720p,尽管一些提供商的高端计划可以提供 1080p。今天,大多数生成内容是以 24fps 创作的,所以如果您需要更高的帧率,您需要使用第四章中讨论的重新定时技术。如果您需要更高的分辨率,缩放技术可能会有所帮助,但它不是魔法,与使用传统相机拍摄的视频相比,今天的 AI 视频通常看起来比较模糊。
虽然高质量图像生成在多个提供商中广泛可用,但视频生成还不够成熟,旧模型更可能出现缺陷。生成没有人的通用股票风格无人机镜头相对容易,但像这样的真实镜头在股票网站上很容易找到。

图 8.3 – 这两个通用的无人机镜头,来自 Sora,都是可用的
如果您想要简单、基本的镜头且质量相对较低,使用简单的文本提示可能会有所帮助。然而,一旦您要求更复杂的内容——例如两个人跳舞——物理动作的问题,甚至过度眨眼,都可能毁掉镜头。一致性也可能成为问题,镜头中的人越多,您遇到问题的可能性就越大。
我提示了“一个微笑的现代情侣在夜总会中跳舞,周围有观众,在黄金时段”,结果出现了混乱。在生成的视频中,有时一个人的肢体会消失。整个人的出现或消失可能是随机的,当其他人出现在他们前面时。有时,如果您真的很不幸,当某人的头旋转时,另一张脸出现在另一边。这可能会让人做噩梦。

图 8.4 – 有多少条手臂?它们是如何移动的?
在测试了 Veo 3(通过 Canva)、Sora(v1,通过 ChatGPT)、Vidu (www.vidu.com)和 Firefly 之后,我发现 Veo 3 最有用,但它并不总是很好,其他选项也值得尝试。对我来说,Firefly 产生的结果最不可信,人脸模糊,角色不一致,而 Sora 提供更逼真的图像,但其不自然的身体动作可能会让人不安,它也不总是足够紧密地遵循你的指示。Vidu 也出现了不可预测性,有时当角色相互移动时,会创建消失的角色。
考虑到所有这些模型在合成复杂人类动作方面都遇到了困难,我们可以推断这是一个难以解决的问题。我相信所有这些模型都会进化,当然,还有其他模型(如 Wan 和 Seedance)可供选择,但从我在网上看到的情况来看,它们在人物和动作方面都存在类似的问题。由于我今天可能得出的任何结论很快就会过时,所以我不会给出任何关于你应该先尝试哪个的明确建议。尝试几个,如果无法得到好的结果,再尝试另一个。
今天,虽然 Veo 可以产生大多数情况下可信的结果(Veo 3.1 比 Veo 3.0 有所改进),但使用它并不便宜。虽然看起来 Veo 的有限版本将成为 YouTube 的一部分免费提供,但这尚未实现,而且免费生成似乎将被限制在 480p。当它公开时,应该是一个免费实验的好地方,因为 720p 及以上生成是昂贵的。
在标准的 Canva AI 计划中,你每月只能创建五个视频——这几乎不足以对其进行充分测试。通过 Firefly,Veo 3.1 一代需要 400 积分,因此如果你没有使用其他高级 AI 功能,Creative Cloud Pro 计划中包含的 4,000 个生成积分也仅能让你每月制作 10 个视频。这些费用经常变化——最近它们翻了一番——所以请查看当前的费用。
由于 Veo 3 可以在其输出中包含这样的帧,我不确定这是否值得:

图 8.5 – Veo 3 比其他产品好,但不擅长复杂动作
对于更广泛的实验,如果你有 ChatGPT Plus 账户,Sora 视频生成将提供无限访问,尽管在繁忙时段可能会有延迟。一些服务,如 Runway,在其顶级计划中提供“轻松”(即“慢速”)模式下的无限视频生成,如果你想要更全面地探索,这类服务将非常重要。
精确的提示
如果你提出简单的请求,例如一个人站立微笑,或者蒸汽从通风口升起,那么从文本提示中创建相对干净的结果是可能的,但你仍然不总能得到你想要或需要的结果。
为了最小化所需的生成次数,通过精确定义你的要求来限制不确定性。例如,如果你不说你想要多少镜头或什么类型的镜头,你可能会得到一个跟踪镜头,或者一个静态镜头,或者三个镜头剪辑在一起——如果你想要的是“一个没有剪辑的单个静态镜头”,那就要求它。
虽然这并不总是足够的,因为模型并不总是理解你想要什么。要求“一个人站在原地,摄像机移动”可能会导致混淆,如果模型不知道如何做某事(例如“磨刀”),要求具体发生某事可能会导致意外结果。
区别特征也很重要。如果你没有要求具有特定特征的人,你会得到一个普通的结果。在这里,我要求 Sora 给我一个“冒险家”,却收到了两个完全不同的男人。虽然这在头脑风暴的背景下可能可以接受,但如果我心中有一个特定类型的人,我应该要求它。
然而,即使你提出了要求,这也不总是足够的。我要求一个跟随进入丛林中的冒险家的摄像机,但那不是我得到的:

图 8.6 – 第一段视频开始得很好,但角色随后向后走;第二个角色从未移动——这也不是我想要的
尽管一个模型可能并不总是理解所有内容,但提供详细的要求很重要,因为任何留给机会的东西都会回到“默认”状态,它们可能在更大的上下文中没有意义。以下是一个没有填满足够空白的提示:
A model stands on a deserted city street, leaning against a lamppost, swinging a bag slowly

图 8.7 – 使用此提示的八次尝试中的六次,只有一次(左中排)是准确的
我使用 Sora 使用相同的提示生成了八个视频,每次都产生了:
-
一位穿着大衣的女性模特,尽管我没有指定性别或服装
-
夜间,尽管我没有要求特定的一天时间
-
广角镜头,尽管根据提示这似乎是一个合理的选择
-
欧式街道,带有复古路灯
背包的风格确实在每一帧中都有所不同,但只有两代显示了它缓慢摆动,只有四代实际上显示了模特按照要求靠在路灯上。在其他情况下,她站在附近,抓住它,融入它,或者奇怪地绕过它。路灯的位置也很随机。在八次尝试中,只有一次单独的生成显示了我要的东西;详细描述并不总是足够的。
你可能更成功于请求抽象图像,无人的镜头,因为那些请求不会落入“人但不够人”的奇异谷。然而,我们不仅熟悉人类动作;我们熟悉所有类型的动作,而通常 AI 模型并不理解一件事物如何影响另一件事物。如果你要求一只蓝色鞋子掉入一池绿色粘稠液体中,鞋子有时会一致地掉落,但只有有时能正确地与液体接触。

图 8.8 – 这只蓝色鞋子掉落了,但它与空气碰撞后弹起,溅起水花,然后继续掉落
为了解决这些问题,你可以提供更长的提示,尽可能详细地说明你想要和不需要的内容。如果你使用 Veo 3,这将包括对话和音频提示,可能长达几段。从 Gemini 网站(gemini.google/overview/video-generation/),以下是 Veo 3 的一个示例提示:
A follow shot of a wise old owl high in the air, peeking through the clouds in a moonlit sky above a forest. The wise old owl carefully circles a clearing looking around to the forest floor. After a few moments, it dives down to a moonlit path and sits next to a badger. Audio: wings flapping, birdsong, loud and pleasant wind rustling and the sound of intermittent pleasant sounds buzzing, twigs snapping underfoot, croaking. A light orchestral score with woodwinds throughout with a cheerful, optimistic rhythm, full of innocent curiosity.
A wise old owl and a nervous badger sit on a moonlit forest path. "They left behind a…a 'ball' today. It bounced higher than I can jump." the badger stammered, trying to comprehend it. "What manner of magic is that?" the owl hooted thoughtfully. Audio: Owl hooting, badger's nervous chitters, rustling leaves, crickets.
A wise old owl flies away out of the frame and a nervous young badger runs in a different direction out of the frame. In the background, you can see a squirrel hurrying past making noise of rustling dried autumn leaves as it goes. Audio: birdsong, loud and leaves rustling, and the sound of intermittent pleasant sounds buzzing, twigs snapping underfoot, and the sounds of squirrels scurrying through the dried autumn leaves. The sound of an owl hooting in the distance, badger's nervous chitters, rustling leaves, crickets, sounds that are full of innocent curiosity.
尽管输出视频在技术上令人印象深刻,但使用 AI 一次性完成所有操作并不能产生专业级别的结果:动作僵硬,对话表情不够好,环境声音有循环问题,整体镜头只讲述了一个故事的一小部分。
更糟糕的是,因为这个不是使用传统的动画或音频制作流程创建的,这些元素中的任何一个都无法以可控、可预测的方式进行微调或调整。它无法扩展到完整的生产。
作为原型,这没问题——但说实话,我更喜欢故事板中的静态图像。我更愿意想象最终镜头可能的样子,而不是被这种方法带来的必然问题所分散注意力。
如果无法实现复杂且可控的镜头——今天,这是不可能的——仅凭文本提示讲述任何长度的连贯故事几乎是不可能的。但这并不意味着这项技术在专业环境中没有用。由简短、简单的镜头组成的蒙太奇风格广告是可行的。一部由一群奇怪角色各自说一句话的短片?当然可以。一个充满特效的未来梦境序列?是的。如果你的项目能够发挥工具的优势,你就能取得成功。
考虑到这一点,大多数真实项目需要更多的控制:一个特定角色穿着特定的服装,在特定的地点。镜头之间的连贯性也非常重要:多个镜头通常需要展示相同的角色,穿着相同的衣服,在相同的环境中。你不能用“一只猫头鹰”在“森林里”来构建一部真正的短片——细节很重要。
我们已经使用模型生成现有图像的变体,这种方法也适用于一些生成式视频模型。为了在镜头之间获得更大的连贯性以及更精确的控制最终输出,我建议使用参考图像。让我们试试看。
从参考图像创建原始视频
文本提示留给机会很多,但提供与文本提示一起的图像可以为视频生成提供一个锚点来引导。虽然可能还需要多次生成才能准确遵循详细提示,但人物、服装和环境都应该与参考图像相匹配。
Firefly 将其作为图像到视频功能的一部分提供,目前可以使用他们自己的 Firefly 视频模型,或者使用 Veo 2 或 Veo 3。请注意,使用 Firefly 模型时,可以提供构图参考视频、相机参考视频或第一帧,但一次只能使用这些中的一个与文本提示一起。还可以通过点击提供的几个缩略图之一来选择风格(如插图)。

图 8.9 – 向 Firefly 提供构图视频很有用,但没有图像伴随,提示无法提供足够控制
不幸的是,因为 Firefly 模型不能接受与构图视频一起的图像,所以每次使用提示进行尝试时,你都会消耗掉一次视频生成的信用。如果你改为切换到 Veo 3 模型,则只能提供第一帧——没有构图参考——并且你必须将风格作为提示的一部分指定。
在一个理想的世界里,我希望提供起始图像和跟随的性能视频,但这个工具目前还无法做到这一点。在本章的后面部分,我们将介绍Runway 的 Act-Two,它可以做到这一点,但有几个服务能够接受与描述发生情况的提示一起的图像。
使用一个参考图像作为起始帧
考虑到 Grok 让你生成图像并将其转换为视频的速度,我认为尝试早期的在荒凉街道上的模型提示可能值得。在前一章中讨论过,Grok 擅长数量,并允许你简单地向下滚动以生成更多图像。
大多数图片并不完全符合我的预期:街道并不荒凉;人行道和道路常常没有意义。在向下滚动了一段时间后,我找到了一条荒凉的街道,尽管系统的创造性随机性已经将我最初的提示改为请求亚洲模特。

图 8.10 – Grok 创建的一些早期图片,以及第一条荒凉街道
通过在画廊视图中图像上可见的播放按钮,很容易从图像生成视频。当图像正在动画化时,播放按钮会被一个进度百分比读数所取代,创建视频大约需要 10-15 秒。如果你点击一个图像进入单图视图,请使用图像下方的制作视频按钮。
然而,无论哪种方式,原始提示仅用于创建静态图像,在生成视频时将被忽略。经过多次尝试,模型通常是在四处走动而不是摆动她的包。
为了更接近原始提示,将原始提示复制到你的剪贴板,点击图像进入单图视图,按 制作视频 按钮,然后快速重新提示视频生成,通过粘贴原始提示并再次按 制作视频。这确实产生了一个摆动的包,但显示的动作与其他 AI 视频模型常见的非现实身体动作相同:

图 8.11 – 从技术上讲,这种动作是可能的,但它不自然
由于原始图像中很少有符合我的提示,仅使用 Grok 可能难以实现特定结果,但你可以上传自己的图像作为动画的起始点,而不是 Grok 的生成。我已经用几个模型测试过,结果参差不齐。
在萤火虫中,使用带有文本提示的起始图像,我尝试给这张图像添加一些微妙的动作,从之前的图像生成扩展到 16:9:

图 8.12 – 我们能否将这张静态图像转换成简单的动画?
在大多数细节由图像提供的情况下,我使用了简单的提示:自然微妙的微风动作,摄像机从左到右缓慢移动,女人保持静止
不幸的是,这还不够,结果显示出较差的 提示遵循度——也就是说,模型未能遵循我的指令。大多数时候,女人开始行走,Firefly 的所有生成都无法保持她的外观。为什么?
人工智能系统不会像人类那样理解你的请求,使用包含“动作”和“移动”的提示更有可能创造出那样的效果,尽管还有额外的请求要求主题保持静止。使用“平移”而不是“摄像机移动”可能有所帮助,但我认为对于表达不完美的指令应该得到执行。
其他工具的表现如何?
Canva AI 也使用了 Veo 3,并在多次测试中遇到了与 Grok 相同的问题——行走而不是静止——Runway ML 的视频生成也有同样的问题,但增加了过多的眨眼和弹跳动作。Higgsfield (higgsfield.ai),和其他工具一样,给了我一个角色行走的视频。它提供了比 Runway 更自然的动作,没有额外的眨眼,但并不是我想要的。图像到视频是一个常见的流程,许多平台都支持,所以如果你已经与 Freepik 或 Envato 等提供商有计划,探索可用的模型。
在另一个类似的提示尝试中,Firefly 的增强提示选项将“女孩”改为“年轻女孩”,这迫使我们的角色在整个剪辑中变年轻。是的,细节可以帮助,但错误的细节会毁掉你的工作。要么确保“增强”提示确实符合你的要求,要么完全禁用它。

图 8.13 – 首先,她走开了,然后她变年轻了
使用两张参考图像作为起始和结束
在 Firefly 的任何模型中,如果你提供了一个起始帧,你也可以提供一个可选的结束帧。通过在标志和空白帧之间过渡,这可以用来创建有趣的过渡,但大多数电影制作者会想用它来控制地移动摄像机。如果你通过提供起始和结束帧来计划摄像机运动,模型可以将它的虚拟摄像头移动以填补空白。
不幸的是,并不是总是容易创建那个最终帧,因为并非所有的图像生成模型都足够一致,能够用不同的构图保持相同的角色和设置。Sora 多次未能创建同一人的近距离视图,而更一致的 Gemini Flash 2.5(又名 Nano Banana)做得更好。
使用这种策略,可以创建一个第二、更近的图像,然后调整提示以反映变化:自然的微妙运动,轻风,摄像机靠近,女人站立不动

图 8.14 – 一张起始帧和一张结束帧,这应该能行得通?
这个在 Veo 3 上失败了,生成了一段视频,它从第一帧到更近的帧使用了交叉溶解效果——不是我的帧!——在那里一个看起来相似的女人走开了。我不确定更详细的提示在这里是否有帮助,因为即使是我的简单指令也经常被忽视。其他用户似乎在提示遵守方面遇到了类似的问题,但并非所有提示都有问题,也不是所有模型在这方面都做得不好。
Midjourney (www.midjourney.com/) 也能产生良好的结果,通过允许你从视频的最后帧扩展——可能多次——使这个过程变得简单。虽然这看起来像是一个简单的用户界面调整,但正是这些小细节可以让困难的事情变得容易得多。
Vidu (vidu.com) 能够通过简单的提示从第一帧和最后一帧生成良好的结果,就像你预期的那样,通过缓慢的缩放移动其虚拟摄像头。

图 8.15 – Vidu 很好地完成了从一幅图像到下一幅图像的过渡
使用多张参考图像进行控制
在另一个有用的界面调整中,Vidu 允许你通过在提示中明确引用多张图像来创建视频:

图 8.16 – 如果你想看看元素如何协同工作,这是一个实现这一目标的好方法
这种极其强大的方法让你可以从一张图片中混合一个角色,从另一张图片中混合一个物体,从第三张图片中混合一个地点——这正是创意过程中有用的控制类型。

图 8.17 – Vidu 在视频中出色地结合了这三个元素
Vidu 在第一次尝试就完美地完成了这两个请求,如果需要更多控制,这将是我会返回的平台。公平地说,我的动作请求很简单——Vidu 的角色还不能跳舞——但鉴于一些其他模型无法让人物可靠地保持静止,我将这视为一次胜利。Veo 3.1 也提供了这一功能,允许你提供“成分”以成为生成的一部分,但 Vidu 界面的精确性确实非常有帮助。
使用 Sora 进行简单和复杂的混音
如果你不需要那么多的控制,并且可以更加灵活,Sora (sora.chatgpt.com/explore,通过 ChatGPT Plus 计划) 允许你上传参考图像以供指导,然后以类似 Firefly 的方式描述视频中的事件。对于 cinemagraph 风格的效果,将静态照片转换为缓慢移动的视频,这可以很好地工作。我尝试使用相同的图像进行了前两个提示,至少有一个提示生成是可以接受的——成功率更高:

图 8.18 – 使用 Sora 进行多次混音请求
更冒险的混音请求可能会以类似文本提示的方式失败。当我尝试 女孩在慢动作中旋转,同时摄像机缓缓升起 时,结果包括与之前跳舞文本提示相似的恐怖身体效果,而且摄像机的移动指令也被忽略了。
在规划一个镜头时,无论是否包含人物,请记住,大多数这些 AI 模型都不理解大多数事物是如何相互影响的。食物不会被消费,饮料不会被喝,如果你要求一颗流星撞击山体,并让火球摧毁一切,它不知道这应该如何运作。
我使用 Sora 创建了两只恐龙和一颗流星坠落静止参考图像,生成的插图图像很棒。然后我要求 Runway 对其进行动画处理,使用以下提示:一只 Diplodocus 和一只 Stegosaurus 正在吃植物,在一个开阔的草原上,背景是山脉,一颗巨大的流星撞击山脉,火球扩散到整个场景。

图 8.19 – 在这个视频中,流星变成了喷火器——这并不是这些物体应有的行为
这样的例子揭示了可能导致从静态图像生成的视频出现缺陷。本质上,生成式视频模型并不理解导致图像出现的情况,也不了解之后会发生什么。在这张图片中,流星后面的条纹是尾迹,而不是火源,山体是因为流星的力量而破裂;它不是一座喷发的火山。如果你要求一个厨师磨刀的视频,他们应该使用工具,而不仅仅是用手:

图 8.20 – 一个微笑的厨师,通过将手靠近它来磨刀
无论你是否在创建包含人物的视频,让事情发生都是一个挑战。虽然有时你可能运气好,但以如此低的成功率反复提示和重新提示的成本太高,也太耗时。如果你有耐心,可以考虑一个允许无限生成的网站计划,即使速度较慢。Runway 的最高级计划允许这样做,Sora 也是如此。
Sora 允许无限量的水印 720p 生成,对于原型来说,这些限制是可以接受的。不幸的是,你需要订阅顶级的 200 美元/月的美国计划,才能生成没有水印的更长 1080p 视频,但一致性和质量仍然不能保证。
如果 Sora 的生成效果足够好,尝试重剪功能,这允许你定义时间线不同部分发生的事情。考虑到长度限制,你可能更喜欢在视频编辑应用程序中组合单独的镜头。

图 8.21 – 从之前生成的视频中,我缩短了结尾并请求不同的动作
虽然我对这个功能的结果好坏参半,但能够精确控制特定时刻发生的事情通常很重要,这个功能值得一试。但不是每个工作都需要完全的手动控制。如果你愿意使用预构建的模板,你可以考虑一个完全不同的解决方案。
使用预设来动画化参考图像
Higgsfield 包含一些令人印象深刻的预设,称为Higgsfield 应用,每个都包含一个简单且引人注目的效果。虽然编写自己的文本提示显然更加灵活,但这里的权衡是承诺更高的提示遵守度。你提供一张人的照片,然后从复杂到让那个人被海怪攻击,或者简单到让那个人吃香蕉的选项中进行选择。如果其中之一提供了一个将图像转换为视频的吸引人的方式,并且它还没有被广泛使用,那么它可能效果很好。

图 8.22 – 是的,它们是预设,但它们很酷
当然,你不必从头开始创建,或者从静态图像开始。一些工具允许你使用现有的视频,利用 AI 作为效果引擎,这可能会在很大程度上消除过程的不确定性。让我们来看看。
从参考视频和音频创建新视频
如果你有一个干净的对话录音,但需要那些话由屏幕上的人物说出,这是可能的吗?或者你可能已经录制了一段面向摄像头的片段,带有常规的人类表情和手势,但你想用其他人或卡通人物来替换?这两件事都是可能的。
使用数字虚拟人音频文件
HeyGen 允许你上传一个音频文件(或直接在网站上录制),然后让一个数字虚拟人说这些话。提供预制虚拟人,或者为了更多的控制,你可以上传你想要看到说话的角色照片,或者一个可以从中创建数字孪生的更广泛的视频。请注意,如果你创建自己的虚拟人,你需要有权使用过程中涉及到的图像或视频。还有其他提供者——Higgsfield 提供了与自己的模型一起使用的 Lipsync Studio 功能,以及 Veo 3 和 Kling 的模型。
注意:HeyGen 和 Higgsfield 都愿意从脚本中生成音频,尽管你可能会从真实的音频录音中获得更好的结果。我们将在下一章回到生成音频。

图 8.23 – HeyGen 可以根据你的照片或绘画创建一个说你的话的虚拟人
我看到所有基于虚拟人的服务的问题在于它们相当机械。我发现它们要么过度强调手势,要么不够使用手势,结果感觉不真实。虽然我可以理解与摄像头对话不是每个人都拥有的技能,但到目前为止,AI 虚拟人是对人类的一个糟糕的替代品。
好吧。那么,如果你录制了一段带有音频、手势和面部表情的摄像头片段,然后让它看起来像另一个人呢?
使用 Runway Act-Two 进行性能迁移
Runway (runwayml.com) 使用他们自己的 Gen-4 模型,有一些独特的服务可以帮助你将现有的视频转换成非常不同的东西,我们将从 Act-Two 开始。这个工具允许你拍摄一个人上半身的视频,然后将其表情、口型和手势转移到 AI 生成的角色上。(Act-One 使用动画角色做了类似的技巧,预计未来还将有 Act-Three)。一般来说,这种技术被称为 姿态迁移,WAN Animate (wan.video/blog/wan2.2-animate) 和一些其他提供者也提供这项服务——我预计它很快就会更广泛地可用。
为了测试第二幕,我录制了一段 1080p 的快速视频,视频中我说了几句话,然后在 Final Cut Pro 中剪辑并清理了音频——仍然需要一些视频编辑知识。接着,我使用 Sora 生成了一张教授的形象,然后用 Photoshop 将其扩展到 16:9,并将这两者都上传到了 Runway。请注意,你也可以上传一个角色视频而不是静态图像,但如果这样做,Act-Two 只会调整面部表情(而不是手势)。

图 8.24 – Act-Two 无需提示,只需一个表演视频和一个角色图像或视频
那么,它是否有效?好消息是教授确实准确地复制了我的动作,并且匹配得非常好。创建的视频是 720p,24fps,这并不完全符合我原始的 25fps 视频,但这是可以管理的——你可以在 Runway 上这里进行放大,并在需要时在编辑应用程序中调整速度。

图 8.25 – 姿势已经正确转移,结果相当可用——但请保持双手空置
这里有一些提高结果的小贴士。首先,你应该尽可能匹配你的外观视频和角色视频的姿势。如果角色拿着一个道具,表演者也应该拿着一个匹配的道具,但空手更可靠。在角色图像中,“教授”角色参考拿着一支记号笔,由于没有正确的方式在匹配我的手部动作时握住这支笔,所以笔变成了其他物体。
为了避免出现令人不安的 valley,尝试创建明显不真实的角色,例如卡通或明显是计算机生成的角色。我们知道人类应该是什么样子,但我们期望卡通角色和 CGI 渲染会有些奇怪。你可以让逼真的真人工作,但这更难。
虽然姿势转移很有用,但定位是您希望生成的视频几乎与原始视频完全相同的一个领域。视觉配音服务,包括 LipDub AI (www.lipdub.ai/) 和 Flawless (flawlessai.com/),能够将一种语言的视频转换为另一种语言,而不会出现配音时预期的任何不匹配。虽然大部分原始视频保持原样,但所有口型动作都被重新生成以匹配翻译后的对话版本。
在一部瑞典特色电影《看天空》中,原始演员用自己的英语部分重新录制,然后使用 TrueSync 再生视频以匹配。已经建立了一个系统来获得原始演员的批准,并且它与 Avid Media Composer 集成。在 LipDub 中,翻译的语音录音是用原始说话者的声音生成的。我们将在下一章回到生成音频,但如果翻译是你的重点,有针对你需求的服务。
Act-Two 的最佳之处在于它能够在不取代表演者的同时产生新的输出类型。在传统的制作中,动画制作成本非常高,如果客户坚持使用动画角色,这种方法可以在节省资金的同时,让人类艺术家负责角色的外观和动作。
当我们在看 Runway 时,他们还有一个独特的特性,承诺保留更多原始视频。让我们深入了解。
转换现有视频
Runway 的Aleph允许您通过提示转换现有的视频,保留大部分原始内容并得到高质量的结果。例如,包括风格转换;完全改变摄像机角度;改变环境、一天中的时间或季节;添加跟踪元素;移除物体和反射;重新照明;等等。
在上传我最近项目拍摄的无人机视频后,我要求改变一天中的时间到夜晚,并添加烟花。这不是我能轻易捕捉到的镜头——通常不允许在夜晚或烟花附近使用无人机。

图 8.26 – 我原始的无人机拍摄,变成了夜晚的烟花表演
令人印象深刻的是,前景中所有横幅和人物的位置都得到了保持。虽然有些细节被省略了,但这个结果是一个成功。一个限制是,因为输出仅为 720p,它需要升级才能接近我上传的 1080p 剪辑的清晰度,更不用说原始的 4K 剪辑了。幸运的是,这种升级已经内置到系统中,只需花费少量积分即可完成。这并不是魔法,但它帮助很大。
Aleph 的一个宣传特性是从图像的反射中移除摄像师,由于这可以是一个棘手的视觉效果任务,我试了一下。提供一部简单的 1080p24 手持 iPhone 视频和这里显示的提示,我抱有希望:

图 8.27 – 简单地要求它移除反射的人物,感觉就像是在寻求魔法
大约一分钟之后,结果返回了,虽然并不完美,但反射的人和他的手机确实被非常出色地移除了。分辨率不足,即使经过 4K 升级;与原始视频相比,一些区域缺乏纹理。镜子的侧面被平滑处理了,尽管不应该这样做,而且尽管这是一个小问题,但尽管有要求不要这样做,内部门把手还是被改变了。
你可能会想将新镜头的某些部分组合到旧镜头上,但由于两个镜头并不完全匹配——处理后的剪辑似乎跳过了一帧——这可能会比预期的稍微困难一些。原始和下载的剪辑之间的亮度也有所不同,这可能是由于 HDR 转换造成的,但这是可以处理的。

图 8.28 – 原始视频下方和上方处理后的几个帧——令人印象深刻
虽然五秒的最大剪辑长度限制了你可以做的事情,考虑到前面的问题,这仍然是一个不错的结果。这里的替换区域问题远没有完全重新构思镜头那样有问题,而且在很多情况下,质量限制是可以接受的。鉴于跟踪移除任务可能非常复杂,Aleph 可以作为一个更快、更便宜的替代方案。
跟踪的形式有很多种。作为另一个测试,我给 Aleph 提供了一个新的移动无人机镜头和一个标志,然后要求它“将这个标志添加到建筑右侧大空白区域的大圆形横幅上”。虽然跟踪本身没有问题,但标志并没有放置在正确的位置,而且标志本身被完全重新解释和扭曲。

图 8.29 – 那不是我给它的标志,也不是我要求的放置位置
另一个测试,尝试将鲸鱼添加到海边场景的背景中,完全不起作用。结果并没有增强原始场景,而是生成了一幅全新的、截然不同的画面。

图 8.30 – 创建的视频与原始视频几乎没有关联
对于 Runway Aleph 来说,结果混合。如果你有困难,另一种方法是使用 Sora 的混音功能对现有视频进行更改,但你需要将混音强度调低以避免完全改变视频。虽然 Sora 不能像 Aleph 那样改变日夜,但它可以添加鲸鱼:

图 8.31 – 是的,那是在波浪中鲸鱼的一个细微混音
Sora 的控制水平与 Runway 或 Vidu 等工具相同,因此您可能需要尝试几次才能得到可用的结果。无论您最终使用哪种系统,您可能需要将静态和图像输出与传统效果技术(如色键和跟踪)混合匹配。如果您无法使视频生成工作,可能可以通过生成静态图像并将其结合到传统视频中使用传统遮罩和跟踪技术来实现。但还有一个可能解决这个问题的方法。
EbSynth (ebsynth.com) 目前提供免费和付费计划,并且比我们迄今为止查看的大多数其他解决方案提供更多控制。以下是流程概述:
-
上传一个视频剪辑,然后浏览它以找到特定的帧。
-
通过在它上绘画或上传图像的部分或全部替换,或甚至选择帧的一部分然后请求替换,以某种方式更改该帧。
-
将该帧上的更改传播到整个剪辑的其余部分,添加的内容将像画在原始图像上一样被转换。
这个工具最吸引人的部分是它类似于常见的桌面视频编辑应用程序,包括用户界面中的时间轴、关键帧、工具和图层。如果您使用过 After Effects、Apple Motion 或视频编辑应用程序,您会很快理解它。

图 8.32 – 在这里,我在一个帧上画了一个红鼻子,然后在整个剪辑中传播了这个红鼻子
使用内置的绘画界面可以快速开始,但控制功能相当简单,更适合实验而不是完成的艺术作品。要使用像 Photoshop 或 Procreate 这样的应用程序中更广泛的可控功能,请下载当前帧并本地编辑您的图像。下载很简单:使用界面左上角的下载按钮,或在屏幕菜单中的另存为…选项(两者在先前的屏幕截图中可见)。
下载图像后,您可以应用整个图像的过滤器,然后上传这个新转换的图像。对于更具体的变化,您可以创建一个新图层,在该图层上添加一些新内容,然后将新图层保存为 PNG 并单独上传。新图像可以放置在原始图像的上方,并且更改将自动传播到整个剪辑中。
还可以使用生成图像模型转换现有帧的全部或部分。可选地,选择图像的一部分,然后点击其他工具右侧的生成图像图标。像平常一样提示(使用 Stable Diffusion 或 Nano Banana),将基于原始图像生成一个新的静态帧。您可以改变物体的颜色,将照片变成绘画,或进行任何其他您想提示的操作。

图 8.33 – 这个“蓝色头发”提示在帧 1 中使用,然后成功地在整个剪辑中传播
一个限制是,你实际上是在给原始图像添加油漆,而不是一个真正的 3D 对象。颜色变化可能成功,但如果你想在脸上添加一副太阳镜,当脸转向时,那些太阳镜看起来会更像身体油漆而不是应该的样子。物体越偏离原始框架,幻觉失败的可能性就越大,尽管可以通过添加更多的关键帧来更精确地控制效果。
尽管存在限制,EbSynth 仍然可以让表演者操纵数字替身,让插画栩栩如生,或者从真实人物的实时视频中添加或去除瑕疵或纹身。在撰写本文时,这个工具相当新颖,所以我不想得出任何明确的结论,但我确实喜欢它提供的控制水平,并看到了潜在的应用。
我们现在已经查看了许多工具和几个可能有用的工作流程。让我们回顾一下。
摘要
总体而言,尽管一些通用人工智能视频服务推荐起来太不稳定,但也有一些亮点:
-
Vidu 能够在第一帧和最后一帧之间实现一些令人印象深刻的转换,并且它还能够以可信的方式组合元素
-
Sora 在处理简单请求时产生了大部分良好的结果,尽管这些结果的可重复性较低
-
Runway 的 Act-Two 参考视频使声音和表演艺术家能够以新的方式使用他们的技能
-
Aleph 有时可以对现有视频进行真正有用的转换
-
尽管 EbSynth 是新的,但它的强大用户界面和独特功能集在适当的情况下可能非常有用
虽然我在这里测试的其他服务值得尝试,但我发现它们比我希望的更不可预测和难以控制,而可预测性影响成本。所有这些解决方案都是云端的,其中许多都太昂贵,无法反复提示。
它们的不可预测性意味着你通常需要执行多代才能获得良好的结果,而且即使是最高档的计划也包括严重的限制。一些昂贵的计划确实以更轻松的速度提供无限代数,而另一些则仅包括更多的付费积分,而重度用户会迅速消耗这些积分。
如果你想要使用 AI 生成视频,我建议你保持相对较低的期望,至少目前是这样。专注于创建用于原型设计的视频——在这里不需要完美——比创建客户可用的成品要容易、快捷、便宜得多。
在测试这些服务时,我遇到了重复的、破坏生成的错误,尽管这些问题最终得到了解决,但我无法连续几天使用某些服务。与静态图像相比,视频还有很长的路要走,这将是一个棘手的问题要解决。
在工作流程方面,虽然仅使用文本生成视频感觉像是一个魔术,但它并不适合较长的内容。为了获得更可预测的结果,我建议专注于图像到视频的工作流程,使用参考视频和音频,以及转换现有视频。
没有魔法按钮可以轻松让一切工作,你的期望越高,你可能会越感到沮丧。虽然这个领域将继续快速演变,但我并不期望进步是线性的,并且我怀疑输出在一段时间内将保持不可预测。
最后,当然还有其他可用的生成视频模型,尽管它们值得尝试,但大多数似乎都存在与我这里发现的问题相似的问题。一年后,或者有了新工具,或者有了不同的提示,你可能会得到非常不同的结果。每次运行都是不同的,每个人的需求都是不同的,模型也在不断更新。关注这个领域,但不要期望立即出现奇迹。
在下一章中,我们将通过音频的介绍来完善本书的生成部分,并且还有一些令人愉快的惊喜。
|
获取本书的 PDF 版本和独家额外内容
扫描二维码(或访问packtpub.com/unlock)。通过书名搜索此书,确认版本,然后按照页面上的步骤操作。 | 
|
| 注意:请妥善保管您的发票。直接从 Packt 购买不需要发票。* |
| --- |
第九章:带音频的生成 AI
在某些方面,AI 辅助的生成音频与生成视频同样存在不完美的问题,尤其是语音录音。尽管一些服务可以生成完全令人信服的对话,但大多数生成的是僵硬、不自然的语音。尽管如此,这个领域有令人惊讶的解决方案,其中一些可以改善甚至彻底改变视频或音频制作的工作流程。
今天的生成技术可以从各种文本和音频提示中生成语音对话、音乐和其他声音。与视频一样,人类在大多数情况下仍然能做得更好,尽管人类可能需要更长的时间并且成本更高。
如果一项工作真的值得做好,你应该雇佣人类。当然,不是所有的工作都是一样的,如果你预算或时间紧张,或者你只是想要一个临时音频文件以备将来替换,人工智能可能就足够了。毕竟,一个不完美的 AI 配音可能比编辑自己的声音更适合,这样就不会在客户审阅早期草稿时分散注意力。
但那是草稿音频——你能为最终输出使用生成 AI 吗?虽然使用 AI 语音或音乐进行广告活动可能会带来声誉风险,但使用不太完美的音频制作内部企业培训视频则不太可能引起人们的注意。
这里也可以选择混合方法。如果配音演员同意,使用人工配音的创意人员可以使用生成 AI 来纠正录音后发现的错误。并不是所有配音演员都会允许这样做,但如果需要快速更改,可能值得寻求许可使用 AI 重做他们作品中的短部分。
最后,音乐呢?虽然与作曲家合作创作作品会很理想,但时间和预算的限制意味着这对大多数创作者来说通常是不可能的。在预算有限的情况下,寻找和许可合适的曲目可能是一个耗时且棘手的过程。
构思出完全原创的音乐,在合适的长度、节奏和调性,这是一个诱人的想法,但它能与人工制作的曲目竞争吗?对于较短的曲目和用于视频和播客的背景音乐,答案可能越来越是肯定的。生成的音效尚未达到相同的水平,但你可以保留对整个过程的良好控制。
在这一章中,我们将探讨音频生成的最新技术状态:
-
创建合成语音
-
基于声音克隆的合成语音
-
替换现有语音录音的部分
-
创建原创音乐
-
音频翻译
-
创建合成音效
首先,让我们看看人工语音的逼真程度已经达到了什么水平。
创建合成语音
文本到语音(TTS)解决方案已经存在了几十年,但直到最近才开始听起来像人类。自从斯蒂芬·霍金(Stephen Hawking)的机器人声音首次被听到以来,我们已经取得了长足的进步,现在最好的 AI 声音几乎与真人无异,甚至有时会犯错。
其中一个引起轰动的是谷歌的 NotebookLM (notebooklm.google),这是一个可以从任何文本源生成整个播客的工具。这是来自 The Verge (www.youtube.com/watch?v=YGtINs3R5EM) 的入门指南。虽然这在技术上令人印象深刻,令人毛骨悚然,并且可能相当令人恐惧,但它可能不是创意专业人士直接使用的东西。
这种单次解决方案无法提供足够的控制或多样性,无法成为大多数创意工作流程的一部分,我们需要稍微退后一步,专注于从我们自己提供的文本生成语音。
作为基准,您的操作系统包含一些基本的文本到语音选项,用于朗读文本,尽管它们已经有所改进,但大多数仍然听起来相当不自然。
在 Mac 上,您可以在系统设置下选择您想要听到的声音,在辅助功能 > 阅读和说话 > 系统声音(Siri 声音听起来最好)。设置完成后,在内置应用程序(如笔记或页面)中选择一些文本,然后右键单击并选择语音 > 开始说话来听它。
Siri 和其他数字助手使用这些声音中的最佳者,但它们并不试图听起来完全像人类,我们知道它们不是。人类级别的 AI 声音通常太复杂,无法在手机上实时工作。这些更复杂的模型以更全面的方式解释提供的文本,解码每个词应该得到的强调和语调,正确的上下文发音,甚至任何停顿的长度。与人类配音一样,从一次录音到下一次录音会有所变化,并且有时会有错误。
尽管有时一个发音错误的词可能会暴露它们,但其中最好的声音听起来比差或平均的人类配音要好。但最差的它们与系统声音相差无几——当“伟大”就在那里时,不要满足于“可以”。
质量并不总是重要的。如果您只计划将合成声音用作临时的“刮擦”轨道,在您用真人录音之前提供一些编辑内容,那么一些奇怪的短语并不是问题。当然,时间仍然至关重要,一个更好的临时轨道,您的草稿编辑就会更接近最终产品。
基于网络的提供商众多。与图像和视频一样,一些模型在多个平台上可用,而一些则是独特的。以下是我尝试过的选项:
-
ElevenLabs (
elevenlabs.io) -
Artlist (
artlist.io/voice-over) -
Runway (
app.runwayml.com/) -
Uberduck (
www.uberduck.ai/app/text-to-speech) -
Murf.ai (
murf.ai) -
Genny (
genny.lovo.ai/) -
Resemble.ai (
app.resemble.ai/hub) -
Hume (
hume.ai)
在几次测试中,我能够从这些提供商的许多声音中产生清晰、可用的语音。Artlist 和 Runway 都提供了一系列适合视频项目的专业声音选择,但ElevenLabs 是最知名的,市场领导者,拥有庞大的声音库可供选择。如果你没有时间自己进行比较,可以从他们最新的声音开始,目前是使用“v3”模型构建的声音。我们将在本书的后面部分再次回到他们的代理声音。

图 9.1 – ElevenLabs TTS 界面与其他该领域的提供商类似;选择一个声音后,你会看到更多的控制选项
虽然这些服务中的大多数并不昂贵,但一些开源模型可以完全离线运行,在你的设备上免费使用。

图 9.2 – Namigen 免费为您提供多种选择
虽然安装这些解决方案需要一些技术知识,但如果你有 Mac,你可以下载 Namigen (namigen.com) 以开始使用高质量的免费模型 Kokoro、Orpheus 和 Dia。Resemble.ai 的 Chatterbox (www.resemble.ai/chatterbox/) 是另一个流行的开源选项,可以在本地或在线运行。
对于预算不足或需要即时完成的任何工作,数字语音可能是最快的解决方案。但请记住,真实的人类也提供这项服务——并且可能并不像你想象的那么昂贵。
外包平台如 Fiverr (fiverr.com) 上有许多有才华的人类以低价提供配音录制服务。为了使这可行,你需要以文本形式给出指示,并等待一两天完成工作。
对于更大的项目,需要表现力或导演想要执导的项目,你仍然需要雇佣真人并在录音棚中现场录制。
我怀疑大多数使用人工智能语音的人最初就不会雇佣真人。相反,合成语音正在取代质量较差的配音,或者被添加到以前根本不会考虑配音的地方。
使用这些选项很简单:你需要一个脚本,并且需要选择一个声音。每个服务都将提供自己的一套声音,这个选择很重要。你不希望使用一个过于熟悉的声音,因为它会显得陈旧——这是大型供应商预制作声音的主要风险。
你还希望选择一个对听众来说听起来很棒的声音。大多数合成声音都是美式的,这可能不适合你的市场。例如,为一家本地澳大利亚公司配音就需要使用澳大利亚口音,因为这是当地市场所期望的。
然而,如果我要创作一个面向国际市场的英文作品,我会选择美国口音,或者可能是英国口音,甚至每个国家都有不同的声音。务必询问你的客户每个当地市场偏好的是什么,因为地方口音会给当地观众带来意义,而对外人来说则失去了这种意义。(如果你对翻译感兴趣,这部分内容将在本章后面讨论。)
风格和情感
重要的是要记住你正在寻找的生成风格:叙述、播客对话、教育内容,或其他什么。一些服务允许你定义这一点,而其他服务则提供针对每个目的的特定声音。
一些服务可以实现戏剧性的表演,但这超出了大多数服务的功能范围。如果你计划制作广播剧或情感投入的有声读物,准备好放弃很多控制权,或者雇佣一个真人。
这并不是说你不能尝试超越一个简单的脚本。更高级的服务允许你指定 [excited] 标签来表示情绪,以及 [gasps] 来表示非言语声音,这可以帮助引导生成。更先进的 ElevenLabs v3 模型允许这样做,并且还允许多个说话者进行对话:

图 9.3 – 这在 ElevenLabs 的对话是更多平台即将到来的一种好例子
缩写通常会被识别为缩写,但如果它们没有被识别,你可以尝试逐个字母拼写出来。
为了获得更多控制,深入了解设置。一些模型允许你只控制一个或两个参数(稳定性是常见的),而其他模型则提供滑块来调整速度、夸张程度等。以下是 Resemble.ai 的一些控制选项:

图 9.4 – Resemble.ai 的声音包括以下控制
如果你难以获得完全正确的结果,尝试将你的文本分成几个部分,独立生成它们,然后在音频或视频编辑应用程序中重新组合。这样,你可以重试有问题的录音,并组合多个版本——只要它们听起来足够相似即可。
就像常规的人类录音一样,每一代都会略有不同,所以如果它不够完美,不要害怕再次尝试。相反,如果一致性成为问题,并且不同的代之间听起来相当不同,你可能希望尝试更长的代,而不是更短的代。甚至可能值得重复脚本的部分,以确保在单个代中获取两次录音。
注意,许多 AI 头像(在上一章中讨论过)将提供生成合成语音的服务,尽管如果你更喜欢,你可以独立录制或生成音频。"Descript" 是一个愿意将图像(或提供的 AI 头像)动画化以匹配生成音频的服务,但请谨慎使用,因为视觉方面远不如音频方面令人信服。

图 9.5 – Descript 有一个桌面应用程序,这使得生活变得稍微容易一些,而且还有头像选项
尽管今天可以产生类似人类的输出,但即使是最好的 AI 语音也有有限的寿命。最受欢迎的应用程序中提供的默认语音将被更频繁和更广泛地使用,因此,它们将变得可识别,然后过时。如果你关心设计,你不会使用默认字体,如果你关心音频,你也不想使用默认的 AI 语音。独特性很重要。
在某些提供商,如 ElevenLabs 和 Hume,你可以通过选择特定的特征来设计一个定制语音。这将大大有助于为特定客户创建独特的东西,尽管它仍然可能被模仿。
那么……是否有可能创建一个只有其他人无法访问的定制 AI 语音?确实可以。
基于声音克隆的合成语音
史蒂芬·霍金知道他将失去说话的能力,当时,一个机器人替代语音是最好的解决方案。今天,如果你预计会因为肌萎缩侧索硬化症(ALS)或类似的疾病而失去说话能力,技术可以在你失去它之前捕捉你的真实声音,并且超越这一技术的下一步可以在极短的时间内克隆一个声音。
作为一种辅助工具,苹果公司在 2023 年推出了个人语音(machinelearning.apple.com/research/personal-voice),并且至今仍然可用。要使用它,你必须通过说出 10 个随机句子来训练一个模型,然后该模型可以以你自己的合成声音朗读你输入的文本。创建它只需要几分钟,但它并不完美。我自己的声音克隆具有一些我的特征,但它听起来就像我是在用假的美国口音说话。
仅仅两年时间,声音克隆技术已经发展到只需几秒钟的声音就能捕捉其精髓的程度。有时,提供更长的样本可以给出更好的结果,但结果差异很大。这项技术创造了以下可能性:
-
文本到语音提供商可以提供更多基于真实人物训练的声音
-
人类配音的一部分可以被合成替代品所取代
-
可以生成与现有录音相同声音的新录音
当然,这里有一条道德底线——你是否有权生成特定人物的音频?如果一个组织之前已经聘请了配音艺术家来为他们的培训视频配音,那么用合成副本简单地替换他们就会涉及道德和法律问题。大多数声音克隆服务都试图验证是否已经获得了许可,所以你可能仍然需要他们的积极参与。
虽然我不会期望在没有许可的情况下,从你的声音样本中创建新的公共声音,但检查你使用的服务的隐私条件总是明智的。这一点在与他人的录音一起工作时尤其如此。为了测试这些服务,我使用了我的声音录音,并且建议你在自己的测试中也这样做。请注意,这个领域中的许多大型公司实际上要求你在语音创建过程中朗读一个口头许可声明。
尽管我测试了几个声音克隆服务,但并非所有都做得同样好。你可能比我更有运气,但到目前为止,我尝试的服务中只有少数能够创建一个听起来像我的克隆体。这可能是因为我的澳大利亚口音带有英国口音的混合,但我对取得的如此小的成功感到惊讶:
-
Descript 要求我朗读一个简短的脚本,耗时略超过 30 秒,然后很快地生成了一个克隆体。不幸的是,它听起来像是一个略微机械的美国版的我——这不是我能用的。
-
Riverside.fm 包含一个名为 VideoDub 的功能,允许你重新输入视频中某人说的一个或两个单词。我没有得到听起来像我的结果。
-
Resemble.ai 承诺免费“快速”声音克隆,并要求你朗读一个简短的脚本。像 Descript 一样,它迅速提供了声音,但这次,它听起来根本不像我,更像英国人。将语言设置改为不同的英语口音给出了截然不同的结果。
-
Runway 提供了定制声音功能,需要支付 300 个积分(几乎相当于标准计划每月积分的一半)来处理它。提供的脚本很长,几乎三分钟,但输出的是一个非常美国化的我,不适合作为克隆体。
-
Uberduck允许你免费克隆你的声音,而且令人惊讶的是,它仅用 10 秒钟的说话就很好地克隆了我的声音。如果你想测试声音克隆的水域,这个网站快速有效,而且使用起来并不昂贵,每月 10 美元可以获得 1 小时的生成时间。
-
ElevenLabs只需几秒钟的录音即可提供即时声音克隆,这在所有付费计划中都是可用的,包括入门计划(每月 5 美元)。虽然我的即时克隆制作得很快,听起来也还可以,但它并不像 Uberduck 的那么好。然而,ElevenLabs 在其创作者、专业和扩展计划(每月 22 美元/99 美元/330 美元)上也提供专业声音克隆(PVC)。这需要更多的训练,并且每个账户对高质量声音的限额非常严格。
在做出承诺之前,要意识到创建一个专业的声音克隆是一个非同小可的练习。这至少需要 30 分钟的录音,最好是 3 小时。我很幸运,因为我已经制作了大量的视频培训课程,所以我上传了超过两小时的高质量录音,让它进行处理。在所有这些上传之后,我还必须现场录制一个特定的短语来验证它确实是我。
有趣的是,如果你想与他人分享你的声音克隆,你可以。如果你选择将你的声音添加到声音库中,当你的声音被他人用来生成音频时,你将获得报酬。虽然目前尚不清楚这对参与者来说是否是经济上的胜利,但至少存在成功的可能性。
几小时后,我的声音准备好了,总的来说,听到我仅曾键入的文字被大声说出,感觉非常神奇。可以使用他们的任何一种模型生成逼真的声音,尽管推荐的更便宜的Turbo模型,但我听到更高品质的 v2 多语言模型的问题更少。目前,跳过最先进的 v3 模型,因为它仍然处于 alpha 测试阶段;它极大地改变了我的声音听起来。
虽然生成的音频大多数都是完全可以接受的,但偶尔还是会有一些停顿,感觉像是放在了错误的位置,或者某个词的发音与我说的不同。就像用真人录制第二遍一样,快速再生可以解决这个问题,但同时也可能在其他地方引入其他问题。仅仅点击再生语音就像告诉一个人,“给我再来一遍”而不提供具体的指导。为了获得更好的结果,你可以调整滑块来控制速度、稳定性或相似度,或者你可以添加标签来指定情绪,但不受欢迎的停顿是无法完全消除的。
你可以将每个录音的最佳部分编辑在一起,对于许多项目来说,这已经足够好了。这个过程与你可能如何与外包的人类配音艺术家合作类似——提供反馈,并接收某些台词的替代版本,但它将负担转移到了编辑身上,并且不如与真人一起在录音棚中工作那么顺畅。
总的来说,这些专业的声音克隆技术令人难以置信地技术精湛且非常实用。如果你想与一个愿意用他们的声音训练模型并允许你使用的特定配音艺术家合作,这将非常有效。如果你能直接与真人录制,你会得到更好的结果,但时间和金钱的成本会更高。
市场仍在迅速发展,本地运行的开源解决方案也在成熟。Namigen(之前讨论过)计划很快添加声音克隆功能,如果你愿意与命令行打交道,IndexTTS2 (indextts2.org) 现在就可以使用。你还可以通过Voicv (voicv.com) 测试这个解决方案。
最后,尽管 ElevenLabs 目前在市场上领先,但这个领域的竞争意味着有多个不错的选择,并且一些基础模型将在多个提供商之间共享。如果你已经订阅的 AI 提供商提供你可以使用的语音服务,尝试一下它们。
我们已经探讨了如何从现有声音生成旁白,以及如何模仿现有声音。我们能用这项技术来修改现有的视频吗?正如你可能猜到的,当然可以。
替换现有声音录音的部分
对于视频和音频创作者来说,一个可能有用的技巧是在拍摄后更改视频中某人说的单词来纠正错误或重写脚本。如前所述,如果你想有灵活性,用合成声音替换人类录音的一部分,请提前获得许可。虽然人类在另一个人类的指导下有潜力录制最准确、最有情感的声音,但你需要他们的许可才能将新词放入他们的口中。
拥有这种批准后,如果你只需要替换一个或两个单词,过程就很简单了。使用能够快速制作高质量声音克隆的提供商,你可以上传音频的错误部分,然后输入正确的文本,并使用 TTS 制作正确的版本。下载,拼接替换部分,任务完成:Tyler Stalman 已经展示了这种方法与 Artlist 一起工作(youtu.be/jCXHOUkeXn4?si=hwRabP5YpnrdyWih&t=806)。
虽然一个简单的 TTS 模型可能在一些诱导下生成一段简短的内容,但并不总是容易匹配原始交付的风格,足以让人信服。语调很重要,情感很重要,许多模型控制不足,无法达到所需的效果。这里有一种方法可以做出更长的修改:
-
创建那个人的声音的合成克隆。
-
您可以亲自模仿那个人的说话,匹配他们的节奏和情感,但要说正确的词语而不是错误的词语。
-
将您的新人声转换为他们的声音,保持您的情感和节奏。
就像您可以从其他视频中创建合成视频一样,您也可以根据现有语音创建合成语音,这可能会让您对语音的情感和节奏有更大的控制。Artlist 提供这项功能(语音到语音),ElevenLabs(语音转换器)和 Runway(语音到语音)也提供。在 DaVinci Resolve 中也可以实现,由于这个过程不太直接,我将一步步为您介绍。
这个例子是我的一位客户在现实生活中遇到的问题。我为专业演讲者 Daryl Elliott Green(twiceshot.com)拍摄了一次演讲,然后之后将演讲视频发送给他。不幸的是,他在演讲的开头说错了,将谈话的第一行中的“八月”说成了“四月”。许多客户都犯过类似的错误,以前修复这些错误需要重新录制那一刻,但现在不再是这样了。
要使用此工作流程,您需要 DaVinci Resolve 的 Studio 版本,并且需要克隆的人的音频录音。大约五分钟应该足够,但如果您有时间,可以提供更长的录音。
- 选择那个人说话的原始剪辑,然后选择AI 工具 > DaVinci AI 语音训练…。

图 9.6 – 在一个人的声音录音上训练模型,然后您可以模仿它
第一次使用此功能时,您可能需要下载一个额外的文件,如果您使用的是除英语以外的语言,可能需要下载多个文件。
- 在同意您有权限克隆这个声音后,您可以命名声音模型并选择所需的准确度级别——这里就使用默认的更好选项即可。
创建模型可能需要一些时间,但它将在后台继续进行——我的 MacBook Pro M3 Max 处理五分钟的原材料大约需要一个小时。
- 完成后,录制您自己的声音,用您需要的节奏、语调和情感说出更正的“引导”词语。最简单的方法是使用时间轴 > 录制旁白将此录制到新轨道。
如果您在录音时戴上耳机听原声,可能会更容易匹配原始语音,这也会避免反馈问题。
-
选择新的轨道,然后选择剪辑 > AI 工具 > 语音转换。在此对话框中,从顶部的轨道菜单中选择新建轨道,并从底部的语音模型菜单中选择您的新声音。
-
按渲染将新的“引导”剪辑转换为该人的声音。如果听起来不太对,撤销并尝试使用不同的音调变化值,或者尝试重新录制您的引导剪辑。
新剪辑将出现在一个新的轨道上。

图 9.7 – AI 语音转换可以将录音转换为内置的几种声音之一或你训练过的声音
- 切割原始剪辑和替换剪辑,调整和淡入淡出以决定每个剪辑使用多少。
这个工作流程使得一年或两年前不可能的技巧成为可能,我这里展示的例子是真实的——一个演讲者说了一个词而不是另一个词,我能够无缝地通过自己说出来替换它。

图 9.8 – 在时间轴上,选择你想要保留的原始音频和替换音频的内容
显然,这种方法的优点是它提供的控制力。如果你没有 DaVinci Resolve Studio,可以尝试在线的语音到语音模型,如果第一次没有成功,不要害怕重新录制一个新的引导轨道(或者简单地重新生成)。
我们已经探讨了生成语音的多种方法,但文字并不是音频中唯一重要的部分。音乐也很重要,AI 服务乐于提供帮助。
创作原创音乐
原创音乐是现代媒体景观中最受控制的部分之一。每个上传到主要流媒体平台的视频都会被扫描以识别其中包含的音乐;YouTube 的系统被称为 内容 ID。如果你使用了你没有版权的音乐,你的视频可能会被屏蔽,或者静音,或者你可能会收到版权警告,或者你可能会失去该视频的所有收益。
为视频寻找音乐可能有点棘手。如果你在一个常见的库存音乐网站上搜索“企业提升背景音乐”,你会找到一些人们已经听过的曲目。即使你自己制作音乐,在如 GarageBand 这样的免费软件中编程循环,如果你不够原创,其他人可能会制作一个类似的曲目并声称你侵犯了他们的版权。(是的,这发生在我身上过。)
即使是演奏原创作品的音乐家也必须小心——如果你无意中使用了比一个更著名且好诉讼的艺术家相同的音符序列,他们可能会独立地起诉你。一方面是版权问题,另一方面是原创性问题,因此转向 AI 制作符合客户需求的音乐是有吸引力的。
当一些人使用 AI 制作可在流媒体服务上播放或甚至独立销售的曲目时,我只建议在音乐在项目中扮演较小辅助角色的项目中使用 Gen AI 创建背景音乐。对于音乐是重点的项目,如果可能的话,雇佣一个人类,或者仅将 AI 制作的音乐作为临时音乐使用。
但如果你从未听过 AI 制作的音乐,请前往 Suno (suno.com) 并要求一些可能用作播客或视频背景音乐的曲目。为了稍微推动道德边界,我要求一首“以 Daft Punk 风格,歌词关于与朋友们在海滩度假”的歌曲,它理解了这个简报。
在短时间内,我可以根据两组不同的歌词,以正确的风格演奏四首不同的歌曲。此外,还用新模型创建了额外的部分样本歌曲,展示了更多样化和更复杂的结构,大多数客户都会在这里找到他们喜欢的东西。如果你自己也是音乐家,付费账户让你可以上传自己的音乐来构建。
当一首歌制作完成后,只需一分钟左右,一定要阅读歌词并确保它们表达了你想要的内容。虽然有两首歌使用了海滩假日朋友的歌词,但另外两首歌则从泳池清洁机器人的角度创作了歌词:“刷去藻类,追逐污垢 / 完美泳池,清洁时间。”很有趣,音乐也还过得去,但不可用。

图 9.9 – 海滩上的朋友之歌,当然;清洁泳池的机器人之歌,则不然
由于包含 Daft Punk 这个名字,ElevenMusic (elevenlabs.io/app/music/) 同样拒绝了相同的提示。经过调整后,输出变得更加通用,但过于偏向机器人声音,而不是 Daft Punk 以其著名的 vocoder 而闻名的声音,并且背后有更多的通用流行音乐配乐。其他使用不同提示的生成版本则出现了歌词唱不清楚和过于简单的音乐结构。
Udio (www.udio.com) 严重误解了情况,创建了几首朋克吉他曲目。那本来是可以的,但这些歌曲包含了听起来像单词但不是的声乐,就像一个人一只手有七个手指一样。
很明显,有众多网站、众多风格和众多提示可以尝试,你需要进行实验以找到适合你口味的网站。请注意,如果你对音乐有些了解,你可以超越提示,成为 AI 制作声音的积极塑造者。
Soundraw (soundraw.io/) 允许你选择流派、情绪、主题、长度、节奏和要使用的乐器,然后为你提供它刚刚组合在一起的曲目选择。向下滚动,你会看到一个混音器,你可以根据曲目播放时进行调整,使曲目的某些部分更加强烈或较弱,控制安静时刻何时到来,何时加入填充,何时低音下降,甚至改变使用的和弦。这些曲目可能包含人声元素,但主要是乐器。这是一种不同类型的音乐,但如果你需要更多控制,它就非常棒。
在对音乐有深入了解的人群中,对这些服务的看法各不相同。技术上,许多 AI 音乐曲目包含瑕疵,很难干净地分离音乐元素。如果你希望混音这些曲目、重新制作它们或移除某些元素,可能会遇到困难。
尽管如此,AI 制作的音乐不完美,可以作为专业人士的有用灵感,就像不完美的 AI 图像一样。再次强调,对于不那么关键的工作,不完美的 AI 音乐可以完美地融入最终产品,就像不完美的 AI 图像可以“足够好”一样。如果你不是音乐专家,请谨慎使用这些曲目,因为你可能听不到一些观众会注意到的所有缺陷。
此外,务必遵守版权规定;如果你打算将制作的任何音乐用于任何商业目的,你需要仔细阅读细则。例如,使用 ElevenLabs 制作的音乐不能用于传统的电视或电影目的。此外,如果你在这些服务中使用免费或低级账户,你根本不能将音乐用于商业目的。
作为一个插曲,如果你真的知道自己在做什么,并且喜欢自己创作音乐,AI 能帮到你吗?当然可以,例如通过像 Output Co-Producer (output.com/products/co-producer) 这样的插件。这个插件位于你的数字音频工作站(DAW)中,根据你的提示和对其作品的分析建议可能有助于的样本。这些样本是由人类制作的,所以这并不是一个通用人工智能(Gen AI)解决方案,但如果你喜欢制作音乐,可能会觉得它很有用。
在我们结束这一章之前,让我们快速看一下翻译口语对话最有用的新解决方案。
音频翻译
在许多方面,音频翻译是文本翻译的延伸,涉及相同的问题和限制,如第六章中讨论的那样。翻译并不完美,但在许多情况下仍然很有用,你应该使用的方法将取决于手头的任务。
实时翻译非常适合与不说法语的合作者进行对话。为此,你可以使用苹果的翻译应用、跨平台的谷歌翻译应用或其他系统。这些应用通常与耳机连接,让另一个人用他们的语言说话,而你听到的是你的语言。

图 9.10 – 在翻译应用中,说一种语言并立即将其翻译成另一种语言仍然感觉像魔法
由于速度对于流畅的对话至关重要,这些系统可能不会给出完美的结果,尽管它们在当下通常足够好。在生产环境中,准确性更为关键,我们将寻找另一种解决方案。
YouTube 提供了自动将视频翻译成多种语言的配音服务,使用合成声音将视频的字幕转换为音频。这些声音相对机械,原始交付中的任何情感或细微差别都会丢失。此外,由于 YouTube 自动生成的字幕通常不如其他转录服务的准确,这可能会损害翻译字幕和配音。
为了提高质量,请务必创建自己的字幕并在上传前检查它们。如果可能的话,请让目标语言的母语者自己翻译脚本或纠正 AI 创建翻译中的错误。在此阶段,您可以使用 TTS 服务生成新的音频,可能比默认的机器人声音更具表现力。
虽然不同语言通常以不同的速度说话,但研究表明,它们仍然在约相同的时间内传达信息(www.cnrs.fr/en/press/similar-information-rates-across-languages-despite-divergent-speech-rates)。总的来说,虽然您可以期望配音节目与原始节目大致相同的时间长度,但在视频的上下文中,个别句子的时间安排很重要。虽然仅音频的播客在句子长度上具有一定的灵活性,但视频的翻译音频必须在每个句子上保持原始语言的时序。
作为视频音频翻译的一站式解决方案,ElevenLabs 提供了配音服务(elevenlabs.io/app/dubbing),它结合了转录字幕、配音音频,并为每个配音句子提供时序控制。为了测试,我为我 Final Cut Pro 空间套件插件的宣传视频制作了法语配音。

图 9.11 – 上传视频后,选择您想要配音的语言,并等待一段时间
每种语言单独计费,并且每分钟每种语言 10,000 个积分,如果您不想输出带有水印,很容易就会耗尽标准计划的月度积分。(注意:如果您计划从输出中提取音频,视觉水印无关紧要,并且成本降至每分钟每种语言 5,000 个积分。)
输出的声音非常令人印象深刻,使用即时声音克隆创建的外国翻译听起来与原始说话者(们)几乎一样。正如您所期望的,它并不完全像专业的声音克隆。重要的是,在配音工作室中,您有机会纠正原始转录和翻译中的错误,这是一个关键步骤。

图 9.12 – ElevenLabs 的配音工作室允许你在需要时修复问题并重新生成音频
首先,转录错误是会发生的,应该在翻译之前进行纠正。例如,尽管这里的转录(图 9.12)大部分非常好,但第一个词 Cinematic 在原始视频中根本不存在。翻译中的 Cinématique 不仅多余;它还破坏了节奏。幸运的是,配音工作室允许你调整任何句子的时间,所以请检查是否有问题,如果需要,移动或修剪音频片段。
此外,请记住翻译问题可能很微妙,由于一个特定短语通常有多种可能的翻译,自动解决方案可能不是最好的。这在术语或技术短语中尤为重要,你希望确保在所有相关视频中以一种一致的方式说话。正如已经提到的,你真的应该请一位母语人士检查任何翻译。
转录和翻译文本都可以编辑,如果你更改了翻译,你可以按下该部分下方的生成音频按钮来创建一个新的音频片段。这些重新生成是免费的(在限制范围内),所以你可以修复问题而不必担心你需要支付比预期多得多的费用。

图 9.13 – 如果需要重新生成某些部分,配音工作室允许进行免费更改
ElevenLabs 是一个我推荐的强大解决方案,但市场上并不只有它,它只是翻译音频方面的一个解决方案。因为当音频改变时视频保持不变,所以口型和听到的词语之间存在不匹配。在看似神奇的解决方案中,如果做得好,AI 唇形同步可能是一个更好的选择。
AI 唇形同步
Perso (perso.ai)、LipDub (www.lipdub.ai)和Dubly (dubly.ai)等解决方案不仅包括翻译和配音,还包括将视频重新生成以匹配新生成的音频。在上一章中简要提到的Flawless (flawlessai.com/),提供了更适合电影工作流程的高端功能。
一些 AI 唇形同步视频可以非常令人印象深刻,以至于许多观众甚至不会意识到它们已经被翻译了。但请注意——结果越无缝,确保转录和翻译完美就越重要。重要的是,除非你精通源语言和目标语言,否则你无法自己评估这一点。
观看使用机器人声音自动配音的 YouTube 视频的观众会期待它犯一些错误,就像原始语言的转录字幕可能包含错误一样。如果只有音频被翻译,也会有一定的容错度。
然而,如果你展示的是某人真实声音的对话,实际上听起来就像他们自己说的那样,这种期望就会改变。翻译错误现在可能会被视为一个真实的人犯下的真实错误。还有陷入诡异谷的风险,即某些东西看起来几乎像人类,但又不太像。在同步视频剪辑中,一个人的手部动作可能不会与翻译完全匹配,你可能会感到有些不对劲。随着技术的成熟,这希望会成为一个较小的问题。
无论你选择是否使用唇同步,如果你有大量的翻译需求,考虑使用专门的服务。要知道,成本可能会迅速增加,你生产的语言越多,你创造的内容就越多,你的积分消耗也就越快。请注意,传统的翻译也不便宜,至少你还需要真实的人类进行验证。
YouTube 提供免费自动配音服务,低端市场得到了很好的服务,尽管时间会证明观众是否会接受唇同步翻译。虽然我个人更愿意听到原始演讲者的声音克隆而不是配音艺术家,但我相信其他人可能有不同的感受。就像一些观众愿意阅读字幕,而另一些人则不愿意一样,市场可能会接受这些技术的混合,就像他们今天对字幕和配音所做的那样。
为了结束这一章,让我们看看 AI 能为音效做些什么。
创建合成音效
即使你更喜欢使用真实的人类声音和真实的人类音乐家,音效也不总是那么容易就能手到擒来。要手工完成这项工作,需要专业的软件,例如Audio Design Desk (add.app)以及可以调用的声音库——如果你有时间,这会很有趣。
但如果你认为没有时间,是的,AI 也可以填补这个空白,无论是暂时性的还是可能达到最终输出标准的。如果你一直在使用 Gen AI 制作视频,这可能会特别有用;这些模型中很少有包含音频的,即使是包含音频的Veo 3,也不总是做得正确。
Firefly是一个容易开始的地方:你可能已经有了登录账号和一些备用积分,音质可以接受,而且有很多选项可以探索。首先,你可以简单地使用文本提示来请求音频,Firefly 会给你四个变体。我选择了一个相对有挑战性的内容(“狗在冲浪海滩上吠叫”),以测试它如何将两种实际上有时会同时听到的不同声音混合在一起。

图 9.14 – Firefly 的四种选项在这里听起来都很好
书并不是传递音频的理想格式,但波形应该显示在八秒的文件中有相当多的变化。这是好的——有不同海滩和不同种类的狗,我的提示并不具体。不幸的是,质量不足以用于最终输出;在半不错的耳机上听,揭示了混浊的音频和压缩伪影。
从其他提供商请求相同的音效得到了混合的结果。ElevenLabs 提供音效(四种变化和持续时间控制),但那里的质量并没有好多少。尝试使用 SFX Engine (sfxengine.com/app/sound-effects),这需要更长的时间,我收到了每生成一个变体就 10 秒长的文件,而且音质相当不稳定。
如果你对自己的音频混音不自信,请求这样的组合音效可能看起来是个好方法,但最终可能会妥协音质。当你请求多个元素组合时,输出听起来好只有在两个源元素都工作的情况下,而且你无法仅替换其中一个元素。
如果可能的话,最好分别请求元素,然后分别控制每个声音的音量、声像、均衡器、混响等。这是一个经典的故事:你花的时间越多,结果越好。如果你借助 AI 跳过所有有趣的环节,你不会在混音、时间控制或空间定位声音方面变得更好。
返回这些网站并分别请求元素,整体上给出了更好的结果,尽管质量仍然不稳定。狗吠声还可以,而海滩上波浪拍打的声音往往听起来很假——这是声音(尤其是波浪)数据率太低时可能发生的事情。
这个质量问题在 ElevenLabs 生成的许多其他声音中也很明显。默认情况下,生成是公开的,其他用户创建的声音可以被听到和下载。

图 9.15 – ElevenLabs 的这个公共音效流展示了可能实现的效果
听了许多这些结果(来自长和短的提示)揭示了森林氛围背景中的低频嗡嗡声,爆炸时峰值被截断,还有一些不愉快的哔哔声。并非全是坏事,但我没有找到很多能与常规音效库相媲美的声音。多样性是好的,但质量并不好。
尽管如此,AI 确实有一些常规声音库无法完全匹敌的技巧。在一些网站上,你可以上传一个视频,AI 会生成与之匹配的音频,无论是否有提示。KlingAI (app.klingai.com/global/video-to-audio/) 提供了这项服务,虽然视频似乎确实起到了提示增强的作用,但结果参差不齐——毕竟你一次要求多个东西。
一个没有行人走动且没有提示产生的音频的视频,添加了混乱的言语或脚步声,尽管一两个变化可能是可用的。当我添加了一个简单的提示“微风轻轻吹拂田野里的庄稼”时,它得到了正确的内容,但所有四代的质量都很差。另一个视频,一个人沿着森林小径行走,与提示“树中的风和鸟鸣”配对,产生了充满伪影的音频,并附带(不想要的)流水声、雷声或错时脚步声。
我也尝试了 Firefly,但它似乎并没有试图使用源视频作为灵感。然而,这里的界面确实鼓励你使用简短、具体的提示并组合多个声音——这是一个好主意。在撰写本文时,这个功能仍在测试版中,并未完全激活,但值得探索。
Firefly 中另一个可能有用的功能是,你可以使用你的声音来模仿在提示中请求的声音的节奏。我要求“脚步声踩在砾石上”,并在上传的单独声音录音中提供了节奏。四代都准确地保持了节奏,尽管质量并不完美,但我确实可以用它作为临时轨道或与其他声音混合。

图 9.16 – 这些脚步声的节奏与我所提供的声音录音相匹配
对于音效,质量似乎是大多数这些网站的问题。虽然我无法测试所有可能的服务,但我对音效的整体质量低于音乐感到惊讶。鉴于音效可以一次生成一个,而且它们并不总是那么难找,也许现在最好还是用传统方式混合它们。
让我们退一步总结一下。
摘要
在语音、音乐和音效之间,AI 可以帮助的方式有很多。语音方面可能发展得最好,无论你选择使用高质量预制声音还是训练自己的声音,我认为我们已经到了这样的一个阶段——使用最好的模型,你可以创建一个许多人会认为是人类的声音。一些合成音乐可能听起来像是人类制作的,特别是如果它以低音量使用,但质量差异很大。总的来说,音效还远远不够,尽管潜力巨大,但我现在还是手动混音。
如果你是一位涉猎音频的视频或照片专家,快速听听 AI 制作的音频并可能印象深刻是很简单的。但如果你是一位视觉专家,能够发现其他人可能忽略的视觉生成中的缺陷,那么不要让糟糕的音频质量轻易滑过。音频对于优质视频至关重要,尽管 AI 工具可以在清理方面创造奇迹,但目前生成方面的效果参差不齐。
接下来,我们将进入本书的自动化 AI部分——一个充满勇气的新世界。
|
获取本书的 PDF 版本和独家额外内容
扫描二维码(或访问packtpub.com/unlock)。通过书名搜索本书,确认版本,然后按照页面上的步骤操作。 | 
|
| 注意:请妥善保管您的发票。直接从 Packt 购买的商品不需要发票。* |
| --- |
第四部分
自动化 AI
本总结部分探讨了自动化工具的潜力,包括旨在加速繁琐或耗时任务的工具、自动视频编辑解决方案,以及关于数字助手和代理未来的讨论,这可能会颠覆比创意工作流程更多的流程。
本书本部分包括以下章节:
-
第十章, 使用图像的自动化 AI
-
第十一章, 使用视频的自动化 AI
-
第十二章, 使用数字助手和代理的自动化 AI
第十章:带图像的自动化 AI
在本书的第一部分,我们探讨了实用 AI 如何帮助您更快地完成工作:选择、分类或查找事物。如果您需要更多帮助,自动化 AI 可以为您完成部分工作,并且有许多与图像相关的任务可以发送给它。使用正确的应用程序,自动图像筛选、色彩校正和润色都是可能的。
然而,为了获得最佳结果,我建议只使用 AI 来自动化无聊、繁琐或耗时的工作。没有系统是完美的,如果您让自动化系统做出不完美的决定,您可能会交付低于标准的工作。有些任务需要谨慎完成,您不能——或者至少不应该——只是按下“使其平滑”按钮来给每个人带来新鲜、塑料般的外表。图像可以以许多不同的方式处理——您是否信任计算机为您做出那个决定?
当然,我们都需要判断哪些任务值得我们的时间,哪些任务可以交给别人。从这个意义上说,使用 AI 应用程序就像外包一样。因为许多这些应用程序运行在您的计算机上,您可能不需要将成千上万张图片上传到云服务器,这样可以节省时间并避免潜在的隐私问题。如果您已经愿意将一些与图像相关的任务外包给其他人,那么将这些任务外包给 AI 可能有助于提高您的工作流程。
本章将专注于图像,展示 AI 如何帮助以下方面:
-
自动图像筛选
-
自动润色
-
自动图像处理
-
编写脚本来加快设计任务
让我们从让 AI 从大量图像中挑选出最佳图像开始。
自动图像筛选
专业摄影师经常拍摄大量照片,尽管一些客户想看到所有照片,但移除坏照片是工作的重要部分。如果摄影师分享所有拍摄的原件,他们可能会受到严厉的评判;可能有很多失手比成功多,简单的调整可以在图像的最终外观上产生巨大的差异。
筛选是流程的第一步,其中挑选出最佳照片。明显的不合格照片被移除,使用马达驱动拍摄的组照被缩减,最终留下最佳照片。不同的摄影师会有不同的方法,但以下是如何在 Adobe Lightroom Classic 中手动筛选的:
-
快速浏览每张照片,判断它是否良好,如果是,则按以下方式标记:
-
如果良好,通过在键盘上点击那个数字键,它会被标记为 4 星(良好)或可选的 5 星(优秀)。
-
如果一张照片比我刚刚标记为 4 或 5 星的照片更好,但非常相似,我将旧照片标记为 3 星,新照片标记为 4 或 5 星。
-
-
重复操作,直到完成。
-
只查看 4 星以上照片。
这显然是一个简化的过程,但它适用于许多应用程序,并为你留下了一组“好”和/或“优秀”的照片,你可以进一步处理这些照片。所有这些图像至少都会进行色彩校正,而五星级的图像可能会得到更多的个人关注。

图 10.1 – 在 Lightroom Classic 中手动筛选不需要花费太多时间——人工智能能做得更好吗?
作为测试,我记录了我处理最近一次拍摄的一批图像所需的时间。我对 1,247 张自己的照片进行的这次手动筛选大约花费了 22 分钟,并留下了 268 张“好”照片。并非所有这些都会进入最终剪辑,但我相信我没有错过任何东西——我看了我拍摄的每一张照片,我知道发生了什么,并且我可以以最佳方式展示这些照片。人工智能能做什么?
重要的是,Lightroom 本身很快将只针对人像包括一个由人工智能辅助的筛选功能。在撰写本文时(2025 年 10 月),此功能尚未推出,但鉴于您阅读本文时它可能已经公开,请务必查看。
Excire Foto (excire.com/en/excire-foto/) 是一个可以自动分析您的图像并以几种有用的方式对它们进行分组的选择——我们在本书的“实用人工智能”部分对其进行了探讨。这个本地运行的程序只需超过一分钟就将我的 1,247 张照片筛选到 656 张,使用默认配置文件——相当快。它根据相似性、照片中的人物以及连续拍摄的照片(例如,在马达驱动下拍摄的照片)来收集图像。它还推荐删除图像,如模糊的照片或闭眼的照片。
这种分析对一些摄影师来说将是有用的,尤其是那些处理大量图像的摄影师。然而,这种方法和所有其他自动筛选功能的风险是,一张好照片可能会被拒绝。在我的测试中,虽然模糊的照片确实被标记为拒绝,但并非所有选择都是完美的。一些模糊的照片最终被选中,而在我看来看起来不错的照片却被拒绝了——可能是因为它们不是人物照片。
其他照片似乎因为太暗而被拒绝,但有时摄影师必须在一个黑暗的环境中工作,并通过额外的处理来挽救他们的照片;只有人类才有足够的背景知识来做出所有正确的决定。如果特定主题的唯一照片不够完美,你可能必须尽可能挽救它。
好消息是这没关系——它是一个助手,而不是评判者。没有必要自动删除 Excire 建议删除的图像,不同的筛选配置文件允许在图像识别和处理方面有一定的灵活性。您可以创建一个新的配置文件,并选择您想要用作自动筛选基础的特性集合。如果您选择已经分析过的照片,这个过程只需几秒钟,因此很容易进行实验。
Aftershoot (aftershoot.com/)是另一个包含筛选功能的应用程序,总体来说,它与 Excire 的工作相似。在提供相同的图像后,它仅用了六分多钟来分析它们并展示评分的图像。我的第一次筛选使用了定制 AI 筛选设置,将 552 张标记为已选(5 星)和 93 张标记为亮点(4 星),但如果这不是您想要的,您可以尝试再次进行,而不需要完整的重新分析。

图 10.2 – Aftershoot 的定制 AI 筛选工具提供了几个选项
要重新筛选,请按快速重启,这只需几秒钟。自动 AI 筛选选项移除了更详细的控制,只提供了一个简单的滑块来告诉应用程序您想要多少张照片:
-
标准为我提供了 503 张已选和 84 张亮点
-
少量提供了 423 张已选和 70 张亮点
-
极端选项为我提供了 161 张已选和 430 张可能
最后那个极端选项更接近我的个人选择,但还不够接近以节省我的时间。在已选组中,它选择了被我拒绝的照片,并省略了我选择的照片。放大镜视图提供了一些有用的功能,自动将相似的照片分组,并允许您快速切换它们,这在验证是否遗漏了任何重要内容时很有帮助。
Imagen (imagen-ai.com)采取了一种略有不同的方法,因为它在云端运行而不是在您的本地机器上。虽然这项服务确实有一个桌面应用程序,并且默认与 Lightroom Classic 集成,但它将所有图像上传到云端进行筛选,这可能会使整个过程稍微延长一些。
我的 1,247 张原始 RAW 图像以原生格式存储需要 48 GB 的空间——RAW 文件并不小。在上传之前,我使用 Adobe DNG 转换器对它们进行了压缩,尽管我的上传连接速度为 100 Mbps,但上传这些图像仍然花了 7.5 分钟,而且在我能够审查其工作之前,已经过去了 19 分钟。

图 10.3 – Imagen 允许您保留最佳照片,或生成特定数量的图像
这里筛选的主要重点是识别每组中的最佳照片;它识别了保留照片、重复照片、独立照片和低评分照片。实用的是,你可以识别每组或筛选到确切的图像数量,但没有滑块让你更加挑剔。默认设置下,它选择了 336 张保留照片,虽然它做得大多不错,但我的几幅最喜欢的照片不知为何被标记为 1 星级的糟糕照片。
因为照片现在在网上,图像之间的切换速度不如本地应用程序快,而且一些信息,如图像的文件名,在主界面中不可用。在开始筛选操作之前,你需要设置一个“AI 配置文件”,定义 Imagen 将用于预处理所有图像的首选外观。这不是最终的外观,但它比查看原始图像并想象如何处理它们要接近得多。
叙事 (narrative.so) 提供了与 Excire Foto 和 Aftershoot 相似的筛选功能。当你将一文件夹的照片拖入应用程序中,它会快速识别照片中的面孔,然后标记哪些是聚焦的,以及哪些眼睛是闭上的。大约三分钟后,初步筛选完成,大约一分钟后,所有图像都被标记了初始评分:860 个潜在选择,200 个不太可能的选择,以及 187 个不理想的选择。

图 10.4 – 叙事快速进行了初步筛选,但没有大幅减少照片池
相关图片被分组,这使得在相似镜头之间选择变得更加容易,还可以根据镜头的聚焦程度进行筛选。对于初步编辑来说,这很有用,但我更希望有更深入的裁剪。
与不完美的结果一起工作
不幸的是,在这些应用程序中,一些好照片被列为“不理想”,因为最好的照片并不总是能在算法的眼中勾选正确的框。有时,你想要的是某人闭着眼睛的照片,因为他们正流着喜悦的泪水。有时,一个模糊的时刻仍然完美无瑕。有时,你唯一拥有的某人微笑的照片有问题,但你仍然必须使用它。
软件也无法了解每个摄影拍摄的特定要求。例如,我用来测试所有这些产品的摄影拍摄包括五人小组讨论一个主题,他们之间共享麦克风。我想至少提供一张或两张每位演讲者手持麦克风讲话的照片,因为这是他们每个人想要分享的照片。但自动筛选并不理解这种细微差别——它怎么能呢?因此,最棘手的筛选任务可能需要一些手动工作,这当然是可以做到的。
如果任何基于 AI 的筛选解决方案隐藏了某个镜头,你将不得不亲自处理。在第一次筛选后,我建议快速浏览“最差”照片的集合,以确保没有丢失任何重要内容。如果你看到任何值得保存的内容,将该镜头重新分类为好或优秀,然后继续。
这些工具对你是否有用取决于你需要处理多少照片以及需要多快完成。如果你发现快速筛选很困难,这些工具可能非常有价值,但如果你在这个流程中已经很快,可能就不那么重要了。每月拍摄多个活动的专业摄影师在这里可以获益最多,尽管偶尔拍照的人也可能节省时间。
如果你正在考虑为工作采用这些解决方案之一,你将想要下载所有这些并亲自测试它们。筛选是一个个人过程,我认为在筛选性能方面没有明显的胜者。每个都可以免费试用,但请注意,如果这些应用程序之一创建了.xmp辅助文件,那么元数据(包括照片评分)将显示在另一个应用程序中,如果你传递相同的图片。为了进行干净的测试,请确保传递你测试图片的新副本,并确保它可以导出你满意的格式。
这些应用程序之间的定价差异很大,虽然 Excire Foto 可以一次性购买,但 Aftershoot 和 Narrative 每月需要订阅费用在 10 至 60 美元之间。筛选在最低计划中可用,但如果你需要调整图片,你可能需要升级到更昂贵的计划。在 Imagen 上的筛选费用为每月 18 美元或年度基础上每月 12 美元,但下一步,自动图像调整,是按每张图片计费。值得注意的是,Evoto,下一节中讨论的自动修图解决方案,很快也将提供筛选功能。
接下来,让我们看看另一个你可能希望在筛选后自动化的常见任务:图像处理。
自动图像处理
虽然这个过程对不同艺术家意味着不同的事情,但大多数专业摄影师在将最终图像发送给客户之前,会调整曝光、锐度、白平衡、皮肤纹理等。一个活动的图像批次可能包括基本的曝光、白平衡和锐度校正,而婚礼的英雄图像可能包括在像 Photoshop 这样的工具中进行的更广泛、更专注的调整。
许多基本的调整可以在一定程度上实现自动化,实际上,大多数图像编辑应用程序都包含某种自动增强选项——其中一些使用 AI 来做出决策。
苹果的照片应用有一个自动增强按钮,Luminar Neo有几个由人工智能驱动的调整工具,ON1 Photo RAW包括人工智能驱动的原始处理,而Pixelmator Pro有一个ML 增强按钮。甚至 Photoshop 的自动级别也有一个使用机器学习来做出决策的增强亮度和对比度功能。
许多摄影功能确实使用了人工智能,但魔法大多发生在幕后,导致一个更老算法的更好版本。在这里,我们将探讨更明显的人工智能应用,这些应用可以帮助你更快地完成工作。
首先,我们将关注那些批量处理图像的解决方案,将可能耗时的工作过程转变为更快的过程。使用所有这些解决方案,你可以在初始自动处理之后随意调整,如果它们在特定图像上不起作用,你无需忍受默认设置。
如果你手动操作,这会怎样呢?要在 Lightroom 中手动执行基本过程,我会过滤只显示选定的图像,然后执行以下操作:
-
使用滑块来校正每个单独地点的典型图像。
-
复制该修正。
-
将该修正粘贴到同一地点的所有其他照片上。
-
根据需要调整每张图像的曝光,以保持一致的曝光。
如果某些图像需要额外的工作,则控制光线或进行修图。
虽然我通常单独处理每一项工作,但有些摄影师可能更喜欢从预设开始。使图像看起来一致可能需要一些时间,尤其是在光线变化的空间内拍摄的照片,但如果你使用 Lightroom,选择人物的蒙版将自动适应每张图像,当你粘贴修正时。这有助于在多张图像中保持一致的外观,所以……你还需要其他什么吗?
一个好的、现代的人工智能图像处理系统将能够将单次“增强”工具的最佳效果与对自身首选风格的理解相结合,并且可能执行更复杂的操作。自动修图是这些服务中的一些选项之一,但你需要找到自动化和保留每张图像特征之间的平衡。并非每个客户都希望应用皮肤平滑滤镜。
虽然 Excire Foto 主要关注组织,但这里讨论的其他筛选应用程序也可以执行自动处理,如果你需要的话。

图 10.5 – 一个 AI 配置文件可以从简单的预设开始,但上传数千张图像更受欢迎
Aftershoot、Imagen 和 Narrative 都提供从你自己的大量处理图片中构建一个定制专业 AI 配置文件的服务。Aftershoot 和 Imagen 也愿意从你提供的预设中快速创建一个配置文件,并给你一个快速测试来确认你的曝光、温度和色调偏好。所有三个网站还提供了一系列预定义的风格,包括一些免费默认风格和一些来自其他摄影师的风格,作为额外购买的选择。
现在,你可以使用任何来源的配置文件来处理所有你的图片。在某种程度上,这就像在视频编辑应用程序中选择一个自定义查找表(LUT)一样,尽管预设比 LUT 提供了更多的灵活性。在我的测试中,结果还不错,但也不是定制的。这些应用程序声称随着你向训练集添加更多图片,它们的结果会随着时间的推移而改进,所以如果你想使这些解决方案为你所用,不要过早放弃。
Imagen 确实提供了一些基本的后期处理(包括牙齿美白),但与 Aftershoot 相比,对皮肤平滑度的控制要少得多。虽然两者都包括自动裁剪、校正和主题遮罩,但 Aftershoot 在斑点、皱纹、飞发和整体皮肤平滑度方面提供了更广泛的控制。它还允许对不同类型的面孔(男性、女性、老年人和儿童)应用不同的效果。这些预设可能有点太强烈了,尽管这里的控制选项并不广泛,但它们是可以调整的。

图 10.6 – Aftershoot 的后期处理选项
价格是服务差异很大的地方;有些是全包的,而有些则按每张图片收费。Aftershoot 和 Narrative 提供了一种固定价格的月度计划,包括更昂贵计划中的编辑服务。Imagen 的月度计划仅包括筛选,而编辑服务按每张图片收费。如果你需要处理大量图片,这可能会花费更多。
就像在筛选过程中一样,尝试一下可用的免费试用版,看看哪种解决方案最适合你,并记住本地部分手动处理也是一个选项。在 Lightroom 和 ON1 Photo RAW 等应用程序的选择中也有一些聪明的 AI,但预设只能带你走这么远。
让我们重新聚焦于后期处理。在 Lightroom 中,这是一个有限的、主要依赖手动的过程,如果你想要自动化这个流程,Aftershoot 可能是一个值得考虑的选择。虽然 Aftershoot 的选项比之前讨论的其他工具要深入一些,但还有更多的事情可以做。如果你的工作流程特别需要批量后期处理,那么考虑一些更专业的选项可能是有益的。
自动图片后期处理
提示(Prompting)是处理一些后期处理问题的方法之一,当你遇到一些无法手动解决的问题时,这可能是最佳的方法。然而,提示并不是为批量处理设计的,它有分辨率限制,并且可能不可预测。更复杂的后期处理任务,包括颜色匹配、消除反光、去除纹身、服装平滑和背景清理,最好使用像Evoto和Retouch4me这样的专用工具来处理。
这些工具使用 AI 算法执行不仅仅是曝光和颜色校正,还有许多需要人类注意的微妙校正。由于许多筛选、排序和处理工具的功能集经常更新,请检查你目前使用的工具是否最近引入了任何新功能。
Evoto包括桌面应用程序,并提供了一套完整的肖像后期处理工具,以及背景替换、服装调整和颜色匹配。如果你做很多肖像工作,尤其是如果你的任务包括调整化妆和身体重塑,这可能是一个不错的选择。它还支持连接,允许你在拍摄时即时对图像进行后期处理,以便客户立即批准。
虽然这里的选项很全面(只有少数在即将到来的图中可见),但滑块并不总是提供足够的灵活性。另一个危险是,你可能会被诱惑过度使用这里的控件,可能导致过度处理、结果相似。虽然我不会建议将所有设置都调到最大,但节制取决于你。

图 10.7 – 这是我们在 Evoto 中的早期图像,应用了几个肖像后期处理选项和化妆
虽然肖像后期处理应用程序在手机上很受欢迎,但这些功能在桌面工作流程中仍然很少见,尽管它们对专业人士来说具有潜在的价值。这里的许多控件产生的结果可以与专业人员在 Photoshop 等工具中产生的结果相媲美——只是更快。当然,像 Photoshop 这样的功能齐全的图像处理工具仍然是进行不寻常、特定更改并完全手动控制的最佳场所,但并非每个工作都需要定制处理。
如果你希望留在 Photoshop 中并可能保留完全控制,Retouch4me (retouch4.me/products/retouch-plugins)通过 Photoshop 中的面板提供后期处理工具,产生可以单独调整或遮罩的分层校正。如果你使用的是其他图像编辑工具,你也可以使用 Retouch4me 的桌面应用程序Arams来访问相同的插件,然后下载分层 TIFF 文件进行进一步调整。

图 10.8 – 前后对比:结果是巨大的改进,尽管还不完美
这里的定价模式很灵活。插件可以一次性购买,拥有永久许可证和免费更新,或者可以按每张图片在线处理。你可以一次性购买积分,或者以更便宜的价格按月订阅。如果你确实选择在线处理图片,Retouch4me 还提供第三个工具,Apex,它可以作为插件或独立应用程序使用。
比较 Evoto 和 Retouch4me 的结果,两者都做得很好,尽管个人偏好可能会引导你的选择。虽然 Evoto 可以更快地产生更平滑的整体结果,但很容易过度修正,产生超塑料效果。对我来说,经过处理后的分层结果使 Retouch4me 成为赢家,而且如果你只需要几个模块(例如修复和** dodge & burn**),你可以直接购买这些插件并永久使用。在线选项确实允许你一次性使用所有修图模块,每张图片只需一个积分,但一次性购买所有模块并不便宜——所以请仔细权衡你的选择。
虽然这些工具中的任何一个都可以提供严重的流程提升,但你仍然会面临所有外包工作共有的一个问题——你没有获得任何技能。没有哪个工具是完美的,也没有哪种方法每次都有效;修图专家需要熟悉他们的工具,并知道解决特定任务的最佳方法。
要享受漫长的职业生涯,你需要学会如何提供一致的优秀结果,而且没有任何一个工具可以单独做到这一点。亲自尝试一些今天的工具,看看哪些(如果有的话)与你的照片风格和预算相匹配。
最后,关于图像相关的图形设计世界呢?AI 能做些什么来让它更快或更容易?是的,但不是直接地。
编写脚本以加快设计任务
显然,创建 AI 图像的便捷性可以使整体设计过程更容易,即使你在草图阶段之后替换这些图像。但设计本身呢?今天的生成图像系统优化的是基于像素的图像,只有偶尔的基于矢量的系统。总的来说,你将创建一个布局的图像,而不是布局本身——而这些系统并不很好。如果你大部分时间都在使用 Adobe InDesign,AI 能否以某种方式帮助你完成这个过程?
虽然有许多方法可以自动化软件,但没有一个系统可以在每个平台和每个应用程序上工作。一些应用程序确实包括内置的自动化功能,例如 Photoshop,它提供可记录的动作来帮助用户重复繁琐的任务。这个系统已经很好地工作了多年,但人工智能有潜力让它变得更好,而且很快就会实现。
到 2025 年底,Adobe 预览了一个即将发布的 Photoshop 新版本,该版本将包括基于提示的 AI 助手,尽管在撰写本文时,它仍然处于测试阶段(并且仅限网络)。当发布时,Photoshop AI 助手应该能够重命名您的图层并控制许多 Photoshop 功能,但它还没有准备好。
在网络上,Firefly 推出了创意生产(firefly.adobe.com/inspire/creative-production),允许用户“使用批量操作处理数千张图片”,尽管当前预设的工作流程列表相当小。我相信功能集将会增长,但我不确定它是否能够处理本地文件或仅仅是在线文件。
采用另一种方法,在第十二章中,我们将探讨可能允许第三方 LLMs 为您控制计算机的即将到来的技术。继续这个主题,这还不是准备好了。
然而,一个目前可以工作的更低级选项是脚本。
在 Mac 上,有 AppleScript,这是一种可以与许多第三方应用程序通信的脚本解决方案,但并非所有应用程序,包括许多 Adobe 应用程序。在 Adobe 的每个应用程序中,通常都有一到多个脚本解决方案,在 InDesign 中,您可以在 Mac 上使用 AppleScript,在 Windows 上使用 VBScript,或者在任一平台上使用 JavaScript。
不幸的是,由于大多数设计师并非也是程序员,因此足够理解 InDesign 和脚本以编写高级脚本的群体相当小。尽管我可以设计和编码,但我不算是一个优秀的程序员,所以我并没有设定过高的目标——直到 AI 的出现。
LLMs 擅长的事情之一是编写代码。ChatGPT 和 Claude 都会积极集成到更严肃的开发环境中,或者提供您可以复制粘贴到简单文本文件中的代码。虽然我不期望这本书的大多数读者都是高级程序员,但即使是免费的 ChatGPT 账户也应该足以帮助您开始。
目标是什么?编写一个免费的脚本,使繁琐的工作变得简单。这本质上是非常简单的氛围编码,虽然这种方法不适合扩展到严肃的应用程序,但它非常适合简单的脚本编写。
在我们开始之前,有一个简短的说明。如果脚本编写看起来太令人畏惧,也许您可以使用一个工具来为您编写脚本?MATE (www.omata.io/mate) 是一个创意人员的 AI 助手,支持 InDesign、Illustrator 和 Figma 的工作流程。目前,这个工具仍然是实验性的,所以我不能推荐它用于生产工作流程,但请关注其进展并亲自尝试。
然而,简单的代码没有什么可怕之处。让我们深入探讨吧!
Adobe InDesign 中的脚本编写
InDesign 包含几个示例脚本,它们是开始的好地方:
-
通过选择窗口 > 实用工具 > 脚本来打开脚本面板。
-
通过打开应用程序 > 示例 > JavaScript来尝试一些示例脚本,然后双击示例来运行它们。以下是一些最有用的几个:
-
FindChangeByList将删除句号后的多个空格、多个段落回车以及其他许多内容——它是清理混乱文本的绝佳工具。
-
PlaceMultipagePDF在需要将 PDF 的所有页面放置在 InDesign 文档中的单独页面上时非常有价值
-
排序段落是一种将列表按字母顺序排列的好方法
-
-
右键单击用户文件夹,然后选择在 Finder 中显示(Mac)或在资源管理器中显示(Windows)。
要创建自己的 InDesign 脚本,我建议尝试两种方法之一:从头开始或从现有工作开始。
从零开始编写 InDesign 脚本
首先,你可以尝试简单地向你选择的 LLM(我推荐 ChatGPT)解释问题,看看它会产生什么。然后你将下载脚本,将其放入用户脚本文件夹中,然后在脚本面板中找到它,双击它以在 InDesign 中运行它。看看它是否按预期工作!
如果失败,InDesign 通常会显示一个错误,列出有问题的代码行——但脚本可能只是没有完全按照你预期的那样做。无论如何,告诉 LLM 出了什么问题,告诉它发生的任何错误,或者描述不符合预期的工作。LLM 将修改其脚本,所以复制、粘贴并重复此过程,直到成功。
这可能有效,但并不总是如此,无论 LLM(大型语言模型)多么自信。有时你会遇到拒绝,有时你会得到一个什么也不做的脚本,而在其他时候,如果你使用的是免费计划,你会达到可能性的极限。这时,一些编程知识将派上用场——你可能能够自己解决问题。
修改现有的 InDesign 脚本
第二种方法是在找到脚本——可能是一个人类编写的脚本——做了一些类似你想做的事情。(大多数公共脚本都是免费共享的,但在继续之前请检查许可证。)然后你可以将此脚本上传到 ChatGPT,并要求它修改脚本以完成你想要的功能。Vibe 编码在每次只要求一个改进时效果最佳。
例如,当处理桌面游戏时,我经常需要导出高分辨率的打印就绪 PDF 以及低分辨率的交互式 PDF 用于网页,我必须同时为几份文档执行这些步骤。我找不到一次性导出所有这些的脚本,所以我找到了一个做类似事情的脚本,并附带了以下请求:
This is a JavaScript script for InDesign. Currently it selects a folder full of files to export. I'd like it to export all open files instead. Can you please change the code and give it back to me?
ChatGPT 能够找出如何做到这一点,并返回一个一次性导出所有当前打开的文档的脚本。然后我问:
Currently the script outputs just one file, but I want it to output an interactive PDF and a print PDF. The interactive PDF needs a suffix of "WEB" before the ".pdf" and the print PDF needs a suffix of "PRESS" before the ".pdf". Can you help?
…而且它成功了。我根本不需要动手或重做任何事情;ChatGPT 就把它搞定了。现在,每次我需要将所有当前打开的文件导出为两个不同命名的 PDF 文件时,体验都是一致且快捷的。我自己根本无法编写这样的脚本,而且我之前在网上也从未见过这样的脚本。
并非每个氛围编码脚本都会像这个一样顺利;有时一个 LLM 会卡在错误的道路上,要么引用虚构的函数,要么以完全错误的方式处理任务。如果脚本请求变成了一次挫折的练习,就放弃聊天,重新开始。
Adobe Illustrator 中的脚本编写
在 InDesign 中有效的方法也应该在 Illustrator 中有效。要开始,你会在Adobe Illustrator 应用程序旁边找到脚本:
-
在
预设>en_US>脚本文件夹中,你可以找到文件 > 脚本菜单中显示的选项 -
在
脚本>示例脚本>JavaScript文件夹中,你可以找到可以从文件 > 脚本 > 其他脚本运行的几个示例
对于不那么实用但更有趣的事情,我像这样向 ChatGPT 提出了一个 Illustrator 脚本请求:
Please create a script for Adobe Illustrator that draws several new straight lines, connecting two points along a curve that a user has selected, in the style of Barbara Hepworth's string sculptures.
注意:虽然我在这里提到了著名的艺术家芭芭拉·赫普沃斯,但我并不是试图“窃取她的风格”,因为这些图案并不独特。当我大约 10 岁的时候,我在 Apple II 上用 BASIC 编写了自己的计算机程序来制作这样的图案,在我发现芭芭拉·赫普沃斯在现实生活中用绳子做了同样的事情之前。从那时起,我制作了许多动画交互版本。
ChatGPT 在短时间内编写的脚本超过了 200 行。我复制了它,打开 TextEdit,选择纯文本,粘贴,然后保存为.jsx文件扩展名。(使用 BBEdit 这样的文本编辑程序是个好主意,即使在免费模式下也能显示行号,但任何纯文本编辑器都可以开始使用。)回到 Illustrator 中,我创建了一个新文件,画了一个圆,并通过文件 > 脚本 > 其他脚本运行了脚本。脚本为我提供了几个对话框,让我提供效果的参数,我点击了确定通过默认值,结果发现…一个错误。
告诉 ChatGPT 错误后,它能够提出一个快速的修复方案。我替换了有问题的代码行,再次运行了脚本。再次点击默认选项后,Illustrator 成功地在圆上连接了多条线。

图 10.9 – 完全不像芭芭拉·赫普沃斯的创作,但我对它能够成功感到印象深刻
虽然输出实际上根本不像芭芭拉·赫普沃斯的雕塑,但脚本确实成功地绘制了几条连接圆上对立点的线条。这并不是我想要的,所以我再次请求:
That's a great start. Ideally, I'd like to see the new lines placed at equal intervals from one another, and typically the lines will cross over one another, so if position 1 meets with position 10, position 2 meets with position 11, and position 3 meets with position 12, and so on. Please make a script that makes designs like that?
ChatGPT 花了一分钟左右的时间,就给出了一个正好符合我想要的脚本。我画了一条快速 S 形曲线,运行了脚本,然后得到了这个:

图 10.10 – 这更像是芭芭拉·赫普沃斯(Barbara Hepworth)的弦雕塑
真是令人惊讶,我可以在几分钟内就有一个自动设计过程的想法,并且得到一个任何标准的、更不用说成功的、工作脚本,只需要几个请求。如果你曾经想要制作几何矢量艺术但不确定如何开始,现在从未如此简单。
但是等等——那还是艺术吗?
如果一位艺术家手动绘制了许多连接另一条线上两点的线条,他们可能可以将之作为艺术出售。但如果那位艺术家将任务交给学徒,并以自己的名义出售,这是公平的吗?这确实是安迪·沃霍尔在工厂(en.wikipedia.org/wiki/The_Factory)中所做的事情。
将其提升到下一个层次,如果我要编写一个计算机程序来制作这种艺术,这正是我过去几十年一直在做的事情,那么这是艺术吗?无形的东西很难销售,但我的代码驱动的动画已经在公共艺术装置中展出,所以让我们假设它确实符合艺术的标准。
人工智能自动化显然将这一步推进得更远,因为我不再需要知道代码是如何工作的来创建一个程序——我现在可以只要求它。虽然我确信这会让许多人认为产生的艺术更加不合法,但从另一个角度来看,这只是艺术家和他们的愿景之间另一个抽象层次。抽象并不是什么新鲜事。
在早期具有图形功能的计算机中,你可以手动放置一个像素,然后就可以绘制线条(en.wikipedia.org/wiki/Bresenham's_line_algorithm)。最终,反走样技术使这些线条更加平滑,尽管你今天可以实施 Bresenham 的线条绘制算法(就像我在大学时做的那样),但根本不需要。
今天的科技已经抽象化了实现 2D 和 3D 图形、游戏机制、窗口系统、文本输入、将文件写入存储设备等所有我们期望的细节。API 和库意味着我们现在通常工作在一个更高的层次上,很少有人愿意直接与硬件交互。如果你想制作一个游戏,为什么还要重新发明轮子,当 Unreal Engine、Unity 和 Godot 都可用时?
当有些人想要深入挖掘时,更多的人可能希望更快地制作更多东西,或者制作出更高品质的东西,因为我们不再需要纠结于实现细节。如果更多的人能够通过数字艺术来表达自己,那将是受欢迎的。
当然,制作艺术作品只是脚本功能的一小部分。脚本可以在许多应用程序中开启更高效的流程,但每个设计师都有自己独特的工作方式,有一套独特的喜爱应用,并且需要发现最适合自动化的任务。
要开始,注意您的工作方式,尝试识别那些耗时、繁琐或容易出错的常见任务。保存到多个格式和带有特定后缀的文件是容易取得的胜利,但 Adobe 应用程序并不是自动化的唯一候选者。最后,如果您灵感不足,可以查找您使用的应用程序的现有脚本,然后思考如何修改这些脚本。
是时候总结一下了。
摘要
阅读这些内容,你可能会对设计和图像处理的前景感到担忧,但至少在一段时间内我们还是安全的。并不是所有事情都可以自动化,有趣的部分、创造性的部分以及与其他人类的互动仍然是人类设计师最擅长的。每一张图片仍然需要人工关注才能达到最佳效果,在一个完全自动化的过程中,对每张图片应用相同的重设置会产生较差的结果。
高效工作很重要,但好的设计仍然需要时间,客户需要意识到他们正在为所有被丢弃的想法、错误的开始和导致最终作品的繁琐人工重处理付费。随着自动化消除了无聊的任务,您可以在相同的时间内完成更多的工作,或者通过在相同的时间内花更多时间在创造性方面来制作更好的作品。仅仅为了数量优化并不总是明智的——要选择得当。
接下来,我们还需要看看视频制作是否具有与某些图像制作任务相同的自动化潜力。让我们更深入地探讨动态图像。
|
获取本书的 PDF 版本和独家额外内容
扫描二维码(或访问packtpub.com/unlock)。通过书名搜索本书,确认版本,然后按照页面上的步骤操作。 | 
|
| 注意:请妥善保管您的发票。直接从 Packt 购买不需要发票。* |
| --- |
第十一章:视频与自动化 AI
视频编辑有时可能是一项耗时的工作,但现代人工智能工具准备提供协助,使编辑过程中的某些部分显著简化。在本书的早期,我们探讨了基于文本的编辑工作流程如何有助于简化编辑过程,现在,我们将探讨试图更完全自动化编辑过程的解决方案。
这些系统中有的是完全在线的,有的是完全离线的,还有一些使用混合模式。有的针对编辑者,有的针对更广泛的受众,功能差异很大。一些系统试图做所有事情,包括生成新的背景(甚至 AI 头像)作为编辑的一部分,而其他系统则旨在提供你可以进一步在所选编辑应用程序中润色的粗剪版本。
当你亲自评估这些视频服务时,保持开放的心态,考虑它们如何帮助你优化工作流程,即使你希望(或完全管理)最终编辑。
这里讨论的一些功能确实跨越到了实用人工智能领域,当然完全可能使用这些功能(如转录、日志记录和组织)而无需自动化实际的编辑。有关基于文本的编辑和相邻的基于转录的工作流程的更多信息,请参阅本书“实用人工智能”部分的第四章。基于文本的编辑是许多自动编辑解决方案的核心。
但你希望这种自动化进行到什么程度?虽然非编辑者可能希望服务完全为他们编辑一个片段,但经验丰富的创意人士可能希望保留最终控制权。人工智能很少完美,正如你将看到的,它不擅长将所有编辑放置在完全正确的位置。但“不完美”并不意味着“不好”,自动化仍然可以给你“一些东西”而不是一个空白的时序表。
在本章中,我们将探讨以下主要主题:
-
使用 DaVinci Resolve 的自动编辑
-
简单的自动编辑
-
基于提示的自动编辑
让我们找出编辑者(像我一样!)是否可以被人工智能取代,从拥有最多人工智能智能的桌面应用程序开始:DaVinci Resolve。
DaVinci Resolve 中的自动编辑
DaVinci Resolve (blackmagicdesign.com) 是一个我们已经讨论过的专业非线性编辑(NLE)应用程序,它包括一些自动编辑功能。在应用程序的免费和 Studio 版本中,你可以自动去除静音,在 Studio 版本中,你还可以使用IntelliScript根据脚本自动剪辑,或使用IntelliCut帮助分离单条音频轨道中的不同说话者。
从技术上讲,在 Resolve 中移除静音并不被归类为“AI”功能,但它自动化了这一过程,并且不会占用太多时间来提及。在编辑页面,选择一个剪辑,然后选择剪辑 > 音频操作 > 涟漪删除静音。这个功能并不特别智能,如果你的源音频比较安静,你可能会预期到一些你的话会被删除。幸运的是,你可以调整检测静音的阈值,所以调整它。

图 11.1 – 这不是 AI,但它做的是类似的工作
没有 AI 智能,这个功能只能完成一半的工作;正如我们很快就会看到的,AI 真的可以帮助检测重复句子、咳嗽和重拍。
IntelliScript 是一个可以节省大量劳动力的功能,而且使用起来非常简单。你从一个剪辑的转录开始,你可以在 Resolve 本身中生成它,或者使用 MacWhisper 或其他工具。接下来,在任意文本编辑器中编辑这个转录,删除你不需要的文字,只留下你想要保留的部分。
最后,右键单击你的源剪辑并选择AI 工具 > 使用 IntelliScript 创建新时间线…:

图 11.2 – 只需右键单击你的剪辑,然后选择一个文本文件,就完成了
在短时间内,Resolve 将找到你请求的所有视频片段,并将它们并排放在时间线上。不是每个编辑都是完美的,但它非常好。

图 11.3 – 最快粗剪的方法是遵循脚本
如果原始录音的多个片段与脚本中选择的行匹配,它们将被添加到主匹配旁边的轨道上,如图所示。要评估它们,按D键禁用主剪辑,然后再次按D键启用备用剪辑以找到最佳拍摄。请注意,如果你正在处理多机位剪辑,请确保首先创建多机位,然后应用 IntelliScript 功能。
最后,在Fairlight页面,有一个可以帮助音频任务的功能。当多个说话者的声音被录制到单个麦克风时,有时需要独立处理他们的声音。虽然围绕每个说话者的剪辑很繁琐,但 Resolve 可以帮助使这个过程变得容易一些。
要开始,将一个剪辑添加到时间线上,然后转到Fairlight页面,右键单击剪辑,然后选择AI 工具 > Checkerboard 到新轨道,就像这样:

图 11.4 – 这个命令使分离多个说话者变得稍微容易一些
如果还没有开始转录,转录就开始了,然后是处理。虽然结果并不完美,特别是如果说话者同时说话,但总的来说,这个功能做得很好。

图 11.5 – 重命名轨道后的输出
最好重命名轨道,无论是使用说话者的名字还是简单地使用 问题 和 答案。剪辑可能不是完美的,但它们仍然很有用,这使得应用基于轨道的效果变得容易得多。Resolve 有许多其他基于 AI 的功能——我们在 第四章 中讨论了一些——并且经常添加新的功能。这是一个很棒的应用程序,可以单独使用,也可以与其他 NLE(如 Final Cut Pro 或 Premiere Pro)一起使用。
但尽管 Resolve 是一个功能齐全的 NLE,较小的专业应用程序和网站也可以帮助自动化你的编辑。让我们从一些基本选项开始。
简单的自动编辑
即使我不是视频编辑,我也不会美化这一点:尽管这些工具中的一些可以产生节省时间的粗剪,但没有任何这些 AI 工具能够组合出一个值得观看的复杂最终剪辑。完成编辑中所投入的许多东西都是直觉的结果,是在现场获得的知识,以及在打印剧本边角上草草记下的笔记。
如果你的需求非常简单,而且你以前从未编辑过任何东西,你可能会想,你可以自己录制谈话,让 AI 选择最好的片段,然后生成一些 B-roll 来说明一些观点。实际上,我们之前已经查看的一些解决方案强调了生成性的一面,包括 HeyGen,它将生成 AI 说话者和 AI B-roll,从你提供的脚本(或另一个 AI 编写的脚本)中创建视频。
这不是我们的重点;我们试图将真实人物的原始素材编辑成好的剪辑。但遗憾的是:准备好失望吧。编辑有太多的变量,AI 第一次可能无法全部正确处理,可用的交付方法意味着可能不容易纠正创建的问题。
每个编辑器移除的咳嗽声、“嗯”或沉默都需要思考和仔细的时间安排。你是在试图完全掩盖编辑,计划用 B-roll 来掩盖它,还是这是一个特别感人的时刻,你需要保留所有内容?围绕编辑的暂停应该有多长才能最好地服务于这个编辑所传达的叙事?
如果你注意到大约 30 秒时提出的观点与大约 1 分钟后提出的观点相似,其中一个应该被删除,但你认为你无法干净地删除客户想要的那个,怎么办?对于所有这些问题,没有完美的答案,即使是按照“ house style”剪辑,每个视频也需要某种独特处理。尽管大多数人类不是视频编辑,但我们都已经看过很多视频内容,我们知道当我们听到和看到不好的编辑时。
然而,AI 可以帮助你移除明显的错误或重复的台词来构建一个粗略的剪辑。如果你有一个较长的采访片段,你可能会发现让 AI 剪掉不好的部分(咳嗽、采访者的问题等)以便你更快地到达工作好部分是有价值的。
要创建一个样本剪辑,我录制了自己对着摄像机讲话 1 分 41 秒,包括长时间的停顿、短时间的停顿、咳嗽、思维停滞和重复的台词。为了挑战音频处理能力,我没有使用外置麦克风,并且适度的风增加了适当的难度。这成为了我发送给所有测试的自动编辑服务的主要测试剪辑。
为了提供一个比较的基准,我也自己进行了编辑,剪掉了不好的部分,放大以掩盖跳跃剪辑,并精心处理每一个编辑,制作出一个 50 秒的成品。在 Final Cut Pro 中,这花了我大约五分钟的时间,我预计有经验的编辑在任何现代非线性编辑器中也能在类似的时间内完成这项任务。
为了进一步测试这些应用程序的能力,我还上传了一个更长的实际采访,但重要的是要认识到,编辑任务通常不会以线性方式扩展。相反,你处理的采访越多,每个采访中可能进入最终剪辑的部分就越少。随着总输入时间的增加,编辑工作流程会显著变化,你可能不希望在较长的项目中仅仅“剪掉不好的部分”。现实世界的编辑需要你将一个人的想法连接到另一个人的想法,这是一个更微妙的过程。
对于更简单的自动编辑的理想情况是,因此,一个更长、连续的对着摄像机的片段,其中包含大量的错误、咳嗽和停顿。AI 能否弄清楚什么是好的,什么是坏的?
Veed.io (veed.io) 是一个基于网页的视频编辑平台,它支持基于文本的编辑。我将我的主要 1:41 测试剪辑上传到系统中,它被转录,并选择了 Magic Cut 选项:

图 11.6 – Magic Cut 使基本自动编辑成为可能
初始剪辑确实发现了原始作品中的某些重复和故意犯的错误,但正如你所预期的,它并没有做得完美。一些我希望保留的停顿被移除了,一些我的话被剪得太紧,一些错误仍然保留在剪辑中。Magic Cut 并不完全符合我的需求,但它已经走了一半的路。
修正编辑很简单,因为基于文本的编辑界面清楚地显示了哪些转录内容被纳入了最终编辑。不幸的是,这种显示方式在视觉上无法区分停顿和其他噪音,如咳嗽,这使得解读稍微有些困难,但仍然容易操作。以这种方式剪辑提供了一种让非编辑人员接近最终编辑的方法,而且很快就掌握了技巧。

图 11.7 – Veed.io 中的基于文本的修正编辑
这里还有其他功能,包括音频清理,它做得很好,在处理和不良之间取得了不错的平衡。您还可以删除填充词,修剪静音,转换画幅比,移除背景,以及一些更高级的选项。一个让演讲者始终看向摄像头的功能对我来说效果不佳;它让我的眼睛看起来很奇怪。
虽然这里有一些有用的功能,但缺少一个功能使得该网站的使用价值大大降低。不幸的是,Veed.io 无法导出为 NLE 友好的格式,因此您必须在基于网络的界面内完成完美的编辑。因此,这个应用旨在取代视频编辑应用,而不是增强它们,而这并不是我所希望的。如果我不能将输出返回到我在 NLE 中选择的时序中,那么对我来说作为视频专业人士就没有什么用处。
我需要能够进行色彩校正,或者至少能够处理 Log 脚本。我需要能够添加自己的标题或转场。最重要的是,我需要能够精细调整编辑。基于文本的编辑对于粗剪很有用,但很难移动几个帧来使停顿恰到好处。由于几个帧可能就是普通编辑和优秀编辑之间的区别,我认为许多专业编辑都希望有时间线导出功能,这样他们就可以自己添加最后的修饰。
如果您的需求更简单,Veed.io 可能就足够了。基础计划起价为每月 24 美元(或每年 144 美元),但您需要专业计划才能进行 4K 导出和一些额外的 AI 功能,如头像和配音。
Gling (www.gling.ai/) 是一个本地运行的解决方案,它首先会要求您在转录剪辑之前选择 AI 编辑或提取短片。在这个阶段,您可以将多个剪辑连接成多机位,甚至上传脚本。准备好一个或多个剪辑用于转录后,您将选择默认选项:

图 11.8 – Gling 提供了多种处理选项
处理完成后,这在我的测试中比运行时间要少,视频将在屏幕底部的时序图中呈现,并带有左侧的基于文本的界面。自动编辑删除了比理想中更多的暂停,但重复的短语被正确删除,以及开头的一个错误开始。
Gling 不是设计来为您执行更复杂的编辑,或者对哪个镜头最好做出判断——那是您的工作。不幸的是,暂停和咳嗽在基于文本的编辑界面中不会显示,但仍然很容易进行编辑。

图 11.9 – 选择一条线,然后根据需要剪切或恢复它
每个包含在视频中的部分都可以使用窗口底部时间线中每个剪辑上出现的“魔法棒”图标来应用或移除效果,或者您可以使用顶部菜单中的增强菜单将这些效果应用到时间线中的所有剪辑。

图 11.10 – Gling 的控制面板相当简单,但效果良好
除了基于文本的编辑外,您还可以直接在时间线上放大,进行逐帧编辑——如果遗漏了单词片段,这是必要的。
关键的是,在此处理之后,您可以导出到几种 NLE 友好的格式之一:FCP、Resolve 和 Premiere 都受支持。无论是闭路字幕还是开放字幕、跳跃缩放,以及您所有的编辑都将在这段旅程中幸存,但音频清理则不行——您必须自己修复。

图 11.11 – 包含了多种不同的导出选项
注意,如果您使用多台摄像机拍摄,您将希望使用 Final Cut Pro 或 Resolve 以获得最佳效果,因为 Premiere 不支持多机位导出。最简单的流程是仅上传音频效果最好的角度,让 Gling 完成其工作,然后以多机位格式下载。
在您的 Final Cut Pro 或 Resolve 中,您可以打开多机位容器(您可能需要从时间线中“显示”它),然后添加并同步其他角度。返回到您的主要时间线,现在您可以手动切换角度。
Gling 并不昂贵,但您将需要一个付费计划来定期导出到 NLE 友好的格式。在免费计划上,您第一次的时间线导出是免费的,但之后,您至少需要支付每月至少 20 美元(或每年 120 美元)来使用此功能。由于您可以免费测试,您可以发送一些您的剪辑,看看 Gling 的编辑是否可以为您节省时间。
如果这些解决方案提供的灵活性不足,一些其他工具可以给出更具体的指令。让我们提示其中几个。
基于提示的自动编辑
Riverside (riverside.fm) 是一个知名的编辑平台,具有多个支持基于网页的编辑工作流程的功能。通过基于提示的 Co-Creator 功能,我请求了一个大约 50 秒长度的输出,并且它智能地确定了要包含的内容,做得相当不错,但有些短语剪裁得太紧,剪掉了部分单词。我的后续提示有时成功,有时不成功。

图 11.12 – 使用 Co-Creator 提示略带不可预测性
在上一图中的第一个请求中,AI 无法调整检测到噪声的暂停容忍度,并将明显的咳嗽重新添加到编辑中。在第二个请求中,编辑中被剪掉的具体单词没有被恢复。尽管如此,能够请求特定时长的工作得很好,作为第一步,使提示变得多样化。幸运的是,基于文本的编辑界面非常全面,使得从成品中添加或删除转录部分变得容易。

图 11.13 – 当你悬停在暂停(…)上时,Riverside 会告诉你它有多长,噪音通过波浪线显示
此处的基于文本的编辑在复杂度上比 Veed.io 和 Gling 都要高,因为它可以区分咳嗽和暂停,甚至可以告诉你暂停有多长——只需悬停在其上。请注意,背景噪声可能导致沉默和暂停被混淆;一如既往,更好的输入质量会产生更好的结果。
在关于音频 Gen AI 的早期章节中简要提到了 Riverside 的一个名为 VideoDub 的功能,如果你想尝试,选择一个单词,然后在上面的 VideoDub 中选择。你可以输入一个替换单词,新一代将取代原始音频。遗憾的是,这对我来说效果不佳,因为生成的合成语音与我自己的声音不匹配。

图 11.14 – VideoDub 可能对你很有用,但音频听起来不像我的原始语音
除了基于提示的 Co-Creator 之外,你还会发现其他 AI 工具,用于去除暂停、填充词(或“废话”)、提高音频质量、强制眼神交流等。不幸的是,音频清理功能的品质并不出色,对我来说,听起来相当经过处理。
优点在于,窗口底部的时间线界面非常灵活,允许精确控制每个编辑放置的位置。如果你对仅网页的界面感到舒适,并想在这里做大部分编辑,Riverside 可能适合你。

图 11.15 – 在 Riverside 中的编辑工作流程考虑得非常周到
不幸的是,如果你是视频专业人士,这个工具并不提供 Gling 在时间线导出方面的相同灵活性。仅支持导出到 Final Cut Pro 和 Premiere Pro 的时间线(不支持 Resolve),并且都不包括多机位支持。更糟糕的是,这个功能仅支持在商务计划中,其固定价格没有显示。没有时间线导出,Riverside 无法像 Gling 那样轻松地融入现有的视频编辑工作流程。Pro 计划的费用起价为每月 29 美元(或每年 288 美元)。
Descript (www.descript.com/) 是我们在生成音频的背景下考虑的一个应用程序,但其中还隐藏着一个完整的可提示视频编辑系统。与其他系统类似,在您上传源剪辑后,它们将被转录并在基于文本的编辑界面中显示。

图 11.16 – 暂停用垂直线(|)表示,但咳嗽没有显示
这里的一个优点是,这些文字也显示在窗口底部的时间轴上,这使得在视频中找到特定的文字变得容易。波形最初是隐藏的,但可以通过快速点击其中一个文字来显示。

图 11.17 – 时间轴上的文字是一个有用的补充
展示了几个预设的 AI 工具,包括清晰编辑、工作室音效以及去除填充词或重拍的工具。我发现这些预设选项并没有达到我期望的效果;并非所有重复都被找到,并非所有咳嗽都被移除,并且在应用了工作室音效后,音频质量相当粗糙——对我来说太强烈了。

图 11.18 – 帮助你开始的预设
然而,在我的测试中,基于提示的系统似乎做得更好。助手被称为Underlord,这个名字听起来像是一个奇怪的品牌选择,但它运作得相当不错。我要求将总长度裁剪到 50 秒,并且它设法保留了视频的大部分正确部分,并裁剪了其余部分。并非每个决定都是我想要的——有时咳嗽被移除,而没有移除它之前的部分句子——但它已经很接近了。

图 11.19 – Underlord对英语语言请求做出响应,比预设选项更灵活
尽管我试图通过与 Underlord 交谈来纠正一些错误,但它并没有完全做到我想的那样。如果你想要简单的事情,你可能最好自己来做。
虽然 Descript 设法很好地放置了编辑,没有剪掉任何单词的边缘,但我确实发现一些本应剪掉的片段被留下了。通过转录本进行编辑很容易,允许你仅使用鼠标或通过键盘快捷键恢复被剪掉的单词或删除额外的单词。
当你完成编辑后,你可能希望将其导出为时序友好的格式,并在你的 NLE 中进行最终剪辑,但这需要创作者层级或更高层级的付费计划,每月 35 美元(或每年 288 美元)。不支持多机位,因此它可能不适合多机位拍摄。如果你使用 Descript 进行其他目的,那么 Underlord 可能很有用,但我怀疑严肃的编辑工作可能更适合使用艾迪。
艾迪 AI (heyeddie.ai) 是一个带有本地应用、支持基于提示的交互和 AI 驱动的粗剪的服务。此外,它不仅允许将内容导出到所有常见 NLE 的时序中,还可以从它们中导入。你现在可以选择几个选项,但我预计它们很快就会改变。即将推出的选项允许提供 URL,艾迪可以从中学到更多关于视频主题的信息,但如果你愿意,也可以直接聊天。

图 11.20 – 在艾迪中开始编辑的几种方式
艾迪至少需要 5 分钟的素材才能开始工作,这使得进行基本测试变得有点困难,所以我通过提供更长的测试访谈来稍微加大了力度。虽然可以上传包含较短剪辑重复的时序,但艾迪的优势并不在于简单地去除咳嗽和停顿。它不会添加缩放以掩盖跳切,也没有传统的时序可以自行调整。
艾迪的目标是成为一个更远的助手,并且能够处理更复杂的任务。

图 11.21 – 艾迪中的粗剪开始
通过接受视频编辑应用中的现有素材,包括直接从 Final Cut Pro 来的单个剪辑和多机位剪辑,将它们集成到现有的视频编辑工作流程中变得容易得多。为了避免上传多 GB 的源文件,我首先对剪辑进行了转码,但我不必这么做;艾迪自动完成了同样的工作。

图 11.22 – 在转码前将两个源剪辑合并成一个单机位
基于 AI 的粗剪在处理某些类型的访谈和摄像机前的演示时表现良好,但与其他类型相比则不太理想。尽管可以一起上传多个访谈,但 AI 无法确切知道哪些句子最重要,并且可能会选择不太理想的答案。
最后,人类编辑可能不会在第一次尝试就为特定的视频片段挑选出最好的答案;这个过程需要深入了解主题,有时甚至需要客户亲自查看转录本。讲述故事是人类的任务,而 AI 并不理解什么是有价值的。
尽管如此,Eddie 做对了所有正确的事情;不仅仅是猜测,在继续之前还会询问更多信息。它询问了目标长度,是否想要排除采访者——这是正确的问题。然而,尽管它开始于我拍摄过的最好的一次采访之一,但它第一次尝试并没有将最好的部分组合成一个故事——它怎么可能呢?它不是人类。它不能从转录本中读出情感。它错过了魔法,尽管它诚实地并没有做得太差。
在所有这些工具中,Eddie 提供的选项提供了最大的灵活性,但人类仍然需要创作故事。人类需要倾听,不仅仅是听他们说的话,还要听他们是如何说的。Eddie 可能会很快提出一个不错的编辑,但同样,也可能不会。复杂的工作需要更多的计划和思考,而且将不同对话的零散线索结合起来创造一个更宏大的叙事并不容易。

图 11.23 – 从预设按钮中选择,或者如果你喜欢,可以输入自己的回复
令人兴奋的消息是,因为 Eddie 倾向于提示并鼓励对话,你可以要求它进行重大、详细的更改。你不会被排除在外;你对原始素材了解得越多,你得到好结果的可能性就越大。例如,如果你知道你想要包含某一行,你只需要求它,Eddie 就会找到并为你添加它。将 Eddie 视为一个合作伙伴,它将根据你的请求修改其编辑。预设按钮允许你要求基本选项,或者你可以在文本输入字段中输入其他内容。

图 11.24 – Eddie 会问很多问题,你也可以向它提问
当你通过提示与系统交谈时,Eddie 会带你浏览它为你准备的不同编辑部分,并询问你是否对它的成果满意。没有时间表需要烦恼,尽管你偶尔会看到一份转录本,但更改是通过你直接请求或通过你对它的提问来进行的。如果你不确定,让 Eddie 剪掉较长的部分而不是较短的,这将给你在稍后进行最终剪辑的灵活性,但你的行为将更像是一个导演或制片人,而不是编辑。
有趣的是,这个系统拒绝去除“嗯嗯”以保留真实性。我尊重这一点,如果需要的话,我可以自己去除它们——毕竟,这也是我拍摄多个角度的原因之一。

图 11.25 – 我尊重爱迪拒绝去除嗯嗯
尽管我仍然想在自己的编辑应用中进一步润色最终剪辑,但我确实可以看到它在较长的访谈或中等复杂编辑中的用途。如果客户要求包含特定的答案,我无需找到那些词的确切位置。如果爱迪可以通过搜索转录本来找到它们,它就会找到并为我添加它们。它选择省略的那个句子?只需要求即可。
您可以要求更长的剪辑、更短的剪辑、更多的剪辑、更少的剪辑——无论这个故事版本需要什么。如果您喜欢,可以用作预编辑工具,或者尝试讲述整个故事。一次处理多个剪辑,或者按您喜欢的顺序逐个处理。
在所有交互式编辑之后,爱迪能够组装出一个不错的粗剪——有点长,但作为进一步剪辑的起点或与其他编辑访谈集成的原始素材都是一个很好的起点。
剪辑以视频形式展示,您可以在应用中观看,也可以阅读转录本,或者简单地拖动图标并将其放入您的编辑应用中。

图 11.26 – 从各种不同的格式中选择,然后拖动离开
那个 XML 文件可以作为一个单角度的多机位剪辑交付,甚至可以设置一个由多个剪辑组成的多机位剪辑,通过音频同步给您,它引用的文件可以链接回您原始的全尺寸媒体。现在您可以自由地选择角度并进行精细调整。是的,还有一个参考 MP4,但您可能希望从自己的 NLE 中导出最终版本。
与 FCP、Resolve 和 Premiere 的集成是现成的,您可以将剪辑拖到爱迪中,或者将完成的编辑拖回另一个方向。方便的是,您还可以将完成的时序拖动到爱迪中,然后要求它剪出一些适合社交媒体的时刻。这可能不是编辑中最困难的任务,但我相信许多编辑会欣赏这一点。
说实话,爱迪让我感到惊讶。尽管这种方法与其他应用在这里的方法真的很不同,但它的功能可能对严肃的编辑来说比我所查看的其他应用更有用。虽然 Gling 可能对粗剪更可预测的片段很有用,但爱迪是唯一一个将提示与 NLE 时间线导出相结合的解决方案,这非常受欢迎。
费用从低开始,但可能会变得昂贵。Plus 计划起价为每月 25 美元(或每年 252 美元),每月允许从 4 个不同的项目中多次导出。如果您需要更多,Pro 计划起价为每月 125 美元(或每年 996 美元),每月允许从 10 个项目中多次导出。
使用 AI 操作 XML
自动视频编辑并不是唯一一种使用 AI 辅助视频编辑过程的方法,但它是最容易接触的。虽然可以使用 LLM 来处理描述编辑时间线的文本文件,但这个过程最终变得相当技术性,并且容易出错。虽然这里有很大的潜力,但我认为这个过程对大多数编辑来说太复杂了,难以遵循。
仍然,如果你好奇想要探索,可以从 Peter Wiggins 的这段视频开始(youtu.be/ixoJdNL4RpM?si=VMgoydkvIVbL-pkB),然后继续观看他的其他视频。
摘要
这个空间比我预期的要复杂,展示了各种各样的工具和能力。简单的编辑任务可以通过这里的几个工具完成,但如果你有更复杂的任务,你的选择会少很多:
-
如果你只需要从镜头到成品视频,那么 Veed.io 或 Riverside 可能适合你,但如果你需要时间线,他们要么无法提供,要么为此收费很高。
-
Gling 为特定 YouTube 博主面对镜头的问题提供了一个很好的解决方案,如果你经常处理较长的项目,其基于文本的编辑加上 XML 导出可以为你节省大量时间。
-
虽然 Descript 允许更复杂的请求,但由于它不导出多摄像头格式,所以它并不适合需要这种格式的任务。
-
虽然 Eddie 不太适合短期的任务,但它可以在大型项目以及更复杂的编辑任务上节省大量时间。我对它如何理解我的请求感到惊讶,并对结果感到满意。
这些产品针对不同的受众,我建议尝试几个,看看哪一个最适合你。这个空间比我预期的要复杂得多,鉴于现有的视频编辑工作流程的深度和多样性,你可能会想亲自测试这些解决方案中的几个。
最后,我们来到了这本书的最后一章。是时候看看代理和数字助手如何帮助我们今天以及未来几年了。
|
获取本书的 PDF 版本和独家额外内容
扫描二维码(或访问packtpub.com/unlock)。通过书名搜索这本书,确认版本,然后按照页面上的步骤操作。 | 
|
| 注意:请妥善保管你的发票。直接从 Packt 购买的产品不需要发票。* |
| --- |
第十二章:数字助手和代理的自动化人工智能
当 Siri 和谷歌助手等现代语音驱动数字助手最初推出时,它们看起来像是魔法,但它们能力的局限性很快变得明显。尽管数字助手在创建约会和提醒、启动应用程序和口述信息方面仍然非常有用,但像 ChatGPT 这样的现代 LLMs 甚至可以做更多的事情——甚至包括语音。为什么我们的数字助手没有简单地被 LLMs 取代呢?
这个问题的答案很复杂,是隐私、可靠性和成本担忧的混合体。无论如何,这个过程已经开始了。似乎不可避免的是,谷歌助手最终将被 Gemini 完全取代,而 Siri 将变得更聪明。
今天的基本助手不可靠是它们没有被更广泛使用的关键原因,而隐私是 LLMs 的关键争议点。成本也是一个担忧,使用通用 LLMs 来回答数字助手的所有当前请求需要显著提升计算能力。
尽管挑战巨大,但潜在的影响也同样巨大。在本章前瞻性的内容中,我们将探讨数字助手在未来几年内可能的发展趋势,创意专业人士如何可能发现它们的有用之处,以及为什么许多之前尝试将人工智能工具整合到我们日常生活中都失败了。
现代操作系统目前正在适应一个未来,其中大型语言模型(LLMs)在我们的计算生活中有更紧密的整合位置,自动化潜力巨大。虽然今天你使用的每个应用程序都不一定能自动化,要么是因为它们没有为此做好准备,要么是因为过程对大多数人来说过于繁琐而难以管理,但这种情况即将改变。
在本章中,我将区分数字助手和代理,前者遵循简单的指令,后者为你执行一系列任务,有时包括具体行动。中间可能存在一些模糊性——你可能会要求数字助手执行代理任务,但就目前而言,这是一个很好的划分点。
你可能已经以某种方式与人工智能代理互动过了,很可能是通过自动电话系统。以前只在大公司中存在,如今,个人可以创建用于自己使用的代理,或者代表客户与他们交谈。代理可以帮助你完成创意任务,如市场营销,执行并总结研究,提供交谈对象,或充当虚拟呼叫中心。
虽然今天的 LLMs 乐于为你进行研究,但代理执行更复杂的任务,如规划你的日程、预订假期或购买午餐并送货上门。有些人永远不会信任 AI 处理他们的信用卡信息,但我确信许多人会,而且人类与决策的距离越远,风险就越大。
代理工具不仅对创意专业人士有用,而且它们很可能是公众 AI 叙事的重要组成部分,值得一看。今天,从主要的 AI 提供商那里可以获得标有“代理”的工具。此外,将 LLM 直接集成到浏览器中(就像 Atlas 现在将 ChatGPT 集成到其浏览器中一样)可以带来额外的代理能力,在你观看的同时填写表格或完成购买。
在这本书的大部分内容中,我试图关注实用、可测试的解决方案,但随着代理故事的构建仍在进行中,这一章节将目光投向了更远的未来。代理和我们的未来数字助理都很重要,但这个故事的部分内容仍在测试阶段。
在这一章中,我们将探讨以下内容:
-
数字助理,今天和未来
-
AI 驱动的可穿戴设备
-
AI 驱动的浏览器
-
代理:为你执行复杂任务
这是一个多角度的故事,涵盖了移动、桌面和语音交互模型。让我们从数字助理开始。
数字助理,今天和未来
当你要求今天的数字助理为你做某事时,通常是在单个应用程序中执行的一个简单操作:设置定时器、拍照或在你回家时提醒你任务。语音是这一套件中的变革性部分,因为它允许你在屏幕太小不方便操作或你正忙于其他事情时执行任务。
与 Siri 或谷歌助手相比,ChatGPT 和 Claude 等 LLM 更智能,那么为什么它们不能做今天数字助理能做的所有事情呢?首先,因为它们无法访问所有相同的数据,其次,因为基于新 LLM 的系统必须处理当前系统几乎能处理的所有事情,否则一些用户将拒绝使用它。
这种“部分替代问题”已经在一些从谷歌助手过渡到 Gemini 作为内置语音助手的谷歌手机上显现出来。如果一个曾经由谷歌助手明确处理的简单任务(比如设置闹钟)在 Gemini 处理得不够好,这在许多人看来就是失败。替换现有系统很困难,替换数十亿用户使用的数字助理更是难上加难。
尽管如此,似乎数字助理最终将被升级到能够执行代理所能做的许多事情的程度。Gemini 正在这样做,Siri 预计也会这样做,甚至微软的 Copilot 现在也有一个可选的友好、类似 blob 的面部表情,名为 Mico (arstechnica.com/gadgets/2025/10/microsoft-makes-copilot-human-centered-with-a-90s-style-animated-assistant/)。
这不是微软第一次尝试数字助理。以下是一些过去的尝试:
-
在 20 世纪 90 年代的 Microsoft Word 中,有一个名为Clippy的动画回形针,因其“看起来你正在写信”而闻名。
-
微软 Bob (
en.wikipedia.org/wiki/Microsoft_Bob) 是一个短暂的尝试,旨在为 Windows 3.1 提供更友好的用户界面,引入了一只名为 Rover 的卡通狗和 Comic Sans 字体。这个产品在 1995 年 3 月推出,但在同年 8 月就停产了。 -
Cortana (
en.wikipedia.org/wiki/Cortana_(virtual_assistant)) 是微软最新的尝试,首次在 2014 年展示,但它在 2023 年被 AI 驱动的 Copilot 所取代。
虽然传统的数字助手可以访问你的本地数据,如联系人电子邮件,但基于云的 LLM 没有相同的权限。我们每个人都在手机上存储了大量的个人数据,我们不希望这些数据被公开。相比之下,与 LLM 的聊天(至少在免费账户中)通常被用来进一步训练这些 LLM。
在一个大多数大型科技公司(苹果公司除外)通过向广告商出售你的个人数据来赚钱的世界里,许多人对于将他们的日历、文件和电子邮件托付给第三方持谨慎态度。他们也有理由担心,如果错误的文件被一个故障的 AI 删除,可能会导致数据丢失。
苹果公司对此的反应是缓慢而谨慎,但苹果智能的功能设计时考虑到了隐私。最简单的任务在设备上运行,而更复杂的任务则在苹果自己的私有云计算环境中运行,苹果公司本身无法访问该环境 (security.apple.com/blog/private-cloud-compute/)。
即使 LLM 提供了今天数字助手的所有功能,并且隐私问题得到了解决,还有一个第三问题:如何与所有你的应用交流。Siri 或 Google Assistant 可以处理与常见操作系统功能相关的基本任务,如电子邮件或消息,但第三方应用必须明确告诉系统它们可以做什么以及如何使用这些功能。LLM 不仅需要这种知识,还需要一种简单的方式来告诉这些应用执行操作。
今天,这个过程在一定程度上是手动的,需要构建自定义自动化。例如,如果你想从 Siri 那里获得更多功能,你可以创建一个快捷方式(在系统级自动化引擎Shortcuts中),它可以在一个或多个应用中执行操作,然后通过你的声音来触发它。或者,在桌面平台上,你可能依赖于脚本支持,甚至模拟点击或按钮按压。并非所有应用都支持快捷方式或脚本,模拟按钮按压是容易出错且不可靠的。
简而言之,当今大多数自动化系统都是刚性和脆弱的;它们容易崩溃。一种通用的方法,让大型语言模型(LLM)理解和控制任何应用程序,可能意味着人工智能(AI)最终可以开始为我们做更多的工作。自 2016 年以来,苹果平台上的应用程序已经能够声明App Intents,这些声明描述了它们可以执行的功能、它们期望作为输入的数据以及它们将提供的输出。这些不是面向人类的;它们是为了帮助应用程序相互交流。
苹果还将基础模型(基本的 LLM)集成到系统级自动化系统 Shortcuts 中。在最新的操作系统中,苹果智能允许你从设备上的模型、苹果服务器上的私有模型,甚至是 ChatGPT 生成输出,然后对输出进行操作。虽然许多 LLM 的输出是纯英文,但如 JSON 这样的文本格式允许灵活的跨应用程序通信策略。
这里有一些你可以使用的例子:appleinsider.com/inside/ios-26/tips/how-to-use-apple-intelligence-in-shortcuts-to-save-time-every-day?utm_medium=social&utm_source=threads。基础模型是 LLM 和今天的自动化解决方案之间有用的桥梁,但它们并不一定打开通往全面系统控制的闸门。
一些即将推出的系统可能更加全面。让我们快速浏览一下现有计算机系统可能被 AI 工具控制的一些方式。
MCP:跨平台未来自动化系统
如果数字助手将要承担更多的代理属性,LLM 将需要能够更直接地与应用程序交互,这就是 Anthropic 的模型上下文协议(MCP)(modelcontextprotocol.io/docs/getting-started/intro)发挥作用的地方。虽然App Intents和基础模型仅限于苹果,但 MCP 是一个跨平台解决方案,它将大多数 LLM 连接到允许的数据源和应用程序,提供了一个新的、安全的连接层。
理论上,如果一个操作系统支持 MCP,并且该系统上的应用程序支持 MCP,那么 LLM 可以为你控制应用程序,执行比今天的数字助手或自动化技术更多的任务。确实,这非常接近代理的领域,而且这可能是我们最终要走向的方向,但这种控制水平也将允许 LLM 为你直接执行更广泛的各种简单任务。
这有多远?我们无法确定,但初步的 MCP 支持预计很快就会出现在 macOS 和 iOS 上(appleinsider.com/articles/25/09/22/ios-26-could-get-a-major-ai-boost-with-the-model-context-protocol),它也将来到 Windows(developer.microsoft.com/en-us/windows/agentic/)。细节尚未最终确定,但幕后有进展。
有趣的是,一个名为Sky的基于 Mac 的 AI 自动化工具(openai.com/index/openai-acquires-software-applications-incorporated/)最近被 OpenAI 收购,因此我们可以期待在这个领域取得进一步的进展。
由于我们的所有应用、操作系统和 LLM 都将在 MCP 准备好之前需要一些时间,一个中间步骤可能是让 AI 工具为我们驱动电脑,使用标准的人类用户界面。这项工作正在进行中,但如果 AI 能理解我们的软件是如何工作的,我们能否要求它查看我们的屏幕并教我们如何使用新应用?当然,如果电脑知道我们的软件是如何工作的,这应该很容易……对吧?
桌面应用的 AI 辅助
Gemini Live (gemini.google/overview/gemini-live/) 可以观察你使用电脑的情况,然后根据你所做的事情给出有针对性的回答。其他系统也能做到这一点,但 Gemini Live 是公开可用的,并且易于访问——如果你喜欢,可以试试看。
虽然这听起来很棒,但它远非完美,很快就会变得令人沮丧。本质上,AI 系统对程序手册的理解程度相当于一个阅读过手册但不是专家的人。
我通过让 Gemini 观察我使用 Adobe InDesign,省略问题中的重要细节,并观察它是否能引导我找到最佳答案来测试这一点。我多次亲自或通过屏幕共享和视频通话教授学生设计和视频应用,所以我清楚预期和答案应该是什么,但新手可能不会。

图 12.1 – 这是 InDesign 中的启动屏幕,包含我的基本问题和回答
当我暗示自己身处澳大利亚时,Gemini 正确地建议了 A4 作为常见的页面尺寸。这正是我所期望的,但我更希望 Gemini 能识别出我的位置并自行意识到这一点。更令人不安的是,尽管我说我在制作传单,但它直到我明确表示要打印 2000 次时,才想到要提到包括 3 毫米出血。

图 12.2 – 装订出血对于大多数专业印刷文档来说很重要,而且应该在我提醒之前就提到
从一些建议的表达方式来看,感觉我就像是被一个刚刚学会使用这个应用的人引导,而不是一个对应用非常熟悉的人。一个新手用户很容易遵循这些指示,却可能走向灾难——AI 并没有真正理解最佳实践,只是简单地回答了提出的问题,而不是提供真正需要的信息。
在 Ripple Training 的马克·斯宾塞(Mark Spencer)进行的一个类似实验中(youtu.be/dCj7-BgjlOI?si=0VJDPYEvW8j29hIU),他试图让 AI 教他使用 Final Cut Pro,我认为可以说他的体验比我更糟糕。
虽然它做了一些正确的事情,但也有很多错误,提到了不存在的按钮和快捷键。马克是一位专家,他知道他问的所有问题的答案,但一个新手可能会尝试、失败,然后放弃。
在学习过程中,阅读手册是不够的;你需要有见地的经验。参考手册和教学手册之间存在巨大的差距,人类需要以更有机的方式进行教学。软件公司通常会教授执行功能的“官方”方式,但知道某个功能不正常的有经验的培训师会足够聪明地告诉你这一点。
今天,我无法推荐让计算机教你如何使用软件,这与简单模式相比。当计算机连如何可靠地告诉我如何做都做不到时,我怎么能期望它为我完成任务呢?为了为我完成任务,AI 需要确保每一步都正确无误,而早期的基本错误可能会导致后续出现巨大问题。
持续的不可靠性是 AI 尚未(可能永远都不会)准备好取代人类完成所有这些任务的一个巨大原因。是的,MCP 可以使这个过程更快、更简单,但如果这种速度没有伴随可靠性,我们就无法信任 LLM 处理我们所有的数据。让我们进入统计学来了解原因。
可靠性:你需要多少个 9?
一个常用来衡量计算机系统可用性高标准的术语被称为五个 9,意味着它有 99.999%的时间可用,或者说一年中只有超过 5 分钟的停机时间。让我们将这个指标应用到 AI 系统的可靠性上。
如果一个系统在 100 次决策中犯了一个错误,那么它的可靠性是 99%——两个 9。一个在 100,000 次决策中犯一次错误的系统将是 99.999%可靠的——五个 9。那么,在提供建议时,系统需要有多高的可靠性?
在接受建议时,我仅仅期望这些建议大部分是可靠的,我可能甚至不需要达到两个 9(99%)的可靠性。但是,屏幕监控的 AI 还远远没有达到两个 9;如果你比较屏幕监控系统的声称知识与专家告诉你的内容,它们可能只有大约 80%是正确的,这远远不够。坦白说,如果一个人告诉我的 20%是错误的,我就不会信任他们,并且我会完全停止听他们的话。
但是,提供建议的成功门槛比执行任务要低,而大型语言模型(LLMs)是出了名的会幻想、在压力下恐慌、忽略指令。当你要求某人替你完成工作时,他们必须按照你的标准来完成。
因此,如果你将一个小型办公室的工作交给初级同事,你可能能够容忍一些错误。如果你可以自己检查结果,那么不完美的结果可以被纠正,无论是你自己还是通过要求同事解决问题。
这同样适用于你转交给 AI 的工作,但请记住,每个子任务都存在失败的风险。你的信心越低,你就需要越频繁地检查进度。
如果某人的工作产出失败率达到了 20%,那将是一个巨大的问题,而现在,训练用于操作常规计算机的 AI 模型在基准测试中通常低于 80%。简单来说,我们还没有达到那个水平,根据 Sayash Kapoor 的说法,我们需要新的技术才能达到(youtu.be/d5EltXhbcfA?si=hoajlz1CVJg351bp)。

图 12.3 – Gemini 2.5 计算机使用在常见基准上的性能,来源:https://blog.google/technology/google-deepmind/gemini-computer-use-model/
随着任务的日益关键,以及验证输出所需的时间减少,可靠性变得更加重要。可靠性已经是人们停止使用数字助手的一个原因;他们要么没有正确听到,要么无法执行请求的动作,或者他们根本就没有完成。
在一些人工智能辅助的场景中,例如自动驾驶汽车,容错空间几乎为零。在道路上,通常几乎没有时间来反应汽车所犯的转向错误,而这个软件的缺陷可能很快就会导致致命。
在常规汽车中添加自动驾驶软件所面临的不确定性可靠性是一个基本问题:从“相当不错”的系统过渡到“完美”的系统非常困难。你如何安全地从不相信汽车过渡到完全信任汽车?在什么点上你可以放松?
如果软件仅仅是“辅助”的,那么人们并不期望它完美——比如说它是 99%。人类驾驶员的目的是保持警觉,并在软件出错时准备接管控制——我确实经常在我自己的车突然减速避让阴影时接管控制。然而,随着软件的改进,人类不可避免地会越来越信任它。当软件的行为正确率达到 99.999%,需要的干预更少时,人类可能会放松并停止关注。当最终出现问题时,比如汽车应该避免但未能避免的情况,人类可能无法及时反应。
公平地说,人类也不是完美的,从大局来看,平均未来的 AI 驾驶员可能比平均人类驾驶员更安全。区别在于,当 AI 犯错时,它可能犯的是人类不太可能犯的错误,比如撞到翻倒的卡车侧面。AI 从未见过这种情况,或者其传感器无法正确检测到它,但人类根本不会犯同样的错误。
数字助手面临的风险较低,但存在类似的问题,即信任问题,而且一个过程中的步骤越多,其中一个步骤失败的可能性就越高。今天,如果 Siri 无法完成某项任务,你会叹气,打开正确的应用,然后自己完成。但如果你有一个“更聪明”的系统自信地说它已经完成了,你怎么知道呢?
当他们过去经常失败时,你怎么能确保他们会正确且完整地完成任务?如果 ChatGPT 去年无法告诉你“strawberry”中有多少个“r”,你怎么能过渡到要求未来的 ChatGPT 用你的信用卡预订假期?这可能是一个大多数时候都能正常工作的任务,但每千次中可能有一次会买错机票,或者把你送到一个城市的替代(但不太方便)机场。
随着我们越来越多地将我们的数据托付给更强大的系统,我们将听到更多灾难的消息。今天,你可以将你的信用卡连接到 LLM,并要求它为你订购并送货上门——比如一瓶水。尽管这可能大多数时候都能正常工作,但考虑到风险,总会有骗子准备利用新授权的机器人。我们在自己与购买的产品和服务之间设置的自动化层级越多,诈骗的风险就越高。
目前来看,我认为数字助手和所有电脑上的应用程序和数据之间可能仍然存在坚固的障碍。我们将对提供给 AI 驱动系统的数据进行更明确的说明,数字助手将逐渐变得更加有能力。
虽然我预计来自手机主要玩家(苹果和谷歌)的数字助手将继续在这里占据主导地位,但已经有人尝试绕过这些巨头。一个由 AI 驱动的硬件设备可能来自其他玩家吗?让我们看看。
AI 驱动的可穿戴设备
在 AI 领域的一个探索领域是创建一种新型的设备,它既不是手机,也不是手表、平板电脑或个人电脑。Humane AI Pin是创建一个能够听你说话并为你执行任务的 AI 驱动可穿戴设备的一次失败尝试。虽然这个设备的代理潜力是吸引人的部分,但我认为可以说这种吸引力并没有实现,AI Pin 在一年内就被停止生产了。Rabbit R1是另一个进入这个市场的失败尝试,尽管这并不是一个可穿戴设备,但它提出了能够代表你执行更复杂任务的主张。
在现实世界中,这些设备还没有足够地融入我们现有的设备生态系统,以至于无法打开市场。我们的大多数设备都有屏幕,而且这比仅仅使用声音传输信息要高效得多,因此,无屏幕设备在处理需要复杂人类输入的任务时可能会遇到困难。
一些今天可用的设备将目标定得稍低一些,专注于转录。它们的目标是监听你听到的所有内容,将其转录下来,然后让你与之互动,总结会议并帮助你找到对话中遗忘的细节。实际上,这些无屏幕的可穿戴设备(如Limitless AI Pendant)似乎还没有流行起来。
将额外的可穿戴设备融入我们的生活是件困难的事情。如果你已经拥有一块数字手表和一部手机,你可能会更倾向于使用这些设备中的任何一个来处理转录任务,而不是添加第三个设备。虽然围绕转录构建的 AI 服务只有在激活时才工作,但这可能是一个优点,因为普通人可能不愿意被持续记录。
要自己尝试,你可以使用前面章节中提到的转录应用程序之一,例如 MacWhisper,但以下是一些可以提供智能 AI 分析转录的服务:
-
Granola.ai (
granola.ai) -
Otter.ai (
otter.ai) -
ChatGPT(在 macOS 应用中使用Record模式)
回到可穿戴设备,智能眼镜似乎将成为下一个被技术升级的常见穿戴物品,尽管今天这些设备有限的视频录制功能也引发了一些问题。你能信任一个按摩师(需要她的智能眼镜来观察)不会记录她的疗程吗?虽然 Meta 的雷朋****智能眼镜包括一个闪烁的 LED 灯来指示相机正在使用中,但这个 LED 灯可以被遮挡,从而产生一个新的隐私问题。
在未来,当眼镜的功能变得更加强大时,用户能否在电影院看电影时佩戴智能眼镜?回到 2014 年,美国电影协会(MPAA)禁止在电影院使用可穿戴记录设备(包括当时的谷歌眼镜)(www.androidcentral.com/piracy-concerns-spur-google-glass-wearables-ban-movie-theaters),但当人们需要这些相同的设备来观看时,这能站得住脚吗?
时间会证明这些设备是否会取代许多人或大多数人的手机,但我怀疑我们还会在一段时间内使用多种设备。许多科技界人士推广“杀手级”设备的叙事,这些设备会完全摧毁其他设备,但除了 iPhone(及其后续克隆产品)几乎完全摧毁了传统哑手机之外,取代旧设备需要时间。
对于用户用一种设备取代另一种设备,新设备需要足够好地完成他们当前设备所做的一切。手表没有取代手机;它们只是增加了手机的功能。因为我们通过展示彼此的手机来共享信息,我不认为智能眼镜在一段时间内会完全取代手机。
AI 驱动的可穿戴市场预计将因 Jony Ive 设计的新 OpenAI 设备而动荡,Jony Ive 因其在苹果公司的工作而闻名。但除非这款新设备能做出一些惊人的事情,比现有选项更好,并且不遗漏任何重要功能,否则它将只会增加而不是取代。
总的来说,Humane AI Pin 失败的关键原因是没有屏幕和缺乏整合。虽然集成的绿色激光投影仪是创新的,但信息密度和图像质量远远低于手机,无法与之竞争。照片质量同样不足,并且没有很好地整合。
然而,新的 OpenAI 设备可能会在 AI Pin 失败的地方取得成功,仅仅是因为它背后有更多的资金,而且 ChatGPT 广为人知且被广泛使用。时间会证明一切。
AI 驱动的浏览器
互联网最近受到了 AI 的巨大影响。由于谷歌的 AI 摘要意味着更少的访客点击到原始来源,网络出版商的流量明显下降。似乎由于多种因素的结合,AI 的影响将进一步扩大。
首先,谷歌本身几乎完全淡化了其新AI 模式的搜索结果。截至 2025 年 10 月底,我现在进行的任何谷歌搜索都有 AI 模式的选择,这本质上是将短语发送到 Gemini。我试了试:
what's the best way to edit a video quickly in final cut pro?
在我们讨论回应之前,主要问题是它不是一个精心制作的问题。如果学生问我这个问题,我会问更多问题来了解他们的问题(们),然后再提供解决方案。正如你所预期的,谷歌的回应给出了相当通用的建议,有些地方不太均匀,有时还过时。

图 12.4 – 谷歌的 AI 模式对一个不完美的问题给出了不完美的回应
虽然我欣赏我写的名为《Final Cut Pro X:最佳高级快捷键》的文章是短块外部链接中链接最多的文章,但我写这篇文章已经有 10 年了。其他建议提到了非官方的调整层,而去年的一次更新引入了官方的调整剪辑,代理并不总是能帮助你更快地工作。
在任何联网的 LLM 中提出相同的问题,你都会得到类似的结果,我发现 AI 驱动的答案对于详细的问题往往能给出更好的结果。当你寻找的是 AI 时,拥有一个 AI 坐在搜索引擎旁边显然是有用的,但我认为传统的搜索仍然有价值。
随着谷歌搜索变得更加以 AI 驱动,如果你希望探索其他搜索引擎,如 DuckDuckGo (duckduckgo.com) 和 Kagi (kagi.com),那么当 AI 无法快速找到好的结果时,你可能愿意尝试这些。
Comet 是来自 Perplexity 的 AI 浏览器,它接管了搜索功能,我对 Final Cut Pro 提出的问题的回应感觉像是一个随机的通用建议大杂烩。

图 12.5 – Perplexity 对我提出的不完美问题提供的表达不佳的杂烩式回应
然而,AI 浏览器的真正力量在于对您正在查看的网页执行功能,而不仅仅是更好的搜索。我访问了 Reddit 的首页,从窗口的右上角调出助手,并要求它总结页面。总的来说,这是准确的,而且有趣的是,这些标题中包括 Reddit 起诉 Perplexity 的新闻(在 2025 年 10 月 23 日):

图 12.6 – 这份 Perplexity 对 Reddit 的总结包括 Reddit 起诉 Perplexity 的故事
虽然总结页面是一个明显的用途,但我怀疑大多数 LLM 制造商进入浏览器的主要原因是这将推动更多流量到他们自己的 LLM。如果你从关于第二次世界大战的维基百科页面开始,并要求内置 AI 总结关键时刻,这是方便的。如果你还想将这些信息以时间线图的形式展示,那么这就是 LLM 的领域,在这种情况下,Perplexity 最终成为你使用的工具。Microsoft Edge 包括 Copilot,我们预计那里会有进一步的整合。我也期待谷歌 Chrome 在某个时候包括 Gemini。
启动刚刚发布的(撰写本文时)ChatGPT Atlas浏览器(目前仅限 Mac,且仅限付费账户),它与 Comet 略有不同。您将从主页开始,在顶部栏中输入查询会直接发送到 ChatGPT,它乐于在其回答中引用过去的对话。与 Google 和 Comet 相比,它给出了稍微更好的答案,可能是根据我过去询问的上下文信息。
对于更传统的搜索,您必须点击位于主页右侧的搜索图标,从该页面,您可以看到带有其 AI 概览的 Google 搜索。这可能适合您,但我不确定 ChatGPT 自己的回答是否总是我最初想要的——它在我和原始信息之间增加了一层解释。
是的,一个好的 AI 摘要可能会比传统搜索更快地呈现更多信息,但有时我只是想阅读几个单独的页面全文,然后自己做出决定。Atlas 使询问 ChatGPT 变得更容易,同时使传统搜索不那么容易访问。优点在于,您可以在任何选定的文本上右键单击并将其发送到 ChatGPT 以获取更多信息、澄清或摘要,这可能很有帮助。
对于更负面的看法,这里有 Anil Dash 的评论:www.anildash.com/2025/10/22/atlas-anti-web-browser/。虽然我不同意他的某些观点(正如他一样,我搜索了Taylor Swift,结果显示了她的官方网站和其他网络资源,而他没有),但这是一个值得阅读的详细观点。
即使您不需要在浏览时使用 LLM,您选择使用 Atlas 的一个关键原因可能是它提供了代理模式,它承诺接管您的浏览并为您执行复杂任务。

图 12.7 – ChatGPT Atlas 的代理模式
因此,这是人工智能开始为我们做事的承诺未来吗?有了我们过去与 ChatGPT 互动的历史作为指导,我们可以安全地将一些任务委托给人工智能吗?让我们在下一节中深入探讨。
代理:为您执行复杂任务
这里的术语已经变得混乱,让我们澄清一些术语:
-
ChatGPT Atlas 的代理模式是在您的计算机浏览器中运行的,ChatGPT 可以介入并接管控制。
-
ChatGPT 代理是一个运行在 OpenAI 服务器上的浏览器盒子。如果您愿意,可以输入您自己的个人信息,但您不是在自己的计算机上执行任务。
-
ChatGPT 的定制 GPT是针对特定问题特别训练的 ChatGPT 版本,您可以给它们分配代理任务。
从 Atlas 开始,我尝试使用它来研究外部 SSD 的价格,这是一项视频编辑人员熟悉的工作,并要求它创建一个包含澳大利亚前 10 款 4TB 外部 SSD 的电子表格。代表我,它查询了许多网站,要求我登录到我的 Google 账户,创建了一个 Google 表格,用有用的数据填充它,然后根据要求修改了该表格。

图 12.8 – Atlas 可以未登录或已登录开始,但如果你想使用电子表格,它会要求你登录到 Google Docs
在某种程度上,观看 ChatGPT 在完成任务时大声“思考”是非常有趣的。因为它控制着常规的 Google Docs 用户界面,在我观看时删除行和移动数据,这使得它比正常的 ChatGPT 效率低,在输入价格时犯了一些奇怪的错误。我原本期望它会维护一个内部的数据版本,然后简单地重新填充整个电子表格,但最终它还是做到了。

图 12.9 – 要求对原始请求进行修订花费的时间比预期更长
在另一个测试中,我询问我的家人他们晚餐想吃些什么,提出了几个具体的饮食要求,然后要求 Atlas 下单。完整请求中有四项内容,Atlas 确实在停止之前正确地将每一项都添加到了订单中。以下是部分过程,展示了 Atlas 在思考,试图弄清楚如何选择无蛋:

图 12.10 – Atlas 在选择饮食要求时的公开思考过程
虽然实时观看很有吸引力,但我认为这不是我经常想让 AI 做的事情,仅仅因为它不够快。整个过程花费了超过六分钟,误操作增加了大量时间,我自己来做会更快。
ChatGPT 代理以类似的方式执行类似的工作,但它在云端的浏览器中执行,而不是你的浏览器中。在这种情况下,如果你需要让它访问你自己的个人账户,它会要求你手动登录。这两种方法很相似,但 Atlas 的摩擦更少。
当 AI 被分配一项原本自己难以完成的繁琐任务时,它最有用,而在这个时候,对于人类来说,点餐比 AI 更容易。这尤其适用于你已经知道你想要什么的情况,而我并不真的想让 AI 决定我的饮食。
那么,对于结果并不固定的任务呢?如前所述,当信任 AI 执行重要任务或昂贵购买时,一些谨慎是必要的。Anil Dash(在之前链接的文章中)尝试使用 Atlas 预订航班,尽管它能够导航到购买页面,但请求的航班日期已经从他的原始请求中更改。传统的 AI 之前的搜索在这里做得更好。
作为对比,Ars Technica 给 Atlas 分配了一些低风险的任务 (arstechnica.com/features/2025/10/we-let-openais-agent-mode-surf-the-web-for-us-heres-what-happened/),结果大多良好。如果你想自己开始使用,请注意安全风险。如果人类会被骗点击恶意链接,LLM 当然也会——而且它可能不会像人类那样识别红旗。
AI 浏览器确实有其存在的空间,无论你是想将 LLM 的核心服务与传统网页浏览集成,还是希望拥抱代理功能,它们都值得一试。同样,如果你更喜欢使用传统的网络搜索(尽管这仍然是一个选项!),那么使用常规浏览器可能就足够了。
虽然我可以看到,围绕正式文本和固定流程构建的更可预测的工作流程具有自动化的潜力,但大多数创意工作流程都有些模糊。一些与创意工作流程相邻的代理相关工具可能对你很有价值。虽然我不会在这里探讨它们,但它们包括以下内容:
-
运动 (
usemotion.com) 是一个流行的 AI 驱动的调度系统,它承诺为你管理时间,包括项目跟踪。在其高级计划中,它提供创建 AI 员工来管理销售、营销和其他任务(不要与 Apple Motion 混淆,这是一个与 Final Cut Pro 集成良好的、被低估的动画程序)。 -
Notion (
www.notion.com) 是一个 AI 驱动的办公空间,包括维基、项目跟踪、笔记和文档。它包括可以在其系统中执行任务的 AI 代理,并且可以扩展到团队规模。 -
ElevenLabs 代理 (
elevenlabs.io/app/agents) 是 ElevenLabs 的一个功能,旨在取代传统的电话应答系统。这里的流程允许你将合成声音(在前面章节中已探讨)与 LLM 连接起来,使用英语语言指令在图中引导用户交互。还包括一个测试平台。
这些工具远非市场上唯一的以代理为中心的工具,但我们已经远离了“创意”领域,所以我就此打住。
虽然我们离题了,但有一个工具并不是一个代理,但却是我们未来可能会使用的有趣例证,那就是芝麻 (www.sesame.com). 目前,他们提供了一个聊天机器人的预览,有两个声音,玛雅和迈尔斯。(同名“芝麻”的移动应用似乎是不相关的骗局。)
芝麻不执行任务;它是一个仅限语音的聊天机器人,乐于交谈,充当一个回声板或帮助你处理决策。引人入胜的是,它有道德规范,我会让你自己与它聊天来发现细节。它响应迅速,听起来相当像人,是我所听到的最接近电影《她》中合成伴侣的系统。
这可能比我们许多人想象的 AI 未来更接近。看起来许多人类只是把 LLM 当作一个可以交谈的人,如果风险得到适当的缓解,它可能会非常受欢迎。
在结束这一部分之前,让我们更深入地看看另一种类型的代理,这可能是一种有用的方式来回答特定于公司或专业领域的问题和执行任务。
构建自定义 GPT
首先,要知道这个过程超出了本书的范围边缘,所以我只会从高层次来探讨。做好这件事是一个技术过程,但如果你有这个倾向,请随意深入研究。
构建自定义 GPT 与使用代理浏览器完全不同。本质上,这个过程让你能够构建一个 ChatGPT 的专用版本,它可以回答包含额外知识和背景的问题,并专注于特定主题领域。许多已经存在,点击 ChatGPT 侧边栏中的探索是一个很好的开始。

图 12.11 – 寻找灵感?许多自定义 GPT 都是公开可访问的
如果你是一家公司中的创意人员,拥有大量编码化、特定领域的知识库,你可能能够利用这些知识构建一个代理来帮助你的初级员工。也许客户可能希望你能帮助他们创建一个代理来向自己的员工提供建议?
或者,你可能希望一个自定义 GPT 能够回答与你自己的专业领域相邻领域的问题。然而,由于那是一种你尚未拥有的知识,它很可能是你从别人那里购买的产品,而不是你自己制作的自定义 GPT。
创建自定义 GPT 不是一个简单的过程,你可能需要多次尝试才能正确完成。你向自定义 GPT 添加知识的顺序很重要,如果你以错误的方式做,最终可能会得到一个根本无法正常工作的机器人。
如果你第一次尝试失败,尝试用稍微不同的内容重新构建,或者甚至以不同的顺序使用相同的内容。开发者可以使用后端 API 工具,但更用户友好的前端方法也可以同样有效,甚至更好。

图 12.12 – 定制 GPT 创建 UI 中的部分前端配置字段
你的目标应该是缩小 LLM 尝试做的事情的范围。原味 ChatGPT 努力成为所有人的所有事物,但定制 GPT 需要专注。
给它如何表现的指令:实际上,这是一个定制的系统提示。这应该将其限制在特定的任务集中,指导它如何与其目标受众互动以及如何交流。当然,你还需要上传包含任何机器人所需特定领域知识的文档。这可能是一套指南、流程或定制软件程序的用户手册。
一定要关注隐私。尽管定制 GPT 与付费账户相关联(并且不用于训练 ChatGPT 本身),但仍然有可能使定制 GPT 公开。如果你包含机密公司数据,显然你需要确保它保持 私密。
另一方面,你可能想要创建一个对公众开放的定制 GPT。这可以通过电子邮件地址的价格分享一些你的知识,以帮助你建立自己的受众。这取决于你。
尽管如此,如果你已经创建了一个定制的 GPT,由于用户可能不知道最佳提问方式,他们可能难以充分利用它。通过提供关于如何最佳使用你的定制 GPT 的指导,甚至提供与它配合良好的提示示例,你将给用户更大的成功机会。
关于如何最好地实现这一目标的一些想法,我采访了 RAMMP 的安娜·哈里森(www.rammp.com),这是一家开发定制 GPT 以帮助小型企业客户进行营销的公司。
RAMMP 为每位客户构建一个定制的 GPT,使用该客户业务信息、当前社交媒体输出以及他们的目标进行训练。训练完成后,每位客户都将拥有一个定制的代理,一个个人营销顾问,以及一个具有独特个性的助手。这可以反映客户本人或其他人。为了帮助用户充分利用他们的代理,RAMMP 还包括另外两个组件:
-
诊断,一个用于审计当前营销活动并找出转化效果不佳的地方的工具。
-
助手,一个你可以要求定制 GPT 解决特定问题的流程提示库。这些提示可能包括季度 SEO 审计、创建营销策略或制定社交媒体日历。
在整本书中,我建议尝试在接近你现有知识领域的领域使用 AI 工具,这种方法与此相符。一个企业主或自由职业者了解他们的产品和客户,但可能不知道如何最好地推广自己。
通过给客户一个额外的推动,告诉他们出了什么问题以及如何最好地提示他们的代理,知识差距将得到很好的填补。如果你在考虑创建一个定制的 GPT,考虑一下它的用户将如何与之沟通,并在可能的情况下引导他们。
定制的 GPT 功能允许普通人探索潜在的代理未来,而不必了解所有 API 的细节或探索代码。这是一步不是所有人都会想要探索的,但它可能解决常规 ChatGPT(以及其他 LLM)无法解决的问题。
其他 AI 提供商有类似但不完全相同的功能。如果你觉得定制的 GPT 不适合你,也许可以探索 Claude Projects (support.claude.com/en/articles/9517075-what-are-projects),它允许你上传额外的私人文档并与其他用户协作。你也许还想要探索一些更专注于代理的工具,例如 Motion、Notion 或Zapier (zapier.com/agents),尽管所有这些服务都有略微不同的功能。
未来将会非常迷人。让我们结束这一章,然后整本书。
摘要
在手机上与数字助手交谈是一项重大创新,但就像任何新技术一样,我们习惯了它,发现了它的局限性,最终它并没有改变世界。我怀疑在接下来的几年里,LLM 将无缝地取代那些功能较弱的数字助手。
随着能力的提升,我们中越来越多的人将开始将更多的工作任务委托给各种类型的代理——但并非所有人、不是所有工作、也不是所有时间。如果由大型语言模型(LLM)驱动的数字助手真的能改变世界,那也将会是渐进式的改变。
我们可能从手动自动化我们正在做的事情开始,但如果 AI 工具足够可靠,我们委托给它们的任务将会更多。它们可能比我们今天慢,但一旦它们开始直接与我们使用的应用程序背后的数据结构对话,它们将比我们更快。
浏览器是一个有用的垫脚石,但许多创意人士在常规桌面应用程序中工作,而不仅仅是网页上。不过,很快,自动化引擎将更好地控制我们的常规计算机,那些对专家来说困难的事情将变得对每个人来说都更容易。希望我们会有更多的时间来创作更好的作品,而不仅仅是用同样的时间创造更多的作品。
这些代理会比人类更好吗?在每一个衡量标准上都不一定,它们也不会在每一个任务中使用。许多代理和定制的 GPT 将找到自己的领域,其中一些将完美匹配。但许多创造性工作将保持手工操作,许多现有的创造性人士可能永远不会使用 AI。
这完全没问题。有足够的空间容纳许多不同的方法,AI 也将带来新的表达创造力的方式。
最后的想法
如果你是一位对 AI 工具潜力感兴趣的创意专业人士,我希望这本书能帮助你不仅理解可能做到的事情,还理解值得追求的事情。任何将创作过程视为一项有价值任务而不是外包的琐事的人,现在可能对 AI 持有复杂的看法。
在实用 AI领域,有无数种方法可以优化工作流程,同时让你完全控制整个过程。能够更快地找到照片或视频,或者请求 AI 对你的想法提供反馈,几乎没有缺点。许多这些工具都是离线运行的,没有持续的成本——这是一个全面的胜利。
在生成 AI领域,有巨大的潜力来了解新想法如何工作,用于协作头脑风暴,以及一些工具使得原本成本高昂的视觉效果或修图任务在正常预算内变得可行。但生成 AI 最好作为更大整体的一部分来使用,那些被卖掉“只用 AI 就能做到”的谎言的客户会发现,这和“只在后期修复”一样有效。
在自动化 AI领域,有可能从一些任务中消除乏味,但不要期待完美的结果。当我们认识到今天工具的限制并接受它们的最佳方面时,它们确实能有所帮助,即使它们不能完成整个工作。这里有很大的潜力,但它只是在地平线上。
无论你如何使用 AI,永远不要忘记你享受的事情。如果你是设计师、编辑、修图师或摄影师,你可能喜欢用工具动手,朝着最终愿景进行许多小的改变。这些细节很重要,而且对于那些将 AI 用于每个任务的人来说,它们是最容易受到风险威胁的。
AI 系统通常鼓励我们像 CEO 一样从高层次思考任务。如果 CEO 想要完成一项任务,他们会要求他们的员工去做,而 CEO 不会担心细节。但在这个过程中,那些员工确实代表 CEO 做出了许多微小的、明智的决定,而这些决定很重要。如果没有人关注细节,比如当 AI 退回到默认设置时,整体产品可能会受到影响。
我们在 AI 之前就已经看到了基于模板的设计系统发生这种情况,而且这种情况不会停止。并不是所有客户都关心他们的设计看起来是否独特,但如果他们想要脱颖而出,他们应该这样做。模板系统和 AI 驱动的内容倾向于同质化,但伟大的设计会带来额外的价值。
通常,创意工作者的工作就是深入细节,质疑每一个决定并分析其后果。如果那个暂停时间稍微长一点,或者那个标题稍微大一点,或者那个词稍微夸张一点,这些改变很重要,也许在最高层次上并不立即明显,但它们汇总成更大的整体。
另一个问题是你如果可以突然制作任何东西(在较低的质量设置下),那么你就完全不受约束了……但是约束激发创造力。如果你有一个 300 字的限制,那么填写空白页面会更容易;如果你手头有风格指南,那么完成一页传单会更容易。源源不断的低质量图像并不能帮助聚焦视野。
有时候,成为一个新手也是很有价值的。当你学习一项新技能,它与你的现有技能多少有些关联时,你会尝试将你的现有知识映射到新领域。有时这会失败,但有时会激发新技术。当你与其他专业人士合作时,同样的魔法也会发生,如果我们依赖 AI 来填补人类形状的空白,我们将看到更少的这种魔法。
尤其是在创意产业中,当你在不同的媒体之间工作或与其他专家合作时,往往会发现洞察力,其中最好的是当你比较笔记并发现意外的同步性时。这些不是在委员会中发现的洞察力。
如果我们不小心,广泛使用 AI 可能会带来一代人,他们虽然创造了东西,但并不享受创造的过程。如果你只是提示而不是制作,追求回报率而不是美感,你的作品将缺乏内涵。把创作的力量带给那些有伟大想法的人不是坏事,但 AI单独并不是制作最佳作品的途径。
在更险恶的方式上,AI 可能会缩小专家创意的群体,因为越来越少的人通过使用它们来提高自己的技能。创意肌肉必须得到锻炼,而仅仅提示结果就像乘坐出租车而不是步行一样。
无论是否有 AI,实施细节都很重要,如果我们都开始把细节视为理所当然,那我们会因此变得更糟。避免乏味是可以的,但不要让你的技能因为把所有工作都交给 AI 工具而退化。AI 作为助手和创意工厂,或者帮助完成任务的特定元素,是非常棒的,但取代人类将导致更差的创意输出。
然而,我认为充分利用 AI 的空间还是很大的。如果你能完成一项任务,并且有可能通过这样做学习新技能,那么就去做吧。但如果这是一项你已经做过的无聊工作,你时间紧迫,而自动化 AI 是一个净赢的局面,为什么不呢?除了节省时间,如果灵感枯竭,通用 AI 可以给你提供比你能够使用的更多新想法,而效用 AI 可以帮助你更高效地工作。
接下来是什么?AI 不会消失,但我预计未来几年当前的格局将发生巨大变化。以下是一些预测:
-
超级智能?不太可能。
-
AI 泡沫破裂,一些 AI 公司倒闭?很可能。
-
定价混乱?可能吧。
-
通用 AI 的图像和视频变得更好?当然。
-
幻觉和不完美?持续进行中。
-
AI 过度使用导致的社会问题?是的。
-
由于安全措施不力导致的隐私问题?在 AI 出现之前就已经是问题。
-
AI 成瘾?这已经发生了。
没有什么比变化更确定的了,从这里开始将是一场狂野的旅程。我们以前从未能够愿望得到某些东西,而现在一个全新的世界等待着。
非常感谢您与我一起迈出这几步。
|
获取本书的 PDF 版本和独家额外内容
扫描二维码(或访问packtpub.com/unlock)。通过书名搜索这本书,确认版本,然后按照页面上的步骤操作。 | 
|
| 注意:请妥善保管您的发票。直接从 Packt 购买的商品不需要发票。* |
| --- |
第十三章:解锁您的专属权益
您的这本书包含以下专属权益:
-
新一代 Packt 阅读器 -
无 DRM PDF/ePub 下载
按照以下指南解锁它们。这个过程只需几分钟,并且只需完成一次。
3 步轻松解锁此书的免费权益
步骤 1
准备好您的购买发票以供步骤 3使用。如果您有实体副本,请使用手机扫描并将其保存为 PDF、JPG 或 PNG 格式。
如需查找发票的帮助,请访问 www.packtpub.com/unlock-benefits/help。
注意:如果您直接从 Packt 购买此书,则无需发票。在步骤 2之后,您可以直接访问您专属的内容。
|
步骤 2
扫描二维码或访问 packtpub.com/unlock。 |
|
在打开的页面(类似于桌面上的图 13.1),通过书名搜索此书并选择正确的版本。

图 13.1:桌面上的 Packt 解锁登录页面
步骤 3
选择您的书籍后,请登录您的 Packt 账户或免费创建一个账户。然后上传您的发票(PDF、PNG 或 JPG,最大 10MB)。按照屏幕上的说明完成此过程。
|
需要帮助?
如果您遇到困难需要帮助,请访问 https://www.packtpub.com/unlock-benefits/help 了解如何查找您的发票等详细 FAQ。此二维码将带您到帮助页面。 |
|
注意:如果您仍然遇到问题,请联系 customercare@packt.com。

订阅我们的在线数字图书馆,全面访问超过 7,000 本书籍和视频,以及领先的工具帮助您规划个人发展和职业发展。更多信息,请访问我们的网站。
为什么订阅?
-
使用来自超过 4,000 位行业专业人士的实用电子书和视频,节省学习时间,多花时间编码
-
使用专为您定制的技能计划提高您的学习效果
-
每月免费获得一本电子书或视频
-
完全可搜索,方便快速获取关键信息
-
复制粘贴、打印和收藏内容
在 www.packtpub.com,您还可以阅读一系列免费技术文章,订阅各种免费通讯,并享受 Packt 书籍和电子书的独家折扣和优惠。
您可能还会喜欢的其他书籍
如果您喜欢这本书,您可能还会对 Packt 的以下书籍感兴趣:
掌握 Adobe Photoshop 2026 - 第二版
加里·布拉德利
ISBN: 978-1-80602-171-0
-
使用智能对象和品牌工作流程创建高级原型
-
无损掌握润色、重新着色和内容感知编辑
-
使用增强人工智能的工具进行图像生成、背景编辑和润色
-
为多个平台设计和自动化大量社交媒体内容
-
使用 Photoshop 的时间轴和帧工具动画标题、GIF 和视频
-
使用画笔、纹理、渐变和效果开发沉浸式视觉效果
-
以专业技巧融合、拼贴和创作超现实主义艺术作品
Final Cut Pro 高效编辑 - 第二版
Iain Anderson
ISBN: 978-1-83763-167-4
-
轻松组织和管理来自多个来源的媒体
-
使用直观界面和强大工具编辑视频
-
通过可定制的 workspace 和快捷方式简化工作流程
-
同步多机位采访并精通高级剪辑
-
使用人工智能色彩工具和音频工作流程增强编辑
-
使用内置编辑工具顺畅协作
-
创建视觉效果和动态图形标题
-
以任何平台的多格式导出项目
Packt 正在寻找像您这样的作者
如果您有兴趣成为 Packt 的作者,请访问 authors.packt.com 并今天申请。我们已与成千上万的开发者和技术专业人士合作,就像您一样,帮助他们将见解分享给全球技术社区。您可以提交一般申请,申请我们正在招募作者的特定热门话题,或者提交您自己的想法。
分享您的想法
现在,您已经完成了《创意生产中的 AI》,我们很乐意听听您的想法!如果您在亚马逊购买了这本书,请点击此处直接转到该书的亚马逊评论页面并分享您的反馈或在该购买网站上留下评论。
您的评论对我们和科技社区非常重要,并将帮助我们确保我们提供高质量的内容。

新一代 Packt 阅读器
无 DRM PDF/ePub 下载
浙公网安备 33010602011771号