人工智能优化攻略书-全-

人工智能优化攻略书(全)

原文:The AI Optimization Playbook: Drive business success with proven AI strategies, best practices, and responsible innovation

译者:飞龙

协议:CC BY-NC-SA 4.0

前言

《人工智能优化手册》旨在培训商业领袖、数据科学家和人工智能工程师,在整个人工智能项目生命周期中实现变革性的商业价值。它不仅涵盖了模型优化的技术方面,还包括将人工智能成功投入生产的战略、领导力、项目选择、AI/MLOps 以及负责任的 AI 治理等关键要素。本书介绍了几个关键框架,例如人工智能项目生命周期(从战略到原型到生产再到迭代),以提供持续产生高质量、高影响力输出的验证方法。

本书指导您如何制定人工智能战略,选择高影响力项目,并从试点到生产的整个生命周期进行导航。它还详细说明了如何使用 MLOps 以及最近出现的 LLMOps(用于生成式人工智能)来实施这些系统,以确保解决方案可扩展且可靠。通过使用真实世界案例研究进行实用、动手的方法,本书还深入探讨了人工智能项目失败背后的概念。这确保了您不仅学会如何构建某些东西,而且理解为什么战略一致性和负责任的治理对于产生可扩展的商业成果至关重要。学会有效管理这个整个生命周期是人工智能快速发展的领域中一种赋权的技能集。

本书分为五个部分:

  • 第一部分为人工智能成功奠定基础,建立了任何成功人工智能项目所需的战略基础。我们将从分析为什么大多数人工智能项目失败开始,表明这些失败主要是策略、执行和整合失败,而不是技术失败。我们将分析常见的陷阱,例如目标不一致(追求技术“替代指标”而不是商业价值)、部门化开发、薄弱的数据基础以及对人工智能迭代和非确定性本质的误解。在确定了出错的地方后,本部分将这些经验教训转化为构建成熟人工智能战略的实用框架。这包括使用 ICE 框架等评估流程来优先考虑项目路线图,利用 NIST AI RMF 等既定模型构建稳健的治理和合规性,以及设计一个将数据视为产品的现代数据战略。最后,我们讨论了需要可扩展的人工智能平台、基于原则的算法选择策略以及混合“中心辐射”组织结构来管理变革。

  • 第二部分将项目与业务影响对齐,提供了一个连接策略与执行的实用蓝图,从选择高影响 AI 项目开始。我们将首先详细说明如何分析和优先考虑倡议,超越仅仅关注技术新颖性,转向关注诸如业务影响、最终用户定义以及涵盖数据、技术堆栈和人才的全面可行性分析等因素。这包括用于机会规模化的定量方法,如 T 恤尺度和自下而上的可比性,以及严格的成本效益分析来证明潜在的 ROI。一旦确定项目,我们将涵盖获取领导支持的关键下一步,通过早期吸引利益相关者,构建一个引人入胜的故事,关注业务价值的“如此何”,呈现分阶段路线图,并设定现实期望。在获得赞助后,我们将展示一个构建有效的概念验证PoC)的剧本,作为一个小规模、低风险的实验来测试可行性,详细说明关键的 PoC 后决策:是进行细化、转型还是推进到 MVP。最后,我们将介绍一个全面的框架,用于衡量 PoC 的性能,而不仅仅是技术模型指标,包括证明其价值并确保清晰生产路径所需的必要系统、业务和安全指标。

  • 第三部分部署和证明机器学习价值,提供了一个关于机器学习系统完整、端到端生命周期的全面指南,从定义其目的到证明其对业务的因果影响。我们将从成功的基石框架开始,超越简单的准确性,定义多维、与业务对齐的目标,防止意外伤害的基本护栏指标,以及跟踪长期目标的代理指标。接下来,我们将深入“产品化”,这是将模型从实验笔记本操作化为稳健、生产级系统的关键过程,探讨 MLOps 最佳实践,代码和数据的可重复管道的重要性,以及模型服务架构的选择。最后,我们将探索因果推断的科学,以回答关键问题,“系统是否做到了它打算做的事情?”,涵盖“黄金标准”的 A/B 测试(RCTs),以及多臂老丨虎丨机等高级观察技术和优化方法。

  • 第四部分新兴主题:生成式 AI 和 AI 代理,探讨了正在改变企业的 AI 技术的新前沿。我们将从用商业友好的术语解释生成式 AI 和 LLMs 开始,涵盖从市场营销和客户服务到代码生成等各个职能的关键用例,以及实际采用考虑。在此之后,我们将定义 LLMOps 并详细说明它是如何将传统的 MLOps 扩展到处理大型语言模型的独特运营生命周期,包括提示编排、微调和专门的监控。最后,我们将探索 AI 代理的新兴世界,讨论它们是什么,它们自动化复杂多步任务的可能性,以及构建和治理这些自主系统的框架。

  • 第五部分负责任的 AI 和治理,提供了一个确保 AI 解决方案是道德的、公平的、合规的和可持续的关键框架,首先定义负责任的 AIRAI)及其核心支柱(FEAT)。然后,它提供了一个通过治理委员会、风险评估清单(风险评分 = 可能性 * 影响)和战略人机协作HITL)方法来实施这些原则的实用指南。本部分还解决了值得信赖的 LLMs 的独特挑战,例如“幻觉”,并概述了不断发展的全球监管格局,包括欧盟 AI 法案,最后展望了未来趋势,如量子计算,并展望了 2030 年完全优化、由 AI 驱动的企业的愿景。

这本书面向的对象

这本书是为那些负责从人工智能中驱动业务价值的关键个人和团队设计的。它面向以下人群:

  • 高级领导者和 C 级高管(CXOs、CDOs、CDAOs):如果您负责制定企业 AI 战略、培养以 AI 为先的文化,或做出关键的支持和资源决策,这本书提供了将技术倡议与可衡量的业务成果对齐的框架。

  • AI 科学家和技术实践者:如果您是数据科学家或应用 AI 科学家,这本书不仅将指导您构建模型,还将指导您学习“销售”您提出的 AI 解决方案给高级领导和最终用户的至关重要的、通常被忽视的技能。它提供了如何构建问题框架、进行成本效益分析和展示价值以获得支持的实用技巧。

  • AI 产品经理和策略师:如果您负责制定 AI 产品的上市策略、管理项目路线图或确保团队按计划进行,这本书提供了一个完整的生命周期视图,从项目选择和机会规模到衡量成功。

  • 机器学习工程师(MLEs):对于那些专注于将可行的原型部署到生产中的专业人士,本书提供了构建系统所需的关键背景,这些系统不仅技术上可靠,而且可扩展、可靠且具有影响力,包括策略、治理和业务对齐。

  • 商业领导者和利益相关者:如果你是与技术团队合作的业务方面领导者,这本书将揭开人工智能生命周期的神秘面纱。它将使你能够提出正确的问题,参与选择具有高影响力的项目,并理解你在开发和采用过程中的关键角色。

本书涵盖的内容

第一章理解人工智能产品的风险,描述了人工智能项目失败的共同模式。它提出,大多数故障不是技术失败,而是策略、执行和整合不佳的结果。它探讨了具体的陷阱,如目标不一致、部门化开发、薄弱的数据基础和缺乏生产就绪性。

第二章构建企业人工智能策略,概述了成熟人工智能策略的结构要素。它提供了一个逐步指南,将业务倡议与技术开发对齐,使用如 ICE 框架进行路线图优先级排序。本章涵盖了全面人工智能策略的基本支柱,包括治理、现代数据策略、可扩展的人工智能平台和组织变革管理。

第三章选择具有高影响力的人工智能项目,提供了一项实用指南,用于选择能够带来最佳回报的人工智能倡议。它详细说明了如何通过评估数据、技术堆栈和人才来执行可行性分析。本章还介绍了机会规模化的定量方法和进行成本效益分析的框架。

第四章超越构建:获得对人工智能项目的领导支持,描述了获得高级领导赞助的关键步骤。它提出,技术团队必须通过构建引人入胜的故事来“销售”他们的解决方案。本章提供了以下建议:尽早吸引利益相关者、用“如此何”来证明投资合理,并设定现实期望。

第五章构建人工智能原型并衡量您的解决方案,详细说明了如何执行一个成功的原型,作为一个低风险实验来测试可行性。它提供了一个五步“原型剧本”,并涵盖了关键的后原型决策:是否完善、转型或构建最小可行产品。最后,它介绍了一个框架,用于通过 360 度视角衡量模型、系统、业务和安全指标的性能。

第六章超越准确性:定义采用指标的指南,解释了为什么简单的准确性是机器学习模型成功的一个足够衡量标准。它是一个定义全面、多维度的指标框架,与业务目标相一致,包括使用护栏指标来防止意外伤害。本章还涵盖了如何将技术模型性能与业务价值联系起来,使用代理指标实现长期目标,以及使用多目标优化来平衡权衡。

第七章从模型到市场:实现机器学习系统的运营,详细介绍了“产品化”的过程,即从将实验模型转变为可扩展且可维护的生产级系统。它强调,现代机器学习需要管理整个可重复的管道(包括数据、代码和基础设施),而不仅仅是静态的模型文件。文本探讨了 MLOps 实践、基础设施选择(如 IaaS 与 PaaS 的比较)以及模型服务策略(如 REST API 或流式传输)等,这些都是成功部署和监控机器学习系统所必需的。

第八章从指标到测量:实验和因果推断,专注于因果推断,即证明机器学习系统导致了特定的商业结果的科学,超越了简单的相关性。它提供了关于随机对照试验(A/B 测试)作为“黄金标准”来衡量影响的全面指南,涵盖了假设驱动的设计和统计分析。本章还探讨了高级方法,如用于优化的多臂老丨虎丨机,以及当 A/B 测试不可行时的观察技术,如提升建模。

第九章企业中的生成式 AI:开启新机遇,探讨了生成式 AI 的变革性影响,详细介绍了关键企业用例,如通过聊天机器人增强客户参与度,以及通过共飞行员民主化企业智能。本章提供了实施的最佳实践和通过成本节约和员工体验等指标衡量投资回报率的最佳实践。重要的是,它还概述了何时不应考虑生成式 AI,例如,对于纯粹数学分析或高风险、可靠的决策,传统工具更为合适。

第十章理解通用人工智能操作,将通用人工智能操作定义为加速和优化 LLM 系统生命周期的基本过程,强调它在指标、人才和培训等方面与传统 MLOps 的不同之处。本章通过解释三个核心优化技术来详细说明“构建”阶段:RAG 用于将外部数据与模型固定,微调用于在特定任务上使模型专业化,提示用于指导模型。它以“运营化”阶段结束,涵盖了关键的生产实践,如离线和在线评估、持续日志记录和监控以及成本管理。

第十一章AI 代理解析,介绍了 AI 代理作为使用规划、工具交互和记忆来自动化复杂、重复性任务的自主程序。它提供了何时应用它们的指导,例如在动态工作流程中,以及在低错误容忍度或低延迟情况下避免它们的情景。本章还回顾了单代理系统与多代理系统之间的区别,流行的代理框架如 LangChain 和 AutoGen,以及代理可观察性对于评估和监控的必要性。

第十二章负责任人工智能简介,将负责任人工智能定义为与伦理目标对齐的实用框架,将其与道德人工智能(道德原则)和可信赖人工智能(可靠性)区分开来。它介绍了公平性、伦理、问责制和透明度FEAT)的核心支柱,并确立负责任人工智能对于真正的优化是必要的,因为它建立用户信任并确保模型优化以实现公平的结果,而不仅仅是技术指标。

第十三章实施 RAI 框架、指标和最佳实践,提供了实施 RAI 的实际路线图。它详细介绍了建立治理结构,如 RAI 委员会,使用道德风险评估清单(风险评分 = 可能性 * 影响),以及战略性地整合人机交互HITL)以进行高风险决策。本章还涵盖了强制性的文档,如模型和系统卡片,以及用于量化公平性、可解释性和安全性的特定指标。

第十四章构建可信赖的 LLM 和生成式 AI,探讨了 LLM 的独特伦理挑战,放大潜在的社会偏见和隐私风险,如数据泄露。它详细介绍了使用可解释性方法实现透明度的策略,概述了公平性指标以减轻偏见,并提供了应用级指南,如内容过滤和用户披露,以建立信任。

第十五章负责任人工智能的监管和法律框架,比较了全球对 AI 监管的演变方法,对比了欧盟全面、基于风险的 AI 法案与美国灵活、分部门的做法。它介绍了了解你的 AIKYAI)流程,用于识别和评估 AI 风险,并详细介绍了新的 GenAI 特定风险,如“影子 AI”数据泄露。本章提供了可操作的合规策略,包括进行AI 影响评估AIIAs)和建立 AI 治理委员会。

第十六章人工智能优化的未来:趋势、愿景和负责任实施,通过探讨新兴趋势,强调真正的优化需要将创新与责任相结合,从而结束了本书。它讨论了规模定律、量子计算、自主智能体 AI 的兴起以及可解释人工智能XAI)对于建立信任的必要性。本章考察了人工智能对未来工作和社会可持续性的深远影响,最终形成一个“2030 年 AI 驱动型企业”的愿景。

为了充分利用这本书

如果记住以下事项,跟随起来会更容易:

  • 将框架作为实际工具使用:在优先考虑自己的倡议时,积极使用影响、信心、易用性ICE)框架进行评分。在规划项目时,使用成本效益分析框架和五步 PoC 剧本来指导你的流程。

  • 使业务与技术对齐:在构建之前,使用第三章中的因素作为清单,对你的数据、技术堆栈和人才进行可行性分析。使用第一章中的对齐问题“强迫”业务团队和数据团队之间的关键对话。

  • 从第一天开始嵌入责任:不要将伦理和治理视为事后之想。将 RAI 的支柱和实施框架,如模型卡和系统卡,作为开发过程中的强制性步骤。积极考虑 LLM 的独特风险和不断变化的监管环境,以建立信任。

  • 从案例研究中学习:研究成功和失败的案例研究。将来自 PoC(如问题定义不明确和数据处理质量差)失败的预测性维护的教训作为诊断清单,以避免在自己的组织中重蹈覆辙。

  • 思考端到端生命周期:成功的 PoC 只是开始。反思项目如何从原型过渡到可扩展、生产系统,使用 MLOps、LLMOps 和 AI 代理原则。考虑这些优化、可重复的过程如何与你的长期企业战略相连接,并增强你组织的整个 AI 成熟度和治理模型。

图片免责声明

本标题中的一些图片是为了说明上下文而展示的,图形的可读性对于讨论并不至关重要。请参阅我们的免费图形包下载图片。

下载彩色图片

我们还提供了一份包含本书中使用的截图/图表的彩色图片的 PDF 文件。您可以从这里下载:packt.link/gbp/9781806115112

使用的约定

本书使用了多种文本约定。

粗体:表示新术语、重要词汇或您在屏幕上看到的词汇,例如在菜单或对话框中。例如:“考虑的主要模型是 基础设施即服务 ( IaaS )、平台即服务 ( PaaS )、软件即服务 ( SaaS ) 和 容器即服务 ( CaaS )。这些模型在运营努力、灵活性和成本方面都提供了一套独特的权衡。”

警告或重要注意事项如下所示。

查看技巧和窍门如下所示。

关于人工智能使用的免责声明

作者承认使用了尖端的人工智能,如 ChatGPT、OpenAI API、Gemini、Claude 和 GitHub Copilot,目的是为了提高本书的语言和清晰度,从而确保读者有一个顺畅的阅读体验。重要的是要注意,内容本身是由作者创作的,并由专业出版团队编辑的。

联系我们

我们始终欢迎读者的反馈!

一般反馈:请发送电子邮件至 feedback@packtpub.com,并在邮件主题中提及本书的标题。如果您对本书的任何方面有疑问,请通过 questions@packtpub.com 发送电子邮件给我们。

勘误:尽管我们已经尽一切努力确保内容的准确性,但错误仍然可能发生。如果您在本书中发现错误,我们非常感谢您向我们报告。请访问 www.packtpub.com/submit-errata ,点击 提交勘误 ,并填写表格。

盗版:如果您在互联网上发现我们作品的任何形式的非法副本,如果您能提供位置地址或网站名称,我们将不胜感激。请通过 copyright@packtpub.com 联系我们,并提供材料的链接。

如果您有兴趣成为作者:如果您在某个领域有专业知识,并且您有兴趣撰写或为本书做出贡献,请访问 authors.packtpub.com

分享您的想法

读完《人工智能优化手册》后,我们非常乐意听到您的想法!请 点击此处直接进入此书的亚马逊评论页面 并分享您的反馈。

您的评论对我们和科技社区都至关重要,并将帮助我们确保我们提供高质量的内容。

随书免费福利

这本书附带免费福利以支持您的学习。现在激活它们以获得即时访问(有关说明,请参阅“如何解锁”部分)。

以下是您通过购买可以立即解锁的快速概述:

| PDF 和 ePub 副本 | 下一代 基于 Web 的阅读器 |

| --- | --- |

| img | img |

| img 在任何设备上阅读此书的免 DRM PDF 副本。img 使用您喜欢的电子阅读器的免 DRM ePub 版本。 | A black background with a black square  AI-generated content may be incorrect. ** 多设备进度同步 **:在任何设备上继续您上次中断的地方。A black background with a black square  AI-generated content may be incorrect. ** 高亮和笔记 **:捕捉想法,将阅读转化为持久的知识。A black background with a black square  AI-generated content may be incorrect. ** 书签 **:保存并随时回顾关键部分。A black background with a black square  AI-generated content may be incorrect. ** 暗黑模式 **:通过切换到暗色或棕褐色主题来减少眼睛疲劳 |

|

如何解锁

扫描二维码(或访问packtpub.com/unlock)。通过书名搜索此书,确认版本,然后按照页面上的步骤操作。 | imgimg |

| 注意:请保留您的发票。直接从 Packt 购买不需要 发票。 |

| --- |

加入我们的 Discord 和 Reddit 空间

您不是唯一一个在导航碎片化工具、不断更新和不确定的最佳实践的人。加入一个不断壮大的专业社区,分享那些没有进入文档的见解。

| 通过了解我们的作者的最新动态、讨论和幕后洞察来保持信息畅通。加入我们的 Discord 空间packt.link/z8ivB或扫描下面的二维码:A qr code on a white background  AI-generated content may be incorrect. | 与同行建立联系,分享想法,并讨论实际的生成式 AI 挑战。在 Reddit 上关注我们packt.link/0rExL或扫描下面的二维码:A qr code on a white background  AI-generated content may be incorrect. |

| --- | --- |

第一部分

为人工智能成功奠定基础

在本书的第一部分,我们将建立任何成功人工智能项目所需的战略基础。我们将从分析为什么大多数人工智能项目会失败开始,表明这些失败主要是策略、执行和整合方面的失败,而不是技术方面的失败。我们将分析常见的陷阱,例如目标不一致(追求技术“替代指标”而不是商业价值)、部门化开发、薄弱的数据基础以及对人工智能迭代、非确定性本质的误解。在确定了出错的地方后,本部分将这些经验教训转化为构建成熟人工智能战略的实用框架。这包括使用 ICE 框架等评估流程来优先考虑项目路线图,利用 NIST AI RMF 等既定模型构建稳健的治理和合规性,以及设计一个将数据视为产品的现代数据战略。最后,我们将讨论需要可扩展的人工智能平台、基于原则的算法选择策略以及混合“中心辐射”组织结构来管理变革。

本部分包含以下章节:

  • 第一章理解人工智能产品的风险

  • 第二章构建企业人工智能战略

第一章:理解人工智能产品的风险

人工智能 ( AI ) 已迅速成为商业和技术的倍增器。预计到 2025 年,全球对人工智能的投资将达到 3600 亿美元,占全球风险投资总额的三分之一以上,并且年增长率超过 60%。

然而,尽管大量投资涌入人工智能实验,但现实是,大多数人工智能项目未能产生有意义的商业成果。根据麻省理工学院最近发布的 2025 年商业人工智能状态 报告,不到 5%的企业人工智能项目产生了可衡量的商业回报。采用率很高;大多数公司都有试点项目和原型,但几乎所有这些活动都停滞在生产力实验阶段,而不是利润和损失水平的转型。

为什么会这样?

在多年的部署人工智能系统的过程中,一个一致的教训已经显现:大多数失败并非由技术本身的局限性造成,尽管算法架构、存储和计算能力的持续改进可以使结果更准确。失败几乎总是由于策略、执行和整合不当造成的。大多数故障源于业务目标和技术方法之间的脱节,加上数据不佳和运营流程碎片化等问题。真正的挑战不是构建更复杂的算法,而是确保人工智能解决方案被设计和实施,以捕捉组织价值,确保其安全、可靠和可扩展。

本章借鉴了现实世界的经验和来之不易的教训,来审视人工智能项目失败的模式。我们将探讨将人工智能倡议与业务目标对齐、建立稳健的数据基础以及构建能够超越试点阶段的系统的实际挑战。无论您是在监督您组织的第一个人工智能实施,还是致力于改进现有系统,理解这些基本挑战对于推动成功结果至关重要。

我们将涵盖以下关键主题:

  • 一些关键定义

  • 人工智能产品如何失败

本书免费优惠

您的购买包括本书的免费 PDF 副本以及其他独家优惠。请查阅前言中的“本书的免费优惠”部分,以立即解锁并最大化您的学习体验。

一些关键定义

这里有一些重要的定义,帮助您导航本书:

  • 人工智能 ( AI ): 创建能够执行通常需要人类智能的任务的智能机器的总体领域,例如问题解决、学习和决策

  • 机器学习 ( ML ): 人工智能的一个子集,它使机器能够从数据中学习并在不针对每一步进行明确编程的情况下提高任务性能

  • 深度学习 : 机器学习的一个子集,它使用具有多个层的人工神经网络来识别数据中的复杂模式

  • 生成式 AI:一种深度学习模型,根据其训练数据中学习到的模式生成新的、原创的内容,如文本、图像或代码。

  • AI 代理:一种软件系统,它能够自动感知其环境,做出决策,并采取行动以实现特定目标,同时最小化人工干预。

  • 代理式 AI:一组能够协调、规划、推理、协作并为复杂问题执行行动的 AI 代理。

人工智能产品如何失败

在接下来的章节中,让我们深入探讨一些常见的失败模式。

目标不一致

太频繁地,AI 和数据团队追逐准确度分数,失去了对业务目标的关注。更好的指标总是意味着更好的业务吗?不一定。

以银行为例。一个流失预警系统可能将目标定义为账户关闭。一个 AI 系统寻找人们在关闭账户之前的一些信号。但那些悄悄将大部分资金转移出去并保持账户开放的客户怎么办?只关注账户关闭会错过更大的目标:建立信任和持久的客户关系。

或者考虑电子商务。许多推荐系统被设置为最大化点击率CTR)。结果如何?用户点击次数增加,至少在一段时间内是这样。但当人们看到低质量或不相关的建议时,他们会感到烦恼。最终,他们访问次数减少或完全停止使用该网站。在这些情况下,更多的点击并不等于更多的忠诚度。

欺诈检测模型呈现了不同的转折。如果你调整模型以标记每个异常交易,它可能会阻止欺诈,但也可能捕获过多的合法购买。忠诚的客户面临支付被拒绝,企业失去销售额。在追求最大化技术成功的过程中,客户体验受到了损害。

零售商和制造商使用预测模型来预测需求。这些模型通常力求达到最低的均方误差,这是一个经典的准确度衡量标准。但仅仅“平均准确”可能会误导。如果系统低估了突然的峰值,例如在特别促销期间,商店可能会缺货或积压未售出的库存。技术指标表明模型表现良好,但业务结果却证明并非如此。

医院也面临着类似的困境。分级 AI 工具旨在提高诊断准确性以预测严重疾病。但仅仅准确性就足够了吗?如果由于过多的不必要的测试导致患者等待时间增加或成本上升,那么答案是否定的。即使是一个表现良好的 AI 系统,如果它失去了对病人和提供者所关心的事物的关注,也无法解决业务挑战。

在生成式人工智能和自主人工智能代理的世界里,这些挑战只会更加严重。想象一下由生成式人工智能驱动的客户支持聊天机器人。管理层跟踪“处理的聊天”和“发送的消息”作为成功的指标。机器人产生了大量的活动,但它实际上解决了问题吗?有时,它可能只是与客户打转,产生长或重复的响应。因此,满意度下降,即使仪表板上的数字看起来不错。

在营销工作流程中的代理人工智能也可能出现同样的不匹配。一个在线零售商可能会使用一个自主代理来发送营销邮件,其单一目标是最大化打开率。代理开始制作吸引注意力的主题行并频繁发送邮件。在短时间内,打开率激增。然而,很快,客户就会对这种攻势感到厌倦。他们开始将邮件标记为垃圾邮件,并大量取消订阅。从表面上看,人工智能似乎很成功,但它正在损害长期信任和参与度。

那么,为什么技术指标与业务目标之间的差距如此频繁地出现?

  • 并非所有可以计数的都值得计数

并非所有可以计数的都值得计数,并非所有值得计数的都可以计数。”

– 威廉·布鲁斯·卡梅伦

这段话描述了人工智能发展中的一项基本紧张关系:商业的更广泛、更抽象的目标,如增加收入、提高客户满意度或降低运营成本,很少能够整齐地转化为单一、明确定义的模型目标。在实践中,模型往往关注具体、可衡量的输出(例如,分类准确度或均方误差),称为代理指标。

什么是代理指标?

代理指标(也称为代理指标)是在直接业务成果难以追踪或测量时间过长时使用的替代测量值。代理指标比最终业务成果提供更直接的信号。

例如,点击率(CTR)通常被用作在线广告中收入的代理指标,而在营销活动中,电子邮件打开率可能代表实际销售转化。由于代理指标的数据易于获取且可以实时收集,模型可以快速训练和评估。

然而,它们并不总是能够捕捉到长期盈利能力、品牌忠诚度或客户终身价值背后的持久因素。相比之下,这些长期成果可能需要数月或数年才能显现,将变化归因于单一干预措施可能很复杂,需要高级跟踪和建模能力。

在平衡短期和长期考虑因素的关键挑战在于,商业目标通常比任何单个 AI 目标更广泛或更抽象。因此,团队可能会在没有推进业务的实际战略目标的情况下,交付局部模型改进。因此,像跨行业数据挖掘标准流程CRISP-DM,Chapman 等人,2000 年)这样的框架仍然相关,强调将业务理解与技术工作相一致。同样,Provost 和 Fawcett(2013)讨论了代理指标如何轻易地成为最终目标,从而将注意力从推动真正价值的更全面的成功衡量标准上转移开。

  • 相关性不等于因果关系

另一个风险是不一致:一个仅与真实目标有弱相关性的代理可能会产生次优甚至有害的结果。例如,过度关注点击率可能会刺激点击诱饵式内容,短期内提高点击量,但长期内会损害用户信任。这种代理指标的过度优化可能会产生局部最优解,即在纸上看起来很理想,但无法转化为真正的商业价值。此外,当单一指标优先于同等重要但难以量化的考虑因素,如用户体验或品牌认知(Kleinberg 等人,2018 年)时,就会产生外部性。

提醒:相关性不等于因果关系

两个变量一起移动并不意味着一个导致另一个。在做出决策或得出商业结论之前,总是要调查潜在因素。因果关系需要更深入的分析、实验或额外的数据来建立真正的因果关系。

经典机器学习通常擅长发现相关性,即可以告诉你下个月谁可能会流失或下个季度你会卖出多少单位的预测模式。在许多商业应用中,这种基于相关性的方法完全足够,因为仅仅知道可能发生的事情就足以做出运营决策或分配资源。但如果你核心问题是“我应该采取什么行动才能可靠地改变这个结果?”那么仅仅相关性是不够的。你需要评估因果关系,即特定因素是否实际上“导致”了你想要影响的结果。例如,一家杂货连锁店可能会发现,购买尿布的人也经常购买啤酒。虽然这很有趣(并且经常被引用),但这只是一个相关性。如果你想改变消费者行为,比如通过重新排列货架,你不能确定这种相关性表明因果关系。

这里有一些场景,区分相关性和因果关系至关重要:

  • 营销活动:如果你的机器学习模型说“早上看到广告的客户更有可能转化”,你可能会将其解释为“早上广告导致更高的销售额”。但也许早上客户已经更加承诺或有更少的干扰,这使得他们更有可能购买,而不管广告如何。

  • 定价策略:降低价格可能与增加销售相关,但价格削减是导致更高销量,还是你只是因为竞争对手短缺而经历整体需求的上升?

  • 降低客户流失率:向被标记为“高流失风险”的客户提供保留折扣可能会提高客户保留率,但你需要因果证据来确保折扣本身造成了差异,而不是一些无关的季节性影响。

尽管有这些细微差别,但大多数日常机器学习应用仍然具有预测性。预测月收入、发现潜在的流失者或识别可疑交易通常围绕“谁或什么是可能做 X 的?”而不是“哪个动作肯定导致了 Y?”随着你成熟你的数据科学实践,请记住一个指导性问题:我只是预测可能会发生什么,还是我需要证明某个动作会使它发生?

  • 业务优先级不会保持不变

业务优先级可能会根据市场条件变化和适应。模型通常是为了上一季度的目标进行调整,但公司的重点已经转移。除非有积极的对话,否则双方会迅速疏远。此外,技术指标有时只是实际影响的代理。例如,CTR 或处理的聊天数量很容易跟踪,但并不总是能讲述完整的故事。过度优化这些替代品实际上可能会损害业务。

许多团队默认使用标准技术指标,因为它们方便,而不是因为它们正确。在这样做的时候,隐藏的成本和独特的业务需求被忽略了。最后,技术结果出现得快,而业务成果需要时间。自然地,注意力会转向快速反馈,即使它并不是真正重要的。

由于这些原因,AI 产品在纸面上看起来很吸引人,但在现实世界中却可能失败。防止这种情况的方法是确保目标和指标的正确对齐。这种对齐可能不仅仅通过精确的数学就能实现。如果一开始对齐就不明确,我们应该从假设哪些措施可能推动期望的结果开始,然后在开发和实施周期中通过测试和改进这个假设。

为了强制这种对齐,业务和 AI/数据团队应该通过以下问题相互挑战:

| 维度 | 业务澄清问题 | AI/数据团队澄清问题 |

| --- | --- | --- |

| 真实目标与代理指标 | 我们关心的业务成果是什么(留存、信任、利润率或风险)?如果代理指标改善,是否保证业务成果也会改善? | 我们的目标指标是代理指标还是业务成果的真实代表?我们是否在无意中优化了指标,但损害了业务成果? |

| 错误的成本 | 假阳性与假阴性的业务后果是什么(收入损失、客户流失、合规性或客户体验损害)? | 我们是否根据业务成本对错误进行不同的加权?我们应该纳入非对称损失或约束吗? |

| 客户和运营影响 | 如果模型按照指标“正确”运行,是否会令客户或员工感到沮丧(警报、拒绝、隐私或垃圾邮件)? | 是否有防护措施或人工检查点,在优化过程中防止损害? |

| 影响的时间范围 | 目标是短期提升(例如,打开率)还是长期关系(信任、终身价值等)? | 我们的指标是短期视角但忽略了长期影响吗? |

| 业务背景漂移 | 自项目开始以来,优先级是否发生了变化?相同的指标在下个季度是否仍然重要? | 我们应该多久回顾一次目标定义和 KPI?随着产品的演变,我们需要版本化的 KPI 对齐吗? |

| 与决策和工作流程的集成 | 如果模型运行良好,谁将采取行动?如何行动?在什么过程中? | 模型是否嵌入到实际的决策循环中,或者只是提供分数/仪表板? |

| 假设和验证 | 这个指标与价值相关的明确假设是什么? | 我们如何在开发周期中测试、反驳或完善假设? |

表 1.1:对齐问题和考虑因素

孤岛式开发

另一个 AI 产品挣扎的常见原因是孤岛式开发。当团队独立运作时,重要的背景信息会丢失,沟通中断,实际问题变得难以解决。

当 AI 团队独立于产品、工程或业务团队工作时,他们很容易错过项目的实际需求或目标。这导致模型可能在技术上合理,但并未解决真正的业务问题或用户需求。

从业务角度来看,如果利益相关者没有参与开发过程,他们往往难以信任 AI 推荐。如果没有清楚地了解模型是如何或为什么工作,他们可能会对使用其结果进行决策持怀疑或犹豫态度。

工程师面临不同的挑战。如果他们在过程中没有得到咨询,将模型集成到现有系统中是困难的。这种脱节可能导致长时间延迟、技术不匹配,甚至废弃项目。

事实是,当每个人都参与其中时,AI 产品才会成功。这些项目需要数据科学家、工程师和业务领导之间的紧密合作。从一开始就共同工作,团队更有可能构建出满足实际需求、赢得决策者信任并顺利融入运营的解决方案。

缺乏强大的数据基础

数据是您组织区别于他人的关键。伟大的 AI 需要大量的数据。然而,大多数组织在强大的数据基础方面都存在挑战。数据可能存在缺失值、有偏的样本或不一致的格式。孤岛、延迟和混乱的管道使得获取可靠的输入变得更加困难。仅仅大数据是不够的。数据的品质、新鲜度和整合度才是将模型转化为有意义解决方案的关键。

您的数据是否可用?

首先要考虑的是你是否拥有足够的“正确”数据。组织可能收集了大量的日志、交易记录或客户互动数据,但这些数据点可能无法捕捉到特定用例所需的必要信号。例如,一个客户流失预测项目需要关于用户互动、订阅时间和用户档案的历史数据。如果这些细节信息不可用或不完整,那么生成的模型对驱动用户流失的因素的视角将非常有限。CRISP-DM(Chapman et al., 2000)在其“数据理解”阶段早期就解决了这个问题,强调识别数据缺口并决定如何填补或绕过它们的重要性。

您的数据是否一致?

同样重要的是,您的数据集是否干净且一致。现实世界的数据通常包括缺失值、错误的条目或由于手动数据输入、系统迁移或不一致的日志过程而产生的重复记录。这些异常可能会引入偏差、扭曲模式,并最终混淆学习算法。在许多情况下,广泛的数据清理和特征工程步骤可能占据机器学习从业者的大部分时间(Provost & Fawcett, 2013)。虽然获取高质量数据更为费力,但它为模型的可信度和可解释性奠定了坚实的基础。

您的数据是否具有代表性?

即使您的数据集结构良好,也可能无法代表您问题域中所有相关的部分。例如,仅基于特定年龄组的历史购买数据训练的下一个最佳产品推荐模型可能难以推广到该人口统计学之外的用户。某些群体的代表性不足或过度代表性也可能导致歧视性结果,这不仅可能引发伦理问题,还可能在受监管的行业中带来法律风险。因此,记录和审计您数据集的人口统计和行为覆盖范围是至关重要的,正如最近关于机器学习公平性的文献(Barocas et al., 2019)所强调的那样。

您是否有基准数据?

监督学习任务,无论是分类、回归还是某种形式的排名,都严重依赖于准确反映目标概念的标记示例。对于图像识别,这可能涉及手动标注大量图像;对于欺诈检测,可能需要广泛的调查来确认哪些交易确实是欺诈性的。如果标记数据不完整或不正确,模型将学习与现实相背离的模式。主动学习技术,其中模型选择性地查询哪些示例需要标记,可以减少标记负担,但获得足够稳健的基准真相仍然是一个关键挑战(Settles, 2009)。

数据准备不是一次性的关注点

商业环境、用户行为和外部市场条件可能会随时间变化,导致“概念漂移”。在去年数据上训练的模型学习到的模式可能不适用于今天的环境,尤其是在电子商务或金融等快速发展的领域。组织需要监控性能,并定期刷新训练数据或重新训练模型以适应这些变化,这个过程有时会得到自动模型监控和“在线学习”系统的帮助(Sutton & Barto, 2018)。

基础设施和治理

最后,数据管道和治理结构在确保高质量、相关数据可靠地到达人工智能开发中起着关键作用。孤岛化或不可访问的数据阻止团队全面了解问题空间,而缺乏版本控制或血缘跟踪可能使重现结果或进行彻底审计变得困难。明确的数据摄取、转换和存储流程,以及清晰的文档支持,有助于组织保持其机器学习管道的长期可行性。

总的来说,这些因素表明,为人工智能准备数据很少是微不足道的。在组织能够应对任何复杂的算法挑战之前,它必须确保其数据来源覆盖必要的基准真相,保持适当的质量标准,并代表目标人群。

人工智能不是确定性的

在传统软件中,开发者定义的规则保持一致。例如,一个贷款申请系统可能根据预定义的公式计算利息收入,如本金余额乘以利率。一个电子商务平台可能根据编程逻辑应用唯一的优惠券代码。这些输出是可预测的,因为它们基于预定义的指令。

然而,人工智能系统的工作方式不同。例如,一个 FICO 信用风险评级模型,旨在评估借款人的信用度,并不使用单一公式。相反,它分析各种数据点,如债务收入比、收入和破产状态,来预测违约风险。这种预测基于过去数据的模式,这意味着如果数据发生变化或引入了新特征,模型的性能可能会改变。

为什么迭代在人工智能中很重要

人工智能结果的不确定性需要实验。每个模型配置或数据集调整都能为模型性能提供见解,导致调整和改进的循环。因此,人工智能开发高度迭代,每个周期都解决随着模型演变而出现的意外挑战,如下面的图所示。

产品模型图  自动生成描述

图 1.1:迭代人工智能开发周期

这种实验性质的绝佳例子是机器学习中的超参数调整,它是人工智能的一个子集。

机器学习中的超参数是在训练模型之前设置的配置变量,它控制着学习过程的展开方式和模型的构建方式。与在训练过程中从数据中自动学习(如神经网络中的权重或线性回归中的系数)的模型参数不同,超参数是由实践者选择的,并在实际学习过程中保持固定。

超参数调整是系统地搜索机器学习模型最佳超参数配置的过程。

数据科学家使用网格搜索、随机搜索和贝叶斯优化等方法尝试不同的超参数组合,寻找模型性能的最佳设置。对模型参数(如学习率或树深度)的调整通常会导致不同的结果,每次调整都提供了可能改善或损害模型性能的新信息。

如詹姆斯·伯格斯特拉和约书亚·本吉奥在《随机搜索超参数优化》(2012 年)一书中解释的那样,超参数调整可以“在表现良好的模型和无法泛化的模型之间产生差异。”换句话说,找到正确的设置通常需要一个迭代、试错的方法。

即使找到了最佳模型配置,模型也需要在生产数据发生变化后重新评估,这种现象称为数据漂移。例如,如果消费者的借款模式或金融政策随时间变化,FICO 信用模型可能会失去准确性。正如 Gama 等人讨论的《概念漂移综述》(2014 年),机器学习模型需要定期监控和更新,以跟上数据中变化模式的步伐。

虽然迭代是必要的,但如果管理不当,它很容易导致范围蔓延。例如,在开发客户服务聊天机器人时,很容易陷入不断调整模型以处理每个可能的查询变化的陷阱。如果没有为每一轮实验设定明确的目标,并且没有在成本和准确性之间建立平衡,团队可能会花费过多的时间和资源进行微调,而不会带来显著的好处。在他们的《数据挖掘跨行业标准流程(CRISP-DM)指南》(2000 年)中,Chapman 等人强调,“结构化过程有助于团队通过在每个阶段明确定义可交付成果来避免范围蔓延。”

设定具体目标和知道何时停止对于保持机器学习项目在轨道上至关重要。如果一个旨在预测客户流失的模型达到了 85%的准确率,这可能“足够好”以做出明智的商业决策,而不必追求可能需要显著增加计算资源和时间的额外几个百分点。然而,一个旨在捕捉欺诈的模型需要在 95%的假阴性率下达到 98%的真正阳性捕获率。

这里的重要启示是,认识到人工智能发展的迭代性质至关重要,因为这是机器学习定义的不确定性。每一轮实验和调整都有助于导航数据驱动预测带来的不可预测性。迭代实验应在结构化的过程中执行。

这自然引出了挑战的核心:管理和理解人工智能结果的不确定性。

结果的不确定性

人工智能发展的迭代性质在很大程度上是对人工智能模型特征的不确定结果的回应。人工智能模型,尤其是机器学习模型,本质上是一种模式识别工具,它们只能识别用于训练它们的数据中存在的模式。在历史数据上训练的模型受限于该数据的质量和代表性。当数据发生变化时,模型的性能也可能发生变化,这意味着结果更难以保证。

如 Halevy、Norvig 和 Pereira 在 2009 年的《数据的不合理有效性》一书中所强调,“更多的数据往往胜过更好的算法”,这显示了机器学习模型对数据的依赖性。然而,世界不会停滞不前,数据也不会。由于客户行为、经济或其他因素的变化,数据模式可能会发生变化,模型可能不再按预期表现。

以股价预测为例。一个在历史市场数据和宏观经济指标上训练的模型可能最初表现良好,但金融市场对意外事件非常敏感,例如经济衰退或政治不稳定。当这些事件发生时,模型的准确性可能会显著下降,因为它是基于没有包括这些新模式的训练数据。

另一个不确定性的来源是许多高级 AI/ML 模型的复杂性,尤其是在深度学习领域。与遵循明确决策路径的简单算法不同,深度学习模型可以在大型数据集中学习高度复杂的模式,但这种复杂性使得它们更难解释。具有多层非线性转换的深度学习模型通常充当“黑盒”,几乎无法解释特定输入如何转化为输出。

James Bergstra 和 Yoshua Bengio 关于超参数优化的工作讨论了这种不确定性。在他们 2012 年的论文《超参数优化的随机搜索》中,他们认为模型参数的微小变化可以产生非常不同的结果,这使得在不同环境或数据集中再现一致的结果变得困难。

考虑到这些不可预测性的来源,无论是数据的性质还是现代模型日益增长的复杂性,对于项目团队和利益相关者来说,考虑更广泛的影响是很重要的。

这意味着什么?

这种迭代特性和结果的不确定性对项目规划和利益相关者的期望有实际影响。传统的软件项目通常有明确的时间表和里程碑,但 AI 开发则不太可预测。从数据挖掘到训练,开发过程从不简单。相反,如果模型性能最初未达到预期,可能需要重新工作或延长时间表。

习惯于传统瀑布式项目规划和时间线的商业领袖可能会质疑为什么 AI 模型需要持续优化。正如 Davenport 和 Harris 在《基于分析的竞争》一书中解释的那样,“由于数据科学项目的实验性质和不可预测的时间表,它们常常受到商业领袖的怀疑。”

这也是为什么数据科学工作不适合传统的敏捷假设。敏捷假设需求可以在一开始就定义,增量是可预测的,并且在构建之前可以清楚地声明“完成”。AI 打破了这些假设。成功不能提前保证,学习是通过迭代发生的,价值只有在经过测试和改进的周期后才会出现。因此,AI 可能存在于敏捷交付结构中,但它不能像标准的敏捷功能构建那样行事。组织理解 AI 的迭代性质,以及其需要微调以帮助管理这些期望并建立信任是至关重要的。

缺乏生产就绪性

真正的商业价值来自于将模型投入生产,并在规模、可靠性和可持续性方面提供见解或自动化。但对于许多组织来说,这一步正是 AI 项目熄火的地方。

过于仓促地将模型投入生产,而没有进行足够的测试,这是一个常见问题。我们需要找到平衡点。

太常出现的情况是没有具体的计划来部署、监控或重新训练模型。团队专注于构建一个技术上令人印象深刻解决方案,但未能将其实施。结果是,模型在开发沙盒中运行良好,但在现实世界中却没有任何影响。

然而,弥合机器学习研究与现实世界部署之间的差距仍然是一个重大挑战。与传统的软件不同,由于数据漂移和现实世界条件的变化,机器学习模型会随着时间的推移而退化。没有自动化的重新训练和监控,模型很快就会过时,导致性能下降。Breiter & Keane(2022)的一项研究发现,只有 20%的公司拥有成熟的 AIOps 管道,这意味着大多数组织缺乏持续更新、监控和优化其 AI 产品的基础设施。这种限制阻碍了人工智能的可扩展性,并可能增加运营风险。

将在 Jupyter 笔记本中开发模型视为处于实验室或工厂原型车间。这是一个充满创意、灵活的空间,可以快速测试和改进想法。但是,将产品推向市场并实现商业化需要仔细的设计、制造和质量控制。实施人工智能也是如此。从实验到生产的飞跃并非易事,需要与建模本身一样多的关注。

许多人工智能项目在这里失败,不是因为科学不足,而是因为工程和运营计划从未得到应有的关注。从一开始就为生产构建,有明确的测试、部署、监控和维护路径,对于将人工智能从实验转变为持久的企业价值来源至关重要。

缺乏可解释性和信任

许多人工智能模型,尤其是深度学习架构,作为黑盒运行,这意味着它们在没有明确解释的情况下产生预测。这种缺乏可解释性在金融、医疗保健和刑事司法等监管行业带来了风险,在这些行业中,决策透明度至关重要。

Lipton(2018)警告说,不一致的可解释性期望会在数据科学家和商业领导者之间造成误解。现在,监管者正在要求人工智能驱动决策有更高的透明度。例如,欧盟人工智能法案(2023)和 GDPR 的第 22 条要求,影响个人的 AI 模型,如信用评分或招聘算法,必须为其预测提供可解释的理由。

即使是最精确的人工智能模型,如果人们没有足够的信任去使用它,那么它也是无用的。这一点在高度监管的行业,如银行、金融和医疗保健行业尤为明显。在这里,决策难以解释的黑盒人工智能系统,常常会遇到来自商业领导和监管者的阻力。

深度神经网络是一个典型的例子。这些模型可以提供令人印象深刻的预测,但它们的推理过程几乎无法被人追踪。没有简单的方法可以追踪从特定输入到特定输出的逻辑。这种“黑盒”特性反映了人脑的复杂性,数百万个小决策结合在一起产生结果。

虽然这种复杂性对于图像识别或推荐系统等任务可能是可以接受的,但在高风险领域,它成为一个关键的缺陷。在刑事司法、医疗保健和金融领域,每个决策都可能影响生活、生计或法律合规性。利益相关者需要知道的不只是答案是什么,而是模型为什么做出那样的选择。没有这种透明度,模型可能会面临怀疑、缺乏责任感和有时是直接的拒绝。

建立信任不仅仅是技术性能的问题。这意味着使人工智能系统更加可理解和透明,这样商业领袖、监管机构和客户就可以看到并信任每个决策背后的原因。没有可解释性,即使是最聪明的 AI 也可能最终被束之高阁。

商业条件变化和模型退化

人工智能模型是在它们开发时基于可用数据构建的。但世界总是在变化。商业优先级会转移。客户行为会演变。法规会更新。如果一个模型不及时更新,它很快就会失去价值。

在最近的历史中,有明显的例子。在 COVID-19 之前训练的供应链模型,当大流行病极大地改变了全球需求模式时,迅速变得不准确。基于 2008 年之前数据的时序预测模型未能预测全球金融危机的巨大破坏。即使今天,依赖于过时产品信息的 AI 聊天机器人最终会让用户因为错误的或缺失的答案而感到沮丧。

这个教训很简单:人工智能和机器学习永远不会完成。它们是持续的过程,需要持续的投资和关注。然而,许多组织忽视了维护的需求。他们将模型视为一次性项目,而不是持续的项目。结果是可预测的:性能下降,信任消失,商业影响消失。

其他挑战:计算、资源和技能差距

企业在计算能力、基础设施、资源限制、人才短缺和实施方面也面临着挑战。这些因素决定了机器学习(ML)项目是保持实验性质还是成功扩展到生产中。

计算和基础设施挑战

训练机器学习模型,尤其是训练深度学习架构,需要巨大的计算资源。大型模型需要高性能的 GPU 和 TPU,这可能会非常昂贵。Patterson 等人(2021 年)的一项研究发现,训练一个大型转换器模型在其生命周期内可能排放的碳量相当于五辆汽车,这突显了其财务和环境成本。

组织可以在云服务和本地基础设施之间进行选择。云解决方案提供可扩展性,但伴随着持续的成本和潜在的供应商锁定。本地设置提供更多控制,但需要大量的前期投资和维护。这些权衡影响了公司构建和部署机器学习解决方案的速度和效率。

资源和预算限制

组织在为机器学习项目预算时往往低估了部署后的成本。除了培训之外,模型还需要持续的监控、再培训和基础设施维护。Sculley 等人(2015)将此描述为“机器学习中的技术债务”,其中公司专注于模型准确性,但未能为运营的隐性成本做出计划。

在多个业务单元中扩展机器学习引入了额外的费用,例如分布式计算和网络带宽成本。麻省理工学院人工智能研究所在 2023 年的一项研究发现,80%的机器学习项目成本发生在部署之后,强调了高效模型生命周期管理的必要性。

技能差距和人才短缺

人工智能的采用速度超过了熟练专业人员的可用性。《领英人工智能人才报告》(2023)(economicgraph.linkedin.com/research/future-of-work-report-ai)指出,对人工智能/机器学习工程师的需求同比增长了 74%,但为专业角色招聘平均需要 6-9 个月。最大的短缺存在于 MLOps、数据工程和模型部署角色,这些角色对于生产就绪的人工智能系统至关重要。

成功的 AI 产品需要多个学科的专业知识。数据工程师管理大规模的数据管道,AI 工程师构建和微调模型,AIOps 专家确保高效的部署和监控。许多公司投资于提升现有员工的技能,但 AI 的跨学科性质使得招聘合适的人才成为一个持续的挑战。

摘要

在本章中,我们分析了为什么如此多的 AI 项目失败了。大多数 AI 失败并非技术问题;它们源于目标不一致、价值观模糊或与业务工作流程整合不佳。仅优化技术指标可能会产生“在数学上可行”但损害业务的解决方案。人工智能是概率性和迭代的;它不应像固定范围的 IT 项目那样管理。

真正的成功取决于正确的基础:明确的企业目标和价值假设;强大的数据基础;安全、可扩展和自动化的 AIOps;以及业务和 AI/数据团队之间的共同所有权。

接下来是什么?

现在我们已经了解了失败模式和 AI 工作的独特性质,我们可以从“出了什么问题”转向“如何正确地做”。

在接下来的章节中,我们将把这些课程翻译成一个实用的、可重复的框架,用于构建和执行与商业价值一致的人工智能战略,优先考虑正确的机遇,并构建可扩展和可衡量的影响。

参考文献

  • Barocas, S., Hardt, M., & Narayanan, A. (2019). 公平与机器学习:局限性与机遇. 麻省理工学院出版社. fairmlbook.org/

  • Bergstra, J., & Bengio, Y. (2012). 随机搜索超参数优化. 机器学习研究杂志 , 13, 281–305. www.jmlr.org/papers/volume13/bergstra12a/bergstra12a.pdf

  • Breiter, M., & Keane, M. (2022). AIOps 管道和可扩展性的现状. [行业报告].

  • Cameron, W. B. (1963). 非正式社会学:社会学思维的随意导论. 随机出版社.

  • Chapman, P., Clinton, J., Kerber, R., Khabaza, T., Reinartz, T., Shearer, C., & Wirth, R. (2000). CRISP-DM 1.0:逐步数据挖掘指南. public.dhe.ibm.com/software/analytics/spss/documentation/modeler/14.2/es/CRISP-DM.pdf

  • Davenport, T. H., & Harris, J. G. (2007). 基于分析的竞争:胜利的新科学. 哈佛商业评论出版社.

  • 欧洲联盟. (2016 ). 欧盟条例 (EU) 2016/679 (通用数据保护条例) . 欧洲联盟官方期刊. eur-lex.europa.eu/eli/reg/2016/679/oj

  • 欧洲联盟. (2023). 人工智能法案. 欧洲委员会. artificialintelligenceact.eu/

  • Gama, J., Žliobaitė, I., Bifet, A., Pechenizkiy, M., & Bouchachia, A. (2014). 概念漂移适应调查. ACM 计算调查 , 46(4), 1–37. doi.org/10.1145/2523813

  • Halevy, A., Norvig, P., & Pereira, F. (2009). 数据的非凡有效性. IEEE 智能系统 , 24(2), 8–12. doi.org/10.1109/MIS.2009.36

  • Kleinberg, J., Lakkaraju, H., Leskovec, J., Ludwig, J., & Mullainathan, S. (2018). 人类决策与机器预测. 季度经济学杂志 , 133(1), 237–293. doi.org/10.1093/qje/qjx032

  • LinkedIn. (2023 年 8 月). 工作未来报告:人工智能. LinkedIn 经济图谱. economicgraph.linkedin.com/research/future-of-work-report-ai

  • Lipton, Z. C. (2018). 模型可解释性的神话. 队列 , 16(3), 31–57. doi.org/10.1145/3236386.3241340

  • 麻省理工学院人工智能研究. (2023). 机器学习项目生命周期成本研究. 麻省理工学院.

  • 麻省理工学院斯隆管理评论。 (2025 年 11 月)。通用人工智能的分歧:2025 年商业中的 AI 状态。麻省理工学院。

  • Patterson, D., Gonzalez, J., Le, Q., Liang, C., Munguia, L-M., Rothchild, D., So, D., Texier, M., & Dean, J. (2021). 碳排放与大型神经网络训练。arXiv。arxiv.org/abs/2104.10350

  • Provost, F., & Fawcett, T. (2013). 数据科学商业应用:你需要了解的数据挖掘和数据分析思维。O’Reilly 出版社。

  • Sculley, D., Holt, G., Golovin, D., Davydov, E., Phillips, T., Ebner, D., Chaudhary, V., Young, M., Crespo, J.-F., & Dennison, D. (2015). 隐藏在机器学习系统中的技术债务。神经信息处理系统(NIPS)进展,第 28 卷。proceedings.neurips.cc/paper/2015/file/86df7dcfd896fcaf2674f757a2463eba-Paper.pdf

  • Settles, B. (2009). 主动学习文献综述。威斯康星大学麦迪逊分校。burrsettles.com/pub/settles.activelearning.pdf

  • Sutton, R. S., & Barto, A. G. (2018). 强化学习:入门(第 2 版)。麻省理工学院出版社。incompleteideas.net/book/the-book-2nd.html

|

获取此书的 PDF 版本和独家额外内容

扫描二维码(或访问packtpub.com/unlock)。通过书名搜索此书,确认版本,然后按照页面上的步骤操作。 | imgimg |

| 注意:请妥善保管您的发票。直接从 packt 购买不需要发票。 不需要。 |

| --- |

第二章:构建企业 AI 战略

第一章 显示,大多数 AI 失败不是技术失败;它们是战略失败。当产品在没有支持性的数据基础和运营卓越的情况下追逐算法,以及数据管道不完整、缺少关键技能、所有权和责任不明确,或者与业务优先级不一致时,产品就会崩溃。解决这个问题需要明确的 企业 AI 战略。

为了捕捉持久的企业价值,组织必须明确地将业务倡议、人员和文化、技术以及运营模式围绕 AI 的使用方式进行对齐。在接下来的页面中,通过以下关键主题,我们概述了成熟 AI 战略的结构性要素:

  • 将业务倡议与技术开发和项目选择相一致

  • 治理和合规

  • 数据战略 – 您 AI 系统的差异化因素

  • AI 平台 – 可扩展的基础设施用于实验和部署

  • AI 算法/模式选择策略

  • 组织结构和变革管理

将战略与技术开发联系起来

在辩论模型架构之前,领导者必须首先明确业务成果以及 AI 是否是实现它的正确杠杆。不是每个问题都是 AI 问题。

路线图优先级排序

并非所有 AI 项目都值得立即关注。因此,一个结构化的评估流程,例如影响、信心、易用性ICE)框架,可以帮助区分高潜力概念和不太紧急的追求:

  • 影响:项目是否解决了业务的首要优先事项(例如,减少流失、增加收入或改善用户体验)?

  • 信心:我们对基于模型的解决方案能够工作的确定性有多大?我们是否有正确的数据、领域知识和员工的专业技能?

  • 易用性:项目的技术挑战有多大?数据是否已经处于良好状态,或者我们需要进行大量的收集/清理工作?

在这些维度上对每个项目进行评分,然后进行排名。这确保了重点放在具有最大上升空间和成功可能性的倡议上,而不是将资源分散在未经筛选的“酷想法”待办事项列表中。

让我们以银行为案例研究。

一家中型超级区域银行正在推出一个 AI 战略,有六个潜在用例:

  • 信用卡欺诈检测

  • 最佳产品推荐NBP)用于消费者营销

  • 通过需求预测进行分支机构人员配置优化

  • 存款流失预测和保留

  • 由 GenAI 驱动的客户服务代理

  • 商业贷款理解助手

领导团队需要决定首先交付什么。他们应用 ICE 框架对每个用例在影响、信心和努力上进行评分。以下表格说明了潜在的结果:

| 用例 | 影响 | 信心 | 努力 | ICE 评分 | 备注 |

| --- | --- | --- | --- | --- | --- |

| 信用卡欺诈检测 | 5 | 4 | 3 | 6.7 | 现有管道和清晰的 ROI,中等努力 |

| NBP 消费者营销推荐 | 4 | 3 | 2 | 6.0 | 强烈的业务拉动,快速在应用中试点 |

| 通过需求预测进行分支人员配置优化 | 3 | 4 | 2 | 6.0 | 运营节约,易于数据获取 |

| 房贷流失预测和保留 | 5 | 2 | 4 | 2.5 | 高价值但低置信度和高努力 |

| GenAI 驱动的客户服务代理 | 3 | 3 | 3 | 3.0 | 有助于生产力和体验,但 ROI 不明确 |

| 商业贷款理解助手 | 4 | 2 | 5 | 1.6 | 高治理摩擦和集成风险 |

表 2.1:基于 ICE 框架的使用案例评分(1-5 级,ICE = 影响 x 置信度 ÷ 努力程度)

根据分析,银行可以根据最高的 ICE 评分做出明智的决定,确定首先启动的前三项倡议:

  • 欺诈模型提升:立即的经济影响和可测量的风险降低

  • NBP 推荐:低增量努力下的收入和参与度

  • 分支人员配置优化:高可行性带来成本节约和效率提升

房贷流失和贷款审批辅助产品将推迟至数据、管道和组织准备就绪。GenAI 代理作为实验,而非前三项主要倡议。

从小开始,快速扩展

在推广许多 AI 程序时,一个主要障碍是证明投资的价值并说服利益相关者这些倡议将带来实际结果。这正是概念验证项目发挥关键作用的地方。组织不是从一开始就进行全面部署,而是通过关注一个具体、明确的使用案例来运行概念验证,例如预测客户子集的流失或自动化更大工作流程的单一步骤。目的是从小开始,快速展示可衡量的好处,使用有限的范围和可管理的资源,然后快速扩展。

该过程从从小开始:选择一两个与重要业务成果有强烈关联的关键指标,例如在流失试点中使用支持工单量作为信号。主要目标是短期内实现可观的投资回报率ROI)。例如,如果试点将客户保留率提高 5%或降低一个部门的运营成本,这将向利益相关者和决策者提供明确的证据,证明其价值。

除了展示成果外,达到利益相关者达成一致并启动试点阶段可能具有挑战性。克服这一挑战的最佳方式是与业务从开始就分享旅程,获取反馈,并迭代到一个实现内部一致性的版本。

一旦概念验证证明了其影响,下一步就是迭代和扩展。这可能意味着向模型添加更多功能,将方法应用于新的业务领域,或逐步自动化更多的工作流程。概念验证有助于组织建立信心,完善他们的方法,并为可持续的、企业级的人工智能采用奠定基础。

明确的人工智能愿景和战略至关重要,必须建立强大的治理和合规实践,以确保您的 AI 系统值得信赖、透明,并与法律要求保持一致。

治理和合规

2025 年的监管环境是碎片化和快速演变的。例如,欧盟 AI 法案设定了新的全球标准,而美国、中国和其他司法管辖区正在分部门推出规则,导致重叠的要求和关于期望和执法如何进行的疑虑。

以下是一个人工智能已建立框架的列表。组织应将这些框架作为参考点,提取与他们的业务、风险概况和运营模式相对应的原则和控制措施:

| 框架 | 来源/焦点 | 如何帮助 |

| --- | --- | --- |

| NIST 人工智能风险管理框架 ( AI RMF ) | 美国 NIST (2023) | 提供了一种结构化的风险识别、缓解和监控方法 |

| 欧盟 AI 法案 – 风险分层模型 | 欧盟立法 (2024) | 引入了基于风险的责任,并适用于分类和监管层 |

| OECD 人工智能原则 | 全球政策机构 | 提供了跨政府的高层次负责任人工智能原则 |

| ISO/IEC 23894:2023 | 人工智能风险 ISO 标准 | 提供了标准化的词汇和生命周期风险指南 |

| 模型风险管理(SR 11-7 调整) | 银行业惯例 | 将成熟的模型治理学科扩展到 AI/通用 AI 环境中 |

表 2.2:人工智能已建立的框架列表

现代人工智能治理策略应首先关注价值创造。目标是构建一个从商业价值出发的系统,而不是仅仅为了法规;设定护栏,允许创新而无需不断升级;将决策权和账户稳定性推给执行团队,而不是集中所有决策;并建立清晰的归属感、清晰的升级路径和自助控制,以便合规性成为内置的,而不是附加的。考虑以下四层运营模型:

一个图表的图表  自动生成的描述

图 2.1:四层人工智能治理运营模型

建立人工智能治理和确保合规性可能会感到压力巨大,这并不奇怪。即使是经验丰富的组织也难以应对这种情况。人工智能创新的加速步伐,尤其是在代理人工智能和通用人工智能领域,只会加剧这一挑战。许多商业领袖和法律团队承认,跟上节奏很困难,感到在平衡新人工智能能力的兴奋与需要护栏和公众信任之间有压力。许多组织也缺乏能够连接技术和法律领域的内部专家,这使得知道从哪里开始都变得困难。

鉴于这种现实情况,重要的是从实际、可管理的步骤开始。首先,确定并记录在您的组织中人工智能的使用情况,特别是在处理敏感数据或做出重大决策的领域。明确分配人工智能监督的责任。这可能意味着建立一个跨职能团队,将合规性、风险、技术和业务利益相关者聚集在一起。即使最初感觉这些政策和流程很基础,也要记录下来,并确保您能够用通俗易懂的语言解释关键模型是如何构建、测试和监控的。

透明度和定期审查至关重要。即使标准发生变化,记录决策是如何做出的以及问题是如何处理的,在审计或出现问题时也会大有裨益。不要害怕尽可能自动化;可以标记偏见、跟踪模型漂移或更新合规性警报的工具越来越多,并且是为非专业人士设计的。最重要的是,培养一种文化,使报告人工智能行为的问题或不确定性被视为一种优势,而不是弱点。

最后,预期这项工作将是一个持续的过程。法规将发生变化,新的风险将出现,您的政策应该相应地演变。通过采取小而稳定的步骤并养成良好的习惯,组织不仅降低了风险,而且还在人工智能规则不断变化的情况下,增强了负责任创新的自信心。

在治理和合规性基础建立之后,下一个优先事项是设计一个清晰的数据策略,确保您的 AI 系统由相关、高质量且管理良好的信息驱动。

数据策略——您人工智能系统的差异化因素

创建一个能够使人工智能发挥作用的数据策略往往是组织面临的最大挑战。

人工智能的现代数据策略应该是以价值为导向的、产品化的、受管理的、语义化的,并采用多模态架构,使可信数据能够持续地被机器学习ML)、通用人工智能(GenAI)和生产中的代理系统使用。

以下是一个现代人工智能数据策略的关键支柱:

一个带有文字描述的蓝色和白色图表,描述自动生成

图 2.2:现代数据策略

  • 以价值为导向,而非以资产为导向:AI 的现代数据策略应以明确的目标开始:我们试图改善哪些业务决策或流程,我们将如何知道它是否有效?以价值为导向意味着在开始任何建模工作之前,将业务目标转化为明确的价值假设,定义目标人群、预期的业务行动以及将在生产中验证影响的经济学信号。当数据策略以明确的企业成果为基础时,优先级变得有纪律,执行变得一致,成功变得可衡量。

  • 将数据视为产品,而非副产品:在大多数组织中,数据仍然被视为应用程序的遗留物,是交易、日志或操作的副产品。当数据以这种方式处理时,没有人负责确保其准确性、可用性、文档化或可信度。建立在如此数据之上的 AI 系统将继承混乱。

将数据视为产品颠覆了范式。数据产品不是存储在存储中的数据。它是一个维护的、文档化的、可信的、可消费的资产,具有明确的目的、定义的用户和定义的服务期望。就像任何产品一样,它有一个所有者、路线图、质量标准和支持模型。

数据产品可以采取多种形式:一个精心制作的客户 360 度表格、用于建模的特征存储、欺诈检测模型评分、用于 GenAI 的嵌入目录,或对财务报告团队公开的指标层。将数据视为产品需要几个转变:

  • 必须有人负责

  • 它必须能够被他人发现和理解

  • 它必须进行版本控制和治理

  • 它必须构建来服务于已知的用例或消费者

  • 它必须在整个生命周期中得到监控、支持和最终退役

  • 语义和治理:历史上,组织认为一旦数据被集中或流入湖/仓库,它就是“准备好了”。现在,AI 已经暴露了这种假设的缺陷:没有意义的集成数据不是有用的情报。ML、GenAI,尤其是代理 AI 需要理解的不只是数据的格式,还有其商业意义、意图、约束和适当的使用。

语义提供了共享的意义,例如客户是什么,什么算作流失,活跃余额是什么,以及“流失”在财富管理和零售银行中的含义。如果不强制在 AI 系统上实施这种逻辑商业模型,它们可能会对相同的问题产生相互冲突的答案。

治理确保正确的人访问正确的数据以执行正确的任务。它定义了谁可以访问什么,哪些字段是敏感的,哪些模型需要审查,以及 AI 决策的监控和证明。

  • 多模态、多速度架构:传统数据策略是围绕结构化、缓慢移动的数据构建的,如季度财务、月度风险报告和每日仓库刷新。现代 AI 系统,尤其是 GenAI 和代理 AI 系统,从不同速度移动的许多信号中学习并采取行动。

“多模态”意味着系统可以消费的不仅仅是行和表:文本(笔记、聊天和政策)、音频(通话)、文档(PDF 和合同)、图像(支票和身份证)、事件(点击流)、日志、向量、嵌入、知识图谱等等。

“多速度”意味着架构必须同时支持慢速和快速决策:某些用例(如营销、预测和资本规划)可以容忍每日或每周刷新,而其他用例(如支付欺诈、个性化和小型代理响应)则需要实时或近实时流式处理。

实际上,多模态、多速度策略意味着以下内容:

  • 设计平台以处理结构化、非结构化和向量化的嵌入

  • 根据业务决策范围支持批量、微批量和流式处理

  • 在需要时使用专用存储,例如,文档存储、向量数据库、特征存储或知识图谱,而不是将所有内容推入一个仓库模式

  • 将延迟视为业务设计选择,而不是技术后续考虑

  • 设计信任与合规性:不言而喻,构建一个值得信赖且透明的数据平台至关重要。信任并非在部署后获得;它应该被设计到生命周期中。这意味着隐私、公平性、透明度、监控和人工监督应该被整合到设计、数据准备、建模、验证和持续运营中。

实践中的“设计信任”数据策略可能如下所示:

  • 在摄取时进行分类、敏感度标记和质量保证

  • 在结构化、列或属性级别内置访问控制

  • 具有使用界限、血缘和免责声明的策略感知数据产品

  • 自动审计跟踪、血缘、访问日志和转换记录在数据移动过程中

记住,AI 并不能修复不良的数据治理;它放大了它。需要一种在源头嵌入信任的数据策略,以实现更少的摩擦和更多的敏捷性。

  • 可互操作执行:随着组织在多个云、SaaS 平台和代理生态系统采用 AI,数据不能存在于孤立的环境中。模型、GenAI 系统和自主代理必须能够在相同的事实上工作,对相同的实体进行推理,并在相同的约束下行动,无论它们在哪里运行或由谁构建。

注意以下关于数据互操作性的内容:

  • 客户、账户、索赔和交易在云、系统和平台中具有相同的意义。

  • 数据使用、隐私、保留和血缘跟踪的政策与数据同行,而不是在承载它的基础设施内部。

  • 系统可以参考而不是替换——即移动意义而不是复制原始数据到每个地方。

  • 确保互操作性的数据策略至关重要。互操作性是允许模型、通用人工智能系统和代理在云和平台之间一致运行的关键,将数据转化为可重用的企业资产,而不是一系列孤立的孤岛。

在构建一个为 AI 准备就绪的现代数据策略时,请考虑这六个支柱。

下一步是构建一个能够支持实验、开发和可靠大规模部署的 AI 平台。

AI 平台 – 可扩展的基础设施,用于实验和部署

一个现代 AI 平台是推动 AI 生命周期所有阶段创新的动力,从实验到生产规模。领先的组织和主要云服务提供商一致认为:从孤立的试点模型转向可靠、业务关键型 AI 需要的不只是强大的算法。它需要的是一个模块化、健壮且适用于快速原型设计和企业稳定性的基础设施。

今天,核心挑战是在创新速度、安全性、可靠性和合规性之间取得平衡。最有效的 AI 平台,无论是本地、混合还是完全云原生,都设计为模块化系统。它们将关键功能如数据摄取、特征工程、模型训练、测试和生产服务分离。模块化设计允许团队更新或扩展单个组件,例如推出新模型或更换更好的数据管道,而不会对整个系统造成风险。这个蓝图被主要云平台和行业领导者如 Netflix、Uber 和 Airbnb 广泛引用。

一个架构良好的平台在沙盒环境(数据科学家可以灵活迭代和测试)和加固的生产管线(业务连续性、合规性和安全性优先)之间划出一条清晰的界限。这种分离确保创新保持快速,但不会将实时服务或敏感数据置于风险之中。许多高级团队运行“影子模式”测试:新模型与生产模型并行运行,让团队能够衡量现实世界的性能并在全面推出之前发现问题。

调度和编排模式也很重要。事件驱动的流程为实时系统提供动力,例如欺诈检测、内容个性化或代理 AI,它们能够即时适应用户交互。批量处理处理周期性再训练或大规模分析,为不需要即时结果的任务提供效率。最好的平台将两者结合,根据延迟和成本需求自动将任务路由到正确的管线。

AI 运营AIOps)已成为管理大规模复杂性的骨干。自动化工具从初始构建跟踪到测试和生产,标准功能包括版本控制、可重复性和回滚能力。持续集成/持续部署CI/CD)管道允许通过自动化测试进行频繁、受控的更新,最小化将有缺陷的模型推入生产的风险。

监控和可观察性现在是不可协商的。除了基本准确度评分之外,平台还需要跟踪模型漂移、延迟、用户结果,甚至公平性指标,并在异常出现时触发重新训练或回滚。由谷歌和 Azure 推荐的全面可观察性意味着不仅要捕获系统日志,还要捕获对业务性能真正重要的运营指标。

管理和合规性应直接构建到平台中,而不是在部署后处理。企业级平台现在自动化审计跟踪、访问控制、模型文档和审批工作流程,以保持对不断变化的法规(如欧盟 AI 法案和 NIST 框架)的领先。指导委员会和记录在案的审查流程保持监督。

总结来说,一个成熟的 AI 平台对于企业创新实现灵活性和可扩展性至关重要。

AI 算法/模式选择策略

选择正确的 AI 算法并非易事。今天的企业环境处理复杂、混合数据,必须满足合规性、安全性、成本和可解释性等要求,这些要求通常比原始准确度或新颖性更为关键。研究和经验表明,最佳结果来自一个基于原则、以业务为先的过程,该过程结合了实验、明确的评估标准以及技术利益相关者和业务利益相关者之间的持续协作。例如:

  • 从业务和合规性要求开始:算法选择应始终从对问题领域的清晰理解开始。监管需求、可解释性要求和运营限制经常在考虑技术性能之前就排除了整个模型类别。例如,在高度监管的行业,如金融服务、医疗保健和政府,可解释性、透明度和记录在案的风险控制是必不可少的。在其他情况下,高吞吐量或低延迟用例可能像预测能力一样影响方法选择。

  • 将模型类型与数据和用例对齐:对于结构化、表格数据或需要透明决策路径的问题(如风险评估或运营分析),经典机器学习方法仍然可靠。基于树的模型、线性模型和广义提升模型在性能、可解释性和部署简便性之间取得了良好的平衡。

深度学习在处理大型、非结构化数据集方面表现出色,例如图像、自然语言文本或多模态传感器数据。然而,对数据、计算和监控的更高需求必须与成本和维护现实情况进行权衡。

转移学习介于这两种极端之间,当标注数据稀缺或生产时间紧迫时尤其有价值。组织不是从头开始训练模型,而是调整预训练模型,例如微调基础模型或重用预训练嵌入,以显著降低成本、训练数据需求和开发时间,同时仍能实现高精度。

GenAI 是深度学习的一个子集,具有语言、图像和代码生成的新能力,以及用于搜索和自动化工作流程的检索增强生成RAG)。这些模型引入了强大的功能,但同时也带来了不可预测性、高计算成本以及更大程度的安全和伦理合规性监管的风险。

强化学习和代理架构解决动态、顺序决策问题,如自动驾驶汽车或自适应供应链系统,但需要用户进行仔细的奖励设计、模拟和稳健的监控,以避免在复杂环境中的意外结果。

  • 评估、实验和结合方法:企业很少从一开始就承诺单一模型类型而取得成功。相反,通过 AutoML 工具、基于云的试点平台和基准竞赛进行结构化实验,可以让团队在早期过程中比较经典、深度和生成方法。越来越普遍的是采用混合架构:例如,使用梯度提升来总结表格型业务数据,然后使用转换器进行文档分析,或者将知识图谱与基础模型结合用于企业搜索。

  • 考虑部署和生命周期影响:在开发阶段的表现很少能保证在实际应用中的成功。因此,算法选择应考虑以下下游因素:

    • 监控的简便性、可解释性和重新训练(特别是在法规变动或新数据到来时)

    • 训练和推理时间所需的总体计算和存储需求

    • 技术支持、与现有 MLOps 堆栈的集成,以及通过扩展来满足业务 KPI 的能力

    • “技术债务”的风险,因为过度复杂的模型可能看起来令人印象深刻,但可能脆弱、难以管理或维护成本过高

  • 定期测试、验证和重新评估:组织不会一开始就选择“完美”的模型就取得成功。相反,他们将模型选择视为一个持续、逐步的过程。他们依赖试点测试、A/B 比较和定期的性能检查。业务反馈有助于在需求变化时保持解决方案的正确方向。详尽的文档、版本控制和审计跟踪现在是合规性和信任的必要条件。以下是关键考虑因素:

    | 应用领域 | 首选方法 | 关键考虑因素 |

    | --- | --- | --- |

    | 信用风险评估 | 基于树的、可解释的 | 必须可解释、低延迟且合规 |

    | 文档摘要 | 通用人工智能 + RAG | 上下文、质量控制以及可审计性 |

    | 图像分析 | 深度学习(CNNs) | 高数据/计算、GPU 扩展和隐私 |

    | 实时推荐 | 混合(经典+深度) | 成本、再训练频率和持续反馈 |

    | 欺诈检测 | 集成/混合 | 平衡准确性、可解释性和成本 |

    | 动态控制/代理 | 强化学习、代理 | 复杂的监控和意外行为的风险 |

    | 低数据域适应性(医疗自然语言处理、法律人工智能等) | 迁移学习/微调 | 标签数据有限、能够重用预训练模型以及领域迁移风险 |

表 2.3:企业环境中的模型选择

算法选择不是一次性的技术练习,而是一个动态的、业务关键的过程。看到人工智能带来实际影响的组织通常会定期回顾模型选择,优先考虑操作清晰度,并将决策建立在现实世界的限制之上,尽可能使用混合设置和试点驱动的验证。

组织结构和变革管理

启动人工智能项目不仅关乎技术和流程,还关乎人和过程。无论你已经构建了先进的数据策略还是复杂的人工智能架构,成功都取决于团队的组织方式、激励措施以及如何引导团队通过变革。以下是一些经过验证的最佳实践:

  • 团队结构很重要:

    • 人工智能触及技术和商业领域,因此清晰的团队结构至关重要。

    常见模型包括以下:

    • 集中式:一个单一的卓越中心CoE)负责整个公司的机器学习。这推动了一致性和深入的专业知识,但可能会使前线团队感到疏远。

    • 嵌入式:每个业务单元都有自己的机器学习团队,这允许快速针对特定领域提供解决方案,但同时也存在重复工作和标准不一致的风险。

    • 混合式:核心平台团队处理治理和工具,而领域团队管理本地项目。这种“中心辐射”方法提供了平衡,但需要强大的沟通以避免混淆。

选择最佳方法取决于组织的规模和需求,但大多数成熟组织倾向于混合模式,以结合共享知识和业务背景。

  • 建立协作和共同目标:

    • 组建跨职能的“老虎团队”,在高优先级项目中将数据、技术和业务专家联合起来。

    • 使用共享目标(如 OKR),以便技术和业务人员朝着相同的成果努力,而不是孤立的目标。

投资于持续培训。领导者应学习机器学习基础知识,技术人员应深化其业务背景。定期的内部研讨会和提升技能项目帮助团队保持适应性。一个开放、以学习为导向的文化,它欢迎动手反馈并庆祝成功与失败,使 AI 团队保持参与和韧性。

  • 管理变革和调整激励:

    • 设定反映业务价值和机器学习性能的共享指标和奖励,例如收入增长或客户保留,而不仅仅是技术基准。

    • 确保强有力的高管支持。高级领导者应倡导机器学习,清除障碍,并传达变革背后的“为什么”。

    • 使用结构化的变革管理框架,如科特的八个步骤或 ADKAR,以支持新的工作流程、角色和心态。从小规模、专注的试点项目开始,而不是大规模推广,以建立信任和动力。

成功的 AI 组织将变革视为持续的过程,而非一次性事件。他们鼓励各级别的所有权,保持沟通渠道畅通,并定期审查进度以快速适应业务和技术需求的变化。

摘要

在本章中,我们概述了成熟 AI 策略的结构要素。我们展示了具有高性能 AI 系统的组织并非从算法开始,而是从业务对齐、结构和可重复的模式开始。

关键要点包括以下内容:

  • 业务对齐应放在首位。AI 必须与定义明确的企业倡议相结合,并针对实际结果进行衡量,而不是技术代理。

  • 治理是推动者,而非制动器。政策、指导方针和合规性必须融入生命周期,以确保创新可以安全且反复地扩展。

  • 数据是基础,也是你组织的差异化因素。可靠、道德、互操作和良好治理的数据产品使 AI 在各个用例中值得信赖且可重复使用。

  • 平台思维取代了单一项目。模块化 AI 平台使实验室中的快速迭代和生产中的硬化执行成为可能。

  • 正确的算法系列取决于上下文、约束和价值。拥有锤子并不意味着一切看起来都像钉子。

  • 运营模式是使所有元素高效工作的关键。当激励措施、角色和协作路径被设计为跨职能交付时,AI 才能成功。

当这些要素到位时,AI 就不再只是实验性的,而是开始成为一种持久的企业能力。

接下来是什么?

现在我们已经建立了有效构建 AI 的基础,接下来的问题是先构建什么。下一章将展示如何识别、排序和选择具有最高商业影响的 AI 项目。

参考文献

免费订阅电子书

新框架、演进的架构、研究发布、生产故障——AI_Distilled 将噪音过滤成每周简报,供直接与大型语言模型和通用人工智能系统打交道的工程师和研究人员阅读。现在订阅,即可获得免费电子书,以及每周的洞察力,帮助您保持专注并获取信息。

packt.link/8Oz6Y 订阅或扫描下面的二维码。

img

第二部分

将项目与商业影响对齐

第二部分,我们将提供一个连接策略与执行的实用蓝图,从选择高影响力 AI 项目开始。首先,我们将详细说明如何分析和优先考虑项目,超越技术新颖性,关注诸如商业影响、最终用户定义和全面可行性分析等因素。接下来,我们将涵盖获得领导支持的关键步骤,通过早期吸引利益相关者,构建一个引人入胜的故事,关注商业价值的“所以呢”,呈现分阶段路线图,并设定现实期望。在获得赞助后,我们将展示构建有效概念验证PoC)的剧本,详细说明关键的 PoC 后决策:是进行细化、转型,还是推进到最小可行产品。最后,我们将介绍一个全面的框架,用于衡量概念验证的性能,而不仅仅是技术模型指标。

本部分包含以下章节:

  • 第三章选择高影响力 AI 项目

  • 第四章超越构建:获得领导支持以推进 AI 项目

  • 第五章构建 AI 概念验证和衡量您的解决方案

第三章:选择高影响力的人工智能项目

在今天快速发展的商业环境中,组织正在将人工智能视为推动效率、改善决策和最大化收入的关键工具。虽然公司可以快速原型化人工智能解决方案,但挑战在于优化这些解决方案以实现各自组织最大的收益。构建人工智能解决方案是必要的,但广泛的采用和持续的势头才是真正赋予这些解决方案意义的关键。

本章为有兴趣创建有影响力的人工智能解决方案的公司提供指南。“有影响力”对每个组织可能意味着不同的事情,但最终,它与向最终用户提供 5 星级体验相关。在本章中,我们将探讨构建优化和有影响力的人工智能解决方案背后的原因,并提供一个实用的蓝图,说明您可以采取哪些步骤来实现这种优化。请注意,本章不讨论模型优化,而是讨论如何最有效地使用人工智能以获得最佳的投资回报率。

我们将涵盖以下关键主题:

  • 为什么选择高影响力的人工智能项目很重要?

  • 案例研究 – 选择正确的战斗

为什么选择高影响力的人工智能项目很重要?

选择高影响力的人工智能项目很重要,但也很困难。确定正确用例的正确时机需要集体的智慧。因此,构建优化的人工智能解决方案至关重要。人工智能优化指的是使用人工智能算法和技术有效地改进系统和流程,以获得所需的企业价值。这是企业可以利用的框架,以最有效地使用人工智能。让我们讨论一下为什么这很重要:

  • 创建人工智能解决方案和产品是一项耗资巨大的任务。在投入数百万美元进行开发之前,评估所有因素,如影响、最终用户、总成本等,至关重要。明确这些因素有助于你确定解决方案的价值,并确保获得必要的动力和资源。

  • 人工智能是新的热门对象,人们强烈渴望使用人工智能来构建解决方案。然而,现在是时候扭转局面了。与其用人工智能来解决问题,不如先确定用例,然后再决定人工智能是否可以增强它。这种方法可以节省时间和资源。

  • 构建人工智能解决方案是一个团队的努力,组建一支 A 队是至关重要的。在开始开发过程之前,获得不同团队和高级领导的支持,确保每个人都完全参与,并为人工智能项目提供他们的关键意见。

  • 通过优化人工智能解决方案,组织可以在开发过程中早期识别和解决潜在风险。这种主动方法有助于最大限度地减少昂贵错误或失败的可能性。

现在,让我们深入探讨在构建人工智能解决方案之前您可以分析的一些因素。

开发有效人工智能解决方案的关键因素

在构建人工智能解决方案之前需要考虑的因素如下:

  • 业务影响:您旨在解决的问题应为业务带来显著的价值。企业应利用人工智能积极影响其运营,而不仅仅是因为它是热门话题。常见的业务价值包括创造新的收入来源、获取新用户、保留现有客户和创造新资产。然而,影响不仅限于客户价值;它还可以包括改善内部运营,例如通过人工智能副驾驶工具提高员工生产力或通过基于 RAG 的解决方案简化招聘或法律工作流程等流程。

小贴士

应通过咨询适当的业务利益相关者来定义业务影响/价值。作为一名数据科学家,您可以自由地提出指标,但也应灵活地吸收来自业务领域专家的反馈。

  • 最终用户:在人工智能产品发布后,明确您的解决方案的最终用户对于跟踪投资回报率ROI)至关重要。这将帮助您创建一个优化的反馈循环机制。这个反馈循环对于衡量人工智能解决方案的持续成功至关重要,能够实现持续改进。技术团队应与最终用户保持清晰的沟通渠道,以便他们能够理解痛点并相应地调整解决方案。

定义最终用户还有助于定义您的人工智能解决方案的影响。例如,如果最终用户是内部员工,影响通常以生产率提升、效率改进或每位员工节省的时间来衡量。另一方面,如果解决方案针对外部客户,重点则转向用户保留、收入增长、客户获取和增加客户终身价值CLV)等指标。

确定正确的最终用户确保您能够根据业务目标定制解决方案,并建立一个动态的系统来捕捉和采取反馈,确保长期成功。

小贴士

确保您的最终用户,尤其是如果他们是内部用户,是开发过程的一部分,并与他们设定现实的目标。虽然您不能包括所有最终用户,但您可以识别几位能够提供关键反馈的重量级用户。

  • 选择合适的 AI 用例:定义一个有影响力的业务问题是至关重要的,但确定它是否适合人工智能则是一个完全不同的挑战。为了将这个问题放在适当的背景下,人工智能和机器学习ML)擅长解决涉及识别模式、趋势或处理大量数据以预测或分类结果的问题。然而,并非所有用例都需要人工智能的复杂性。在考虑适当的 AI 用例时,首先确定业务问题,然后评估人工智能是否可以增强或解决它,而不是盲目寻找人工智能应用。

让我们探讨三个案例研究,以展示人工智能何时是一个很好的选择,何时是过度使用,以及何时处于灰色地带。

案例研究 1(人工智能过度使用)

假设一家公司旨在计算基本描述性统计,例如在给定期间的平均销售额或简单的趋势分析。这些任务完全在标准统计方法或工具(如 Excel 和仪表板)的能力范围内。在这里引入人工智能或机器学习只会增加不必要的复杂性,而不会增加价值。

解决方案:在这种情况下,简单的统计工具更有效率。

警告:如果将来数据的大小和复杂性发生变化,那么应该重新审视这个问题,看看简单的统计方法(如线性回归)是否比简单的趋势分析能带来更多的价值。

案例研究 2(人工智能处于灰色地带)

考虑一家公司使用基于规则的引擎来根据固定参数为用户推荐下一个最佳营销行动。这些行动可能看起来像是向新婚夫妇推荐申请住房贷款。基本上,营销团队根据客户的生活事件和/或其他参数发送促销信息。如果这些参数(生活事件)可以以静态和可预测的方式编码,例如,如果有人结婚则编码为1,如果没有则编码为0,那么可能不需要人工智能技术。你可以非常容易地构建一个基于规则的引擎。然而,如果用户基础显著增长,并且你希望解决方案足够动态以决定重要参数,那么转向人工智能驱动的方法可能是有益的。

解决方案:深度神经网络等高级技术可能能够更好地解决这个问题,因为它们可以处理大量用户与其偏好之间的复杂关系,而不仅仅是基于规则的引擎。深度神经网络擅长捕捉用户偏好和关系随时间的变化。它们对于冷启动问题也非常出色——基本上,新客户/用户加入公司,因为它们将能够找到具有相似兴趣的类似用户,并为他们提供最优推荐。

案例研究 3(人工智能可以产生重大影响)

利用 AI 通常对高影响用例有益,例如诊断罕见疾病或检测欺诈。这些场景通常涉及大量数据集和复杂模式,而基于规则的系统或手动流程可能无法在规模上得出结论。AI 的预测能力可以显著提高此类用例的准确性和速度。

解决方案:通过处理大量数据和更有效地识别异常,实施 AI 将提供有形的益处。让我们以使用 AI 技术进行欺诈检测为例。

要构建欺诈检测解决方案,你需要多个数据点,例如交易记录、用户行为日志、客户档案,甚至可能是外部数据源,如信用局信息。现在,所有这些大量数据都可以通过神经网络或强化学习来高效地处理,以适应欺诈检测策略。如果你还有非结构化数据,例如任何类型的文档,你也可以利用高级推理大型语言模型LLMs)来处理结构化和非结构化数据,并有效地标记欺诈交易。随着 LLMs 的出现,也可以在无需人工干预的情况下实时提醒用户。你可以部署一个代理来发送消息或电子邮件给用户。

现在我们已经定义了可以利用 AI 为解决方案的最终用户带来益处的用例,并确定了商业影响,接下来要考虑的是,尽管 AI 可能有益,但这并不意味着它可以立即实施。在接下来的章节中,让我们探讨其他对 AI 实施构成约束的商业因素。

可行性分析

在企业环境中,可能会有额外的约束,如人才、资源、预算等。因此,为了进行尽职调查,在开始构建 AI 解决方案之前,需要执行一些额外的分析。

在实施 AI 之前,进行全面的可行性分析以评估技术和商业可行性。这确保了所构建的解决方案能够带来可衡量的商业价值。这可以在以下变量上进行执行:数据、技术栈和人才。

数据

数据是 AI 解决方案的燃料。你的 AI 解决方案的质量取决于你提供的数据。即使是最复杂的技术,如果数据质量不高或数据不正确,也会失败。因此,关注你组织内的数据非常重要。以下是关于数据的考虑因素:

  • 高质量数据的可用性:AI/ML 需要大量的数据来学习模式和趋势,并在此基础上进行泛化。一旦确定了正确的数据来源,确保在数据被摄入 AI 算法之前进行数据清洗是非常重要的。所有模型,包括 LLMs,都需要高质量的数据。

例如,假设你正在为员工构建一个聊天机器人,以便他们获取关于所有人力资源相关信息的帮助,例如休假政策、福利等。提供给大型语言模型(LLM)的数据必须干净且更新,以便员工能够获取相关信息。否则,他们可能会认为自己在遵守公司规定,但可能会因为过时的信息而陷入麻烦。

同样,如果你正在构建一个简单的预测模型,确保数据中没有不必要的字符或过多的缺失值是至关重要的,因为这些可能会误导模型。

  • 数据量有限:公司可能只有少量高质量的数据,例如只有 100 个用户的数据。数据有限的原因可能有很多,比如公司刚刚推出新产品,只有早期采用者的数据。在这种情况下,为了增强数据,使用如生成对抗网络(GAN)之类的合成数据生成技术可以非常强大。

例如,假设一家公司正在为一种潜在的爆款药物制定上市策略。在这种情况下,你可能没有大量的数据来分析之前的上市策略,以决定诸如何时上市、在哪个国家上市、针对哪些医疗保健提供者等问题。你可以利用生成对抗网络(GAN)来增强数据并进行分析,以应对这一问题。尽管结果可能不是 100%准确,但它们为利益相关者提供了一个良好的起点,以制定他们的上市策略。你可以使用的其他技术包括合成少数类过采样技术(SMOTE);在这里,不是简单地复制少数类样本,而是通过在特征空间中插值现有少数样本及其最近邻来生成合成示例。这有助于模型学习更一般的决策边界,并降低过拟合的风险。

警示故事

合成数据是模拟复杂模式和场景的绝佳工具。然而,需要注意的是,对于高风险用例,如预测患者是否可能感染 COVID-19,挑战会随之而来。由于 COVID-19 是一个独特的事件,没有先前的数据,做出准确的预测是困难的。在这种情况下,合成数据可能不足以发挥作用,因为没有精确的基础数据集来有效地应用合成数据技术。在这里,你可以做的最接近的事情是查看过去的大流行病,以分析整体趋势。

  • 购买第三方数据:公司通常希望多元化目标受众并探索新的用户基础。在这种情况下,获取数据可能是有兴趣的。

例如,考虑这样一个案例,你正在为针对小型企业主的人工智能挖掘策略工作。现在,这可能是公司的一个全新的目标受众,因此将没有先前数据来理解小型企业生态系统。在这种情况下,最好从 ZoomInfo 等供应商那里获取数据,并基于行业、公司规模、收入等因素构建个性化的 AI 挖掘策略。

  • 多样化和代表性数据:为了构建值得信赖和负责任的 AI 解决方案,必须拥有代表人口中每个人的数据,以便你的算法可以理解模式,即使是对于少数群体。还必须去偏数据,以确保没有基于种族、性别等因素的群体比其他群体更受青睐。

还非常重要的一点是,尽可能避免使用个人身份信息PII),例如社会保障号码。在某些情况下,例如癌症预测问题,PII 数据(如性别和年龄)是不可避免的,因为这些特征决定了治疗过程。

例如,假设你正在构建一个预测问题,预测一个人是否有资格获得高信用额度。在这种情况下,历史数据可能显示男性比女性获得更高的信用额度,因为他们工作的时间更长,或者可能比女性有更高的净财富和薪水。在这里,这是一个社会问题,以某种形式削弱了数据。如果你不使用性别作为训练特征,模型将根据其他特征(如当前净财富、消费模式等)预测高信用额度,而不会根据性别进行区分。因此,进行详细分析以确定可能引入模型偏差的属性,并退一步考虑它们是否会影响模型结果,这是至关重要的。

考虑到前面的观点,下一个问题是,数据量过多是什么意思?虽然这里没有一刀切的方法,但有一些一般性指南可以遵循:

  • 监督式机器学习问题需要更多的标记训练数据。

  • 模型越复杂,它需要的数据就越多。

  • 一个普遍的规则是,你需要的数据点数量是你数据集中特征数量的 10 倍。如果有 10 列,你应该至少有 100 行。

  • 对于大型语言模型(LLMs),如果你正在进行微调,那么拥有一个涵盖所有场景(包括边缘情况)的健壮数据集是至关重要的。

数据应该是你 AI 策略的一个关键组成部分。确保有足够的高质量数据可供使用,将引导你走向成功的结局。这一步骤可能需要一些时间和精力,但它可以让你免于构建次优 AI 解决方案的痛苦。一旦你有了数据,下一个因素就是检查你的技术堆栈,以构建这些 AI 解决方案。

技术堆栈

大多数生产中的 AI 解决方案都需要一个强大的技术栈。本地计算机可能不足以处理大量数据并提供无缝的用户体验。除此之外,并不是每家公司都能建立自己的云基础设施。这是一项昂贵的投资,而且在大多数情况下并不需要。因此,他们更倾向于选择现有的云服务提供商。

在某些情况下,例如如果你正在构建基于规则的引擎或简单的统计分析,你可能会选择本地部署。但随着解决方案的扩展和用户基础的扩大,你将不得不转向云服务提供商。

如果目标是构建通用人工智能解决方案,我们都知道在利用大型语言模型(LLMs)时,会面临巨大的环境限制。容量有限。即使你获得了访问容量,也有可能如果多个用户同时使用你的解决方案,他们可能会遇到速率限制错误(这基本上是一个消息告诉他们没有容量,请稍后再试)。这可能会影响用户体验,人们可能会对你的通用人工智能解决方案失去兴趣。为了减轻这个问题,你应该确保你可以为你的解决方案提供持续的吞吐量,这样用户就不会遇到这个错误。这可以通过分析你现有的流量并确保在一天中繁忙时段你的云平台内有足够的资源来实现。你还应该考虑响应的延迟。例如,推理模型,如 o 系列,可能需要更长的时间来响应,这可能会增加客户跳出率或导致客户体验不满意。

小贴士

另一点需要注意的是,如果你选择云平台,一个关键优势是能够访问其云解决方案架构师和专家,他们可以为你提供针对用例的最佳实践,帮助你优化解决方案,并指导你完成实施。确保利用这些宝贵的资源以获得专家建议。

人才

虽然数据和科技栈很重要,但你还需要能够利用所需数据和技术的个人来创建有影响力的 AI 解决方案。构建 AI 解决方案是复杂的;因此,拥有专业技能的人员很重要。

人工智能应用需要一支专业的人才库。根据具体用例,所需技能可能有所不同,但了解数据科学、机器学习和统计学的基础知识至关重要。另一个需要注意的关键因素是,你的数据科学家可能对数据科学栈非常熟悉,但可能不是 MLops 的专家,MLops 是指管理和部署 AI 解决方案在生产环境中的技能。为此,你可能需要具有操作技能的人才——也就是说,他们知道如何以最高效的方式在生产环境中编写代码,以及持续监控和评估 AI 解决方案。

在众多角色中,决定哪些人最符合团队需求可能很困难。一般规则是拥有数据科学家,因为这些人擅长深入处理数据,甚至使用机器学习算法构建概念验证(PoC)或最小可行产品(MVP)。接下来,你可能还需要机器学习工程师MLEs),他们擅长将可行的 PoC 部署到生产环境中。最后,拥有能够为 AI 产品制定上市策略并帮助项目保持正轨的 AI 产品经理或产品经理也非常重要。

由于 AI 的发展速度很快,很难找到该领域的“专家”。与其追逐专家,不如雇佣那些具有成长心态和愿意学习的人。

小贴士

如果你正在考虑部署 AI 作为用户界面应用程序,你可能还需要.NET 开发者,所以确保你的团队中有这样的人。

在大型组织中,你可能还需要项目经理或产品经理来定义里程碑、确保每个人都承担责任,并确保 AI 解决方案的顺利交付。

在本节中,我们讨论了在企业环境中,在实施 AI 解决方案之前进行全面的可行性分析至关重要。这包括评估技术和商业可行性,以确保解决方案能够带来可衡量的商业价值。需要考虑的关键变量包括数据、技术堆栈和人才。高质量的数据对于 AI 的成功至关重要,公司可能需要增强或采购数据。一个健壮的技术堆栈,通常涉及云服务提供商,对于处理大量数据和确保无缝的用户体验是必要的。具有成长心态和愿意学习的能力的专门人才对于有效地利用数据和科技至关重要。

在下一节中,我们将探讨机会规模,这对于理解 AI 解决方案的潜在影响和可扩展性非常重要。这有助于确定正确的追求机会,并确保资源得到有效分配,以实现最大的商业价值。

机会规模

机会规模是一种数据科学家在决定投资之前,用来量化一项计划潜在影响的方法。尽管企业试图优先处理计划,但它们很少进行数学评估来评估机会,而是依赖直觉驱动的决策。虽然这种决策方式有其位置,但它也面临着容易被一些微妙偏见所左右的风险,例如可获得的信息、确认偏见等。

机会规模可以采用多种方法来处理。在本节中,我们将介绍两种方法:方向性 T 恤尺码和自下而上的比较方法。

方向性 T 恤尺码是一种定性方法,根据机会的潜在影响和可行性,将机会分类为小、中、大和超大等尺码。这有助于快速评估和优先排序机会,而无需详细分析。另一方面,自下而上使用可比方法涉及一种更量化的方法,通过分析类似项目或倡议来对机会进行规模评估。

让我们从方向性的 T 恤尺码开始讨论。

方向性 T 恤尺码

方向性 T 恤尺码是一种定性方法,用于估计项目不同阶段所需的时间和努力。它根据任务的复杂性和范围,将任务分类为超小XS)、S)、M)、L)和超大XL)等尺码。这种方法有助于快速评估和优先排序任务,而无需详细分析。

方向性 T 恤尺码的重要性在于它能够提供一种快速直观的方式来估计项目需求。它促进了团队间的连贯性和标准化,使得沟通和项目期望的协调变得更加容易。此外,它有助于在项目规划阶段早期识别潜在的瓶颈和资源需求,确保项目能够现实地界定并有效管理。

假设你正在为一个电子商务平台开发推荐引擎。以下是你可能对任务进行分类的方式:

  • XS : 设置初始项目环境,包括基本配置和依赖项。这项任务简单直接,需要最少的努力。

  • S : 使用现有库实现基本的推荐算法。这涉及到一些编码和测试,但相对简单。

  • M : 将推荐引擎与电子商务平台的用户界面集成。这需要更多的努力,因为它涉及到确保推荐引擎与平台之间交互的无缝性。

  • L : 通过添加基于用户行为和偏好的个性化推荐等高级功能来增强推荐引擎。这项任务复杂,需要大量的开发和测试。

  • XL : 将推荐引擎扩展以处理大量数据和用户。这涉及到优化算法、确保高可用性,并可能迁移到云基础设施。

使用方向性 T 恤尺码有助于快速评估和优先排序任务,而无需详细分析。它提供了一种快速直观的方式来估计项目需求,促进了团队间的连贯性和标准化。

自下而上使用可比方法

自下而上的可比方法规模评估方法通过利用可比产品、服务或市场来估算业务或产品的潜在价值。当您有有限直接数据但可以与现有业务或市场细分进行比较时,此方法很有益。重点是识别类似实体并外推其指标以估算您的机会。

下面是如何逐步应用自下而上的可比方法规模评估方法的步骤:

  • 识别相关的可比产品、服务或市场:寻找在目标受众、功能、行业或定价模式方面与您试图评估的内容相似的产品、服务或公司。

例如,如果您正在推出一个新的基于云的客户关系管理CRM)平台,查看提供 CRM 解决方案的其他 SaaS 公司,如 Salesforce 或 HubSpot。对于一个新电动汽车,您可能会查看 Tesla 或 Rivian。

  • 从可比方法收集数据:研究公开信息,并从可比公司收集关键指标,如收入、客户基础、定价、增长率和市场份额。来源可以包括以下内容:

    • 年度报告或投资者演示

    • 行业基准和报告

    • 新闻稿和新闻报道

    • 市场研究数据库或市场研究

    • 对目标用户群体进行调研

例如,对于一个新的流媒体平台,从 Netflix、虎牙或 Disney+等公司收集订阅者、平均每用户收入ARPU)和市场份额数据。

  • 调整规模和市场动态:调整不同产品的数据,以反映关键差异,如地理位置、目标受众规模或定价。

例如,如果您将产品与北美运营的公司进行比较,但您的产品将在全球范围内推出,相应地调整数据。

  • 使用定性调整:考虑定性差异,如品牌强度、客户忠诚度或技术功能的差异。

例如,如果一个品牌已经拥有强大的用户基础,那么任何新产品或服务的适应都会更容易,用户更有可能与其互动,相比之下,新品牌在市场上的用户互动可能性更低。对于初创公司来说,通过开源其代码或部分技术一段时间,更容易建立品牌,使用户信任他们。这些调整可能有点棘手,但在您的计算中应考虑作为一个因素。

  • 应用可比指标:一旦调整了差异,将可比指标(如每用户收入或市场渗透率)应用于您的业务场景。

例如,如果同一行业的可比产品 ARPU 为 100 美元,客户基础为 100 万,根据产品提供和市场条件相似性,估算您产品的 ARPU 和潜在客户基础。

总之,方向性 T 恤尺码和自下而上的比较方法都是机会规模的方法。方向性 T 恤尺码提供了一种快速直观的方式来估计项目需求,而自下而上的比较方法则提供了更精确和基于数据的评估。通过利用这些方法,您可以有效地优先考虑机会,并将资源分配到最大化商业价值。

机会规模的关键组成部分之一是成本效益分析。在下一节中,我们将详细介绍这一点。

性能成本与收益分析

成本效益分析是证明假设的 ROI 并从利益相关者那里获得信心的重要步骤。它涉及评估与机会相关的潜在成本与预期收益的对比,以确定其整体价值和可行性。这种分析通过量化财务影响并确保投资资源将产生显著回报,有助于做出明智的决策。

将成本效益分析与机会规模相结合,使组织能够根据其潜在价值优先考虑机会。通过比较成本和收益,公司可以确定哪些机会提供最高的投资回报率(ROI),并相应地分配资源。这确保了努力集中在提供最大商业价值的项目上,从而实现更有效和战略性的决策制定。

这里是一个数据科学家在确定时的框架:

  1. 首先,确定并估算成本:

    • 开发成本

      • 数据收集和准备:AI 模型需要大量数据集。估算收集、清理和标注数据的成本至关重要。对于某些项目来说,获取高质量数据可能很昂贵,生成高质量数据也可能成本高昂。

      • 基础设施:AI 项目通常需要大量的计算能力,尤其是训练模型。考虑云基础设施成本(例如,AWS、Azure、GCP 等)、服务器硬件和持续维护。

      • 资源:AI 项目需要包括数据科学家、AI/ML 工程师和领域专家在内的熟练团队,以估算薪资、培训和咨询费用。如果您聘请顾问而不是全职人才,则应相应调整成本。

    • 运营成本

      • 部署:这些是与在生产中实施 AI 系统相关的成本,包括与现有系统和自动化管道的集成。

      • 监控和维护:AI 模型会随着时间的推移而退化,需要定期监控、更新和再训练,这需要专门资源。

      • 法规和合规性:根据行业(例如,医疗保健、金融等),确保遵守法律和道德标准,这可能会增加成本。

  2. 接下来,估算收益:

    • 提高效率

      • 流程自动化 : 人工智能可以自动化重复性任务,释放人力资源用于更高价值的工作。通过减少人工工作时间(例如,人工智能自动化客户支持或重复性行政任务)来量化劳动力节约。

      • 运营效率 : 人工智能可以优化流程,例如供应链管理或预测性维护,减少停机时间和运营成本。

    • 收入增长 :

      • 新的收入来源 : 人工智能可以创造新产品、服务或商业模式(例如,个性化推荐推动更多销售,人工智能驱动的服务如虚拟助手等)。

      • 客户体验 : 基于人工智能的个性化可以导致更高的客户保留率、增加满意度和更高的平均订单价值(例如,电子商务中的定制推荐)。

    • 改进的决策 :

      • 数据驱动的洞察 : 人工智能模型通过识别人类可能错过的模式和趋势,帮助做出更快、更准确的决策。这些洞察可以导致更好的战略规划、定价或产品开发。

      • 风险缓解 : 人工智能模型可以识别潜在风险,例如欺诈检测、贷款审批或网络安全。量化降低风险和避免损失的价值。

  3. 接下来,开发市场竞争力以获得竞争优势。作为人工智能的早期采用者,可以在市场上给你的业务带来优势,提高客户忠诚度、运营效率和市场份额。

  4. 进行投资回报率分析:

    • 总成本 : 将所有识别的成本(开发、运营、人才等)相加。

    • 总收益 : 总结成本节约、收入增加或风险降低的收益。

    img

  5. 进行敏感性分析:

    • 最佳、预期和最坏情况场景 : 改变你对成本和收益估计的假设,以了解你的投资回报率对关键变量变化的敏感性。

    • 不确定性因素 : 评估数据质量、模型准确性、监管变化或潜在延迟,并相应调整分析。

    • 长期与短期价值 :

      • 短期价值 : 量化即时收益,例如成本节约或改进的客户服务,并将它们与前期开发和部署成本进行比较。

      • 长期价值 : 考虑可扩展性和随时间学习带来的价值。人工智能模型在接触到更多数据时可以不断改进并带来越来越多的收益。

    • 非货币收益 :

      • 战略定位 : 即使它们不提供即时回报,人工智能项目通常也与长期创新战略相一致。

      • 客户和员工满意度 : 自动化日常任务可以使员工更加快乐,而个性化的基于人工智能的体验可以取悦客户。

      • 品牌认知 : 人工智能可能会提升你的品牌形象,将你定位为一个具有前瞻性和技术敏锐的组织。

现在,让我们来看一个例子。假设你正在实施一个用于客户服务的 AI 聊天机器人。成本可能包括 10 万美元的开发和部署费用,50,000 美元每年的基础设施和更新费用,以及 100,000 美元每年的人力资源费用来管理和监控它。收益可能包括每年减少 40 万美元的客户服务成本,由于人工代理减少、响应时间更快和客户满意度提高。这将导致以下投资回报率:

img

这表明了强烈的正面回报,但应该带着一颗谨慎的心去看待。所有这些投资都假设一切都会按预期进行,但在现实世界的实施中这很少是情况。

成本与收益分析对于评估机会的整体价值和可行性至关重要。通过比较成本和预期收益,组织可以优先考虑那些提供最高投资回报率的倡议,确保资源得到有效分配,以实现最大商业价值。

所讨论的所有方法都是定量分析。在优先考虑企业内的 AI 用例之前,你应该考虑一些其他因素。

分析用例的风险等级

另一个重要的步骤是评估用例对组织来说风险是高还是低。如果你的公司风险承受能力低,明智的做法是从低到中风险的 AI 用例开始,例如以下这些:

  • 自动化报告:简化重复性任务并提高报告准确性

  • 内部聊天机器人:增强内部沟通或客户服务

  • 推荐引擎:为用户个性化产品或服务推荐

从可管理的、低风险的项目开始可以帮助建立对 AI 能力的信心,并为扩展更复杂、影响更大的解决方案打下基础。

如果你在一个受监管的组织(如医疗保健、金融、保险等)工作,实施低风险用例将帮助你增强对法律和合规团队的信心,并习惯于文档工作。这在实施复杂用例时将非常有用。

分析用例的规模

我们都知道 AI 在扩展方面很强大。可能问题已经通过现有的工具或数据分析得到解决,并且是足够的,但现在公司的状况已经改变。

例如,一家公司使用简单的基于规则的营销引擎向客户发送电子邮件活动。然而,在收购另一家公司后,用户数量增加了十倍,导致大量新数据的涌入。在这种情况下,AI 可能是一个合适的解决方案。因此,利用 AI 为客户构建推荐引擎可能更有效。

分析历史解决方案

当构建 AI 解决方案时,重要的是要深入了解组织内部,确定问题是否已经被解决。这可能通过遗留工具或简单的统计分析来实现。这有两个重要原因:

  • 与所有者/利益相关者沟通以检查问题是否已经被解决是了解过去没有奏效的方法以及 AI 是否可以解决它的好方法

  • 这也有助于你决定 AI 是否是解决方案,或者是否可能存在无法使用 AI 解决的问题

让我们通过一个例子来详细了解:

示例:基于订阅服务的客户流失预测

背景:一家基于订阅的视频流媒体公司面临着高流失率。产品团队建议开发 AI 模型来预测哪些客户可能会流失,并主动提供促销活动以留住他们。在此之前,公司应遵循以下步骤来了解是否需要 AI 来解决该问题:

  1. 与利益相关者沟通:在开发 AI 解决方案之前,数据科学团队会与包括客户支持在内的关键利益相关者会面。数据科学团队了解到公司已经尝试过手动流失分析,分析客户反馈和使用数据,但失败了。营销团队提到,过去已经基于简单的细分(例如,上周最后登录的客户)发起过留存活动,但尚未看到留存率显著提高。运营团队透露,某些地区的服务中断频繁,这可能导致客户不满和流失。

  2. 利益相关者的见解:讨论表明,仅 AI 可能无法完全解决流失问题。某些地区的服务中断可能引发客户不满,但这是一个必须在引入 AI 模型之前解决的问题的运营问题。

  3. 确定 AI 是否合适:团队得出结论,仅 AI 本身不足以解决问题。虽然 AI 可以帮助预测哪些客户可能会流失,但它不会解决根本原因(服务中断)。

  4. 解决方案:他们解决服务问题并提高整体客户体验。一旦运营问题得到解决,基于 AI 的流失预测模型可以通过在客户决定离开之前主动接触有风险的客户来增加价值。历史解决方案也是进行基准测试的好方法。

  5. 示例 : 假设您想构建一个基于 AI 的需求预测系统来取代现有的平台。这可能是因为需求规划师观察到准确率下降,从而导致收入减少。现在,假设遗留系统使用统计方法(如 Auto-ARIMA)进行预测,但您的新 AI 解决方案可以跳过到高级机器学习和神经网络技术。这样,您正在构建对需求规划师生活有价值的东西。此外,这两个系统可以并行运行几个月以比较准确率,给业务用户带来更多信心。

所有这些不同类型的分析都将帮助您发现用例的潜力,并确定 AI 是否需要用于您的解决方案。进行详细分析将使您能够做出明智的决定,并对您的选择充满信心。

案例研究 – 选择正确的战斗

在本章中,我们探讨了决定您企业最佳 AI 用例的潜在技术,包括进行可行性分析、机会规模评估,以及考虑其他因素,如用例的风险和规模。现在,让我们看看这在现实世界中会如何展开。

Apex 银行是一家虚构的领先中型金融机构,一直在大力投资数字化转型。作为其 5 年创新路线图的一部分,银行的领导层成立了一个 AI 工作组,以探索与战略优先事项一致且能带来可衡量回报的高影响用例。

工作组筛选出两个潜在的 AI 项目:

  • 客户流失预测模型

  • 欺诈检测系统

这两个项目数据丰富且技术上可行,但鉴于有限的预算和资源限制,选择正确的项目进行优先考虑至关重要。

  • 项目 1:AI 驱动的客户流失预测 :

    • 概述 : 该项目建议构建一个机器学习模型来预测哪些客户可能会关闭账户或停止使用关键产品。目标是通过对目标保留活动进行主动参与。

    • 此项目的潜在好处 :

      • 减少客户流失(估计每年 12%)

      • 提高客户终身价值

      • 加强个性化营销

      • 提高品牌忠诚度

    • 与项目相关的挑战 :

      • 这需要从各种系统(CRM、交易日志和呼叫中心数据)进行大量数据集成

      • 预测结果需要协调营销和客户服务部门的变化

      • 保留激励措施可能侵蚀利润

  • 项目 2:AI 驱动的欺诈检测模型 :

    • 概述 : 该项目涉及使用监督机器学习技术构建实时欺诈检测引擎。它将分析交易行为以标记异常供审查。

    • 项目的潜在好处 :

      • 减少因欺诈造成的财务损失(估计每年 8000 万美元)

      • 提高客户信任和安全性感知

      • 提高对金融法规的遵守

    • 与项目相关的挑战 :

      • 它需要一个强大的实时基础设施

      • 假阳性可能会影响用户体验

      • 模型重新训练需要持续的数据质量监控

评估标准

任务小组根据以下标准评估了两个项目:

| 标准 | 流失模型 | 欺诈检测模型 |

| --- | --- | --- |

| 战略一致性 | 中等(客户增长) | 高(风险缓解优先级) |

| 业务影响 | 中等 | 高 |

| 数据可用性 | 低-中等 | 高 |

| 技术可行性 | 中等 | 高 |

| 利益相关者支持 | 中等 | 高 |

| 风险 | 中等 | 高 |

| 规模 | 高 | 高 |

表 3.1:评估项目的标准

基于前面的参数,我们做出了决定。我们将在下一节讨论这个观点。

决策:优先考虑欺诈检测

Apex 银行选择了 AI 驱动的欺诈检测模型进行立即开发。关键原因如下:

  • 战略契合度 : 由于最近的高调事件,欺诈缓解成为董事会层面的优先事项

  • 高回报率 : 防止欺诈具有立即的、有形的财务效益

  • 更快地实施 : 数据更加集中,实时能力最终作为更广泛的数据战略的一部分被引入

  • 客户信任 : 加强欺诈控制支持品牌声誉和合规性

一旦数据基础设施成熟,流失预测模型被降级,但被标记为未来发展的项目。

结果和影响

实施六个月后,欺诈检测系统实现了以下成果:

  • 欺诈相关损失显著减少。

  • 与之前的基于规则的系统相比,欺诈检测准确性有所提高。

  • 实时警报,延迟小于 1 秒。

  • 改进的监管审计分数。

  • 顽强的数据监控框架。这些框架被构建来跟踪数据的变化并标记潜在的数据漂移。这不仅对当前项目有帮助,也对未来的 AI 解决方案有帮助。

在这个案例研究中,因为它涉及银行,欺诈检测是其首要任务。人们使用银行的主要原因是确保他们的钱是安全的,这使得欺诈预防成为银行的主要责任。另一方面,如果你为一家电子商务公司工作,你的首要任务将是向用户提供个性化的推荐,因为这会增加公司的现金流。总的来说,我们讨论的框架,如可行性分析和机会规模评估,是出色的定量工具。然而,将一切与你的业务目标对齐,做出明智的决策也同样重要。

摘要

在本章中,我们学习了选择一个有影响力的 AI 项目的重要性以及在进行选择时需要考虑的关键因素。我们讨论了如可行性分析等方法,以确定 AI 项目是否可行,这基于诸如高质量数据可用性、技术栈和人才等因素。我们还探讨了机会规模方法,主要是方向性 T 恤尺度和使用可比物的自下而上方法,以估计项目的潜在美元影响,并有效地对 AI 解决方案中的不同工作流进行规模评估。接下来,我们考察了如何进行成本与收益分析,这是确定与项目投入的资源相比,你是否将实现所需的回报率(ROI)的另一种优秀方法。在做出明智选择时,还需要考虑用例的规模和风险。最后,我们讨论了一个案例研究,以将所有内容整合在一起,并查看这一切在企业中是如何实际发挥作用的。

在下一章中,我们将学习技术团队如何从高级领导层获得 AI 驱动型项目的赞助。

|

获取此书的 PDF 版本和独家额外内容

扫描二维码(或访问packtpub.com/unlock)。通过书名搜索此书,确认版本,然后按照页面上的步骤操作。 | imgimg |

| 注意:请保留您的发票。直接从 Packt 购买不需要发票。 |

| --- |

第四章:超越构建:为 AI 项目获得领导层支持

想象一下:你已经确定了用例、合适的技术和人才,所有分析都已完成,你知道你的指标、投资回报率ROI)等,看起来是开始构建解决方案的完美时机。但等等!你仍然需要资源来构建解决方案,所以你必须向能提供这些资源的人展示所有这些分析,也就是你的高级管理层。这是整体 AI 战略中最关键但被忽视的一步。大多数技术人员认为处理数据和构建模型是他们的主要角色,但这远非事实。即使作为数据科学家,你也必须学会向高级管理层和最终用户推销你提出的 AI 解决方案。

为了让大家更好地理解,让我给你们举一个例子:一家公司希望扩大其覆盖范围,进入全新的用户群体(这可能是一代 Z 或小型企业)。为了支持这一目标,你提议开发一个由 AI 驱动的策略,以吸引和引导新用户群体进入生态系统。如果你这么想,这需要大量的投资:购买外部数据,进行文本挖掘和分析,构建预测模型,以及将解决方案与旧系统集成。为了构建这个,你需要高级管理层的支持。

在本章中,你将发现关于技术团队如何从高级管理层获得赞助的实用技巧。为了更好地说明这些概念,我们将以一个案例研究结束,展示这些策略如何在现实世界中应用。

我们将涵盖以下关键主题:

  • 开始讨论

  • 构建 AI 叙事——从愿景到支持

  • AI 如何获得 CXO 支持——一个假设场景

开始讨论

为了获得支持,你可能会用几页幻灯片开始讨论,包括以下内容:

  • 初级和次级研究:这可能包括美国特定参数(如州、净资产等)下新增用户总数。这是为了在高级管理层中提升对市场潜力的兴奋度。你可能从在线报告(麦肯锡、贝恩等)中获得这些数字,或者你可能通过纸条计算来推导它们。你也可能通过在公司内部数据库中侦察或与可能分析过该人群的人交谈来获取这些数据。

  • 数据选择:如果是一个全新的用户群体,你可能需要购买数据,因此你需要包括一个供应商列表和数据获取成本。这也是你应该指出你将用于分析或最终推广产品的任何内部数据的地方。需要注意的是,这不仅仅关于数据收集,还包括你需要进行哪些转换才能在你的产品中吸收这些数据。你不必明确指出,但在开始构建时你应该记住这一点。

  • AI 选择:根据受众,你可能需要在较高层次上涵盖 AI 技术,或者深入探讨细节。AI 策略是一个更广泛的概念,但在这里它指的是提到这是一个机器学习ML)解决方案还是通用 AI 解决方案。这将决定我们在上一章中讨论的其余参数,例如所需的技术、人才、成本等等。

  • 路线图:很可能你不会在第一天就推出一个 AI 解决方案并完成它,因此定义精确的里程碑并在最初的几次讨论中设定期望是至关重要的。这是一个不断发展的步骤,因此重要的是要主动更新里程碑。

  • 设定期望:这是另一个关键步骤,因为它明确了 AI 解决方案不会解决所有问题,而是一个正确的方向上的步骤。例如,如果你正在构建一个内部聊天机器人,期望可能是突然生产力会激增,所有人都会专注于创新和创造力。虽然内部聊天机器人可以帮助提高生产力,但个人在如何有效地提示以及如何在他们的判断和聊天机器人的响应之间取得平衡方面可能会有一个陡峭的学习曲线。这种期望设定和透明度应该会加速高级领导的支持。在设定期望阶段,还重要的是要强调 AI/ML 产品的迭代性质;因此,第 0 阶段的期望将与第 1 阶段不同。

让我们举一个例子。对于任何 AI 解决方案,里程碑可能看起来像数据准备、测试你的假设、完善假设、评估你的解决方案、部署到生产,然后持续监控。这不是一刀切的方法,而是关于你的里程碑可能看起来像什么的通用指导。

在整个 AI 开发生命周期中,你需要得到高级领导的支撑。本章将作为指导,说明如何获得他们的支持以及采取哪些主动措施以成功实现它。让我们深入了解!

构建 AI 叙事——从愿景到支持

获得支持和赞助涉及多个步骤;以下是在构建故事时需要考虑的一些最佳实践:

  1. 在早期和整个过程中与合适的利益相关者建立联系:

    • 在决策过程中尽早引入合适的人员,例如数据科学家、AI 专家和业务领导者,至关重要。这就是为什么首席数据官CDOs)和首席数据和分析官CDAOs)的作用越来越重要。拥有正确的利益相关者确保项目执行更加顺利,并增加了获得必要资源的机会。当企业积极投资于 AI 解决方案时,采用过程成为一种拉力效应,领导者是要求这些解决方案,而不是一种推力效应,即您在强制采用。

    • 即使解决方案已经建成,涉及利益相关者也是至关重要的,这样您就可以继续获取反馈并改进 AI 解决方案。业务需求、用户需求和数据输入会随着时间的推移而演变,AI 解决方案也应如此。您的利益相关者将在传达这些演变需求中扮演关键角色。

高级技巧

确保业务利益相关者参与的最佳方式是提供他们关于您的 AI 解决方案进展的定期更新。

此外,请不要将这种关系视为交易性的;相反,专注于与利益相关者建立长期关系。这将帮助您与他们建立信任,并提供愉快的合作体验。另一个需要记住的重要事情是了解您的利益相关者和领导层的长期和短期目标,这样您就可以通过您的解决方案来实现这些目标。这样,每个人都有所投入,这对每个人来说都是一次有意义的体验。

  1. 在您的幻灯片中包含“那么呢”。高层领导首先会问的问题是,“那么呢?”。这是您证明投资合理性的机会。因此,在初始幻灯片中主动包含它是至关重要的。这将使他们保持参与并感兴趣于参与演示的技术方面。“那么呢”可以通过您所进行的初级和次级研究来回答。一些例子包括一旦部署,解决方案可能带来的潜在市场规模、收入等。

高级技巧

总是从直接向高层领导汇报或在一年的演示之前就认识他们的人那里获得您幻灯片(尤其是这一张)的视角是很好的。这将确保有一组新视角审查您的演示,并提供坦率的反馈。

  1. 对您的数据进行尽职调查:

    • CXO 们通常对市场大小、行业趋势等数据了如指掌。如果引用来自公开报告的数字,请在您的提案演示文稿中包含它们之前,参考多个来源。如果数字与事实相差太远,这将为演示文稿设定一个消极的基调。

    • 对于任何内部汇总数据,在您将其放入演示文稿之前,请要求行业专家进行审查。当被要求证明数字时,这将作为您的安全垫。

高级技巧

进行尽职调查通常耗时较长;建议在安排演示之前,为这些检查额外预留一周或两周的时间。

  1. 展示你的产品路线图:

    • 习惯于这样一个事实,即你第一天可能无法实现完美的解决方案,也没有人会仅仅因为你说了它会工作就为其提供资金。你需要展示渐进的进步以获得正确的支持。列出你计划实现的内容以及何时实现(即展示你的里程碑以及每个里程碑的预期成果)。

    例如,路线图的第一阶段可能是为有限的用户群体构建解决方案。该阶段的里程碑可能包括获取数据、摄取数据、构建模型的第一个版本、向该有限用户群体发送推荐、获取反馈和分析结果,仅举几个例子。这只是阶段和里程碑的一个例子;最好根据你组织遵循的框架来修改这些内容。

    • 根据解决方案的类型和组织,第一天可能不会得到所有答案。有很大可能性,第一阶段的结果将决定你是否会进入下一阶段。如果是这样,那么请将路线图保持在高层次,并计划有限的时间。如果解决方案在接下来的五个月内可能不会见光,那么为五年后制定计划是没有意义的。

      小贴士

      建立 AI 解决方案最困难的部分是知道何时停止或转变方向。具有阶段性思维并在每个阶段分析结果将帮助你做出明智的选择。

  2. 安排定期的检查:

    • 这可能有点棘手,因为高级管理层通常非常忙碌,可能没有时间定期进行交流。然而,让他们了解你解决方案的发展情况并告知他们进度非常重要。

    • 这种检查不仅应包括进度或胜利,还应包括你可能会遇到的挑战,以及你是否需要他们的帮助来减轻这些挑战。

小贴士

你也可以通过发送电子邮件更新来代替安排定期的会议。

  1. 首先从基础知识开始,例如数据和所需的任何先决条件。在推销 AI 解决方案时,人们往往会试图全面介绍 AI 解决方案的更大愿景。虽然这很重要,但首先强调先决条件也同样关键。这通常包括全面的数据策略。这可能包括你需要的数据类型、获取数据的成本、从本地到云的迁移,以及你可能需要的任何访问控制。展示这些方面可以显示出你对数据的清晰认识,并为高级管理层准备他们可能需要的任何投资。

小贴士

与基础设施和数据团队合作,了解他们在购买/整理数据方面的见解,以及实现这一目标的时间表,这是一个好主意。这将帮助你获得数据交付的合理时间表,并相应地调整其他时间表。

  1. 坦诚地表达期望。虽然认为人工智能或机器学习驱动的解决方案可以解决所有问题很诱人,但我们知道这并不完全正确。因此,真实地传达产品的期望至关重要。

例如,假设某个产品的用户参与度正在下降。你被要求分析和找出下降的原因。一旦你完成了分析,你会发现大多数用户已经超过了那个产品,所以即使你可能会增加新的用户基础,参与度的增长也需要一段时间,或者更糟糕的是,可能根本不会增长。

另一个例子是,随着 ChatGPT 的出现,许多公司都在尝试将他们的客户互动机器人转变为更准确。虽然最新的技术,如 GPT-4,可能解决这个问题,但可能存在模型无法解决的潜在数据挑战。

  1. 列出挑战。每个 AI 解决方案都伴随着它自己的挑战。虽然它可能会阻碍你的产品开发,但它也让我们有机会重新思考我们的 AI 策略。向高层领导强调构建 AI 解决方案的挑战总是好的。

  2. 总是准备好一个电梯演讲:

    • 你的高层领导时间和精力有限,所以当他们问你最近在忙什么时,你应该总是有一个有趣的演讲来吸引他们的注意。这有助于不断提醒你的产品,并且还能让你的产品在没有你出席的房间里被讨论。

    • 你也可以在非正式的与高层领导的交流中使用这个电梯演讲,比如在见面或内部活动中。

小贴士

不要专注于算法,而要关注工作流程的是什么为什么,以便进行有影响力的对话。

让我们想象一个假设的场景,一个数据科学家正在为公司构建推荐引擎,而总经理在电梯里遇见他们并问道,“进展如何?”。他们的回答可能是以下这个样例:

“我们正在构建一个推荐引擎,它已经使参与度提高了超过 20%。我们早期面临的一个挑战是训练数据中的偏差;它使结果偏向于一个狭窄的用户群体。为了解决这个问题,我们重新平衡了数据集,并引入了一个实时调整推荐的反馈循环。现在,系统可以更准确地针对不同的用户档案进行内容个性化。看到这一点如何推动客户满意度和转化率,我们感到非常兴奋。如果你感兴趣,我很乐意分享更多!”

  1. 制定 B 计划。目前,创新的步伐,尤其是在人工智能领域,是无与伦比的。随着新模型的推出,优先级和策略必然会发生变化。制定 B 计划可以帮助你为可控和不可控的因素做好准备。如果出现极端情况,B 计划将帮助你调整或暂停项目。考虑到你从第一天起就与合规团队保持联系,并正在协商云平台的条款和条件。另一方面,你也在与云服务提供商讨论你可以向云团队展示的证据。尽管你在所有事情上都积极主动,但云平台尚未满足特定的审计要求,他们需要一些时间来为你推出这些要求。这是一个你很可能无法将项目迁移到生产环境并不得不暂停开发的情况。

高级技巧

你不必在第一天就向领导层展示这一点。相反,这是一个在你需要时可以放在口袋里的计划。这是最后的手段。最佳实践是在模块化(松散耦合)的方式下构建人工智能解决方案。这样,你可以尝试替换那些不起作用的组件,而不是废弃整个解决方案。

所有的前文建议都是针对数据科学家或技术社区,但高级领导层也有培养和拥抱人工智能文化的内在责任。变革会在组织中带来焦虑。在人工智能领域,我们看到了人们对工作岗位的担忧,这种焦虑是有道理的。构建人工智能解决方案不仅需要技术专长,还需要一个欢迎新想法和创新的文化。

开发人员和技术领导者需要寻求上级管理的支持,以庆祝人工智能优先的思维模式。以下是 CXO 可以采取的一些措施来实现同样的目标:

  • 投资于人工智能技能提升:举办人工智能研讨会,让公司每个人都提升技能至关重要。了解这个话题可以减轻恐惧并培养成长心态。通过庆祝那些持续完成认证的人,并激励他人效仿,也可以促进学习。

  • 注重实践经验:在公司内举办黑客马拉松,以促进创新。团队可以开发一个用例,或者选择一个他们长时间想要工作但受限于时间无法进行的用例。这也是开发可能长期为公司带来益处的新的用例的绝佳方式。另一种促进这种做法的方式是举办学徒计划,其中专注的群体和专家在一个现有项目上工作。此外,作为一项拓展任务,选定的学徒可以继续他们的日常任务,并将这视为在公司内学习新技能的机会。

在本节中,我们探讨了技术团队可以利用的最佳实践,以获得高级领导层的赞助。虽然执行任何人工智能项目都是一项成本高昂的举措,但获得这种赞助是实现成功的关键步骤。此外,我们还讨论了 CXO 可以采取的主动措施,例如投资于员工技能提升,以准备他们的劳动力适应人工智能驱动的未来。

在下一节中,我们将通过考察一个成功获得 CXO 支持的监管公司的假设案例研究,来说明这些实践如何应用。

人工智能如何获得 CXO 的支持——一个假设场景

这是一个高度监管的公司试图建立内部共飞行员以提高员工生产力的故事。

在这个倡议中,关键的挑战以及如何缓解它们如下:

  1. 最初,领导层对批准预算以尝试概念验证(PoC)或最小可行产品(MVP)持犹豫态度,担心合规和监管官员。解决这个问题的一个方法是让合规团队从一开始就参与进来,完成所需的文件工作,这样开发者就可以专注于构建。设定了一些边界,例如在前几个月内不向外部客户推出任何 PoC。

  2. 一旦团队开始构建,公司内部就出现了竞争。多个团队正在处理类似用例,具有竞争性的优先级。拥有一个共同的卓越中心CoE)有助于缓解这个问题。CoE 是一个中心位置,了解所有的人工智能倡议,如果多个团队正在处理相同的用例,它会发出警告。因此,团队要么合并他们的努力,要么转向不同的方向。

  3. 并非每个人都欢迎变革;很少有领导者愿意承担风险,但有些人非常谨慎。因此,那些带头的人成为了他人的榜样。他们在公司内部受到了庆祝,这激励了更多的人提出新想法。

对于他们来说,通用人工智能(Gen AI)是一个黑盒子。为了弥合这一差距,他们邀请了专家教育员工了解通用人工智能,并组织黑客马拉松帮助团队熟悉这项技术。在这些黑客马拉松/PoC 结束时,团队向高级管理层展示了他们的工作演示,管理层对这项技术的潜力感到震惊。公司利用核心能力中心(CoE)对这些 MVP 进行审查,并将最具影响力的产品迁移到生产中。黑客马拉松中的小型工作演示得到了合适的人才、资源和法律支持的认可。

在八个月内,其中一个项目推广给了数千名用户。这个项目是一个数字同事,帮助分析师快速提取数据、编写代码和文档,从而使开发者更加高效。反馈表明,以前花费超过五小时编写查询和回答业务利益相关者问题的分析师现在可以在一个小时内完成。他们利用额外的时间专注于战略项目,并发现由于不再被日常任务拖累,他们的工作满意度更高。一些分析师甚至提升了他们在生成式人工智能(Gen AI)方面的技能,以思考更多能够赋权同侪的用例。

该产品的成功非常显著,以至于它获得了行业赞誉并激发了竞争对手。

下面是从这个案例研究中得出的关键教训/收获:

  • 教育您组织的人员并赋予他们创新的能力不仅能够提升组织,还能引发多米诺效应,培养持续向前思考的文化。

  • 单独的幻灯片往往不足以展示人工智能的真实影响;你需要一个工作演示来使价值具体化。黑客马拉松是实现这一目标的绝佳方式,它允许团队进行实验、构建并亲身体验人工智能的潜力。

  • 通过可衡量的成功清楚地展示价值至关重要;节省的时间通常是这些情况的关键指标。

  • 完成比完美更好,因此庆祝进步而不是追求完美总是一个好主意。

  • 黑客马拉松是启动 PoC 开发的好方法,开发者往往在竞争环境中表现出色。

  • 在人工智能之旅的起点,建立一个拥有专用资源的中心(CoE)对于推动采用和长期成功至关重要。

本案例研究为那些对团队或组织中生成式人工智能(Gen AI)的影响持怀疑态度的企业提供了一个镜子。克服这种怀疑的第一步是教育,将技能提升作为一个有价值的起点。虽然好处不能保证,但通过从小而意义重大的举措开始,拥抱人工智能浪潮至关重要。这种方法允许你评估影响是否足够大,以至于可以扩大规模或转向另一个用例。

摘要

本章强调了从高级领导层获得赞助对人工智能项目的重要性。它为技术团队提供了获得这种支持的实际建议,并以一个展示这些策略实际应用的案例研究结束。

在下一章中,我们将关注获得赞助后的步骤,这些步骤涉及通过成功的概念验证(PoC)开始构建过程。

订阅免费电子书

新框架、演进的架构、研究发布、生产故障——AI_Distilled 将噪音过滤成每周简报,供与大型语言模型(LLMs)和生成式人工智能(GenAI)系统实际工作的工程师和研究人员阅读。现在订阅,即可获得免费电子书,以及每周的洞察力,帮助您保持专注并获取信息。

订阅请访问 packt.link/8Oz6Y 或扫描下方的二维码。

白色背景上的二维码  AI 生成的内容可能不正确

第五章:构建人工智能概念验证和衡量您的解决方案

概念验证,简称 PoC,在组织中的看法因组织规模、目标、最终用户、领导策略等因素而异。我们都在不同规模的组织中工作过,并亲身体验过这一点。为了使这一点更具背景,在受监管的行业中,PoC 可能甚至在您获得所需的赞助和合规批准之前都不会开始。但对于初创公司或科技公司来说,PoC 是证明想法的一种方式,他们可能以“快速失败,更快创新”的心态运营。无论您在哪个组织,PoC 都是部署 AI 解决方案到生产的第一步;因此,在构建它时投入时间和资源至关重要。

在前几章中讨论的每个因素,如正确界定人工智能问题、选择适当的 AI 技术、以及引入合适的利益相关者,对于构建有说服力的 PoC 都至关重要。本章将探讨一个执行良好的 PoC 如何展示您解决方案的内部工作原理,并帮助获得进一步开发所需的牵引力和支持。

在本章中,我们将涵盖以下关键主题:

  • PoC 案例手册 - 构建有效 PoC 的指南

  • 构建成功的 AI PoC 的最佳实践

  • 衡量 PoC 的性能

  • 从试点到验证 - 一个成功故事

  • 整合所有内容

PoC 案例手册 - 构建有效 PoC 的指南

PoC 是将您的想法付诸实践并展示其可行性给投资者或组织内部高级领导的第一步。根据用例、预算、资源和时间,PoC 可以从 Excel 中展示的简单模型到复杂的用户界面。例如,您可能正在尝试进行预测。这可以通过 Excel 中的简单统计技术如 ARIMA 实现,您也可以使用 Python 库。然而,您无法在 Excel 中构建一个可以用标准库轻松编码的神经网络模型。这样的场景突出了使用代码优先方法的重要性,而不是像 Excel 这样的工具。

简而言之,它是一个小规模、低风险的实验,旨在测试特定用例的人工智能解决方案的可行性和潜在影响。将您的 PoC 视为盛大表演前的排练。

让我们进一步探讨构建 PoC 的好处:

  • 成本效益:构建一个完整的 AI 解决方案需要时间和资源,但构建 PoC 需要的资源显著更少,且节省时间。

  • 快速失败并快速改进:PoC 帮助您证明想法是否适合企业。如果结果不理想,您可以快速转向新的想法。

  • 快速部署:PoC 是测试产品中新功能并评估其优势的绝佳方式。这样,你可以了解哪些功能将在现实世界中发挥作用,并将它们纳入路线图。构建 PoC 的理想时间应该是 4 到 6 周,但可能会根据用例的复杂性、数据可用性、团队技能等因素而有所不同。

  • 早期问题检测:PoC 允许你检测产品中可能成为开发后期障碍的潜在问题。

  • 宝贵的数据和知识:PoC(Proof of Concept,概念验证)过程提供了对未来项目数据需求、AI 工具和所需技能集的见解。

创建 PoC

虽然我们在前面的章节中已经介绍了一些这些步骤,但我们在这里重申它们,以便使一切内容都得到上下文化。创建 PoC 通常涉及详细的项目需求、目标和分配给每个利益相关者的责任的文档。PoC 成功的另一个结果是部署到生产的路线图。

这里是一个通常适用于企业的五步流程:

  1. 定义需求:如果你已经达到创建 PoC 的阶段并阅读了前面的章节,你就已经弄明白了。这包括界定问题、确定最终用户、分析历史解决方案、定义独特的卖点以及估计构建解决方案所需的资源。

  2. 选择技术方法:在创建 AI 解决方案时,你通常有多种模型可供选择。你可能需要在简单的统计模型(例如 ARIMA)和深度学习模型(例如 LSTM)之间进行选择,比如用于预测任务。重要的是要列出所有方法,并确保你选择一个可以使用有限资源执行的 PoC 方法。PoC 成功后,你可以选择资源密集型的方法。还有一点需要注意,数据可用性也会决定方法。

有时候,并不是只选择一个模型;可能需要使用一系列不同的模型来做出明智的决定,确定哪些可以用于生产。例如,在预测任务的情况下,根据你的数据,深度学习可能是一个更有效的方法,但你只能通过将性能与统计技术(如 ARIMA)进行比较来知道这一点。

  1. 创建一个可工作的 PoC:很多人把这个步骤与大海捞针混淆,但 PoC 的目的并不是这样。理想的 PoC 应该是解决方案的缩小版但仍然可以工作。它应该包含最关键的功能和基本用户界面,以便最终用户测试产品。避免添加那些“想要有”的功能,坚持基本的工作模型。

  2. 迭代和改进:PoC 不是最终产品,这意味着在测试过程中,您将发现应在项目下一阶段(通常是构建 MVP)中缓解的问题。记录来自您的最终用户或任何测试您产品的个人的所有反馈非常重要。

  3. 制定路线图:根据 PoC 结果,您将有一些行动项。这些可能包括精炼 PoC、在 PoC 阶段停止项目但记录可应用于其他项目的经验教训、转向解决方案的另一个版本或迁移到生产。重要的是要分享项目的下一步和里程碑,以便每个人都了解。

在下一节中,我们将深入探讨在 PoC 构建并交付后可能出现的某些可能性。

PoC 之后对 AI 采用的临界战术决策

在构建 PoC 之后,分析性能并做出关键决策以确定 AI 旅程的下一步至关重要。以下是三个基本路径供您考虑:

  1. 精炼 PoC:一旦 PoC 构建完成,下一步是详细分析结果以确定改进领域。这可以包括以下内容:

    1. 提升模型性能:如果 AI 解决方案表现不佳或交付的结果未达到预期,则可能需要采用不同的方法来提高准确性。

    2. 提升数据质量:在 PoC 过程中,您可能会意识到某些数据缺失或质量低下。精炼 PoC 可能包括清理和加强数据集或添加新的、更相关的数据。

    3. 提升用户体验:收集最终用户和利益相关者的反馈对于了解解决方案在实际场景中的表现至关重要。精炼 PoC 可能包括调整以使解决方案更易于使用或符合业务需求。

    4. 改变成功指标:也可能发生的情况是,您认为与用例相关的指标不再具有影响力,因此退一步考虑成功指标可能是个好主意。

最终结果:您将收集对精炼后的 PoC 的反馈,并创建一个最小可行产品MVP)。构建 MVP 的详细信息在步骤 3 中提及。

  1. 转型:有时,PoC 的结果表明初始方法没有产生预期的价值,或者您在构建 PoC 期间业务目标发生了变化。在这种情况下,您可能需要转型:

    1. 重新思考方法:如果 PoC 证明原始 AI 方法不可行(例如,由于复杂性高、数据不足或性能不佳),则可能有必要探索替代 AI 模型、算法,甚至解决业务问题。

    2. 重新审视问题框架:可能您最初设定的要解决的问题不适合 AI 解决方案。您可能需要重新定义商业挑战或探索更适合 AI 的其他用例。

    3. 改变技术栈:有时,转型可能涉及切换到更适合实现预期商业成果的不同技术、AI 模型或工具集。

最终结果:您将再次进行彻底的测试和评估,收集最终用户的反馈,并决定项目是否应该部署到生产环境中。

  1. 构建 MVP:如果概念验证(PoC)提供了有希望的结果,下一步合乎逻辑的步骤就是构建 MVP。这包括以下内容:

    1. 扩展解决方案:MVP 是比概念验证(PoC)更健壮的版本,可以部署给更广泛的受众。它可能需要额外的功能、安全措施和可扩展性改进,以处理更复杂的用例或更大的数据集。

    2. 与现有系统集成:构建最小可行产品(MVP)需要将解决方案与组织中的其他系统和工作流程集成。这确保了 AI 解决方案可以在商业生态系统中运行。

    3. 测试实际性能:MVP 阶段包括广泛的测试,以确保 AI 解决方案在现实世界环境中运行良好。您需要监控关键绩效指标KPIs)并根据需要做出调整。

    4. 收集用户反馈:与概念验证(PoC)一样,在 MVP 阶段继续收集利益相关者和最终用户的反馈,以完善解决方案。

    5. 利用云平台:扩展 AI 解决方案的一种实用方法是利用云基础设施。云超大规模提供商提供的托管 AI 服务,如 AI/ML 平台,可以简化大规模训练、部署和维护 AI 模型的过程,同时提供高可用性和弹性。

    6. 变更管理:在您的组织中成功采用 AI 的关键是变更管理,因为它通常需要角色、责任和流程的重大转变。如果没有适当的变更管理流程,您可能会遇到习惯于传统工作流程的团队的阻力,这可能会延迟 AI 的部署,或者更糟,导致该倡议失败。

    7. 清晰沟通:为了克服阻力,您必须说明 AI 将如何增强而不是取代现有角色。将您的 AI 项目与整体业务目标对齐,以展示 AI 的采用如何支持更广泛的组织成功。领导层应培养一种鼓励实验并重视数据驱动决策的文化。

最终结果:到目前为止,所有利益相关者和高级领导都应该对解决方案有信心。这是您开始创建生产部署计划并收集所需资源的点。

我们讨论了在 PoC 创建之后你必须做出的三个关键决策。但要达到成功的结局,你可以遵循某些最佳实践。在下一节中,我们将详细讨论这些最佳实践。

构建成功的 AI PoC 的最佳实践

我们明白没有关于 AI PoC 最佳实践的蓝图,但这是我们结合在不同领域推出多个 PoC 的经验所学到的东西:

  • 选择敏捷方法以在 AI 项目中拥有更多灵活性。

  • 在一开始就为你的 AI 项目定义成功。然后,设定增量目标和里程碑,以在整个 PoC 过程中跟踪进度。

  • 在开始开发之前,从高级领导层那里获得安全赞助。

  • 在开发之前确保你有高质量的数据。这将为你成功奠定基础。这包括详细的数据质量检查、稳健的数据清理措施,以及在必要时通过合成数据生成技术增强数据的计划。

  • 与经验丰富的 AI 顾问和解决方案架构师合作,以指导 PoC。

  • 在 AI 方面投资于培训和开发,以提高你团队的技能。这些培训和开发可以是邀请专家、为人们提供参加会议的机会,或提供免费订阅在线学习平台。

  • 如果要集成遗留解决方案,制定一个详细的计划,突出集成将如何工作。此计划还应包括退役任何组件以使解决方案更有效。

  • 定期与利益相关者会面,更新他们关于 PoC 进度的信息,并寻求他们的意见以解决担忧和采纳建议。

  • 为了避免最后一刻的麻烦,在 PoC 阶段关注数据治理。这应包括数据匿名化、访问控制、合规要求和对敏感数据的加密。

  • 你应该有一个部署到生产的计划,因为那是目标。包括部署的下一步、资源和时间表,以使每个人都能了解情况。在这里,定义生产中的成功也很重要。

  • 从一开始就与模型审查委员会会面,寻求他们的意见,并要求你的数据科学家在 PoC 开发阶段开始文档工作,以避免遗漏任何细节。

  • 从简单的模型开始 PoC,这样你就可以用有限的资源管理它们。

  • 为测试和评估你的 AI 解决方案制定一个框架,其中包含明确定义的指标。我们将在下一节中探讨这一点。

  • 从一开始就规划你 AI 解决方案的可扩展性。这意味着开发可以随着你的业务需求变化而增长和适应的 PoC AI。这也意味着分配云资源以实现更快地扩展。

  • 定义 KPI 以跟踪 PoC 相对于其目标的成功。

  • 定期分析性能数据,以确定改进领域并相应优化 AI 模型。

  • 将失败正常化,以便您的团队成员能够持续创新并不断进化到更好的 AI 驱动解决方案。

  • 创建一份详细的报告,总结 PoC 过程,包括成功、失败和关键经验教训,以指导未来的发展。

  • 每个 AI 倡议都应该是与整个企业目标相一致的战略愿景的一部分。从一开始就建立明确的 KPI 来衡量 AI 项目的成功,然后确保跨职能团队支持 AI 倡议,以促进协作。

  • 您的组织应实施道德 AI 框架,以确保 AI 的负责任使用。您还应建立一个专门的 AI 道德委员会,并关注不断变化的法规,以满足合规需求并维护公众对您 AI 部署的信任。同样重要的是遵守居住国的法规,例如,如果您是欧盟居民,法律比美国的法律更为严格(请参阅欧盟 AI 法案artificialintelligenceact.eu/)。

最后,记住 PoC 是部署到生产的第一步,因此确保整体战略包括这一点,以便您和组织为部署做好准备。

虽然对于大多数用例来说,构建 PoC 可能看起来是一个明显的选择,但也有一些情况下构建 PoC 是不必要的。让我们在这里揭露一些这些情况:

  • 如果用例具有时间敏感性,例如在疫情期间预测药物供应,由于这是一个生死攸关的用例,您可能希望直接跳到最终产品。

  • 如果任务仅涉及简单的统计方法,并且没有利用复杂机器学习或深度学习算法的计划,那么这里的 PoC 投资是无法证明其合理性的。

构建 AI 解决方案只是方程的一部分,但衡量其成功同样重要,以证明其价值。衡量 AI 解决方案是实践者面临的最大挑战之一,因此我们提出一个框架来减轻负担。在下一节中,让我们深入探讨对 AI 成功至关重要的指标。

测量 PoC 的性能

有句名言:“你不能改进你不能衡量的东西。”这对于企业 AI 解决方案也是如此。一旦你构建了 PoC,你需要证明投资的合理性;因此,拥有一个强大的框架来帮助你跟踪你的 AI 解决方案变得至关重要。随着 AI 解决方案的发展,从 PoC 到 MVP,仅仅依赖技术模型性能并不能给你一个完整的 AI 解决方案图景。技术指标为我们提供了与基线(如随机猜测)相比的预测模型的相对性能,但并没有直接推导出模型的企业价值。此外,我们还需要考虑模型不是孤立发布的;它们通常是系统的一部分,其中模型要么集成到遗留系统中,要么作为应用程序发布。你需要能够跟踪 AI 系统的性能。

为了涵盖所有这些方面,我们提出了以下指南,这些指南提供了一个全方位的视角,以了解 AI 解决方案的表现,以便您可以进行适当的补救。衡量 PoC 与衡量 AI 系统的性能相同,我们将在未来的章节中详细讨论。以下是您可能希望考虑的一些指标快照。

模型指标

这些指标评估 AI/ML 模型的性能,并确保其达到预期的准确度、效率和可靠性水平。我们将在第六章中更详细地讨论这一点。

系统指标

随着通用人工智能(GenAI)系统的出现,衡量您整体系统的表现变得至关重要。通用人工智能系统复杂且通常由多个组件组成,如数据、提示和基础模型,这些组件都作为 UI 或工具内的集成呈现。

在跟踪系统质量时,以下是一些需要考虑的指标:

  • 数据相关性:所有数据对于当前模型和项目的必要性程度。过时或不相关的数据可能会引入偏差和低效,导致有害的输出。

  • 数据和 AI 资产的可发现性和可重用性:您数据和 AI 资产的可发现和可使用百分比。维护一个可以衡量数据漂移并在性能低于阈值时立即更新数据的系统至关重要。

  • 吞吐量:这是生成式 AI 系统在特定时期内可以处理的信息量。计算此指标需要了解模型的处理速度、大规模效率、并行化和优化资源利用。

  • 系统延迟:这是系统响应答案所需的时间。这包括任何网络延迟、数据延迟、模型延迟等。系统延迟受损可能会损害用户体验并显著降低组织或品牌特许权使用费的采用率。与云服务提供商沟通以提供恒定的吞吐量至关重要,这样你就不必担心大量流量同时冲击你的应用程序。

  • 集成和向后兼容性:上游和下游系统 API 可以直接与 GenAI 模型集成。你还应考虑下一个版本的模式是否会影响基于现有模型构建的系统(而不仅仅是限于提示工程)。

商业指标

这些是最难定义的。但我们喜欢这样想:你如何定义 AI/ML 系统的“成功”?

将此与用例示例的 KPI 对齐:对于一个推荐,可能是保留率或净新客户的增加;在这种情况下,成功可能表现为净新客户增加 5%。

一些业务价值改进指标示例包括以下内容:

  • 客户服务

    • 平均处理时间和每次互动成本的降低

    • 客户满意度(NPS)提升

  • 市场

    • 从简化流程中节省的时间(例如,小时):简短的写作、编辑、协作等。

    • 由于个性化增加,广告支出回报率ROAS)更高

    • 增强创造力和想法生成

  • 医疗保健

    • 通过减少行政负担增加与患者的相处时间

    • 来自清晰、一致护理计划的更好患者结果

    • 提高效率、减少等待时间、提高护理能力

  • 零售

    • 每次访问收入提升

    • 通过 AI 驱动的产品建议增加的销售

    • 客户满意度/体验的提高

  • 产品开发

    • 受生成 AI 工具影响的内容百分比

    • 通过自动化流程节省的员工小时数

    • 产品发布加速带来的价值实现时间

安全指标

根据 KPMG 的调查,61%的人不确定他们能否信任 AI 系统。信任 AI 意味着对其决策有信心,并且愿意分享数据以帮助其改进。但许多人担心三个风险:AI 侵犯我们的隐私、损害社会或没有经过足够的测试以成为可靠的。

  1. 偏差评估:衡量数据的代表性至关重要。偏差通过数据被削弱。因此,确保数据集多样化并代表所有类别很重要。偏差可以通过以下三种方式削弱你的数据:

    1. 选择偏差:这发生在选择的数据不代表整体人口,因此呈现偏差的情况。

    2. 系统性偏差:在整个模型中重复出现的持续错误。

    3. 响应偏差:数据参与者以被认为错误或不准确的方式回答问题。

为了对抗偏差,以下是一些可以主动执行的数据预处理步骤:

  • 注意异常值,因为移除它们可能不是最佳解决方案。分析异常值至关重要,因为它们可能是你数据中缺失的群体的指示。

  • 处理缺失变量也可能是在引入偏差中的关键指标。如果你忽略缺失值或用数据的“平均值”替换它们,你实际上是在改变结果。你的数据收集将因此更多地偏向结果,而不是反映一般的“平均值”。

  • 过度过滤数据往往会导致原始数据目标缺乏代表性。

  • 除非你正在构建一个需要年龄或性别作为确定结果关键参数的医疗保健解决方案,否则屏蔽 PII 也是一个很好的实践。

除了数据中的偏差,跟踪 AI 系统中的偏差也很重要。这可能表现为男性获得比女性更好的报价或更丰富的信用额度。在 GenAI 解决方案中,建立强大的安全系统以阻止任何有害攻击至关重要。即使用户尝试越狱解决方案,LLM 也能通过回应“很抱歉,我无法回答这个问题”或类似的话来阻止它。

  1. 提示注入:当用户通过提供自然语言中的替代指令来颠覆语言模型的编程时,就会发生提示注入攻击。例如,模型会执行代码而不是在翻译应用中翻译文本。这种漏洞在处理机密信息的 AI 个人助理等应用程序中尤其令人担忧。想象一下,一个用户成功指挥 AI 删除或泄露敏感数据。提示泄露是一种提示注入的变体,涉及说服模型揭示其初始提示。提示注入和类似的攻击可能会损害你的品牌形象,或者更糟,造成经济损失。

以下是一些可以用来保护应用程序的策略:

  • 限制用户输入的长度和格式,因为提示攻击需要较长的提示来使模型出错。你可以进行实验以确定最佳数量,但聊天机器人不应超过 1,000 个字符。同时,确保阻止任何不合理字符。

  • 为 LLM 访问后端系统实施访问控制。为 LLM 配备专用 API 令牌,例如插件和数据检索,并分配权限级别(读取/写入)。遵守最小权限原则,限制 LLM 仅访问其设计任务所需的最小访问权限。例如,如果你的应用扫描用户的日历来识别空闲时段,它就不应该能够创建新事件。

  • 在实施内部 RAG/Copilot 时,根据项目的机密性对员工实施访问控制,以确保机密信息不被泄露。例如,如果有一个名为“Beta”的秘密项目,只有授权用户才能访问它。即使有人尝试越狱,也应该收到“访问拒绝”的消息。

  • 持续监控应用程序,因为用户可能会多次攻击它。对于任何以“忽略所有先前请求”开头的用户输入,要积极阻止。

  • 实施稳健的日志记录实践,确保每个用户交互都详细记录,以便进行审计和标记。

另一种方法是积极实施红队战术。这是一种在发布前发现模型弱点的积极方法。为了实现这一点,组建一个多样化的红队,包括设计、产品等角色。目标是开发优化您语言驱动应用程序的创造性方法。因此,参与者的多样性是必要的。

我们已经尽力全面覆盖企业中 AI 和 ML 解决方案的指标和最佳实践。可能有一些事情是您应用程序特有的。以下是衡量您 AI 解决方案性能的最佳实践总结:

  • 根据问题和目标选择指标。

  • 使用多样化和代表性的数据进行评估。

  • 定期监控和跟踪指标,以便在需要时进行调整。

  • 总是依赖多个指标来获得对性能的整体理解。

  • 积极设定预期,即 AI 解决方案可能需要一些时间才能获得收益,因此要明确定义长期和短期目标。

也要正确设置 AI 解决方案的预期。AI 解决方案不是万能的。尽管有正确的成分,模型可能会产生幻觉或错误的预测。

在本节中,我们简要总结了您会选择哪些指标来证明您的 PoC 的可行性,以便将其推进到下一阶段。在下一节中,让我们详细讨论一个案例研究,看看所有这些如何在企业环境中适用。

场景 1:从试点到证明 - 一个成功故事

一家全球制药公司在其重磅药物的需求预测方面面临持续的挑战。传统的预测方法,依赖于历史销售数据和人工调整,往往导致不准确,导致缺货或过度生产。认识到需要更稳健和基于数据的方法,公司探索机器学习ML)作为提高预测精度的解决方案。

原型验证(PoC)

公司启动了一个 PoC 来评估基于 ML 的预测引擎的可行性。该倡议的成功由四个关键因素驱动:

  1. 高质量数据:团队确保输入到机器学习模型中的数据是干净的、全面的,并且能够代表各种市场条件。历史销售数据通过季节性、竞争对手活动和宏观经济趋势等外部因素进行了增强,以增强预测准确性。建立了稳健的数据管道以保持一致性和完整性。

  2. 明确的目标:原型验证(PoC)是根据明确的成功标准设计的:

    • 与现有模型相比,至少降低 10%的平均绝对百分比误差(MAPE)

    • 减少预测所需的手动工作量

    • 提升生产和供应链团队的决定力

  3. 利益相关者支持:早期吸引关键利益相关者对项目的成功至关重要。数据科学团队与供应链规划师、需求规划师和销售领导者以及 IT 团队合作,确保一致。定期的研讨会和互动会议有助于解决担忧、设定期望并获得高层支持。

  4. 快速原型设计和迭代:团队不是通过漫长的开发周期,而是在几周内使用基于云的机器学习平台构建了一个可工作的原型。他们根据反馈快速迭代,优化模型功能,并纳入领域专业知识以提高性能。

转向生产

在原型验证(PoC)展示了预测准确率提高了 10%之后,领导层批准了全面部署。过渡到生产的关键步骤包括以下内容:

  • 自动化和集成:机器学习模型被集成到公司现有的需求规划工具中,实现了无缝数据摄取和自动更新

  • 用户培训和采用:供应链和销售团队接受了如何解释和采取行动基于机器学习生成的预测的培训,确保顺利采用

  • 持续监控和改进:建立了一个治理框架来监控性能、用新数据重新训练模型,并适应不断变化的市场条件

结果和影响

在部署后的六个月内,公司看到了以下情况:

  • MAPE(平均绝对百分比误差)降低了 10%,减少了缺货和过剩库存的情况

  • 提高运营效率,在预测过程中需要的手动干预减少

  • 更高的业务敏捷性,使公司能够更快地应对市场变化

关键要点

以下是此场景的关键要点:

  • 高质量数据是任何成功的机器学习项目的基石。

  • 明确的目标确保了一致性和可衡量的成功。

  • 早期获得利益相关者的支持可以加速采用并使过渡到生产过程更加顺畅。

  • 快速原型设计和迭代开发能够实现快速胜利和持续改进。

  • 教育是成功的关键。对于业务利益相关者来说,解码技术概念很重要,这样他们才能对原型验证(PoC)感到自信。

这个场景说明了如何将一个成功的 PoC 发展成为一个可扩展的企业人工智能解决方案,该解决方案可以带来可衡量的投资回报和业务影响。通过将您的方案建立在坚实的数据基础和明确定义的目标上,您可以自信地朝着生产就绪的人工智能部署迈进。

场景 2:失败的 AI PoC - 工业设备的预测性维护

一家中型制造公司,专门从事工业暖通空调系统,希望通过实施基于人工智能的预测性维护解决方案来减少停机时间和维护成本。

PoC 目标 : 建立一个机器学习模型,能够至少提前 48 小时预测设备故障,使用压缩机、电机和温度调节器的传感器数据。

PoC 设置

  • 数据来源 : 历史传感器日志、维护记录和技术人员笔记

  • 使用的模型 : 在标记的故障事件上训练的随机森林分类器

  • 时间表 : 由数据科学家、IT 工程师和运营经理组成的跨职能团队六周冲刺

结果

  • PoC 在 8 周后被搁置

  • 团队得出结论,需要在数据工程、利益相关者协调和变革管理方面做更多的基础工作

  • 公司恢复了计划中的维护并推迟了人工智能的采用

下面是 PoC 出了什么问题:

  • 问题定义不明确 :

    • 团队没有就“失败”的定义达成一致。一些人认为任何停机都是失败,而其他人只计算灾难性故障。

    • 关键绩效指标(KPI)含糊不清。“减少停机时间”没有量化,也没有建立基线。

  • 数据质量差 :

    • 传感器数据不一致。一些机器缺少日志;其他机器有不同的采样率。

    • 维护记录是手写的,并且数字化程度低,无法用于训练。

  • 技术限制 :

    • 模型在 Jupyter 笔记本中显示出有希望的结果,但在实时部署中失败了。

    • 它无法处理流数据,并且由于内存过载而频繁崩溃。

  • 没有业务支持 :

    • 运营经理不相信预测,并继续使用手动检查。

    • 模型标记了假阳性,导致不必要的维护和挫败感。

    • 没有进行投资回报分析,利益相关者将其视为“科学实验”。

因此,以下是我们学到的教训:

  • 提前定义成功指标并将它们跨团队对齐

  • 在建模之前投资于数据准备

  • 早期并经常与业务利益相关者互动

  • 在实际条件下验证技术可行性

在本节中,我们探讨了两个案例研究,它们基本上是硬币的两面:一个是成功的 PoC,取得了显著的结果,利益相关者的支持,以及清晰的走向生产的路径,而另一个是失败的 PoC,它确实为组织提供了宝贵的见解,但没有达到生产阶段。这些案例研究应该为在您的组织中创建 PoC 时提供明确的指导方针。让我们通过回顾 PoC 清单来结束这一章。

整合一切

这里有一个快速且可操作的清单,您可以根据它来确保成功的 PoC:

  1. 达到了明确定义的目标:

    • 它是否解决了定义好的问题?

    • 它是否达到了您事先设定的关键绩效指标或成功阈值?

    • 这些结果是否使用真实或代表性的数据进行验证?

如果它没有达到所有目标,请反思看看可能缺少了什么,并在进行下一步之前修复这些问题。

  1. 证明了技术的可行性:

    • 模型的性能指标(准确率、精确率、召回率等)是否强劲?

    • 它能否在不崩溃或出错的情况下处理真实世界的数据?

    • 它是否可以扩展或与现有系统集成?

如果在这里失败,考虑在生产前进行更多迭代。

  1. 展示了商业价值:

    • 它是否提高了速度、效率、收入或客户体验?

    • 业务利益相关者是否看到了它的潜力?

    • 如果扩展,回报率是否具有前景?

如果业务价值不明确,PoC 可能尚未准备好向前推进。

  1. 获得了利益相关者的信心:

    • 非技术决策者对此是否感到兴奋?

    • 是否已经通过引人入胜的演示或结果总结清晰地解释了它?

    • 是否有动力进行试点或全面部署?

如果高级管理层仍然存在阻力,这就是您希望在组织中找到支持者的地方;这些人可能是您的业务利益相关者,他们会推动变革。

  1. 最终成功指标:

    • 证明了您的假设

    • 实现了可衡量的商业或流程价值

    • 获得了利益相关者的支持

最终目标是有一条清晰的路径通往生产。

摘要

在本章中,我们探讨了如何构建一个成功的 概念验证PoC),为部署企业级 AI 解决方案奠定基础。PoC 常常是最终解决方案可能外观的第一印象,因此关注基础至关重要:明确目标、确保正确数据、建立成功标准。这些要素对于确保您的 PoC 不仅仅是一个技术练习,而且是迈向生产的战略步骤至关重要。

在下一章中,我们将深入探讨机器学习开发的最佳实践。

参考文献

|

获取本书的 PDF 版本和独家额外内容

扫描二维码(或访问packtpub.com/unlock)。通过书名搜索本书,确认版本,然后按照页面上的步骤操作。 | imgimg |

| 注意:请妥善保管您的发票。直接从 Packt 购买不需要发票。 |

| --- |

第三部分

部署和证明 ML 价值

在本书的第三部分中,我们将提供一个全面的指南,涵盖机器学习ML)系统的完整、端到端的生命周期,从定义其目的到证明其对业务的因果影响。我们将从成功的基石框架开始,超越简单的准确性,定义多维、与业务对齐的目标,必要的防护性指标以防止意外伤害,以及代理指标以跟踪长期目标。接下来,我们将深入探讨“产品化”,这是将模型从实验笔记簿转化为稳健、生产级系统的关键过程。我们将讨论 MLOps 最佳实践,代码和数据的可重复管道的重要性,以及模型服务器的架构选择。最后,我们将探索因果推断的科学,以回答关键问题,“系统是否做到了它打算做的事情?”,涵盖随机对照试验(A/B 测试)的“黄金标准”以及高级观察技术和优化方法,如多臂老丨虎丨机。

本部分包含以下章节:

  • 第六章超越准确性:定义采用指标的指南

  • 第七章从模型到市场:实现 ML 系统

  • 第八章从指标到测量:实验和因果推断

第六章:超越准确性:定义采用度度量指标的指南

正如我们在第一章中讨论的那样,任何成功的 ML 应用都需要一个可衡量的指标。ML 通常是一个迭代的过程,其理念是改进实验或增强。

为 AI/ML 模型定义成功比选择单一指标要复杂得多。它需要一个结构化、多维度的方法。本章首先确立明确成功指标的重要性及其有效性的基础原则。然后探讨守卫指标在防止意外副作用中的作用,接着讨论操作延迟和模型性能的演变特性。叙述继续强调技术损失函数与业务指标之间的不匹配,并引入代理指标作为连接短期和长期目标的实用解决方案。我们还深入探讨了通过帕累托前沿的多目标优化、扩展 AI 解决方案的成本考虑以及最后,负责任 AI 在确保公平、透明和社会一致性中的关键作用。通过这些相互关联的主题,本章为定义、衡量和维持 AI/ML 系统中的成功提供了一个全面的框架。

本章将涵盖以下关键主题:

  • 定义成功指标的需求

  • 成功指标的基本原则

定义成功指标的需求

在实施 AI/ML 模型时,明确界定“成功”的样子是一个关键的第一步。如果没有确立的成功标准,就没有一种结构化的方式来评估模型的有效性。一个明确界定的成功指标充当反馈循环,使团队能够实时跟踪模型进展和性能。它确保业务目标和模型行为之间的一致性,帮助利益相关者做出明智的决策。此外,它为设置阈值、触发警报和指导模型改进提供了基础。

当缺少或定义不佳的成功指标时,团队可能会部署表现不佳的模型,资源分配不当,或优化错误的目标,这最终会导致财务损失、用户体验下降和利益相关者信任的丧失。

成功指标的基本原则

为了使成功指标有意义,它必须遵循以下关键原则:

  • 具体:指标必须直接与业务目标一致,不应含糊不清。这确保了 AI/ML 模型正在解决正确的问题。

  • 可衡量:一个指标只有在可以量化时才有用。可衡量性对于跟踪进度和从模型性能中获取见解至关重要。

  • 可操作的:所选指标应提供有意义的见解,这些见解可以导致具体行动。如果一个指标表明表现不佳,应该清楚需要采取哪些步骤来改进它。

  • 现实的:成功指标应该在可用的资源和限制条件下是可实现的。

  • 时间限制的:AI/ML 模型的性能应在定义的时间框架内进行评估,以监控其在短期和长期内的有效性。

以电子商务平台中使用的推荐引擎为例。一个具体的成功指标可以是转化率CR),它衡量的是在互动产品推荐后进行购买的用户百分比。CR 是具体的(它衡量购买),可衡量的(转化与互动的比例),可操作的(可以通过改变来提高它),现实的(基于过去的绩效),并且有时间限制的(每日、每周或每月评估)。定义一个成功标准是否足够确保成功?可能还不够。另一个例子是通过聊天机器人改善客户体验,它们可以回答初始查询并提供相关响应。在这种情况下,成功指标可以包括客户服务电话的减少或基于调查的净推荐值NPS)的增加。

另一个例子是当用户用他们选择的语言提问时,用可视化图表对商业报告进行响应。如果我们花费大量时间来制作商业报告和可视化图表,这将是一个糟糕的用户体验,我们将会错过市场。没有明确成功指标的 AI 模型往往难以推动采用。这在文本生成模型中尤为明显,其中比较生成的消息或将其与事实真相对齐可能具有挑战性。已经提出了各种评估技术,每种技术都有自己的假设。例如,如果重点是高质量的消息,BLEU 分数通常被使用;对于多样性,ROUGE 分数更为合适。在需要优化质量和多样性的情况下,MS-Jaccard 可能是一个更好的选择。虽然这些是评估生成文本的定量方法,但它们都带有特定的假设,理解这些假设可以帮助减轻潜在问题。随着最近利用另一个 LLM 进行评估的进展,如 Sher Badshah 在《参考指导判决:在自动评估自由文本中作为法官的 LLM》一文中建议的,天空才是极限。接下来,让我们看看防御性指标,这些指标确保在模型优化成功的同时,不会无意中损害其他关键业务目标。在下一节中,我们将探讨如何在生产系统中有效地定义、监控和执行这些防御性指标。

防守性指标——平衡短期成功与长期目标

有时候,优化一个指标可能会对商业的其他重要方面产生意外的后果。安全指标有助于在主要成功标准和其他基本商业目标之间保持平衡。在追求成功的同时,企业必须确保他们不会牺牲其他关键绩效指标。

让我们再次以电子商务推荐引擎为例。假设你有一个向用户推荐产品的系统。你可以将你的成功指标定义为CR,它跟踪点击推荐后进行购买的用户百分比。CR 满足了所有条件。它是具体的(衡量来自推荐的购买),它是可衡量的(它只是一个比率),它是可操作的(如果 CR 下降,你知道你需要调整某些东西),它是现实的(你知道根据历史数据什么是可以实现的),并且它是时间限制的(你可以每天、每周或每月进行衡量)。

但这足够了吗?仅仅有一个成功指标,就能保证模型的成功吗?并不完全是这样。还有更多需要考虑的因素,比如“安全指标”。这些指标帮助我们避免意外的后果。想想看:如果你只专注于提高转化率(CR),那么如果 AI 模型开始推送用户觉得令人烦恼或令人不知所措的激进推荐,会发生什么?当然,CR 可能会在短期内上升,但你可能会损害与客户的长期关系。这可不是什么好主意,对吧?

在金融领域,另一个例子可能是预测订阅计划中的客户流失,其中会提供各种奖励以保留有价值客户。然而,如果没有将成本敏感性作为安全指标来考虑,奖励计划可能会花费大量资金来运行,并且可能无法证明模型的投资回报率(ROI)。

这为我们不仅能够衡量产品推荐中的 CR 或订阅计划中的客户流失率,而且还能够确定是否在令人烦恼的方面保持了安全指标,这可以通过每日活跃用户或每周应用删除次数来衡量,或者通过成本来证明 ROI。

操作延迟

另一个重要的考虑因素是操作延迟,它指的是系统是否能够在实际条件下提供及时的预测。满足响应时间的服务级别协议(SLA)通常取决于架构选择,例如模型是实时提供还是批量提供。虽然大型语言模型(LLMs)提供了令人印象深刻的性能,但如果没有专门的架构,它们可能会很慢。在这里,平衡速度、成本和性能变得至关重要,尤其是在实时系统可能需要大量基础设施投资的情况下。通常,对于大多数机器学习应用,特别是面向客户的解决方案,监控 95%或 99%百分位数的延迟是一个好主意。

演进指标 - 监控模型性能随时间的变化

这里还有另一件事要考虑,指标会变化。是的,ML/AI 解决方案生活在一个充满假设的世界里,假设会变化,所以指标也会变化。当你最初部署模型时有效的方法,六个月后可能不再适用。一开始,你可能专注于诸如用户参与度或点击率等指标,以确保模型能够完成其基本任务,即在人们面前提供推荐。但随着模型成熟,你将把重点转移到更多面向业务的指标上,如终身价值或长期客户保留。AI 模型不是静态的,你的指标也不应该是。你必须适应随着模型的发展、市场的变化以及业务优先级的变化。

性能可以以三种方式演变:

  • 性能下降:随着时间的推移,一个 AI/ML 模型可能会遭受性能下降。例如,由于用户行为、市场条件或数据分布的变化,预测质量可能会下降。这种现象称为数据漂移,要求企业定期重新训练和更新模型。例如,一个曾经具有高转换率的推荐模型可能会因为客户偏好的变化而出现下降,这需要更新特征工程和重新训练。

  • 提高性能:有时,模型可能会随着时间的推移而表现更好,这可能是由于数据质量提高、数据集更大或模型改进。即使在性能提高的情况下,持续衡量成功指标也非常关键。然而,当指标显示出持续的改进而没有相应的外部因素时,企业应该保持谨慎。这可能表明模型开始利用数据中的捷径,而不是学习可推广的模式,这就是过拟合或模型游戏。随着时间的推移,性能的改进还可以通过强化方法变得明显,其中在线学习更新环境参数以达到最佳目标。

  • 停滞的性能:如果模型的性能在一段时间内保持不变,那么是时候探索新技术或进行特征工程了。即使指标没有恶化,这也可能表明模型不再适应不断变化的环境,或者没有足够优化。

通过定期监控和修订模型,企业可以确保其 AI/ML 解决方案在一段时间内保持相关性和影响力。

将模型指标与业务成功联系起来

如果一个超级准确的 AI 模型实际上不能帮助公司赚更多的钱或工作得更好,那么建造这样一个模型有什么意义呢?一个模型可能在纸上得到满分,但如果它对现实世界的业务目标没有影响,比如保持客户满意或减少浪费,那么它实际上只是浪费时间和金钱。

关键在于选择正确的方式来衡量成功,而这实际上取决于你用 AI 试图解决什么类型的问题。我们将探讨几种衡量成功的方法。

  • 监督学习(模型是否学会了正确的答案?):这是最常见的一种人工智能类型,我们给模型提供一些带有正确答案的示例,并要求它学习模式。

  • 对于分类模型(是这种还是那种?):当一个模型需要将事物分类到不同的类别中,例如将电子邮件标记为“垃圾邮件”或“非垃圾邮件”时,仅仅查看整体准确率可能会陷入陷阱,尤其是如果其中一个类别远大于另一个类别。更好的方法是使用一些特定的工具:

    • 精确率和召回率:你必须同时考虑这两个指标。想象你是一家夜店的保安。你希望让所有酷的人进来(召回率),但如果你不小心,可能会让一些麻烦制造者进来。另一方面,你可以非常严格,只让那些你 100%确信是酷的人进来(精确率),但你可能会拒绝很多优秀的人。F1 分数帮助你在这两个目标之间找到正确的平衡。

    • ROC 曲线和 AUC:这基本上是评估模型在区分两组之间好坏的评分表。曲线下的面积(AUC)最终得分告诉你,它有多自信地分离这两组。AUC 为 1.0 是完美分数,而 0.5 意味着模型只是掷硬币。

    • 校准:这完全关乎信任。如果你的天气应用说有 70%的降雨概率,你期望它大约有 7 次降雨。一个校准良好的模型是你可以真正相信其自信度的模型。

  • 对于回归模型(猜测预测/数字):当模型试图预测一个特定数字时,例如房价或公司销售额,我们通过其猜测的接近程度来衡量成功:

    • 平均绝对误差(MAE):这是最直接的一种度量。它告诉你,平均而言,你的模型预测的误差有多大。如果销售预测的平均绝对误差是$500,这意味着你的预测平均偏差约为$500。它简单易懂。

    • 均方根误差(RMSE):这个指标与大的错误非常敏感。它对单个极端错误的惩罚远大于多个小错误。当预测严重偏离会导致商业灾难时,例如没有订购足够多的最畅销产品,你会使用 RMSE。

  • 无监督学习(我们是否找到了任何有用的模式?):在使用无监督学习时,我们不给模型任何答案。我们只是给它一堆数据,并要求它自己找到有趣的结构或分组。

  • 对于聚类(分组事物)

    • 轮廓分数:在模型对你的数据进行分组之后,这个分数告诉你这些分组是否真正有意义。高分意味着簇是密集且分隔良好的,就像派对上不同的朋友群体。低分意味着所有数据点都混合在一个大而混乱的团块中。

    • 戴维斯-鲍尔丁指数:把这个想象成集群的“反社会”分数。分数低是好的——这意味着每个集群都保持独立,不会与其他集群重叠,表明有清晰的分离。

  • 对于降维(简化事物)

    • 解释方差:想象一下将一本 500 页的书总结成 10 页的摘要。“解释方差”告诉你你保留了原始情节的百分比。95%的分数意味着你的简短摘要非常出色,几乎包含了所有重要的内容,证明你的简化数据仍然非常有用。
  • 基于知识的 AI(我们的数字专家实际上是不是专家?):这种类型的 AI 不是从数据模式中学习,而是在一个预先编程的“大脑”中操作事实和规则,就像数字百科全书或诊断机器故障的专家系统。成功不在于统计误差;在于正确性和实用性。

    • 覆盖范围:我们的数字图书馆的藏书是否全面?如果它是一个医疗诊断工具,它覆盖了 50 种疾病还是 1000 种?这衡量了其知识的广度。

    • 查询准确性:当你提问时,它是否给出正确的答案?如果 AI 被设计来帮助技术人员修理引擎,它的建议必须是正确的。业务指标很简单:使用它的技术人员“首次修复率”更高。

    • 用户满意度:这是终极测试。使用系统的医生、律师或工程师实际上是否信任其建议并觉得有帮助?高满意度分数意味着 AI 不仅聪明,而且有用。

  • 生成式 AI(我们创造出了好东西吗?):生成式 AI 全在于创造新内容:文本、图像、代码或音乐。这里的指标通常更主观,将技术分数与人类判断相结合。

    • 对于文本生成(LLMs)

      • BLEU/ROUGE 分数:对于摘要或翻译等任务,这些分数将 AI 的输出与人类编写的“黄金标准”进行比较。这就像老师通过检查原文中的关键短语有多少被包含来评分摘要。

      • 复杂度:这个技术指标衡量模型对句子有多“困惑”。分数低意味着模型认为文本可预测且听起来自然,这是一个流畅性的好迹象。

      • 人工评估:这是黄金标准。真实的人对输出在流畅度(听起来自然吗?)、连贯性(是否有意义?)和有用性(是否很好地回答了问题?)的尺度上进行评分。

    • 对于图像生成

      • 弗雷歇初始距离(FID):这就像一个 AI 艺术评论家。它问两个问题:1) “这些图像是否清晰且逼真?”(质量)和 2) “你给我展示的是各种创意图像,还是只是反复展示同一张猫的图片?”(多样性)。FID 分数低更好。

      • 美学评分和人类偏好:最终,艺术是主观的。模型通常基于人类评分来学习人们认为视觉上吸引人的东西。关键的商业指标通常是用户参与度。人们是否会下载、分享或点赞 AI 创建的图片?

    • 强化学习(我们的机器人是否在学习获胜?):这是 AI 代理通过做事和获得反馈来学习的地方,就像宠物通过奖励学习新把戏一样。

      • 累积奖励:这基本上是 AI 的总分。在视频游戏中,奖励是分数。对于管理广告活动的 AI,奖励可能是总利润。目标始终相同:使累积奖励尽可能高。

最后,所有这些技术统计数据只是线索。它们帮助我们了解模型是否在内部正确工作。但真正的成功测试是它是否真正解决了它被设计用于解决的现实世界问题。指标只是工具;商业影响才是真正的奖品。

将模型优化与商业指标联系起来

在机器学习领域,损失函数是一个用于衡量模型预测输出与实际结果之间差异的数学函数。它是训练过程的核心,通过逐步更新梯度下降来指导模型的优化。然而,损失函数通常并不直接与商业指标对齐,这使得指标选择更加复杂。

例如,在欺诈检测中,模型的目的是将交易分类为“欺诈”或“非欺诈”。这个分类任务的损失函数可能是交叉熵,它衡量预测概率与真实结果之间的差异。然而,从商业角度来看,相关的成功指标可能是精确度(正确预测的欺诈与总欺诈预测的比例)或召回率(正确识别的欺诈与实际欺诈案例的比例)。精确度可能对于最小化误报至关重要,而召回率可能对于检测尽可能多的欺诈案例至关重要。

不匹配的一个常见例子是,如果目标是提高不平衡类别问题的 F1 分数(将精确度和召回率视为调和平均值),那么交叉熵可能不是一个很好的选择,因为最小化交叉熵损失可能会导致在多数类别上表现良好的模型,但在少数类别上表现不佳,这是不希望的。

通常,损失函数被设计为可微分的,以便梯度下降能够高效工作,而商业指标,如精确度或召回率,通常是非可微分的。这种不匹配在直接 AI/ML 模型优化中提出了挑战。已经开发出了一些技术,如焦点损失,来解决分类任务中的不平衡,尤其是在模型需要更多地关注困难示例而不是简单示例的情况下。

当业务指标不可微分或需要进行顺序决策时,可以采用强化学习RL)等技术,这些技术侧重于从反馈中学习,而不是通过损失函数进行直接优化。RL 可以通过使用奖励和惩罚来引导模型训练,从而优化不可微分的指标,这在传统损失函数不足的情况下尤其有用。

导航长期指标——替代指标问题

许多商业策略旨在优化长期成功。然而,长期指标往往难以实时衡量,这对模型开发团队构成了挑战。企业通常依赖于短期指标作为长期目标的代理,假设提高这些短期指标最终将导致长期成功。这是一个很大的信念飞跃,对吧?

例如,一个社交媒体平台可能会将每日活跃用户DAU)作为一个短期指标,如果增加 DAU 也会导致长期用户保留率的提高。然而,这种信念飞跃可能会出现问题,因为优化短期指标并不总是能带来预期的长期结果。在这种情况下,通常会使用替代指标作为长期目标的替代品。替代指标作为长期指标的代理,其目的是提供更多实时反馈,这对于构建更稳健的 ML/AI 解决方案通常是必需的。

为了有效地操作 AI/ML 模型,企业必须确定那些在时间上稳定、与长期目标高度相关且对短期波动最小敏感的替代指标。目标是确保短期优化能够导致可持续的长期成功。这个过程仍然是一个开放的研究领域,企业需要持续评估和验证他们的替代指标是否确实导致了预期的长期结果。

在银行业务中,预测客户流失提出了独特的挑战。与许多行业不同,银行客户通常同时持有多个产品——例如储蓄账户、支票账户、信用卡、贷款和投资组合。在这里,流失并不总是意味着完全退出银行;相反,它可能涉及产品使用的逐渐减少或将关键服务转移到竞争对手。与基于订阅的业务一样,流失可能发生在客户旅程的较晚阶段,这使得难以及时检测和应对。为了积极管理这种情况,银行通常依赖于能够显示早期脱钩迹象的替代指标,以便在客户完全脱钩之前进行干预。

这些代理指标应该与特定的业务目标深思熟虑地对齐。例如,如果目标是增加产品使用和参与度,一个有意义的指标可能是在定义的时间框架内交易活动、登录或其他形式的客户互动的显著减少。当目标是保留高价值客户和平衡时,银行可能会跟踪账户余额的显著下降,比如说下降一定百分比,作为早期预警信号。同样,为了减少整体流失,关键账户的关闭可以作为一个明确的流失指标。最后,为了提高交叉销售或升级努力,银行可能会监控客户持有的活跃产品数量的减少,因为这种下降通常预示着更广泛的脱钩。通过仔细选择和监控这些代理指标,银行可以深入了解客户行为,从而实现及时干预,防止流失。

处理多个目标——帕累托前沿和优化技术

在大多数现实世界的应用中,企业通常有多个目标,每个目标都在整体成功中扮演着关键角色。挑战在于同时优化多个目标,而不牺牲其中一个目标。这就是帕累托前沿概念发挥作用的地方。

帕累托前沿是一条边界,它代表了在相互竞争的目标之间最优的权衡。前沿上的任何一点都代表了一种解决方案,其中提高一个目标将降低另一个目标。例如,一个电子商务平台可能希望同时优化用户参与度和利润率。然而,通过提供过度的折扣来增加参与度可能会对利润率产生负面影响。

为了导航这样的权衡,企业可以采用诸如强化学习贝叶斯优化等技术,这些技术通过使用线性权重或部署启发式搜索将目标结合在一起,从而帮助学习目标的一个标量化。这些权重可以根据业务优先级进行调整,以优先考虑不同的目标。例如,在某个时间点,最大化用户参与度可能是主要目标,而在另一个时间点,盈利性可能更为重要。

通过利用强化学习或贝叶斯优化,企业可以探索帕累托前沿,并就如何平衡其相互竞争的目标做出明智的决策。仅仅平衡业务目标是否足以达到采用,或者我们在这样做时需要更加负责任?

成本/投资回报率考虑

将人工智能投入运营也引发了关于成本的问题。维护系统,尤其是那些需要实时推理或持续训练的系统,可能会很昂贵。包括为大型语言模型(LLMs)专门设计的硬件在内的基础设施成本必须与模型预期的回报率相权衡。组织面临着艰难的决定,是投资高性能系统还是考虑更高效的替代方案,例如较小的模型,这些模型可能为了降低成本而牺牲一些准确性。

对负责任人工智能的需求

在一个机器试图超越人类的 AI 时代,AI 的道德部署从未如此关键。AI 影响着社会的各个方面,包括心理健康、传播错误信息、就业替代和社会经济挑战。因此,负责任的人工智能RAI)是必要的,以减轻这些不利影响并确保构建更公平的 AI 解决方案,并确保其负责任和透明。

随着全球范围内人工智能法规的增多,例如欧盟和中国,以及美国各州的监管倡议,组织需要采用 RAI 实践来遵守法律要求。确保 RAI 意味着避免偏见和不准确的决策,这对于公共服务、私营部门和受监管机构至关重要。转向以人为中心的人工智能实践是必要的。这意味着从业者应致力于不仅关注合规性,还要理解 AI 系统对利益相关者的社会技术影响。

每个组织都应该致力于将负责任的人工智能(RAI)作为一种文化来采纳,而不是将其视为一项清单。开发可解释和值得信赖的人工智能系统至关重要,这些系统能够提供决策、培养信任和帮助用户做出明智决策所需的可理解解释。

因此,最终,定义人工智能/机器学习模型的成功并不仅仅是选择一个指标并跟随它。你需要一个经过深思熟虑的方法,考虑业务目标、模型随时间的变化以及更广泛地对客户的影响。别忘了那些安全指标。它们能帮助你避免为了短期收益而牺牲长期可持续性。

注意

定义人工智能模型的成功不仅仅是技术练习。它需要一种深思熟虑的、全面的方法。成功指标必须与业务目标一致,随时间适应,并考虑到权衡、成本和社会影响。正确地完成这一步可以说是将人工智能投入运营中最关键的一步,确保模型为企业和社会带来持续、有意义的价值。

摘要

本章概述了一个全面的大纲,用于衡量机器学习成功。它从定义与业务目标一致的具体、可衡量和可操作指标开始,然后添加护栏以避免有害的副作用。接下来,我们发现了如何将技术性能与业务价值联系起来,管理不断变化的指标,并确保负责任、成本效益的 AI 采用。这个基础对于构建可信赖的系统至关重要。在下一章中,我们将探讨如何将这些模型投入运营,并将它们从实验带到可扩展、生产就绪的解决方案。

免费订阅电子书

新框架、演进的架构、研究发布、生产分解——AI Distilled将噪音过滤成每周简报,供与 LLMs 和 GenAI 系统实际操作的研究人员和工程师使用。现在订阅,即可获得免费电子书,以及每周的洞察力,帮助您保持专注并获取信息。

packt.link/8Oz6Y订阅或扫描下面的二维码。

白色背景上的二维码  AI 生成的内容可能不正确。

第七章:从模型到市场:实现机器学习系统的运营

在上一章中,我们为机器学习(ML)的成功奠定了基础框架。我们了解到,为了实现现实世界的价值,我们必须定义成功的样子,超越简单的模型评分,转向一个多维度的视角,包括与业务目标一致的 SMART 指标、预防意外伤害的护栏指标和跟踪长期目标的代理指标。有了对要衡量什么的这一关键理解,我们现在面临战斗的第二阶段:运营化。

一个拥有完美指标但仍然停留在研究项目中的模型是一个错失的机会。为了使公司真正从机器学习中受益,我们必须弥合从实验模型到生产级系统的差距。这意味着不仅仅是部署模型,还要让人们接受它,将其融入业务的日常运作中,并确保它与公司的战略保持一致。为了使公司受益,我们需要确保其运营化。我们这是什么意思?这不仅仅是部署模型。这是让人们接受它,展示其影响,并将其融入业务的日常运作中。此外,它还需要与公司的短期和长期战略保持一致。你可以拥有世界上最具复杂性的 ML 模型,但如果没有人使用它,或者运行成本高昂,或者更糟糕的是,它与公司的目标不一致,你就是在错失良机。

在本章中,我们将重点转向真正实现这些模型运营化所需的因素,确保它们能够从笔记本和概念验证环境转移到可扩展且可维护的生产系统。这包括对模型产品化所需的技术和组织考虑因素的深入研究:支持持续部署的基础设施、监控和可观察性的作用,以及反馈循环如何帮助模型在实时环境中进化。

这一转型的核心推动力是代码模块化,无论是通过过程脚本、面向对象设计还是高级框架。我们将探讨这些不同的方法如何影响机器学习管道的维护性和灵活性。框架提供了强大的抽象,简化了分布式系统的设计,处理硬件加速,并实现大规模的可重复性。

最后,我们将探讨最近在大型语言模型LLMs)和基于代理的编排方面的进步,如何重塑机器学习系统的构建和部署方式。有了如 LangChain 和 Langraph 这样的应用框架,基于深度学习的框架如 PyTorch 和 TensorFlow,以及新兴的协议如模型上下文协议MCP),开发者现在拥有前所未有的工具集来构建智能、情境感知且持续学习的系统。

本章旨在为您提供从实验模型到稳健、企业级机器学习系统所需的实用工具和架构思维。无论您是在构建第一个流水线还是扩展生产模型集群,这里讨论的概念对于正确且可持续地完成工作至关重要。

本章涵盖了以下关键主题:

  • 理解可持续运营的基础

  • 连接软件开发生命周期(SDLC)和机器学习开发周期

  • AI/ML 部署的基础设施和架构选择

  • 机器学习系统下一步是什么?

到本章结束时,您将了解如何将模型产品化以产生现实世界的影响,有效地模块化机器学习代码,并利用现代框架构建可扩展、可维护的人工智能系统。

理解可持续运营的基础

一旦定义了正确的指标并与业务目标保持一致,将机器学习解决方案投入运营的下一个关键步骤就是产品化。虽然构建高性能模型是一个关键里程碑,但它只是旅程的开始。机器学习的真正价值在于当实验原型被转化为稳健、可维护且可扩展的产品,这些产品能够无缝集成到业务流程中时。产品化为此转化提供了基础,强调可复制的代码、迭代反馈循环和纪律化的工程实践。这些实践确保机器学习系统在长时间内保持适应性、透明性和成本效益,同时最小化技术债务,在快速实验与长期可维护性之间取得平衡。在本节中,我们将探讨机器学习产品化的原则,展示它们如何加速部署并实现持续学习和业务影响。通过将这些实践与之前关于指标的讨论联系起来,我们将产品化定位为模型开发与现实世界应用之间的桥梁。

从沙盒到现实世界成功:产品化的必要性

将机器学习模型从实验转移到生产需要远不止在测试数据集上获得高准确率分数。在现实世界中的成功取决于模型是否能够可靠地提供商业价值,适应变化条件,并有效地扩展。机器学习模型本质上成本高昂——不仅包括初始开发成本,还包括持续维护、基础设施和监控成本。随着深度学习和大型语言模型的出现,这种复杂性急剧增加。因此,评估模型复杂性与增量商业价值之间的权衡变得至关重要。

以下表格突出了模型性能、训练时间和内存使用之间的关键权衡:

| 算法 | 训练时间复杂度 | 预测时间复杂度 | 辅助空间复杂度 | 备注 |

| --- | --- | --- | --- | --- |

| 线性回归 | O(n*m² + m³) | O(m) | O(m) | 运行时间和空间复杂度低。 |

| 逻辑回归 | O(nm) | O(m) | O(m) | 运行时间和空间复杂度低。 |

| 朴素贝叶斯 | O(n*m) | O(c*m) | O(c*m) | 适用于高维数据。 |

| 决策树 | O(nlog(n)d) | O(d) | O(p) | 适用于处理数值和分类数据,但可能容易过拟合。 |

| 梯度提升 | O(nlog(n)dr) | O(dr) | O(pr + br) | br << drbr 是提升轮数,dr 是提升过程中每棵树的深度。 |

| 随机森林 | O(nlog(n)*dntree) | O(dntree) | O(pntree) | dntree 是随机森林中单个树的深度,而 pntree 是每个树中使用的参数或特征的数量。比单个决策树提供更好的泛化能力。 |

| 支持向量机 (SVM) | O(n²m + n³) | O(mnsv) | O(nsv) | 训练时间高但空间复杂度低。适用于低延迟问题和小型数据集。 |

| K-means | O(nmki) | O(mk) | O(nm + km) | 对于大型数据集快速且可扩展,但对初始化敏感,需要选择 k。 |

| K 最近邻 (KNN) | O(1) | O(nm) | O(nm) | 无训练时间,但预测时间高。需要存储整个数据集。 |

| 层次聚类 | O(n³) = O(n²log(n)) | O(mn) | O(n²) | 训练时间、运行时间和空间复杂度都高。不适合低延迟应用。 |

| DBSCAN | O(n²) / O(nlog(n)) | O(mn) | O(n) | 在时间和空间复杂度方面优于层次聚类。处理噪声和任意形状的簇。 |

| 主成分分析 (PCA) | O(nm*min(n, m) + m³) | O(Im) | O(Im) | 协方差矩阵计算的复杂度为 O(nm × min(n, m)) 。特征值分解的复杂度为 O(m³)O(Im) 是变换矩阵的复杂度。有效地降低维度,但可能计算成本高。 |

| t 分布随机邻域嵌入 (t-SNE) | O(n²) | O(nq) | O(n²) | t-SNE 需要大量的计算和内存。在数据点的数量上具有二次的时间和空间复杂度。它需要 O(3n²) 的内存,这使得它对于大型数据集来说不切实际。 |

表 7.1:流行机器学习模型的时间和空间复杂度

监督学习算法

通常来说,监督学习算法在速度和资源需求上差异很大。一端有高效的工具:线性回归、逻辑回归和朴素贝叶斯。这些模型训练速度极快,通常与数据大小成线性比例( O(n) ),这使得它们非常适合创建快速基线或在你拥有大量数据集且需要简单、可解释的模型的情况下使用。

在中间是树形模型。单个决策树训练非常快,预测也非常快。然而,其过拟合的倾向通常通过使用集成来解决。随机森林和梯度提升比单个树更强大、更准确,因为它们结合了数百棵树,但这也带来了代价,因为它们的训练时间显著更长,并且需要更多的内存。

然后是专家。SVMs 是两个模型的故事:使用线性核时,它们与逻辑回归一样快。但对于复杂、非线性问题,它们使用使训练时间爆炸(O(n²))的核,这使得它们对于大型数据集来说不切实际。最后,KNN 是“懒惰的学习者”。在训练期间它不做任何工作;它只是记住整个数据集。这使得预测非常慢(O(nm)*)且内存密集型,因为它必须将每个新点与所有旧点进行比较。

无监督学习算法

对于无监督任务,如聚类,K-means 是短跑运动员。它非常快,并且扩展性好,使其成为将大型数据集划分为预定义数量(k)的簇的首选。相比之下,DBSCAN 要慢一些,但更加灵活;它可以找到形状奇特的簇,并自动识别噪声,而无需你指定簇的数量。在另一端是层次聚类,它非常慢(O(n²)O(n³))且内存密集型,使其仅适用于需要探索嵌套簇结构的小数据集。

对于降维,PCA 是标准且高效的选项。它通常在将数据转换到低维空间时非常快,尽管如果特征数量庞大(m)时,其速度可能会受到影响。另一方面,t-SNE 是一个专为可视化设计的强大工具。它在创建高维数据的 2D 或 3D 有意义的地图方面表现出色,但因其著名的慢速(O(n²))和内存密集型,限制了其在以视觉探索为主要目标的较小数据集上的使用。

因此,你已经构建了一个表现出很多潜力的优秀机器学习模型。接下来是什么?最困难的部分不仅仅是创建一个智能算法;而是将这个算法转化为一个可靠的产品,让人们可以使用。这个关键步骤被称为产品化

想象一下:一位杰出的厨师可以在他们的厨房里创造出一道令人惊叹的新菜肴。产品化是将设计餐厅和系统化的过程,以便每晚都能为数百名顾客完美地复制这道菜肴。

要成功做到这一点,过程需要针对现实世界进行工程化。这意味着以下内容:

  • 模块化设计:将模型构建成可互换的部件,这样就可以轻松更新或修复某个部分,而不会破坏整个系统

  • 稳健的版本控制:对所有更改进行严格的记录,就像一个详细的食谱,跟踪对食谱的每一次调整

  • 自动化管道:创建一个“装配线”,自动测试和部署模型的最新版本,确保质量和速度

  • 深思熟虑的基础设施:选择合适的硬件和云服务,以确保模型能够处理重负载而不会崩溃

简而言之,产品化是酷炫实验和有价值的商业工具之间的桥梁。它是确保机器学习模型提供一致、可靠结果的工程基础,也是我们将要深入探讨的内容。

在此之前,让我们讨论一下为什么反馈循环很重要。

在离线测试中,庆祝模型达到高准确率是很常见的。然而,这往往无法转化为生产成功。现实世界环境是动态和不可预测的,仅基于历史数据训练的模型一旦部署可能会表现不佳。反馈循环对于缩小这一差距至关重要。它们使模型在部署后能够持续学习和模型优化。在生产中可能会出现一些挑战:

  • 训练数据中缺失的行为模式

  • 从特征集中排除的关键影响因素

  • 导致模型过度拟合某些子组的采样偏差

反馈循环允许组织系统地解决这些挑战:

  • 用户反馈:最终用户可以揭示模型预测中的差距,这些差距在内部测试中被忽略。例如,一个电子商务推荐系统可能会忽略季节性,导致产品建议不佳。

  • 数据漂移监控:随着时间的推移,用户行为或市场条件的变化可能会降低模型性能。监控漂移可以及时进行模型重新训练。

  • 数据增强:在生产中遇到的新边缘情况可以丰富训练数据集,提高模型的鲁棒性。

最终,从原型到生产的旅程是迭代的。部署的模型必须持续监控、优化和重新训练,以保持其有用性。在积极的反馈循环支持下,产品化将静态模型转化为自适应、高性能的系统。

超越反馈:为什么产品化加速了机器学习价值创造

反馈循环只是方程的一部分。产品化解锁了对于长期机器学习成功至关重要的额外好处:

  • 可扩展性:实验模型往往在现实世界的数据量或用户负载下失败。产品化确保系统可以有效地扩展。

  • 可维护性:生产系统需要严格的监控和维护。产品化鼓励诸如版本控制、自动化测试和模块化设计等实践,以简化维护工作。

  • 创新:产品化的系统可以加快创新速度。通过模块化组件,团队可以轻松地尝试新的模型或数据源,而不会影响整个流程。

  • 技术债务管理:快速实验往往会导致捷径,积累技术债务。产品化提供了减少这种债务、清理代码库和构建更稳定系统的机会。

考慮一個電商推薦引擎。沒有產品化,添加新類別或擴展到更大的用戶群將會很麻煩。然而,產品化系統是設計來通過模塊化架構和數據科學與工程團隊之間清晰的移交來應對變化的商業需求。

代碼可重現性:可靠系統的基礎

可重現性對擴展和維護機器學習解決方案是基礎。沒有它,協作、錯誤调试和部署將充滿風險。關鍵的可重現性實踐包括以下幾點:

  • 版本控制:如 Git 和數據版本控制DVC)等工具幫助跟蹤代碼、數據集和模型的變更

  • 容器化:Docker 和 Kubernetes 在開發和生產中創建一貫的運行環境

  • 自動化管道:CI/CD 工具自動化測試和部署,減少人為錯誤

這些做法確保模型可以可靠地重現、審計和跨團隊、系統轉移。可重現性是堅固 AI 產品化的不可商量的先決條件。將思考的第一原理應用於機器學習代碼,鼓勵清晰、高效和可維護。有效的代碼設計重點在於簡單性、模塊化和關注點分離:

  • 可讀性和模塊化代碼:乾淨、結構良好的代碼提高協作並加快錯誤调试

  • 全面的文檔:清晰的解釋幫助團隊理解模型行為並隨時間維護代碼

  • 數據、模型和邏輯的分離:解耦數據管道、模型訓練和推斷層次增加靈活性並減少系統脆弱性

在現代機器學習架構中,這通常涉及整合特徵存儲或數據 API,以解耦特徵工程與建模。這種設計提高了可擴展性和部署速度。

最小化技術負債

未受控制的技術負債可能會損害 M 項目。它通常來自匆忙的實驗、未記錄的工作流程和臨時的管道擴展。為了減少技術負債,考慮以下幾點:

  • 標準化實踐:建立共享的編程、數據和模型治理標準

  • 定期重构:安排時間進行代碼庫清理和優化

  • 模塊化管道:設計管道,使單個组件可以獨立發展

主動管理技術負債確保機器學習系統隨時間保持適應性和可持續性。

平衡實驗與重构

機器學習開發需要在快速實驗和嚴謹工程之間取得精巧的平衡。兩者都是持續成功的必要條件。

有效策略包括以下幾點:

  • 隔離實驗:在沙盒環境中快速原型設計最小化生產風險

  • 定期重构:定期分配時間進行清理和優化代碼庫

  • 控制釋放:僅將徹底驗證的變更整合到生產系統中

这种平衡在不牺牲长期可维护性的情况下促进创新,从而产生稳定且适应性强的人工智能解决方案。

AI/ML 产品化不仅仅是一项技术练习;它是长期商业价值的战略推动者。通过嵌入循环反馈、确保代码可重复性、应用良好的工程原则和管理技术债务,组织可以将有希望的 AI 实验转化为耐用、可扩展的解决方案。

产品化确保模型不仅在实验室中准确,而且在现实世界中具有影响力。它将机器学习从一项研究努力转变为可靠、可重复且持续改进的商业能力。通过采用这些基础实践,组织可以释放人工智能的潜力,并构建能够多年带来可衡量影响的系统。

随着组织从实验转向生产,下一个关键步骤是将 AI/ML 工作流程与既定的软件工程实践对齐。这需要弥合传统软件开发生命周期SDLCs)与机器学习系统独特需求之间的差距。

注意

我们强调,成功的 AI 部署不仅限于构建准确的模型——它需要产品化,将原型转化为可扩展、可维护的解决方案,并集成到业务流程中。关键实践包括建立反馈循环、确保可重复和模块化代码、管理技术债务,以及平衡快速实验与系统重构。这些基础使 AI 系统能够适应和随着数据及业务需求的变化而进化,确保持续的价值。最终,产品化弥合了开发与现实世界影响之间的差距。

桥接软件开发生命周期(SDLC)和机器学习开发周期

机器学习系统的发展与传统软件开发有相似之处,但由于其动态特性,也引入了独特的复杂性。与以代码为主要成果的传统软件不同,机器学习系统同样依赖于数据、模型配置和基础设施,所有这些都在不断进化。这需要强大的生命周期管理实践,包括代码、数据和基础设施的版本控制,以确保可重复性和可维护性。此外,机器学习不仅仅是交付一个静态的模型文件,而是管理一个整个管道,该管道自动化数据处理、模型训练、评估和部署。通过过程编程、面向对象原则和现代框架的模块化设计是处理这种复杂性的关键,它使机器学习系统可扩展、可维护,并能适应变化。本节探讨了这些基础概念,将它们与软件开发生命周期SDLC)进行比较,同时强调机器学习系统的动态、进化特性以及模块化代码库的最佳实践,以支持可持续的 AI/ML 操作。

机器学习中的代码和数据版本控制

在软件开发生命周期(SDLC)中,代码版本控制是一种标准做法,它允许开发者跟踪变更、回滚到先前版本以及协同代码开发。然而,在机器学习(ML)的开发周期中,数据版本控制同样重要。在传统的软件开发中,只要代码保持不变,软件的行为相对稳定。但在机器学习系统中,即使代码保持不变,底层数据的变更也可能极大地影响模型的行为。

如果没有对数据和代码进行适当的版本控制,AI/ML 团队可能会发现难以在部署后重现结果或解释模型行为。一个模型可能是在特定的数据集上训练的,当新数据可用时,其性能可能会显著变化。因此,为了确保可重现性和在部署中保持一致性,代码和数据都应该进行版本控制。

此外,版本控制不仅限于数据和代码,还扩展到基础设施。基础设施版本控制确保了模型训练的环境(例如特定的硬件配置、依赖项和库)是可重现的。当在本地、云端或边缘设备上部署模型时,这一点变得至关重要。

正如代码版本控制允许在传统的 SDLC 中进行回滚一样,模型版本控制确保团队可以在新部署导致意外结果时回滚到先前模型。

机器学习是模型文件包还是流水线?

机器学习最关键且常常被误解的一个方面是,它仅仅是一个模型文件包,还是一个完整的流水线。简短的回答是,机器学习是一个动态且不断发展的组件,需要三个层次的版本控制:数据、代码和基础设施。如果没有在这些维度上进行适当的版本控制和跟踪,重现结果和维护机器学习系统将变得极其困难。

一个常见的误解是,共享一个 pickle 文件(.pkl.h5)或任何其他序列化的模型文件(例如,TensorFlow 保存模型、ONNX 或 PMML)就足以重现机器学习模型的输出。然而,这远远不够。模型文件本质上是无上下文的已学习参数的冻结状态,没有关于用于训练它的数据、预处理流水线、超参数,甚至是在训练期间使用的特定硬件或软件堆栈的信息。没有这些元数据和支持性基础设施,仅仅共享模型文件就像给别人一个上锁的保险箱,但没有提供钥匙或开启它的组合。

为什么持续整个机器学习流水线很重要

为了确保机器学习系统是可重现和可维护的,我们需要存储和版本化不仅训练好的模型,还包括整个流水线,这包括以下内容:

  • 数据处理步骤:在将原始数据输入模型之前应用的精确转换。这包括处理缺失值、特征工程、缩放和对分类变量进行编码。

  • 特征选择和工程:用于生成模型所依赖特征的特定步骤。如果这些步骤没有进行版本控制,即使是最优秀的训练模型,在新的数据到来时也可能无法正确工作。

  • 模型训练配置:在训练模型时使用的超参数、训练轮数、优化器设置和验证标准。

  • 代码库版本控制:用于训练和部署模型的特定代码、库和依赖项的版本。

  • 基础设施依赖:在机器学习管道中使用的运行时环境、GPU 可用性、基于云的服务或容器化部署策略。

例如,考虑一个电子商务平台的推荐系统。如果数据科学家仅仅共享训练好的模型文件,而没有记录特征提取逻辑(例如,用户行为数据是如何转换为输入向量的),那么试图后来复现该模型的另一位工程师可能会因为预处理中的细微差异而产生不同的结果。

一种更稳健的方法是使用 MLflow、DVC 或 Kubeflow Pipelines 等工具来跟踪和管理机器学习模型的整个生命周期。这些工具有助于版本控制、实验跟踪和部署一致性,确保机器学习管道在不同环境中保持可重复和可扩展。

下面的图示说明了构成完整且可重复的机器学习管道的各种组件,它不仅包括模型训练,还包括数据处理、部署和监控。它强调了在长期可靠性和可扩展性方面,坚持每个阶段的重要性:

img

图 7.1:超出模型训练的机器学习管道组件,包括数据、部署和监控

既然我们已经为生产工作流程建立了组件,下一步关键步骤是讨论构建管道的最佳实践。由于机器学习与典型的软件开发生命周期(SDLC)管道不同,因此以下章节将广泛讨论框架及其相关的优势。

管道:确保可扩展性和稳定性

在大规模部署机器学习模型时,管道的概念是其中最关键的组成部分之一。管道自动化了数据摄入、预处理、模型训练、评估和部署的端到端流程,确保系统稳定、可扩展且可重复。

在传统的机器学习工作流程中,模型通常被视为静态文件。一旦训练完成,它们就会被保存并部署。然而,这种方法会导致一些挑战,例如确保模型在更新的数据上重新训练、处理模型版本控制以及集成新功能。

谷歌有影响力的论文《机器学习系统中的隐藏技术债务》强调了构建管道而不是依赖静态模型文件如何帮助管理技术债务。该论文认为,机器学习系统中的复杂性不仅来自模型本身,还来自处理数据、特征工程、监控等周围的系统。

一个设计良好的管道确保以下内容:

  • 数据持续刷新:新数据被自动摄取、处理并通过模型。

  • 模型重新训练是自动化的:每当引入新的数据或特征时,模型可以重新训练、评估和重新部署,无需人工干预。

  • 端到端可追溯性得到保持:管道跟踪过程的每个阶段,确保每个模型版本都是可重现的。

通过构建管道,机器学习团队可以自动化部署过程,降低人为错误的风险。它们还使得在多个环境中扩展模型、集成新的数据源和尝试新的模型变得更加容易。

机器学习代码中的模块化:过程化编程、OOP 和框架

代码模块化在确保人工智能/机器学习解决方案的可维护性、可扩展性和适应性方面发挥着关键作用。包括过程化编程、面向对象编程OOP)和框架在内的各种模块化方法提供了不同的利益和权衡。选择正确的方法对于构建健壮和可扩展的机器学习系统至关重要。

过程化编程侧重于编写计算机按步骤执行的指令序列。虽然在小项目中,过程化代码易于编写和理解,但在大型系统中,它很快就会变得难以控制。随着代码库规模的扩大,缺乏模块化会导致代码重复、调试困难和技术债务的增加。

对于人工智能/机器学习系统,当代码库较小时,过程化编程可能有效,但随着更多数据源、模型和特征的添加,管理起来变得更加具有挑战性。这就是面向对象编程或框架变得重要的地方。以下是一个面向对象编程的示例:

# Procedural approach for data preprocessing
import pandas as pd
from sklearn.preprocessing import StandardScaler
def load_data(filepath):
    return pd.read_csv(filepath)
def preprocess_data(df):
    scaler = StandardScaler()
    df[[‘feature1’, ‘feature2’]] = scaler.fit_transform(
        df[[‘feature1’, ‘feature2’]]
    )
    return df
data = load_data(‘data.csv’)
data = preprocess_data(data) 

当项目规模较小时,这种方法是有效的,但随着步骤数量的增加(例如,处理缺失值、特征选择和模型训练),过程化代码的管理和调试变得更加困难。

面向对象编程(OOP)提供了一种通过组织成可重用对象来模块化代码的方法,这些对象封装了数据和方法。与过程化编程相比,OOP 在初始设置上可能更困难,但它提供了显著的长远利益,尤其是在机器学习系统中。在 OOP 中,模型、数据集和预处理步骤可以表示为对象,每个对象都有自己的方法和属性。这种结构使得维护、扩展和调试代码库变得更加容易,因为系统某一部分的更改不太可能影响其他部分。

面向对象编程(OOP)的主要挑战在于它需要在前端采用更加严谨的设计方法。然而,一旦设置完成,它能够显著提高代码的可维护性和可扩展性,尤其是在大型、复杂的系统中。以下代码展示了面向对象的风格。代码结构是可重用的类,而不是独立的函数调用:

class DataPreprocessor:
    def __init__(self):
        self.scaler = StandardScaler()
    def fit_transform(self, df):
        df[[‘feature1’, ‘feature2’]] = self.scaler.fit_transform(
            df[[‘feature1’, ‘feature2’]]
        )
        return df
# Usage
preprocessor = DataPreprocessor()
data = preprocessor.fit_transform(data) 

使用面向对象编程,可以将不同的组件(如数据预处理、模型训练和评估)模块化,这使得维护和扩展机器学习项目变得更加容易。

框架:复杂工作流程的可扩展解决方案

虽然结构化代码(无论是过程式还是面向对象)带来了极大的清晰性和可维护性,但在机器学习中存在更深层次的挑战,这些挑战需要不仅仅是良好的代码组织。随着项目的增长,它们面临的设计模式无法解决的复杂性。可扩展性、分布式计算、硬件加速和可重复性等问题成为核心关注点,尤其是在生产级系统中,大型数据集和密集型模型是常态。框架在这里作为不可或缺的工具介入。

要理解框架的重要性,思考一个简单但基本的场景是有帮助的:在多台机器上分布式训练模型。假设你有一个跨越 10 台机器的数据集。在这种情况下,模型训练不是独立地拟合 10 个不同的模型。相反,你仍然希望产生一个单一的统一模型,该模型能够从所有可用数据中受益。

但这是如何实现的呢?这不仅仅是将所有数据发送到一台机器的问题,那样会违背分布式处理的目的。相反,采用了分布式训练方法,其中每台机器处理其数据的一部分,计算模型的部分更新,然后与其他机器同步这些更新。这些机器通过以下方式通信:通过协调更新的集中式参数服务器,或者通过使用集体通信协议直接在点对点方式下共享梯度,例如由库(如 Horovod 或NVIDIA 集体通信库NCCL))提供的协议。

以下图展示了数据并行方法在分布式训练中的应用,涉及将数据分割并在多个节点上并行训练:

img

图 7.2:分布式训练的数据并行方法

在同步情况下,不同批次数据的梯度在每个节点上分别计算,但跨节点平均以对每个节点中的模型副本应用一致的更新。

手动设计和构建这类分布式系统将是一项巨大的工程任务,需要网络、并行计算、优化等方面的专业知识。然而,现代机器学习框架抽象了这些细节的大部分。例如,TensorFlow、PyTorch 和 Horovod 等框架使开发者能够在规模上训练模型,而无需担心分布式计算的底层机制。

但框架的价值不仅限于分布式训练。它们还提供了对机器学习流程每个阶段都至关重要的能力。它们处理硬件加速,自动利用可用的 GPU 或 TPU。它们提供模型检查点工具,使训练作业能够在中断后恢复,而无需从头开始。它们支持自动日志记录和实验跟踪,这对于研究和生产中的可重复性至关重要。它们还易于与云平台和编排工具集成,使得模型能够无缝地从实验过渡到部署。

同样,TensorFlow Extended 流程是一系列组件,它们实现了机器学习流程,专门设计用于可扩展、高性能的机器学习任务。这包括建模、训练、推理服务以及将部署管理到在线、原生移动和 JavaScript 目标。

每个框架通常都有其擅长的领域。例如,Scikit-learn 仍然是涉及结构化或表格数据的经典机器学习任务的首选解决方案。它特别适合小规模问题和快速原型设计。相比之下,TensorFlow 和 PyTorch 在深度学习应用中占据主导地位,尤其是在图像、音频和文本等非结构化数据方面。在图神经网络领域,PyTorch Geometric 提供了专门工具,使得构建旨在从图结构数据中学习的模型变得更加容易。在概率建模和贝叶斯推理领域,PyMC3 和 TensorFlow Probability 等框架为构建复杂的概率模型提供了强大的抽象。

以下图展示了用于构建和管理机器学习应用的模块化开发者平台:

img

图 7.3:一个模块化开发者平台

平台解决方案层提供用于调试、测试和监控模型工作流程的工具。集成组件连接外部系统、数据源和模型提供者。架构层定义了系统的核心运行时和执行框架。API 与所有层并行运行,使程序性访问和无缝集成成为可能。

随着 LLM 的兴起,框架生态系统显著扩大。在这个领域,出现了新的框架来管理 LLM 带来的特定挑战,例如将多个提示链接起来、集成外部数据源以及跨多个代理编排推理。LangChain 和 LangGraph 是两个突出的例子,它们简化了由 LLM 驱动的应用程序的开发。这些框架使得构建复杂的工作流程变得更容易,其中模型与工具、数据库和 API 交互,同时保留交互过程中的记忆。这种记忆保留的概念,即系统可以从一步带到另一步携带上下文,是使系统表现出通用智能的基础。

最近,如 MCP 等进步更进一步,为不同 LLM 代理之间共享上下文和内存提供了基础设施,增强了它们的协作能力。这些机制允许 LLM 驱动的系统记住之前的交互,使它们能够解决多步问题、进行长对话推理或在多个代理之间协调行动。

在许多方面,框架是现代机器学习中的无名英雄。没有它们,现在被认为是常规的许多事情,从在大型数据集上训练模型到大规模部署,对于所有但最专业化的团队来说都将遥不可及。它们不仅结构化代码,还提供了现成的解决方案,解决机器学习、软件工程和分布式系统交叉处出现的问题。

从本质上讲,框架允许机器学习从业者专注于建模和实验,而不是分布式计算、硬件优化或工作流程编排的底层工作。它们提供了一个无形的支架,支撑着整个机器学习生命周期,从研究到生产,同时促进可重复性、效率和可扩展性。

通过提供这些高级抽象或 API,这些框架已经促进了人工智能领域的关键创新。无论是训练一个在 PB 级数据集上运行的模型,还是构建一个具有长期记忆能力的对话式人工智能代理,框架使得这些想法的实现变得比以往所需的努力少得多。随着该领域的持续发展,框架很可能会继续处于这一进步的核心,推动下一波可扩展、智能系统的浪潮。

下面是一个关于 scikit learn 框架的概述,作为一个最小化的示例,它优化了简洁性、可读性和可重用性:

from sklearn.pipeline import Pipeline
from sklearn.preprocessing import StandardScaler
from sklearn.linear_model import LogisticRegression
pipeline = Pipeline([
    (‘scaler’, StandardScaler()),
    (‘model’, LogisticRegression()) ])
pipeline.fit(X_train, y_train) 

这种方法确保数据预处理和模型训练是同一工作流程的一部分,提高了可维护性并降低了不匹配转换的风险。

下面是框架的优势:

  • 内置的最佳实践,用于确保可重复性和效率

  • 预优化的函数,可减少开发时间

  • 与云平台和分布式计算的集成

然而,当处理框架不支持的情况时,框架也可能成为限制因素。在这种情况下,结合面向对象原则和框架实用工具的混合方法通常是最佳解决方案。

与传统软件不同,ML 系统必须管理动态组件,如数据、模型和基础设施,以及代码,在 LLMs 的情况下还要管理内存。因此,可重复性、版本控制和管道持久性是必不可少的。无论是通过过程编程、面向对象编程还是框架,模块化设计对于构建可扩展、可维护和健壮的 ML 解决方案是基础。这些实践不仅简化了开发,还使系统能够在生产环境中平稳地演进。

注意

ML 开发需要管理动态组件,而不仅仅是代码,包括数据和基础设施,以确保可重复性。与传统软件不同,ML 需要全面的版本控制和管道持久性,而不是静态模型文件。通过过程、面向对象或基于框架的方法进行模块化设计,增强了可扩展性和可维护性。这些原则使 ML 系统在生产环境中能够高效地演进。

在理解了结构化编程范式和第三方框架如何支持 ML 系统的开发和扩展之后,下一步是探索支持这些解决方案在生产环境中可靠运行的底层基础设施和架构选择。

AI/ML 部署的基础设施和架构选择

在实际场景中部署 AI/ML 模型时,选择适当的基础设施至关重要。不同的云服务模型提供不同层次的服务抽象,从对底层基础设施的完全控制到完全托管服务。主要考虑的模型是基础设施即服务IaaS)、平台即服务PaaS)、软件即服务SaaS)和容器即服务CaaS)。每个模型在运营努力、灵活性和成本方面都呈现独特的权衡。

在 AI/ML 部署中理解 IaaS、PaaS、SaaS 和 CaaS

在将 AI/ML 模型部署到实际环境中时,选择合适的基础设施对于平衡控制、灵活性和易用性至关重要。不同的云服务模型提供不同层次的服务抽象,从对基础设施的完全控制到完全托管服务。需要考虑的四种主要模型是 IaaS、PaaS、SaaS 和 CaaS。每个模型都在运营努力、灵活性和成本之间提供了权衡:

  • IaaS通过在云上提供虚拟化计算资源(如虚拟机、存储和网络)来提供最大的控制和灵活性。使用 IaaS,组织对其环境拥有完全控制权,这允许进行定制配置和设置,但也意味着他们需要负责管理和维护底层基础设施。

    • IaaS 的关键特性

      • 完全控制:用户控制操作系统、存储和网络配置,这提供了显著的灵活性。

      • 定制:IaaS 高度可定制,允许进行特定的硬件和软件配置。

      • 可扩展性:用户可以根据需求增加或减少资源。

    • 优点

      • 灵活性:IaaS 为 AI/ML 工作负载提供了最高级别的灵活性。数据科学家和工程师可以选择精确的硬件规格,包括 GPU 或 TPU,用于大规模训练或推理任务。

      • 大型运营的成本效益:对于需要大量计算资源的大型、连续 AI/ML 操作,IaaS 可能更具成本效益,因为用户只需支付他们使用的部分。

    • 缺点

      • 运营开销:管理底层基础设施需要显著的技术专长和资源,增加了运营复杂性。

      • 维护:用户负责维护基础设施,例如更新操作系统、管理安全和处理故障。

    • 用例:IaaS 非常适合具有显著技术专长、大规模 AI/ML 工作负载和特定计算资源需求的企业。例如,进行深度学习且需要大量 GPU 处理的复杂模型的公司通常会选择 IaaS。

  • PaaS通过提供一个包含操作系统、中间件和运行时环境的平台来简化大部分基础设施复杂性。用户专注于开发、部署和管理应用程序,无需担心基础设施管理。

    • PaaS 的关键特性

      • 预配置环境:该平台附带预配置的开发工具、数据库和服务器。

      • 简化部署:PaaS 允许开发者快速部署应用程序,无需担心底层硬件或操作系统。

      • 内置可扩展性:随着需求的增长,PaaS 解决方案提供易于扩展的选项。

    • 优点

      • 缩短上市时间:开发者可以专注于构建和部署 AI/ML 模型,无需管理基础设施的复杂性。这导致开发周期更快。

      • 减少运营工作量:PaaS 减少了系统管理、安全管理硬件维护的需求。

      • 集成工具:许多 PaaS 解决方案都内置了机器学习工具,如模型部署、监控和版本控制系统,这使得集成 AI/ML 工作流程更加容易。

    • 缺点

      • 较少的灵活性:PaaS 环境比 IaaS 更受限制。如果平台不支持特定配置或工具,这些工具对于高级人工智能/机器学习模型是必需的,用户可能会遇到限制。

      • 成本:虽然 PaaS 减少了运营开销,但由于内置服务和可扩展性的溢价费用,对于持续、高容量的人工智能/机器学习工作负载来说可能更昂贵。

    • 用例:PaaS 对于希望加快开发和部署过程,而不想管理基础设施复杂性的组织来说很合适。例如,希望快速原型化和部署机器学习模型的 AI 创业公司可能会更倾向于使用 PaaS。

  • SaaS 在云上提供全面管理的软件解决方案,用户所需参与的最小化。服务提供商处理从基础设施到应用程序管理的所有事情。在人工智能/机器学习背景下,SaaS 平台提供预构建的 AI 工具、API 和服务,企业可以直接将其集成到其工作流程中。

    • SaaS 的关键特性 :

      • 预构建解决方案:SaaS 平台提供现成的 AI/ML 服务,如自然语言处理、图像识别和推荐引擎。

      • 零基础设施管理:所有基础设施、软件更新和安全都由提供商管理。

      • 易于集成:SaaS 解决方案旨在易于集成到现有工作流程中,所需定制的最小化。

    • 优点 :

      • 最小技术开销:SaaS 消除了对基础设施或平台管理的需求,使团队能够完全专注于业务用例。

      • 快速部署:SaaS 解决方案可以快速部署,无需开发或对人工智能/机器学习有深入的技术专业知识。

      • 可预测的成本:SaaS 模型通常是基于订阅的,这使得预算可预测。

    • 缺点 :

      • 有限的定制性:SaaS 解决方案提供的灵活性有限。用户必须依赖平台提供的功能和能力。

      • 对供应商的依赖:企业变得依赖于 SaaS 供应商进行更新、可扩展性和性能改进。

      • 数据隐私:使用 SaaS,敏感数据可能需要通过第三方供应商进行传输和存储,从而引发潜在的隐私问题。

    • 用例:SaaS 对于寻求快速且易于使用的人工智能解决方案,而不愿在基础设施或人工智能专业知识上大量投资的企业来说非常理想。例如,一家营销公司可能会使用基于 SaaS 的 AI 工具进行客户细分和定位,而无需构建定制模型。

  • CaaS 通过提供基于容器的虚拟化,在 IaaS 和 PaaS 之间提供了一个中间地带。容器允许将应用程序及其依赖项打包在一起,确保它在不同的环境中保持一致性。在人工智能/机器学习部署中,容器可以用来封装模型,使它们易于携带并在各种基础设施设置中部署。

    • CaaS 的关键特性 :

      • 容器编排:CaaS 解决方案通常包括 Kubernetes 等工具,用于编排、扩展和管理容器化应用程序。

      • 可移植性:容器可以轻松地在不同环境中移动,从本地到云再到混合环境,而无需更改应用程序或其依赖项。

      • 自动化管理:许多 CaaS 平台提供容器集群的自动化管理,从而减轻了用户的管理负担。

    • 优点

      • 灵活性和可移植性:容器通过允许模型部署在任何支持容器的基础设施上,提供了灵活性,确保了环境之间的一致性。

      • 可扩展性:使用 CaaS,容器化 AI/ML 模型的可扩展性变得更加简单。编排平台如 Kubernetes 使得管理大规模部署变得更加容易。

      • 减少基础设施管理:虽然不如 PaaS 或 SaaS 那样无需过多干预,但 CaaS 通过抽象容器编排来减少基础设施管理的工作量。

    • 缺点

      • 设置复杂性:设置和管理容器,尤其是在大规模生产系统中,可能需要容器化技术的专业知识。

      • 操作开销:虽然低于 IaaS,但 CaaS 仍然需要一定程度的基础设施管理,尤其是在扩展容器化的 AI/ML 应用时。

    • 用例:CaaS 非常适合那些希望在减少基础设施管理复杂性的同时,寻求灵活性和可移植性的组织。例如,一家在多个环境中部署 AI 模型的公司,无论是在本地还是云中,都可以从 CaaS 提供的可移植性和一致性中受益。

比较 IaaS、PaaS、SaaS 和 CaaS 的经济效益

在选择这些云服务模型之间,重要的是要考虑控制、复杂性和成本之间的权衡:

  • IaaS 提供了最大的控制权,但需要大量的操作努力。对于大规模、资源密集型操作来说,它具有成本效益,但可能因维护和管理成本而增加。

  • PaaS 抽象了大部分基础设施复杂性,使得开发和部署应用程序更快、更容易。虽然 PaaS 减少了操作开销,但由于对托管服务的溢价,对于持续的大规模操作来说可能更昂贵。

  • SaaS 提供了最少的操作工作量,因为所有内容都由供应商管理。然而,它提供的灵活性最少,通常适合那些需要快速解决方案而不需要大量定制的业务。

  • CaaS 在灵活性和易用性之间取得平衡,为部署 AI/ML 模型提供了一个更可移植和可扩展的选项。CaaS 比 PaaS 更复杂,但提供了对基础设施的更好控制,同时与 IaaS 相比,减少了部分操作开销。

    注意

    组织必须仔细评估其具体需求、技术能力和预算,以选择合适的模型。对于需要控制基础设施的、高度专业化的 AI/ML 工作负载的企业,IaaS 或 CaaS 可能更为合适。对于优先考虑速度、灵活性和低运营负担的企业,PaaS 或 SaaS 将是理想的选择。在将 AI/ML 用例部署到现实世界时,组织面临从产品化到模块化、数据与代码版本控制、管道自动化和基础设施选择等一系列挑战。通过根据其具体需求选择合适的服务模型(IaaS、PaaS、SaaS 或 CaaS),企业可以优化运营效率,降低成本,并确保可扩展和可维护的 AI 解决方案。

随着我们从架构基础转向在生产中部署 ML 模型的现实,考虑支持运营卓越和长期可持续性的周围工具,如日志记录、版本控制、监控和工件管理,是至关重要的。

支持模型部署的其他 MLOps 设计考虑因素

将 AI/ML 模型投入运营的过程远远超出了构建和部署模型。它包括定义正确的成功指标、确保持续监控和改进、处理长期和多目标优化,以及将模型集成到可以提供真实商业价值的应用程序中。将模型集成到多样化的环境中,从基于云的系统到偏远地区的边缘设备,需要对模型大小、数据隐私和资源约束进行深思熟虑的方法。

随着企业继续采用 AI/ML 模型,关注运营效率和模型可扩展性将是释放其全部潜力的关键。联邦学习和模型扩散等新兴技术为确保 AI 解决方案不仅性能高,而且适应现实世界约束提供了有希望的途径。通过解决这些挑战,组织可以推动 AI/ML 技术的采用,改进其业务流程,并实现长期成功。

部署 ML 模型到生产的规划和工具

将 ML 模型部署到生产涉及几个关键步骤和规划方面,以确保平稳运行、可维护性和可扩展性。需要各种工具和最佳实践来处理 ML 生命周期的不同阶段。在此,我们概述在部署 ML 模型之前需要关注的重点领域,并讨论每个领域可用的工具:

  • 代码版本控制:这确保了不同版本的 ML 管道,包括预处理脚本、训练代码和推理逻辑,得到良好的管理。它有助于跟踪变更、与团队协作,并在必要时回滚到先前状态。

    • 常用工具

      • GitHub:一个广泛使用的源代码管理和版本控制平台

      • GitLab:类似于 GitHub,但具有内置的 CI/CD 功能

      • AWS Code Commit:与 AWS 服务集成的托管源代码控制服务

      • Bitbucket:支持 Git 和 Mercurial,常用于企业应用

    • 最佳实践

      • 使用分支策略(例如,GitFlow)来管理开发、测试和生产版本

      • 实施代码审查和拉取请求以确保质量控制

      • 使用 CI/CD 管道自动化代码部署

  • 工件管理:一旦训练好机器学习模型,应将其安全存储以进行版本控制、检索和部署。这确保了在不同环境中始终使用相同的模型版本。

    • 常用工具

      • JFrog Artifactory:支持多种包格式的通用工件仓库管理器

      • Azure Artifacts:集成到 Azure DevOps 中,用于存储依赖项和构建工件

      • Nexus 仓库:支持二进制文件、Docker 镜像和机器学习模型

    • 最佳实践

      • 将训练好的模型与元数据(包括超参数和数据集版本)一起存储

      • 使用语义版本控制对模型工件进行版本控制

  • 构建和部署工具:自动化构建和部署过程对于保持生产环境中的效率至关重要。

    • 常用工具

      • Jenkins:广泛使用的 CI/CD 工具,用于自动化构建和部署

      • GitHub Actions:在 GitHub 内直接提供工作流程自动化

      • Poetry:Python 的依赖管理工具,简化了打包和版本控制

      • AWS CodeBuild:AWS 中的完全托管构建服务

    • 最佳实践

      • 使用容器化(Docker)以实现一致的部署环境

      • 使用 CI/CD 管道自动化测试和部署

  • 日志和监控:这些对于在生产环境中检测问题、跟踪模型性能和故障排除至关重要。

    • 常用工具

      • Elasticsearch:用于日志和基于搜索的分析的分布式搜索和分析引擎

      • Prometheus:用于监控应用程序和基础设施,具有实时警报功能

      • Fluentd 和 Logstash:日志收集、转换和存储的工具

    • 最佳实践

      • 集中存储日志并对日志进行索引以提高检索效率

      • 实施故障和性能异常的实时警报

  • 可视化和仪表板:可视化日志、性能指标和业务 KPI 对于保持运营洞察至关重要。

    • 常用工具

      • Grafana:与 Prometheus 集成的强大仪表板工具,用于可视化性能指标

      • Kibana:与 Elasticsearch 协同工作,用于分析和可视化日志和搜索查询

      • Tableau 和 Power BI:用于创建业务智能仪表板

    • 最佳实践

      • 为可视化工具设置基于角色的访问控制RBAC

      • 创建用于监控机器学习性能和基础设施指标的定制仪表板

  • 模型监控和日志记录 : 随时间跟踪模型性能对于检测漂移、偏差和准确度下降至关重要。

    • 常用工具 :

      • MLflow : 跟踪实验、管理模型并促进部署

      • Kubeflow : 用于训练、服务和监控模型的 Kubernetes 原生机器学习平台

      • AWS SageMaker 模型监控器 : 监控生产中的模型以检测漂移

    • 最佳实践 :

      • 根据模型性能衰减自动触发重新训练

      • 将模型预测与输入特征一起存储,以便审计和分析

  • 容器化和编排 : 在生产环境中部署机器学习模型通常需要可扩展、便携和高效的基础设施解决方案。

    • 常用工具 :

      • Docker : 将机器学习模型及其依赖项打包到轻量级容器中

      • Kubernetes : 部署和管理容器化应用程序的编排工具

      • Amazon EMR : 大数据处理的管理集群平台

    • 最佳实践 :

      • 使用容器化推理服务器(例如,TensorFlow Serving 或 TorchServe)进行可扩展部署

      • 使用 Kubernetes 中的自动缩放策略优化资源分配

  • 数据版本化和管理 : 版本化数据集确保机器学习实验的可重复性和可追溯性。

    • 常用工具 :

      • DVC : 管理数据集和机器学习管道

      • Google BigQuery : 支持大规模分析的无服务器数据仓库

      • Delta Lake : 用于管理结构化和半结构化数据的开源存储层

    • 最佳实践 :

      • 以不可变格式(例如,Parquet 或 ORC)存储数据集以提高效率

      • 实施访问控制以规范数据修改

  • 机器学习部署的托管云服务 : 云服务提供商提供简化机器学习部署和扩展的托管服务。

    • 常用工具 :

      • Azure Functions : 事件响应中执行代码的无服务器计算服务

      • AWS Lambda : 无需管理基础设施的函数执行

      • Google Cloud Run : 自动扩展部署容器化应用程序

    • 最佳实践 :

      • 使用无服务器架构来构建轻量级、事件驱动的机器学习应用

      • 与 API 网关(例如,Amazon API Gateway)集成以暴露机器学习模型作为服务

        注意

        将机器学习模型部署到生产需要跨多个维度进行仔细规划,包括代码版本控制、工件管理、监控和基础设施。利用合适的工具有助于确保可重复性、可扩展性和可维护性。组织应采用最佳实践,如版本控制代码和数据、自动化 CI/CD 管道,并实施强大的监控解决方案以简化机器学习操作。通过仔细选择和集成这些工具,机器学习模型可以高效地部署、监控和维护以实现长期成功。

模型服务实践

将机器学习模型部署到生产环境是将 AI 研究转化为实际应用的关键步骤。然而,选择正确的部署策略对于确保效率、可扩展性和响应性至关重要。包括 REST API、共享数据库、流式模型部署、图模型架构、向量嵌入架构和强化学习在内的各种部署方法,满足不同的运营需求。

本节探讨了这些方法,并提供了一个决策框架,以帮助根据性能、延迟和用例要求选择适当的模型服务方法:

  • 基于 REST API 的模型部署 : 表示状态传输应用程序编程接口REST API)是用于服务机器学习模型最广泛使用的方法之一。在此方法中,模型被封装在 API 中,并作为服务公开,允许外部应用程序发送请求并接收预测。

    • 优点 :

      • 容易与 Web 应用程序和微服务集成

      • 可通过负载均衡器进行扩展

      • 可以使用 Docker 进行容器化,并使用 Kubernetes 进行编排

    • 挑战 :

      • 处理大规模实时推理请求时存在高延迟

      • 需要额外的基础设施来管理身份验证和速率限制

    • 示例用例 : 一个欺诈检测系统,其中金融应用程序将交易详情发送到 API,API 返回欺诈概率分数

  • 用于模型服务的共享数据库 : 在这种方法中,机器学习模型生成预测,这些预测存储在数据库中,然后由各种应用程序访问。

    • 优点 :

      • 确保一致性,因为所有用户都访问相同的预测结果

      • 减少了不需要实时推理的模型的计算开销

    • 挑战 :

      • 预测更新基于批处理,限制了实时适应性

      • 随着预测数量的增加,存储开销也在增加

    • 示例用例 : 一个推荐系统,它预先计算个性化的内容建议并将它们存储在数据库中以供用户检索

  • 流式模型部署 : 流式模型部署涉及使用 Apache Kafka、Apache Flink 或 Spark Streaming 等技术将模型与实时数据处理管道集成。

    • 优点 :

      • 通过动态更新模型以包含传入数据支持持续学习

      • 适用于需要低延迟和实时决策的应用程序

    • 挑战 :

      • 需要强大的基础设施和监控来处理大规模数据流

      • 在调试和维护流式处理管道时增加了复杂性

    • 示例用例 : 对社交媒体帖子进行实时情感分析,其中传入的文本被即时处理以检测情感变化

  • 图模型架构 : 当需要动态捕捉实体之间的关系时,例如在社会网络或知识图中,使用基于图的模型服务。

    • 优点 :

      • 适用于需要深度关系分析的应用

      • 使高效查询和遍历相互连接的数据成为可能

    • 挑战 :

      • 需要专门的数据库,如 Neo4j 或 Amazon Neptune

      • 对于大规模图,计算密集

    • 示例用例 : 将实体(用户、账户和交易)之间的关系建模为图进行金融交易中的欺诈检测

  • 向量嵌入架构 : 基于向量嵌入的服务存储数据的高维表示,从而实现快速相似性搜索和推荐。

    • 优势 :

      • 优化用于需要最近邻搜索的应用,如图像检索和推荐系统

      • 使用近似最近邻ANN)技术进行高效的存储和查询

    • 挑战 :

      • 需要专门的库,如 FAISS 或 Annoy 进行优化索引

      • 处理大型嵌入空间时内存消耗高

    • 示例用例 : 存储为向量嵌入的用户偏好的个性化电影推荐,与电影嵌入进行匹配

  • 基于强化学习的服务强化学习RL)模型根据环境的反馈动态更新其策略。

    • 优势 :

      • 随时间推移不断改进的自适应学习机制

      • 适用于需要实时调整的决策应用

    • 挑战 :

      • 计算成本高,因为需要持续的训练和推理

      • 需要大量的历史数据来启动学习过程

    • 示例用例 : 基于需求和对竞争者行为的实时调整的电子商务动态定价模型

选择合适的模型服务方法的决策标准

在选择部署策略时,需要考虑各种因素,包括性能要求、延迟约束和用例的具体情况。以下决策标准可以帮助指导选择过程:

  • 性能要求 :

    • 如果模型需要处理高吞吐量请求,建议使用具有负载均衡的 REST API 或流部署

    • 对于依赖于预计算输出的应用,共享数据库方法更有效

  • 延迟考虑 :

    • 对于需要实时决策的应用(例如,欺诈检测、自动驾驶汽车等),流模型或向量嵌入架构是理想的

    • 相比之下,批量处理工作负载(例如,预测性维护)可以利用基于数据库的部署

  • 可扩展性需求 :

    • 如果模型必须根据需求动态扩展,基于 Kubernetes 的 REST API 部署或流框架是最佳选择

    • 对于涉及大量相互连接数据的用例,图模型架构提供了可扩展性的优势

  • 复杂性和可维护性

    • REST API 为标准应用提供了最简单的集成

    • 流式部署和强化学习(RL)需要更复杂的基础设施和监控

    • 图架构需要专门的数据库和查询优化

  • 用例对齐

    • Web 应用程序:REST API 部署

    • 推荐系统:向量嵌入架构

    • 金融欺诈检测:图模型部署

    • 自主系统:基于强化学习(RL)的服务

      注意

      高效地服务机器学习模型需要一个经过深思熟虑的部署策略,该策略与应用程序的需求相一致。部署方法的选取,无论是 REST API、共享数据库、流模型、图模型、向量嵌入还是强化学习(RL),都取决于性能需求、可扩展性、延迟约束和复杂性考虑。通过利用正确的模型服务方法,组织可以提升其 AI 驱动应用程序,确保在生产环境中具有高效率和可靠性。

虽然部署模型是一个重要的里程碑,但在现实世界环境中保持其有效性需要持续学习和适应。将反馈循环集成到机器学习系统中,使模型能够随着用户行为、环境变化和业务目标的发展而进化,从而推动长期性能和相关性。

集成反馈循环以实现持续改进

机器学习模型并非孤立存在;它们在动态环境中运行,其中用户偏好、外部条件和业务目标会随着时间的推移而演变。为确保持续改进和长期有效性,将反馈循环集成到机器学习管道中至关重要。反馈机制允许模型适应、细化预测并基于现实世界的观察优化结果。

本节探讨了基于用户、环境、特定领域和指标的反馈类型,并概述了将反馈无缝集成到机器学习管道中的策略。

下面是用于模型改进的反馈类型:

  • 用户反馈:用户反馈是改进机器学习模型最有价值的来源之一,特别是对于推荐系统、搜索引擎和个人化算法。

    • 示例

      • 电子商务推荐系统:客户点击、购买和停留时间提供了对产品兴趣的隐式信号

      • 搜索引擎:查询重构、点击率和跳出率有助于改进搜索排名模型

      • 聊天机器人和虚拟助手:用户情感分析和重复性问题突出了需要调整模型的部分

    • 集成策略

      • 实施对用户交互的实时监控,并收集显式(评分、评论)和隐式(点击、悬停和会话持续时间)反馈

      • 利用 bandit 算法根据新的反馈动态调整推荐

      • 使用 A/B 测试来衡量将用户反馈纳入模型改进的影响

  • 强化学习和自适应系统的环境反馈:在动态环境中,动作影响未来状态,强化学习提供了一种结构化的方式来整合来自环境的反馈。

    • 示例

      • 自动驾驶汽车:根据不断变化的道路条件调整驾驶策略

      • 交易算法:根据市场波动更新投资组合策略

      • 动态定价:根据实时需求和竞争对手的行为调整产品价格

    • 集成策略

      • 使用奖励函数评估模型动作并确定最佳调整

      • 实施离策略学习,从过去的交互中学习而不需要重新训练整个模型

      • 利用多臂老丨虎丨机在探索(新策略)和利用(最优策略)之间进行平衡

  • 针对特定行业的领域特定反馈:不同的行业需要针对独特约束和目标定制的专用反馈机制。

    • 示例:营销和媒体组合优化专业人员在不同渠道(电视、数字广告和社交媒体)之间分配预算,并需要反馈机制以动态调整支出:

      • 短期反馈点击率CTR)、转化率和参与度指标提供即时性能信号

      • 长期反馈:品牌知名度、客户终身价值LTV)和保留指标表明更广泛的战略成功

    • 集成策略

      • 使用多触点归因模型分析客户旅程并根据相应调整渠道权重

      • 应用因果推断技术(例如,差异法和倾向得分匹配)来估计营销干预措施的真实影响

      • 利用贝叶斯优化根据不断变化的反馈持续微调媒体组合分配

  • 基于指标的反馈(短期与长期优化):指标作为模型成功的代理,但区分短期和长期目标是至关重要的。

    • 示例

      • 短期指标:准确率、精确率、召回率和点击率(CTR)

      • 长期指标:客户保留、盈利能力和品牌价值

    • 集成策略

      • 定义中间代理(例如,客户参与度得分)与长期目标相关联

      • 在强化学习中设计奖励函数,平衡短期收益和长期稳定性

      • 使用帕累托前沿分析同时优化竞争目标

短期指标,如准确率、精确率、召回率或 CTR,更容易衡量,但如果过度优化,可能会导致意想不到的后果,例如过度拟合用户点击而忽视长期参与度。长期指标,如客户保留、盈利能力和品牌价值,提供更深入的策略洞察,但更难量化,通常需要间接的测量方法。

在机器学习管道中实现无缝反馈集成机制

为了使反馈机制投入运营,组织必须制定稳健的策略,将反馈循环直接集成到机器学习管道中:

  • 自动化反馈收集和处理:为了简化反馈集成,组织应实施自动数据收集和处理管道。

    • 最佳实践 :

      • 使用 Apache Kafka 或 AWS Kinesis 等工具建立事件驱动架构以捕获实时反馈

      • 在特征存储(例如,Feast 或 Tecton)中存储结构化反馈以确保模型间的一致访问

      • 使用数据版本控制工具(例如,DVC 或 MLflow)跟踪反馈数据的变更

  • 持续模型重新训练和部署:为了使模型与最新的反馈保持更新,组织应实施持续重新训练和部署管道。

    • 最佳实践 :

      • 使用 CI/CD 工具(例如,Jenkins 或 GitHub Actions)采用 MLOps 实践来自动化模型重新训练和部署

      • 实施漂移检测算法以监控用户行为的变化并在必要时触发重新训练

      • 利用在线学习框架逐步调整模型,而无需完全重新训练

  • 人机交互HITL集成:在自动化反馈不足的情况下,集成人类反馈确保了更高质量的模型更新。

    • 最佳实践 :

      • 实施主动学习技术,当模型的不确定性高时,模型会向人类请求标签

      • 使用众包平台(例如,Amazon Mechanical Turk)收集领域专家的反馈

      • 建立反馈仪表板,使分析师和决策者能够审查和验证自动预测

  • 平衡探索与利用:为确保持续改进,模型必须在利用现有知识(利用)和尝试新策略(探索)之间取得平衡。

    • 最佳实践 :

      • 使用ε-贪婪策略偶尔测试替代推荐

      • 实施汤姆森抽样根据反馈动态分配资源

      • 应用上下文赌博来根据用户交互实时优化决策

        注意

        将反馈循环集成到机器学习管道中对于保持模型的相关性、提高性能和确保与业务目标一致至关重要。通过利用用户反馈、环境反馈、领域特定反馈和指标驱动反馈,组织可以创建自适应、自我改进的机器学习系统。一个良好的反馈集成策略确保模型持续进化以满足用户、行业和长期目标的变化需求。

MLOps 是一门专注于自动化和简化生产中机器学习模型部署、监控和管理学科的学科。借鉴 DevOps 的原则,MLOps 确保了机器学习系统的稳定性、可扩展性和可维护性,同时减少了技术债务。

首先,我们应该理解在生产机器学习中 MLOps 的需求。与传统软件开发不同,机器学习引入了新的复杂性,例如以下内容:

  • 数据依赖:模型依赖于不断演变的数据集,这使得它们容易受到数据漂移的影响

  • 模型版本控制:与代码不同,机器学习模型会随着重新训练而持续变化,需要版本控制

  • 管道复杂性:端到端机器学习管道涉及数据预处理、特征工程、训练、验证、部署和监控

  • 操作化:确保可重复性、持续集成和部署并非易事

MLOps 通过标准化机器学习系统的生命周期来弥合研究和生产之间的差距,从而提高可靠性和效率。

MLOps 的关键组件包括以下内容:

  • 自动数据摄取和验证:在训练前确保数据质量

  • 特征工程管道:标准化特征生成以避免重复

  • 模型版本控制和实验跟踪:使用 MLflow 和 DVC 等工具跟踪模型变化

  • CI/CD for ML pipelines:使用 Jenkins、GitHub Actions 或 Kubeflow 自动化训练、测试和部署

  • 监控和日志记录:实时跟踪数据漂移、模型性能和系统健康

  • 模型重新训练和回滚:对于性能下降的模型,自动重新训练并具有回滚机制

采用 MLOps 最佳实践通过提高可重复性、可扩展性和可维护性来减少机器学习技术债务。

系统性反馈:机器学习系统中的持续学习

机器学习模型不是静态的工件;它们必须从现实世界反馈中持续学习以保持准确性和有效性。系统性的反馈循环通过以下方式帮助改进模型:

  • 在线和离线反馈循环

    • 离线反馈:使用新标记数据进行的定期批量更新

    • 在线反馈:从用户交互中实时学习,例如推荐系统中的 RL 更新

  • 实施反馈机制

    • 用户反馈:显式评分、参与度指标和 CTR

    • 领域特定反馈:专家注释和人工审查

    • 性能指标:监控精确度、召回率、AUC-ROC 和准确度变化

  • 反馈集成挑战

    • 反馈延迟:离线模型在更新方面存在延迟

    • 反馈数据的偏差:用户交互可能会加强现有偏差

    • 自动化风险:过度依赖未经验证的反馈可能导致漂移

一个健壮的反馈机制确保机器学习系统随着用户需求和业务目标的变化而发展。

数据漂移、模型漂移和监控策略

由于数据分布的变化和现实世界数据中演变模式的改变,机器学习模型会随时间退化。理解和缓解这些漂移对于维持模型性能至关重要:

  • 理解数据漂移:当输入特征随时间变化时,就会发生数据漂移,导致训练数据和生产数据之间的差异:

    • 数据漂移的类型

      • 特征漂移:单个特征分布的变化(例如,平均客户年龄随时间增加)

      • 概念漂移:输入和输出之间关系的变化(例如,在重大政策变更后欺诈检测模型失效)

      • 先验概率偏移:类别分布演变(例如,节假日欺诈交易的增加)

  • 理解模型漂移:当训练好的模型由于数据漂移或外部条件变化而导致性能下降时,就会发生模型漂移:

    • 模型漂移的主要原因

      • 用户行为的变化

      • 改变交互的新产品特性

      • 影响数据模式变化的监管变化

  • 检测和缓解漂移

    • 漂移检测指标

      • Kolmogorov-SmirnovKS)测试

      • 人口稳定性指数PSI

      • Jensen-Shannon 散度

    • 缓解策略

      • 在最近数据上的持续再训练

      • 老数据和新技术数据的动态加权

      • 模型集成方法以调整漂移特征

监控数据和模型漂移确保机器学习系统随时间保持稳健和相关性。

机器学习系统中的架构考量

构建可扩展的机器学习架构需要平衡灵活性、性能和运营效率:

  • 微服务与单体机器学习架构

    • 单体架构:集中的机器学习管道,易于开发但难以扩展

    • 微服务架构:模块化方法,允许独立扩展数据处理、模型推理和监控等组件

  • 基础设施选择

    • 云与本地:云平台如 AWS Sagemaker 和 Google Vertex AI 提供可扩展性,而本地解决方案提供更大的控制权

    • 容器化和编排:Docker 和 Kubernetes 使跨多个环境的可扩展部署成为可能

  • 实时与批量处理

    • 批量处理:适用于周期性模型再训练和评分

    • 实时推理:适用于欺诈检测和推荐系统等应用的低延迟推理

设计可扩展的机器学习架构确保高效的生产化和长期可维护性。

偏差识别和缓解

机器学习模型中的偏差可能导致不公平的结果、监管问题以及信任丧失。识别和缓解偏差对于负责任的 AI 部署至关重要:

  • 机器学习模型中的偏差类型

    • 采样偏差:训练数据中某些群体的代表性不足

    • 标签偏差:主观标签导致学习偏差

    • 自动化偏差:过度依赖算法决策而没有人类监督

    • 测量偏差:影响预测的不准确特征收集

  • 偏差检测技术

    • 差异影响分析:检查不同人口群体受到的影响

    • 反事实公平性测试:检查当敏感属性(例如,种族和性别)被改变时,模型决策是否会发生变化

    • 可解释性工具:SHAP 和 LIME 帮助解释模型决策

  • 偏差缓解策略

    • 重新平衡训练数据:确保多样化的代表性

    • 公平性约束:结合公平性感知算法,如对抗性去偏

    • 后处理调整:校准模型输出以减少差异

缓解偏差对于道德人工智能和遵守公平性法规至关重要。

注意

建立机器学习系统的强大运营基础需要实施 MLOps 最佳实践,整合系统反馈,监控漂移,设计可扩展的架构,并缓解偏差。通过遵循 MLOps 框架中概述的结构化方法,组织可以构建弹性、可扩展且值得信赖的机器学习解决方案。通过自动化、持续监控和公平措施解决隐藏的技术债务,确保人工智能驱动应用程序的长期可持续性和运营卓越。

随着我们完成对 MLOps 和部署策略的探索,同样重要的是展望未来,关注正在塑造人工智能/机器学习系统下一阶段的挑战和创新,尤其是那些为现实世界、资源受限环境设计的系统。

机器学习系统接下来是什么?

在将人工智能/机器学习模型应用于商业成功的过程中,一个关键挑战是确保模型能够很好地集成到它们设计的支持的应用环境中。仅仅在开发或云环境中拥有高性能的模型是不够的。模型需要在现实世界的场景中高效部署,在这些场景中,必须解决诸如计算资源、网络可用性和隐私问题等限制。

在许多情况下,企业在生产环境中可能无法访问与模型开发期间相同的基础设施。例如,在偏远地区运营的组织,如物流或农业部门,可能并不总是有可靠的云访问或高性能计算基础设施。这要求人工智能/机器学习模型轻量级,能够在计算能力有限的边缘设备上运行。同样,模型可能需要在没有持续 Wi-Fi 或云服务访问的情况下运行,这进一步复杂化了它们的部署。

减少模型大小:扩散技术用于小型设备

人工智能/机器学习模型,尤其是深度学习模型,以其大型规模和计算需求而闻名。模型扩散技术旨在在保持其准确预测能力的同时,减小这些模型的大小。为此目的,最常用的技术包括以下几项:

  • 模型剪枝:这项技术涉及从模型中移除不太重要的参数,在保持性能的同时减小其大小。剪枝可以在训练期间或模型训练完成后进行。

  • 量化:在量化过程中,模型参数的精度会降低。例如,可以使用 8 位整数来代替使用 32 位浮点数表示权重。这种精度降低有助于减小模型的大小和计算需求,使其能够在性能较弱的机器上运行。

  • 知识蒸馏:这项技术涉及训练一个较小的“学生”模型来模仿较大的“教师”模型的行为。学生模型更轻便,更适合在边缘设备上部署,但仍然捕捉到教师模型学习到的重要模式。

这些方法允许企业在内存、处理能力和网络连接有限的设备上部署人工智能/机器学习模型,确保运营过程不受硬件限制的阻碍。

联邦学习:确保数据隐私和高效学习

在将人工智能/机器学习模型投入运营时,另一个关键考虑因素是数据隐私和最小化数据传输。传统的机器学习方法通常依赖于从各种来源收集数据,将其集中,然后在集中数据集上训练模型。然而,在隐私法规(例如,GDPR)或网络限制阻止大规模数据传输的场景中,这种方法可能不可行。

联邦学习FL)为这一挑战提供了一个有希望的解决方案。在 FL 中,模型在多个设备或服务器(称为“客户端”)上训练,每个客户端都持有本地数据样本。而不是将数据传输到集中服务器,每个客户端使用其数据训练模型的一个本地版本,并且仅与中央服务器共享学习到的参数(如模型权重)。服务器从所有客户端汇总这些更新以创建全局模型。这允许以分布式方式发生学习,确保以下方面:

  • 数据隐私:敏感数据保留在本地设备上,不进行传输,从而降低隐私泄露的风险。仅共享模型更新(而非原始数据),这有助于保持隐私合规性。

  • 最小数据传输:由于客户端和服务器之间仅交换模型参数,这种方法显著减少了需要传输的数据量,使得联邦学习(FL)更适合网络带宽有限或连接断断续续的环境。

  • 高效学习:尽管 FL 具有去中心化的特性,但汇总的模型通常与在集中收集的数据上训练的模型表现相当,甚至更好。这是因为 FL 通过利用更多样化的数据源而受益,这可以提高在各种环境中的泛化能力。

例如,在医疗保健行业,联邦学习可用于构建患者诊断的预测模型,而无需医院共享敏感的患者数据。每家医院都可以使用其内部数据本地训练模型,并将更新共享以提高全局模型,同时不违反隐私法规。

优化资源受限环境

在业务在计算资源低或连接性有限的环境中运营(如偏远行业、农村医疗保健或由物联网驱动的供应链)的情况下,AI/ML 模型需要优化以在这样环境中高效运行。这可以通过以下组合方法实现:

  • 边缘计算:在边缘设备(如手机、传感器或物联网设备)上部署模型确保推理可以在本地进行,而无需将数据发送回云端。这减少了延迟并降低了持续连接的依赖性。

  • 设备端学习:在某些情况下,模型需要在设备本身实时学习和适应,尤其是在数据模式快速变化的环境中。可以采用边缘学习算法在设备上微调模型,而无需访问集中式数据或训练资源。

  • 压缩算法:如模型压缩、参数共享和低秩矩阵分解等技术,允许模型在资源受限的环境中适应,而不会在精度上造成重大损失。

通过确保 AI/ML 模型即使在资源受限的环境中也能有效运行,企业可以扩大其 AI 解决方案的覆盖范围,并确保在各种运营环境中无缝采用。

注意

这最后一章深入探讨了机器学习的未来,重点关注通过新兴趋势解决当前挑战。它探讨了针对效率的创新,例如用于小型设备的扩散技术、模型剪枝、量化以及知识蒸馏,以及隐私保护协同学习的进步,例如联邦学习。为了跟上这些快速发展的技术,您应积极关注领先的 AI 研究会议(例如 NeurIPS、ICML 和 ICLR),阅读信誉良好的 AI/ML 期刊和博客,参与在线课程和社区,并参与行业报告和开源项目。

摘要

本章探讨了成功实施 AI/ML 系统所需的基础要素。它首先强调了明确定义成功指标的重要性,区分了短期指标,如准确率或点击率,以及长期目标,如客户保留或业务影响。接着,它探讨了传统的 SDLC 与传统 ML 工作流程的不同之处,以及如何通过重新思考数据、实验和部署时间表来使两者保持一致。讨论随后转向基础设施和架构选择,包括云、本地和边缘环境,以及支持可扩展模型部署所需的工具。关键考虑因素包括模型服务策略、集成到应用环境以及利用 MLOps 来管理生命周期复杂性。本章还深入探讨了持续学习和适应的机制,介绍了来自用户行为、环境和指标的反馈循环,以及 A/B 测试、因果建模和奖励塑造等技术。

最后,本章展望了在受限或去中心化环境中运行的 ML 系统的演变需求。它强调了通过模型压缩、扩散和蒸馏实现轻量级部署,以及使用联邦方法进行隐私保护学习。这些见解共同提供了一个前瞻性的视角,以构建具有弹性、可扩展性和适应性的 ML 系统,这些系统能够在多样化的业务环境和基础设施现实中保持有效性。

在我们过渡到下一章时,我们将通过探讨组织如何严格评估由 AI 驱动的决策和模型干预来在此基础上构建。接下来的讨论将重点从运营准备就绪转向经验验证,涵盖实验设计、因果推理和以指标驱动的评估框架,这些框架不仅确保模型在生产中表现良好,而且确保它们产生可衡量的、值得信赖的影响。

|

获取本书的 PDF 版本和独家额外内容

扫描二维码(或访问packtpub.com/unlock)。通过名称搜索本书,确认版本,然后按照页面上的步骤操作。 | imgimg |

| 注意:请妥善保管您的发票。直接从 Packt 购买不需要发票。 |

| --- |

第八章:从指标到测量:实验和因果推断

在前两章中,我们建立了衡量“什么”的基础框架,并探讨了如何构建和运营交付我们产品的机器学习系统。现在,我们应该弥合部署和价值之间的差距。本章解决了任何业务中最关键的问题:“机器学习系统是否做到了它打算做的事情?”

回答这个问题是因果推断的科学。它是一套工具,使我们能够超越简单的相关性(“我们在推出信用卡功能后,电子商务销售额上升了”)到因果关系(“我们的电子商务销售额上升是因为我们推出了信用卡功能”)。

没有严格的测量,无法确定变化是否导致了有意义的改进,或者仅仅是随机机会或其他外部因素的结果。本章探讨了三种测量方法的家庭:黄金标准的随机对照试验、当实验不可行时使用的巧妙观察方法,以及处理复杂、高维数据的新的、强大的高级机器学习模型。

以下关键主题将涵盖:

  • 随机对照试验 - 具有局限性的黄金标准

  • 为什么我们不能仅仅使用机器学习?

  • 观察方法 - 统计方法

  • 观察方法 - 用于因果推断的高级机器学习模型

随机对照试验 - 具有局限性的黄金标准

随机对照试验RCTs),也称为 A/B 测试,被认为是通过随机分配用户到控制组和处理组来衡量干预措施影响的黄金标准。

什么是 A/B 测试?

A/B 测试,或 RCT,是一种实验,其中客户群体被随机分成两个或多个组:一个控制组(A 组)接受现有的体验,一个或多个处理组(B 组、C 组等)接受该体验的新版本(例如,新功能、不同的机器学习模型或新的用户界面)。

为什么 A/B 测试很重要?它是衡量影响的黄金标准。通过随机化,我们确保组间唯一的系统性差异是我们引入的变化。这消除了选择偏差和其他混杂因素,使我们能够自信地声明,任何观察到的指标差异都是我们变化的结果。

其关键好处包括因果影响的直接、无偏测量。

这里有一些基本要点需要注意:

  • 控制组与处理组:控制是基线;处理是变化。这两个组之间的比较是我们想要衡量的核心思想。

  • 基于假设的测试:每个测试都必须从明确的假设开始。例如:“我们相信,在商品页面用户群体旅程中引入个性化 ML 模型(变化)将增加移动新用户的添加到购物车率(指标),因为它通过个性化定位提高了购买相关性*(理由)。”

  • 指标和 KPI 选择:你必须定义你的指标在测试之前

    • 主要/目标指标:将决定测试是否成功的单一指标(例如,转化率)。

    • 次要/目标指标:你期望提高的其他指标(例如,平均订单价值)。

    • 警戒指标:你不得损害的指标(例如,页面加载时间应用卸载)。

  • 样本大小和统计显著性:我们应该决定所需的样本大小。这取决于你的基线指标,你关心的最小可检测效应MDE)(例如,“我只希望如果它能至少提高转化率 1%,我才启动这个项目”),以及你想要的统计显著性(p 值)和统计功效水平。

  • 随机化和偏差减少:随机分配(“随机化器”)是最关键的组成部分。它必须确保每个用户都有平等的机会被分配到任何一组,并且分配是独立和无偏的。

这是你应该设计 A/B 测试的方式:

  • 定义目标:你正在解决什么业务问题?

  • 选择正确的变体:这将是一个 A/B 测试(一个控制组,一个处理组)还是一个 A/B/n 测试(例如,测试红色、绿色和蓝色按钮与原始按钮)?

  • 确定样本大小和功效分析:一个功效不足(样本大小)的测试,即使功能确实更好,也可能得出结论不明确。这是一个常见且浪费的错误。

  • 确定合格/触发人群:谁应该在这个实验中?所有人?还是,只有看到该功能的用户(例如,只有滚动到页面底部的用户才能看到新的页脚)?定义这个“触发器”对于分析至关重要。

  • 实验持续时间:你必须运行多长时间才能获得所需的样本大小?这通常是速度和信心之间的权衡。你还必须运行足够长的时间来捕捉自然每周变化(例如,用户在周末的行为不同)。

运行 A/B 测试包括以下内容:

  • 实施最佳实践:确保测试运行干净。代码中的错误如果只影响处理组或对照组,将使你的结果无效。

  • 确保数据完整性:监控数据管道以确保你正确地为所有组记录事件。

  • 污染:警惕用户“污染”其他组。例如包括网络效应(一个组中的功能使产品对所有用户都更好)或使用多个设备的用户(在手机上看到控制组,在笔记本电脑上看到处理组)。

  • 样本比例不匹配(SRM):一个关键的健康检查。如果你将测试设置为 50/50,但你的数据显示为 52/48 的分割,这表明你的随机化或记录中存在错误,你的结果不可信。

  • 常见陷阱:过早查看结果(使频率派测试无效),一次性运行太多变体,或者当测试变得具有显著性时立即结束测试(p-hacking)。遵守你为运行测试分配的时间,以避免常见的失败。

要选择正确的统计测试,你使用的特定数学测试来计算 p 值和置信区间完全取决于你正在测量的指标类型。

以下流程图提供了一个决策框架:

img

图 8.1:一个流程图,帮助选择统计测试

这是如何解释 A/B 测试的:

  • 确定你的数据类型:

    • 分类:你的指标是一个比例或比率吗(例如,点击率,转化率,“用户是否转化:是/否”)?如果是,你比较比例。对此常见的测试是比例的 Z 检验或卡方检验。

    • 数值:你的指标是一个连续的或离散的数字吗(例如,平均每位用户的收入,会话持续时间,购买的商品数量)?如果是,请进行下一步。

  • 确定你的组织结构(分组):

    • 两组:这是标准的 A/B 测试(控制组与处理组)。

    • 超过两组:这是 A/B/n 测试(例如,控制组与处理组 A 与处理组 B)。

  • 假设数据分布:

    • 参数(假设正态分布):如果你的数值数据是正态分布的(如钟形曲线),你可以使用参数测试。对于两组,这是 t 检验。对于超过两组,这是方差分析分析方差)。

    • 非参数(不做假设):网页和商业数据通常不是正态分布的;它们通常是偏斜的(例如,一些“鲸鱼”用户花费很多,而大多数人花费很少)。对于这种偏斜数据,非参数测试更安全且更稳健。对于两组,使用曼-惠特尼 U 检验。对于超过两组,使用克鲁斯卡尔-沃利斯检验。

  • 提升测量:

    • 绝对提升:(处理指标 - 控制指标)。例如:2.2% - 2.0% = 0.2%。

    • 相对提升:(绝对提升 / 控制指标)。例如:0.2% / 2.0% = 10%。

  • 何时进行测试:你应该在预定的持续时间或样本量满足时进行测试,而不是当它首次变得具有显著性时(除非你在进行顺序测试或多臂老丨虎丨机测试)。

这是你应该如何解释和采取行动的结果:

  • 如何做出数据驱动的决策:首先,所有结果都是有用的,尤其是负面的结果。了解什么不起作用和了解什么起作用一样有用。如果结果是正面的且具有显著性,就推出它。如果结果是负面的,记住它。

  • What to do when results are inconclusive:一个“平坦”或非显著的结果是一个学习机会。这正是分割或队列分析至关重要的地方。整体平坦的结果是否隐藏了该功能对 iOS 用户有害但对 Android 用户有益?它是否适用于新用户但不适用于回头客?深入挖掘队列可以发现这些隐藏的见解,并导致部分发布或新迭代。

  • Documenting learnings:同样,每次测试,无论输赢,都会让你学到一些东西。将它们记录在中央存储库中,以构建机构知识。

接下来是一些需要注意的先进主题:

  • Bayesian versus frequentist approaches

    • Frequentist (traditional):这种方法之前已经描述过。它是严格的,需要固定的样本量,并回答:“在没有效果的情况下,这些数据的概率是多少?”

    • Bayesian:这是一个更直观的方法,它回答了直接的商业问题:“B 比 A 更好的概率是多少?”它提供“改善概率”,是灵活的(你可以“窥视”并在任何时间停止测试),并且通常更容易沟通。

  • Personalization and segmentation:在队列分析中,有一个想法是超越“一刀切”的发布,为从最大受益的用户细分市场发布功能。这通常是这种情况;不是所有模型都适用于所有客户队列。了解模型在哪里有效以及在哪里无效,可以为数据科学团队提供见解,以增强功能或模型。

多臂老丨虎丨机优化方法

A/B 测试非常适合找到单个“胜者”,但它们伴随着“遗憾”成本,因为一半的用户在整个测试期间都困在(可能更差的)对照组中。多臂老丨虎丨机MAB)方法通过平衡探索(尝试所有变体)与利用(将更多流量发送到当前胜者)来解决这个问题。

How it works

MABs 动态地将更多流量分配给表现最佳的“臂”(变体),从而降低实验成本并最大化测试期间的指标。

Example

Optimizing LLM-generated creatives:想象一下,你使用 LLM 为新的活动生成 20 个不同的广告标题。运行包含 20 个变体的传统 A/B 测试会非常缓慢,并且会让用户接触到许多糟糕的标题。这是一个 MAB 的完美用例。MAB 系统会执行以下操作:

  • Explore:最初,它向一小部分用户展示所有 20 个标题,数量相等。

  • Exploit:在收集点击数据的过程中,它迅速识别出表现最佳的 3-4 个标题。

  • Optimize:它自动开始将大部分流量发送到这些“胜者”,同时仍然分配一小部分流量到其他变体,以防万一其中一个开始表现更好。这种方法可以更快地找到最佳创意,并减少损失的收入。

问题是,在 MAB 中老丨虎丨机是如何决定的。MAB 系统需要一种方法来决定如何平衡探索与利用已知的赢家。这就是特定算法发挥作用的地方。两种最受欢迎且最有效的策略是上置信界UCB)和汤普森抽样。

  • 上置信界(UCB):这个算法是“乐观的”,来源于频率学派的思想。对于每个变体(或“臂”),它计算当前的平均性能加上一个“不确定性奖金”。

    • 对于数据非常少的变体,这个奖金很大(不确定性高)。

    • 对于已经大量测试的变体,这个奖金很小(不确定性低)。

    • 接下来,老丨虎丨机总是选择得分最高的臂(性能 + 奖金)。这种策略有效地迫使系统尝试那些测试较少的标题,以防它们是隐藏的宝石,同时仍然青睐已证明的赢家。

  • 汤普森抽样:这来自贝叶斯学派的思想或“概率”方法,在实践中通常表现优异。它不仅仅跟踪一个数字(如平均点击率),而是为每个臂的性能维护一个完整的概率分布(一系列可能的值)。

    • 一个新的、未经测试的标题有非常广泛的分布(例如,“其真正的点击率可能在 1%到 10%之间”)。

    • 一个经过充分测试的赢家有非常狭窄的分布(例如,“我 99%确信其比率在 4.9%到 5.1%之间”)。

    • 为了做出选择,算法从每个臂的分布中随机抽取一个样本,并简单地选择在这一轮中产生最高样本的臂。这自然给已证明的赢家更多的流量,同时确保不确定(但可能很出色)的选项仍有机会被选中并证明其价值。

到目前为止,我们已经探索了随机对照试验、即 A/B 测试和 MABs 等方法,这些都属于主动实验的范畴。它们的强大之处在于一个关键能力:我们能够控制分配并随机化用户看到哪个变体。这种随机化是“金标准”,因为它确保了,在平均意义上,被比较的组在各个方面都相似,除了我们正在测试的变化。

但当你无法运行实验时会发生什么呢?

  • 如果数据已经收集了呢?

  • 如果在技术上不可能或成本过高,无法将用户随机分配到对照组,会发生什么?

  • 如果拒绝一个群体使用新功能(如关键的安全补丁)是不道德的或代价高昂的,会发生什么?

我们经常拥有大量的观察数据。我们可以看到发生了什么;例如,哪些用户自然决定使用新功能,哪些没有,但我们不能确定地说他们的结果为什么不同,或者结果是否是用户选择该功能的真实反映。

这就是观察性因果推断的基本挑战:将相关性从因果关系中分离出来。在观察数据中,我们想要比较的群体几乎从不相同。选择采用新功能的用户可能更投入,iPhone 用户可能更懂技术,或者比那些没有采用的人更熟悉这个平台。是功能使他们更投入,还是他们一开始就更有投入?

这就是为什么一套新的准实验方法工具包变得至关重要。以下几节将介绍旨在通过智能地考虑这些潜在差异并隔离特征的真实因果影响的强大技术。我们将从“发生了什么?”转移到“本可能发生什么?”

我们为什么不能直接使用机器学习?

现在我们知道我们不能仅仅通过实验来模拟历史干预。我们不能随机分配一些用户去“获得贷款”,而其他人则不。在这种情况下,我们依赖于准实验方法进行测量,这些方法使用统计技术使用历史数据来近似实验。

但我们能否在这里使用函数逼近机器学习?不幸的是,答案是不了,解释有点复杂。让我们通过以下图示来了解预测模型在最基本层面上做什么:

img

图 8.2:预测模型执行函数逼近,将 X 映射到 y

前面的图示解释了典型的机器学习模型主要负责对给定特征集 X 进行函数逼近,X 试图预测结果 y。

这是一个关键的区别。标准的预测模型是为了回答,“会发生什么?”

示例: “谁最有可能在试用会员后注册为付费客户?”

在这个模型中,所有输入,用户特征(x1, x2...)和任何治疗(T),都被视为特征包。该模型擅长发现相关性并做出准确的预测,但它从根本上混淆了相关性和因果关系。它无法告诉你试验折扣是否导致了转化,或者获得折扣的用户是否仅仅因为在线更投入而一开始就更有投入。

另一方面,因果模型是为了回答一个完全不同的问题而构建的:“如果我们做些什么?如果这件事发生了,会发生什么反事实情况?”以下图示说明了这一概念:

img

图 8.3:因果模型探索“如果”场景,检查干预措施的反事实结果

示例: “给予 10%折扣对会员注册率的影响是什么?”

为了回答这个问题,治疗(T),即图中描述为“T”的“折扣”,不能再仅仅是一个特征。它必须被视为“一等公民”。整个模型的目标从预测结果转变为隔离 T 对那个结果的精确、独立的影响。

如果我们在这里应用机器学习进行函数逼近,它不会将“折扣”视为一等公民,并认为所有特征都是相同的,这会削弱整个隔离治疗对结果影响的整个目标。

那么,因果模型需要什么(除了数据之外)?以下图示显示了答案:

img

图 8.4:因果建模超越了函数拟合,需要数据加上因果假设(Z)

这种转变意味着因果模型需要的不仅仅是函数逼近,我们可以从模型.model.fit(X, y)拟合中获得。正如前面的图示所示,模型需要数据和明确的“Z”因素。这个“Z”代表我们的因果假设,即我们对系统如何工作的理解。

现在,让我们回顾一下在运行此因果模型之前我们需要的所有内容。我们必须定义以下内容:

  1. 因果问题:治疗(T)是什么,结果(y)是什么?

  2. 混杂因素:哪些其他变量(x)同时影响治疗和结果?例如,用户的“参与度”可能影响他们是否获得折扣(T)以及他们是否注册付费会员(y)。我们必须明确识别并控制这些。

  3. 因果结构:我们相信什么导致什么?这通常在分析开始之前在图中绘制出来。

这些假设是设计的“准实验”部分。我们正在使用我们的知识来构建一个结构,试图从从未进行过实验的数据中统计“设计”一个实验。

“Z”在这里是什么?我们对系统的理解超越了数据。这种理解决定了我们想要实验的方法:

  • 如果理解是网络,什么导致什么,那么我们可以尝试的方法是贝叶斯网络

  • 如果理解与混杂因素(混杂因素被定义为同时影响治疗(分配)和结果的因素)是通用的,那么我们可以尝试的方法是 DoWhy + EconML

  • 如果理解是先验信念,那么我们可以尝试的方法是贝叶斯过滤器

这种对显式结构的需求导致了两大类因果方法的产生。我们将从探索基础观察性方法开始,其中许多方法起源于计量经济学。这些技术使用巧妙的“设计”来隔离因果效应。之后,我们将介绍利用机器学习处理复杂、高维数据并找到个性化因果效应的新一代高级 ML 模型。

观察性方法 - 统计方法

目标是隔离处理(例如,折扣)对结果(例如,付费注册)的影响。这些统计方法通常分为两类:创建可比组的匹配方法(如 PSM、合成控制和 DiD)和利用特定数据结构来估计效应的建模方法(如 RDD 和 IV)。

  • 倾向得分匹配(PSM):试图从观察数据中创建一个“控制组”。它计算任何给定个体接受“处理”的概率(倾向得分),然后匹配具有相似倾向得分的处理和未处理个体。

  • 合成控制匹配:通过找到一个非处理单位的加权组合(例如,其他城市)来创建一个“合成”控制组,该组合最好地匹配处理单位(例如,你启动新广告活动的城市)的预处理趋势。

  • 双重差分(DiD):当您有来自干预前后的处理组和未处理组的数据时使用的一种强大技术。它从控制组的干预前到干预后的变化中减去处理组的干预前到干预后的变化,从而隔离处理效应从潜在趋势中。

  • 回归断点设计(RDD):当根据锐利截止点分配处理时使用(例如,分数超过 80 的学生获得奖学金)。通过比较刚好高于和刚好低于该截止点的个人的结果,我们可以估计奖学金的因果影响。

  • 工具变量(IV):一种复杂但强大的方法,它找到一个与处理变量相关但与结果变量不相关(除了通过处理)的第三变量(即“工具变量”)。这有助于从混杂变量中隔离真正的因果效应。

这些经典方法非常强大,但通常依赖于特定的数据结构(例如 RDD 的锐利截止点)并且可能难以处理高维或非线性数据。接下来,我们将看到机器学习的原理如何与这些因果目标相结合,以创建更加灵活和强大的模型。

观察性方法 - 高级机器学习方法

一类新的方法使用现代机器学习来处理因果问题的多维和非线性特性,特别是对于个性化。

  • 因果树和森林:这些是针对因果推断而改编的(随机)森林。它们将数据分区以找到处理效应差异最显著的子组,有助于揭示异质(不均匀)效应。

  • 双重机器学习(DML):使用两个机器学习模型,一个用于预测结果,一个用于预测处理,然后在最终估计步骤中使用两个模型的残差(误差)。这是一种控制许多混杂变量的稳健方法。

  • 提升建模:这是实现真正个性化的关键。而不是对结果进行建模(例如,“这个用户会转化吗?”),提升模型直接对治疗效果本身进行建模(例如,“如果我向他们展示这个广告,这个用户转化的额外概率是多少?”)。这允许你只针对“可说服的”用户,避免在那些无论如何都会转化(“确定的事情”)或永远不会转化(“无望的事情”)的用户上浪费资源。

  • 贝叶斯结构时间序列(BSTS):谷歌推广的一种用于时间序列数据的方法。它构建了一个模型,在没有干预的情况下,一个指标(例如,加利福尼亚的销售)会发生什么,然后将这个“合成”预测与实际发生的情况进行比较。

  • 因果深度学习(用于因果推断的神经网络):一个新兴领域,利用神经网络的力量来模拟复杂的因果关系,特别是在具有非结构化特征的数据(如图像或文本)中。

我们刚刚讨论的因果方法对于从历史数据中学习和理解复杂、假设性的问题非常强大。它们擅长事后分析,从而回顾过去理解什么有效以及为什么有效。现在,让我们将我们的关注点从离线分析转移到在线优化。当我们进行实时实验时,我们的目标不仅仅是学习,而是尽可能快地学习和实时调整我们的决策。

下几节将探讨针对这一特定挑战的先进方法。我们首先将研究顺序 A/B 测试,以提高实验效率,然后深入探讨强化学习作为连续、自动化决策的强大框架,这是投币问题的复杂演变。

顺序 A/B 测试及其相对于 RCTs 的优势

传统的 A/B 测试在分析之前需要固定的样本量,如果某个变体一开始就明显优于其他,这会导致时间和资源的浪费。顺序 A/B 测试通过允许持续评估来提高效率。

为什么选择顺序 A/B 测试?

  1. 早期停止:如果一个新功能明显优于其他,测试可以提前终止,节省资源。

  2. 降低样本需求:通过在结果明确时提前停止测试,所需的样本量减少。

  3. 更高效的实验:不必等待整个测试周期结束,决策可以动态进行。

示例:顺序 A/B 测试与 A-B-C 测试

考虑一家公司正在测试着陆页的三个变体(A、B 和 C)。A-B-C 测试需要在得出结论之前收集所有三个变体的足够数据。顺序方法(例如,先进行 A-B 测试,然后测试最佳变体与 C)确保了显著的样本量和更快的迭代。

有趣的观点:强化学习与模型预测控制

强化学习RL)和模型预测控制MPC)都侧重于自适应学习,但在方法上有所不同。

强化学习(RL)是一种通过与环境交互、接收奖励并在时间上更新其策略来学习的代理方法。

关键特性包括以下内容:

  • 通过尝试错误学习最佳策略。

  • 根据观察到的奖励更新策略。

  • 随时间自适应地优化策略。

示例:一个推荐系统根据持续的用户反馈改进其个性化。

模型预测控制(MPC)是一种控制方法,它预测未来的系统状态并相应地优化决策。

关键特性包括以下内容:

  • 使用系统模型来预测结果。

  • 在滚动时域内优化行动。

  • 比纯强化学习更稳定,但需要领域知识。

示例:一辆自动驾驶汽车根据预测的交通流量调整加速和制动,而不是仅仅从经验中学习。

这两个之间的关键区别如下:

| 特征 | 强化学习(RL) | 模型预测控制(MPC) |

| --- | --- | --- |

| 适应方法 | 尝试错误 | 预测优化 |

| 使用先前数据 | 有限 | 强烈依赖模型 |

| 稳定性 | 可能会经历不稳定性 | 更稳定的控制 |

为什么选择其中一个而不是另一个?

  • 当环境不确定且长期学习有益时,使用强化学习(RL)。

  • 当存在良好的系统模型且稳定性至关重要时,使用模型预测控制(MPC)。

    注意

    测量技术对于评估机器学习模型、指导优化策略和确保业务影响至关重要。随机对照试验仍然是一种基础方法,但在某些情况下存在局限性,需要因果推断方法。多臂老丨虎丨机提供实时优化,尤其是在搜索引擎等动态环境中。顺序 A/B 测试通过动态调整样本大小和提前停止测试来提高效率。最后,强化学习和模型预测控制提供了适应学习的不同方法,每种方法都有其特定的优势。通过选择适当的测量和适应技术,组织可以实现稳健、数据驱动的决策过程,从而推动持续改进。

概述

本章提供了因果推断的全面指南,这是证明 ML 系统导致特定业务结果的必要科学,使我们超越了简单的相关性。这是关键的第三步,直接建立在我们的先前工作之上,即定义指标(第六章)和实施模型(第七章)。

我们从“黄金标准”的实验方法开始,重点放在 A/B 测试(RCTs)上。我们探索了其整个生命周期,从定义一个坚实的假设和选择指标的基础,到执行的实际问题,如计算样本量和密切监控如样本比例不匹配SRM)等陷阱。我们看到了如何选择正确的统计测试,如何通过队列分析揭示隐藏的见解,并对比了频率主义和贝叶斯测试哲学。我们还探索了更有效的方法,如用于早期停止的顺序 A/B 测试和多臂老丨虎丨机MABs),这对于动态测试许多变体是完美的。

从那里,我们转向了观察方法,这是在随机实验不可能进行时的工具箱,我们看到技术如差异-差异法DiD)和倾向得分匹配PSM)如何从统计上近似一个对照组。然后,我们探索了高级机器学习模型的新前沿,例如提升模型,它使我们从衡量平均效果转向个性化干预。最后,我们对比了强化学习RL)和模型预测控制MPC)的适应性学习方法。

在建立了这些用于衡量影响做出数据驱动决策的严格框架后,我们现在可以评估下一波主要的技术变革。我们刚刚学到的工具,A/B 测试、MABs 和因果推断,正是企业需要来验证我们这个时代最具变革性技术——生成式人工智能的价值。在下一章中,我们将探索这个新领域,研究生成式人工智能如何重塑商业,作为决策的副驾驶,并创造全新的创新机会。

订阅免费电子书

新框架、演进的架构、研究更新、生产分解——AI_Distilled将噪音过滤成每周简报,供工程师和研究人员使用,他们亲手与大型语言模型和通用人工智能系统合作。现在订阅,即可获得免费电子书,以及每周的洞察力,帮助您保持专注并获取信息。

packt.link/8Oz6Y订阅或扫描下面的二维码。

白色背景上的二维码 AI 生成的内容可能不正确

第四部分

新兴主题:生成式 AI 和 AI 代理

在本书的第四部分,我们将探讨正在改变企业的 AI 技术的新前沿。我们将首先用易于理解的语言解释生成式 AI 和大型语言模型LLMs),涵盖从市场营销和客户服务到代码生成等各个功能的关键用例,以及实际采用考虑。随后,我们将定义 LLMOps 并详细说明它是如何扩展传统的 MLOps 以处理 LLMs 独特的运营生命周期,包括提示编排、微调和专门的监控。最后,我们将探索 AI 代理的新兴世界,讨论它们是什么,它们自动化复杂多步任务的可能性,以及构建和治理这些自主系统的框架。

本部分包含以下章节:

  • 第九章企业中的生成式 AI:开启新机遇

  • 第十章理解生成式 AI 操作

  • 第十一章AI 代理解析

第九章:企业中的生成式人工智能:开启新机遇

ChatGPT 的兴起对我们所有人来说都是变革性的,以各种方式影响我们的生活。虽然生成式人工智能GenAI)在过去存在并被广泛用于合成数据生成等应用,但这次情况不同。ChatGPT 为我们提供了一个直观的用户界面来与这些高级模型交互,彻底改变了我们搜索信息的方式,并提供了轻松学习和检索知识的方法。生成式人工智能通过重塑我们的工作、决策和创新方式,已被证明是变革性的。

它通过使信息检索比以往任何时候都更容易,同时自动化常规任务,如撰写电子邮件和创建摘要,从而提高了生产力。

除了提高生产力之外,它还通过作为可靠的副驾驶来加强决策,帮助个人产生新想法,发现洞察力,并识别推动更快、更明智选择的模式。

在企业方面,多个流程,如客户互动、新员工入职和品牌策略,正在使用生成式人工智能进行转型。技术也被用于创建智能应用程序,这些应用程序能够实现自然语言交互、个性化体验和快速交付新功能。

考虑到所有这些,我们在本章中探讨以下关键主题:

  • 何时考虑生成式人工智能

  • 何时不考虑生成式人工智能

  • 构建生成式人工智能解决方案的最佳实践

在我们开始之前,这里有一些重要的定义和免责声明:

  • 生成式人工智能是人工智能的一个领域,专注于以文本、图像和其他媒体形式生成新数据。

  • 大型语言模型LLMs)是高级机器学习模型,旨在理解和生成人类语言。它们在大量文本数据上进行了训练。它们基于转换器架构。

  • 转换器使用一种称为自注意力的机制来关注输入文本的不同部分,这使得模型能够理解上下文和词语之间的关系。这种架构使得 LLMs 能够比之前的模型更有效地处理更长的文本序列。

  • 在 LLMs 的上下文中,如果您使用小型或中型模型用于企业应用,解决方案系统是同义词。

我们正在介绍最常见的使用案例,所以我们可能错过一些您组织特有的案例。

何时考虑生成式人工智能

评估潜在的生成式人工智能用例具有挑战性。我们有一种使用生成式人工智能解决一切问题的冲动,但显然这是不可能的。我们一直在研究多个框架来决定有意义的生成式人工智能用例。我们将用例分为理解和生成应用,如下所示:

  • 理解应用涵盖涉及情感分析、关系提取、意图分类、摘要等任务。这些任务的重点领域是解释、组织和标记数据。

  • 在企业环境中,生成式应用更为普遍,涉及生成新的工件,如文本或图像。通过正确的提示和微调,LLMs 可以通过新的代码、图像、文本等方式产生所需输出。

在下一节中,我们将列出一些用例。

GenAI 用例

让我们探索一些用例,以了解前面的分类:

  • 五星客户参与度:想象一下这个场景:你试图通过聊天机器人预订航班,但聊天机器人不断误解你的信息。这不会让你烦恼吗?你不会尽快尝试和人交谈吗?我知道我会!如果这种情况发生在所有客户身上,公司可能需要雇佣多个人类客户服务代表,甚至可能失去一些客户。

此外,还有可能一些代表可能不如其他人经验丰富,可能不知道所有问题的答案。为了到达这些边缘情况,他们可能需要向他们的主管求助,然后主管需要离开手头的任务来回答客户迫切的问题。这在大多数呼叫中心是一个常见的场景。如果我们仔细观察,这种运营模式存在多个问题:

  • 与雇佣不同代表和几位主管相关的更高成本

  • 信息并没有实现民主化,这意味着一些代表可能比其他人知道得多,从而导致客户体验不统一

  • 在节假日或繁忙季节,客户的等待时间更长,会导致混乱和客户满意度下降

现在想象一个你不知道你是在和人类还是人工智能交谈的世界,你的问题将在几秒钟内得到回答,而不需要“人类”介入。这就是世界级客户服务的定义。随着大型语言模型的出现,这是可以实现的。复杂的技术允许你构建能够准确解释人类文本并在几秒钟内提供预期响应的聊天机器人。除此之外,大型语言模型还可以提供多语言支持。

基于人工智能的解决方案可以减少客户服务代表的交通量,这样他们就可以将 100%的注意力集中在只有少数几个有复杂问题或情况的客户身上。为了在您的组织中实现这一点,以下是一些您可以今天开始做的事情:

  • LLM 系统与其底层数据一样好。构建一个健壮的聊天机器人意味着在准确和可靠的内部文档上进行训练,以获得投资的好处。如果你计划在 2026 年部署聊天机器人,那么在 2025 年,数据策略必须是首要任务。这应该包括但不限于 FAQ 文档、边缘情况、更新的政策信息和价格。

  • 当部署基于 LLM 的客户体验解决方案时,最好在全面部署解决方案之前对少数客户进行详细测试。这意味着从少数客户开始,通过客户调查或雇佣人工参与监控这些对话来分析他们的体验。这将帮助您识别差距并加以改进。这应该与 LLM 作为评判机制相结合,以确保您有包括人工参与以及 LLM 作为评判者的稳健评估。

  • 除了响应的准确性,还必须监控您的 LLM 解决方案对恶意行为者的反应,例如,试图获取用户的信用卡信息或使用不恰当的词语。监控边缘场景的响应将帮助您调整系统以屏蔽此类内容,并确保无缝的客户体验。

  • 基于 AI 的 LLM 解决方案在第一天不能取代所有的客户服务代表。将 AI 解决方案视为前几个月或几年的员工补充。例如,当您开始时,AI 解决方案可能只能将流量减少 3 到 5%,但随着 AI 的持续反馈变得更加智能,这个比例将会增加,您将体验到生产力的提升。

  • 数据民主化:根据埃森哲的调查,采用 AI 进行数据分析的企业报告决策速度提高了 30%,数据驱动的洞察力增加了 20%。让我们通过一个场景来理解这个用例。考虑一下您团队内的一个数据处理组织,它处理数据以生成结果。您是一家航空公司,希望查看过去五年感恩节期间的预订、取消和客户评分数量,以便更好地为假日季节做好准备。您实现这一目标的一种方法就是前往数据处理组织,并要求他们优先处理这一请求。通常,数据处理组织会收到大量此类请求,并将您的请求放入队列,并提供一个时间表,例如一周,以便回复您。这会使您处于困境,因为高级管理层可能已经要求进行分析,而您可能没有一周的时间来完成这项工作。

相反,考虑一个不同的世界,在这个世界中,所有这些信息都输入到基于 LLM 的解决方案中;任何业务用户都可以提出这些简单的问题并立即获得响应。这就是数据民主化的定义。您还可以将这种体验向前推进,并从现有的报告中提供视觉表示。

在这个领域内,另一个应用是 Text2SQL。也可能您的组织由于多种原因(如缺乏干净的数据或资源)尚未准备好推出之前讨论的副驾驶解决方案。在这种情况下,您可以为您的数据团队提供一个副驾驶,根据用户通过自然语言提供的输入为他们编写 SQL 查询。这将加速快速高效地获取数据的过程。

要在您的组织中实现 Text2SQL 用例,您可以采取以下几项措施:

  • 如果您计划在云端构建解决方案,数据也必须存储在那里。虽然这不是强制性的,但它可以加速开发过程,使连接到各种数据源变得更加容易。

  • 确定将被输入副驾驶解决方案的表格、BI 报告及其相应的元数据。这是为基于 LLM 的解决方案识别更新信息的好方法。

  • 信息民主化:如果您的团队成员仍然花费大量时间获取正确信息(如数据、内部文档或电子邮件),可能需要重新考虑这是否是大家时间利用的最佳方式。随着互联网的发展,信息已经大量且免费地可用。然而,通过大型语言模型(LLMs),信息以友好用户界面和最紧凑的方式提供。在您的组织中部署副驾驶并对其公司数据进行培训,可以确保信息快速可用,从而提高生产力。

让我们用一个例子来理解这一点。您雇佣了五位新的客户代表,并为他们提供了适当的培训,但您不能期望每个人都能在第一天就学会并掌握所有内容。如果所有信息都通过副驾驶对他们可用,当客户提出他们不知道的问题时,他们可以快速将其输入副驾驶聊天以获得回应,这将提高他们的学习曲线并消除需要另一位主管的需求。由于您的公司创建了所有文档并部署了副驾驶,因此相同的信息对每个人都是可用的,无需翻阅数百份文档。这将导致更快的客户响应,从而提高品牌忠诚度。

在您的组织中开始实施此方案,您可以采取以下行动:

  • 收集所有关键文档,并确保它们使用最新信息进行了更新。确保有一个数据摄取管道,确保将最新信息输入到 AI 系统中。

  • 这些副驾驶可以在企业范围内部署,但始终从拥有最不敏感数据的团队开始,以熟悉技术,然后扩展到所有团队。

  • 运营效率:根据《福布斯》杂志,64%的企业预计人工智能将提高生产力。我们都知道,一些特定的报告和流程必须在一天内同时运行。我也见过分析师在休假时发送报告,更糟糕的是,在他们的婚礼上。这种依赖性可能对组织造成灾难。有了 AI 代理的存在,他们可以快速生成这些定义良好的报告,甚至将它们发送给正确的受众。

例如,Tableau 这样的公司利用 LLM 来自动化报告生成和数据可视化。通过将 LLM 如 Tableau GPT 集成到其平台中,Tableau 用户可以有效地自动化报告生成和数据可视化。

以下是如何今天开始在您的组织中应用这种方法:

  • 确定前 3 或 4 个低风险但可以通过将它们分解成定义良好的步骤使用 LLM 或代理工作负载自动化的工作负载。

例如,每周一,营销文件从一个外部供应商传送到一个位置,然后该位置的数据被加载到你的数据库中。从这些数据中计算出一些预定义的问题并发送给特定群体。这是一个包含 3 或 4 个固定步骤的工作流程,可以通过代理工作负载实现自动化。

  • 运行已识别工作负载的分析师应该是验证流程和响应的人,这样他们就会成为你的专家。

  • 加大营销力度:对任何公司来说,营销都是一项昂贵的活动。但我们都知道,它是公司收入的秘密推动力。内容创作和视频编辑需要花费几天甚至几个小时来策划和实施。AI 可以帮助加速这些努力。以下是方法:

    • 文本到语音和文本到视频技术可以用来创建 CEO/名人定制的虚拟形象,节省时间和成本。

    • 视频编辑/创建和内容创作可以在几小时内完成,而不是几天。GenAI 擅长“生成”任何类型的数据,如图像和视频,因此这是一个它们可以大放异彩的典型例子。

    • 通过更直接地向客户发送个性化推荐,启用了超个性化。这可以通过传统的机器学习推荐系统或通过微调、代理等方法训练大型/小型语言模型来实现,仅举几个例子。我们将在接下来的章节中详细介绍。

如果你已经准备好将这些想法付诸实践,以下是一些开始实施的实用步骤:

  • 确定前 3 或 4 个需要大量资源或难以实施的市场工作负载。分析是否可以利用 LLM 来自动化这些工作负载。

  • 要实现个性化,确保包含过去用户行为的数据以适当的格式可用。

  • 机器学习工作负载:历史上,对于任何预测或预测用例,机器学习和统计算法,如随机森林、线性回归、ARIMA 和 Holt-Winters,都是流行的选择。然而,随着 LLM 的出现,它们被用来识别趋势和模式。LLM 可以识别传统统计模型可能难以捕捉的趋势、相关性异常,为企业提供竞争优势。

企业为何会偏好 LLM 而不是机器学习来处理此类用例?以下是一些原因:

  • 如果数据是无结构的(例如,客户评论、聊天记录或法律文件),并且您需要提取见解或生成预测。

  • 当数据中的关系需要理解细微的语言或复杂的依赖关系时。

  • 当有用于训练的标记数据时,LLM 可以在没有广泛定制训练的情况下使用。例如,Salesforce 使用 LLM 根据历史购买数据和客户支持交互等因素来预测客户流失。然后,这些信息被用来识别有流失风险的客户,并采取措施防止他们离开。

要在您的组织中实施这一行动,请考虑以下建议:

  • 如果数据是有结构的,您可能甚至不需要 LLM,可以坚持使用机器学习进行传统的预测和分类工作负载。

  • LLM 可能非常资源密集,因此在做出任何解决方案承诺之前请牢记这一点。

  • 研发:对于许多研究人员来说,研究可能是一个孤独的领域。将 AI 视为一个聪明的实习生,它可以讨论想法、寻找类似的研究论文、执行复杂的数学计算、撰写提案等等。它可以分担研究人员的负担,使他们能够专注于高价值任务。LLM 还可以帮助解决复杂挑战,从而加速复杂问题的解决方案。

现在我们已经讨论了一些日常用例,以下是一些您可以在组织内部实施基于 AI 的解决方案的最佳实践:

  • 尽早确定构建解决方案的基础平台(云服务提供商)。这将帮助您就数据、API 管理、解决方案的规模等问题做出决策。大多数企业利用云平台提供的模型即服务,这样他们就不必担心底层基础设施。

  • 您的第一个基于 LLM(大型语言模型)的解决方案可能会破坏您与内部或外部用户之间的信任。明智地选择早期采用者,并缓慢地扩展您的解决方案。将解决方案推向成千上万的用户可能会弊大于利。

  • 为每个用例提供用户的问题列表(提示)。这将帮助他们制定更好的提示并获得准确的响应。您可以发挥创意,并通过用户界面提供它们,例如“您可能想问...”后跟问题列表。

  • 使您的应用程序模型具有通用性。正如您所看到的,提供商推出新的模型,但这意味着他们有时会停用旧模型,因此您不应过度依赖一个模型。选择一个您能够触及的模型,并在需要时轻松切换到新模型。LLMs 现在已经商品化;您提供相关上下文的方式决定了应用程序的成功。上下文的例子包括您的企业数据或适当的提示。

  • 在第一天就组建您的 A 队。这包括您的人类测试人员、数据科学家、应用开发人员和基础设施/云团队。

  • 在构建 LLM 解决方案时,请考虑数据匿名化、严格的访问控制和极端措施,如机密计算。这些可以帮助您保护客户数据,并使审计人员和法律当局更有信心。

  • 为您的业务用户设定明确的期望。尽管 LLM 解决方案减轻了组织内的多个痛点,但它们仍然不是所有问题的解决方案。关于发布时间表和解决方案的功能要明确。

这些最佳实践将确保您获得 GenAI 解决方案所需的回报率。但您如何衡量这个解决方案的“价值”呢?在下一节中,我们将深入探讨如何实现这一点。

衡量您的 GenAI 解决方案的商业价值

理解您的 GenAI 解决方案的商业价值对于获得适当的资金和创建我们所需的投资回报率ROI)至关重要。以下是一些量化您收益的因素:

  • 成本节约:通过自动化和减少错误来衡量恢复的小时数。在这里,关键绩效指标可以是自动化率(自动化任务的百分比)。

  • 收入增加:通过五星级的客户参与度和满意度,识别出增加了客户终身价值和新客户的获取。

  • 员工体验:关于满意度和生产力的内部调查表明,更多的时间用于创造性工作会导致员工快乐并提高留存率。在这里,关键绩效指标可以是实施 GenAI 后节省的小时数。

在本节中,我们探讨了各种对企业和潜在价值的企业级 GenAI 用例。虽然我们旨在展示一个广泛的范围,但这个列表旨在作为一个一般性指南,而不是一个详尽的目录。认识到确保资金和利益相关者兴趣的重要性,我们也讨论了衡量这些用例的 ROI 的必要性。为此,我们讨论了可量化的因素,如成本、收入影响和员工体验。

接下来,我们将讨论何时不应考虑 GenAI 用于您的企业工作负载。

何时不应考虑 GenAI

人们经常谈论 GenAI 如何对您的组织产生变革性影响;虽然这是真的,但也有 GenAI 不会为您的公司增加价值的用例。以下是一些需要考虑的场景:

  • 纯粹的数学分析可能并不适合 GenAI。模型中存在有限的数学推理,但如果您试图实现大量统计数据处理,最好坚持使用预测 AI。GenAI 最好描述数值分析中的见解或用普通英语创建 SQL 查询。然而,仅凭提示进行回归分析或优化可能无法获得价值。这是模型在逻辑推理或数值分析中使用时首次发现模型幻觉的原因之一。随着高级模型的问世,推理能力可能会随着时间的推移而提高,但就目前而言,最好避免使用 LLM 进行数学分析。尽管 LLM 每天都在变得更聪明,具有高级推理能力,但对于多元数据预测等解决方案,重要的是要么坚持使用经典机器学习,要么构建一个混合解决方案,其中机器学习用于推理,LLM 用于解释推理并基于机器学习模型的结果推导出更多信息。

  • 基于 LLM 的解决方案不应被视为最终解决方案,而应视为增强现有解决方案或工作流程的成分。很容易被“闪亮的新玩具”吸引,开始构建花哨的演示以获得资金,但最终目标不是因为 AI 潮流而使用它;而是如果它能增加真正的商业价值,那么使用它就很重要。因此,始终将您的 GenAI 解决方案与业务目标对齐,以衡量投资回报率并展示可衡量的影响。LLM 基于的解决方案如何帮助传统工作流程的一个例子是通过零售网站上产品的元数据增强来改善产品搜索。

  • 当将 LLM 与现有应用程序集成时,创建一个稳健的集成计划。您的集成计划应包括推出和测试的时间表,以及针对最后时刻失败和未来可能需要退役的任何功能的缓解计划。如果计划执行不当,可能会导致客户体验不佳,甚至失去客户。

  • 如果 GenAI 带来的风险不可接受且无法有效缓解,那么它可能不适合您的用例。这些风险包括不可靠的输出、数据隐私、知识产权、责任、网络安全和合规性,这些风险可能单独存在或组合出现。

  • 在做出关键决策时,依赖 GenAI 存在风险。当前的 GenAI 模型并非为可靠的决策而构建。它们的输出可能不可预测,通常缺乏可解释性,并且无法明确清晰地模拟决策以实现预期结果。传统的决策工具更适合需要高风险决策的任务,例如金融投资或战略商业行动。

  • 计划诸如库存优化、现场工作人员调度、路线优化、金融投资组合优化、定价优化和资源分配等任务需要精确的计算和明确的决策建模。GenAI 模型在处理这种精确性和复杂性方面存在困难。您可能需要优化算法或模拟模型来处理这些用例的详细计算并提供可靠的解决方案。

在本节中,我们探讨了 GenAI 可能不适合需要精确数学推理、高风险决策或精确优化的任务。它应该用于增强现有工作流程,而不是作为独立解决方案,并且必须与业务目标一致,以证明投资回报率。此外,某些情况下,如不可靠的输出、隐私问题和糟糕的集成规划等风险可能会超过其好处。在下一节中,我们将讨论构建成功的 GenAI 解决方案的案例研究。

场景 - 构建“与数据聊天”用例

假设一家财富 500 强公司决定构建一个内部聊天机器人,以使业务利益相关者能够民主化数据和其见解。使用此解决方案,业务利益相关者可以提出有关数据的问题,例如“ABC 产品在 XYZ 月份的收益是多少?”这种“与数据聊天”的应用程序可以帮助他们通过自然语言对话快速获得见解,而无需编写复杂的查询或代码。这种革命性的方法消除了分析师需要放下一切并优先处理业务利益相关者查询的需求,使他们从 24/7 回答业务查询的负担中解脱出来。这样,任何业务用户都可以按需获取数据,并对自己所在的业务线感到有力量。

以下是在部署此类解决方案时面临的挑战:

  • 在这些情况下,构建提示至关重要。在初始推广期间向用户提供示例提示,帮助他们熟悉提示的使用。

  • 该解决方案根据用户反馈进行改进,但并非所有用户都积极提供反馈。在最初几个月内识别几位活跃用户,以收集他们对响应的反馈至关重要。

  • 监控数据漂移至关重要。根据原始数据源的刷新频率刷新数据,确保用户接收到的信息是最新的。

  • 在整个过程中涉及利益相关者至关重要,但在收集需求时,避免过度简化。收集所有需求,并采取分阶段的方法,尽可能满足它们。将需求分类为“理想情况”和“必须具备”。作为一名数据科学家,做出这种判断至关重要。

  • LLM 在理解非结构化数据方面很出色,但有时理解复杂的表格可能具有挑战性,因为 AI 系统可能无法捕捉到表格中不同列之间的关系。

以下因素将使解决方案成功:

  • 即使分析师的参与度不是 100%,他们仍将监控应用程序以确保其以最高标准运行。

  • 用户反馈被认真收集,分析师花费时间进行适当的错误分析,以确定哪些问题是由模型正确回答的,哪些不是。这有助于他们调整提示、模型等。

  • 解决方案以分阶段的方式推出,这提供了对变化的更多控制,并允许测量每次变化的提升效果。

  • 在对结构化数据进行分块和索引时,确保您使用正确的技术来保留表格的语义关系。

  • 持续测量业务指标确保人工智能系统正朝着投资回报率(ROI)的方向前进。在这种情况下,投资回报率可以通过生产力来衡量,即每个分析师节省的小时数,以便他们能专注于其他创新任务。

  • 设置数据刷新管道以确保数据以固定的频率刷新,并且用户始终获得最相关的信息。

  • 以分阶段的方式推出,以确保业务利益相关者的充分认可和参与。

在这个场景中,我们讨论了一家财富 500 强公司如何构建一个内部聊天机器人,以简化业务用户的数据访问,减轻分析师的工作负担。成功取决于提示设计、分阶段推出、利益相关者参与和持续反馈。投资回报率通过生产力提升和可靠的数据刷新管道来衡量。现在,让我们以构建此类人工智能解决方案的一些最佳实践来结束本章。

构建通用人工智能(GenAI)解决方案的最佳实践

让我们以讨论构建通用人工智能(GenAI)解决方案的一些最佳实践来结束这一章。我们在本章开头已经讨论了一些,但这里还有一些额外的事项需要考虑:

  • 非确定性:通用人工智能(GenAI)解决方案是非确定性的,因此响应将不会达到 100%的准确性。主动与用户设定这些期望。您可以通过将模型基于您的数据或微调它来减少幻觉,但您无法完全消除幻觉。有一些技术可以使用,例如用于更确定性的输出的语义缓存,但仍然,基于 LLM 的系统是概率系统。

语义缓存是一种高级缓存技术,它根据意义(语义)而不是精确的文本匹配来存储和检索数据。与仅当查询字符串完全相同时才工作的传统缓存不同,语义缓存使用嵌入(文本的向量表示)来理解查询背后的意图,并将其与先前缓存的响应相匹配,即使措辞不同。

以下是一个例子:

  • 传统缓存:

“什么是人工智能?” ≠ “什么是人工智能?” 缓存未命中

  • 语义缓存:

“什么是人工智能?” ≈ “什么是人工智能?” 缓存命中

  • 数据策略:这仍然是整体 AI 策略中的一个关键要素。花时间制定数据策略,确保输入数据格式正确,并在构建生成式 AI 解决方案之前设置数据刷新。

  • 模型测试:根据您的用例测试不同的模型。大型语言模型(LLMs)非常出色,但对于您的用例,小型语言模型可能就足够了,这样可以节省您的时间和资源。从 LLMs 开始,为您的 AI 应用建立基线性能,然后尝试小型语言模型。比较性能,如果小型语言模型没有明显偏离,您可以选择它们用于您的生成式 AI 系统。

  • 安全措施:实施强大的安全措施以保护您的应用程序免受恶意攻击。在这方面要积极主动。

  • 可扩展性:设计可扩展的解决方案。您可能一开始只有 10 个用户,但几年后可能会有 10,000 个用户。您的生成式 AI 解决方案应该足够灵活,以适应这种增长。

所有这些最佳实践都将帮助您在生成式 AI 之旅中取得成功,并与您的用户拥有无缝的体验。

摘要

本章介绍了关键生成式 AI 概念,包括 LLMs 及其架构,并探讨了实际的企业用例,例如客户参与、数据民主化和运营效率。它概述了何时生成式 AI 可能不适用,分享了一个聊天机器人部署的案例研究,并强调了实施的最佳实践。我们现在了解到,通过成本节约、收入影响和员工体验来衡量投资回报率对于成功至关重要。

在下一章中,我们将详细介绍生成式 AI 的运营,并揭示如何使生成式 AI 应用变得生动。

参考文献

|

获取本书的 PDF 版本和独家额外内容

扫描二维码(或访问packtpub.com/unlock)。通过书名搜索本书,确认版本,然后按照页面上的步骤操作。 | imgimg |

| 注意:请妥善保管您的发票。直接从 Packt 购买不需要 发票。 |

| --- |

第十章:理解 GenAI 运营

大型语言模型LLMs)在 2018 年随着 BERT 的推出而受到关注。尽管“GPT”自 2019 年以来就已存在,但它被用于名为“ChatGPT”的应用中,并于 2022 年推出。这就是互联网爆炸的时候,在可用五天内就获得了 100 万用户(yahoo.com/news/chatgpt-gained-1-million-followers-224523258.html)。这表明市场中有正确的兴奋情绪。然而,在企业和应用中构建类似的东西,其中你期望用户进行商业化,完全是另一回事。

企业 AI 很困难。选择合适的模型、优化技术和评估指标可能很困难。选择可能会决定你的企业解决方案的成功与否,这可能会影响公司整体适应。这就是 GenAI 运营Ops)发挥作用的地方。实施 GenAI Ops 可以帮助你做出关于模型、数据、评估指标和优化技术的正确选择,并部署一个生产就绪的解决方案。在本章中,我们将探讨 GenAI Ops 的什么、为什么和如何。

我们将涵盖以下关键主题:

  • GenAI Ops 的什么和为什么

  • GenAI Ops 的生命周期

  • 案例研究 – 企业 LLM 解决方案背后的幕后

  • 案例研究 – 智能索赔处理平台

    重要定义和免责声明

  • LLM 系统:任何由 LLM 驱动的应用、工作流程或系统。这一点很重要,因为在本章中,我们将详细讨论 LLM 系统的评估,而不是实际大型语言模型的评估。

  • 混合精度训练:一种在深度学习中使用的技巧,通过在单个模型中结合不同的数值精度来提高计算效率。通常,它涉及使用16 位浮点FP16)精度进行大多数操作以减少内存使用并提高速度,同时保留32 位浮点FP32)精度进行关键计算以保持准确性。

  • 用户提示:用户向 AI 系统给出的特定问题,以指导 AI 执行特定任务。

  • 系统提示:开发者提供的一组指令,用于定义 AI 模型的整体行为和角色。

  • 知识蒸馏:一种机器学习技术,其中较小的、更简单的模型(“学生”)被训练来复制较大的、更复杂的模型(“教师”)的行为。目标是把知识从教师模型转移到学生模型,使学生能够以减少的计算资源实现相似的性能。

在本章中,我们假设你具备 GenAI 的背景,特别是 LLMs 和小型语言模型SLMs),因为我们不会深入探讨架构,而是分享构建成功的 GenAI 系统的实用技巧和窍门。

请注意,GenAI OpsLLMOps经常被互换使用,尽管它们背后的意图是相同的。

什么是 GenAI Ops?

GenAI Ops(LLMOps)是一个旨在加速和优化模型在整个生命周期中的创建、开发、评估和监控的过程。

为什么需要 GenAI Ops?

让我们探讨在构建 GenAI 应用程序时,为什么 GenAI Ops 是一个重要的概念。以下是一些原因:

  • GenAI Ops 对于优化您的 LLMs 的性能至关重要,这可能涉及微调模型、添加新的数据点等,以提高准确性和实现所需的回报率。

  • 它帮助您积极监控您的模型,发现潜在的问题,并立即缓解它们

  • 它降低了风险,并确保用户获得最可靠的经验

  • 它帮助您根据应用程序的使用情况调整规模,使您能够节省成本,并确保您的用户获得最高级别的体验。

  • GenAI 是一项昂贵的任务;GenAI Ops 确保您可以通过企业内部定义的过程获得 GenAI 的最大收益。

GenAI Ops 与 MLOps 有何不同?

当 MLOps 已经存在时,AI 从业者经常质疑 GenAI Ops 的必要性。尽管 LLM 和基于 ML 的应用程序在概率应用方面有相似之处,例如,但它们之间也存在导致分离流程的潜在差异。以下表格突出了其中的一些差异:

| 功能 | MLOps | GenAI Ops |

| --- | --- | --- |

| 人才 | 数据科学家和 ML 工程师 | 数据科学家、AI 工程师和应用开发者 |

| 指标 | 模型指标,如准确性和精确度 | 模型指标,如扎根性和连贯性;操作指标,如延迟和每分钟令牌数 |

| 训练过程 | 从头开始构建 | 在基础模型或 API 调用上进行微调 |

| 人类反馈 | 可选 | 不可或缺 |

表 10.1:MLOps 与 GenAI Ops 之间的差异

GenAI Ops 不仅仅是使用最新的 AI 技术,而是关于正确的人、平台和过程的融合。正确的人包括商业和技术人员、合规性、法律和早期采用者或商业用户。正确的平台是关于稳健地托管它,并为最终用户提供最佳体验。流程是关于拥有一个简化的系统来衡量和监控您的 LLM 系统的性能,这样您就可以在注意到模型轻微退化或任何类型的性能问题时采取主动,而不是被动反应。

在本节中,我们介绍了 GenAI Ops 的概念,为什么它是必要的,以及它与 MLOps 的不同之处。在下一节中,我们将详细探讨 GenAI Ops 的生命周期。

GenAI Ops 的生命周期

组织对 GenAI Ops 的看法不同。没有一条路径是神圣的,它对你的组织和用例高度可定制。以下小节提供了一个高级流程,概述了你在构建 AI 应用程序时需要考虑的所有步骤。

构思

这是第一步;过程从构思开始。公司开始探索他们想要利用语言模型的使用案例。AI 实践者或数据科学家通常在这一步探索 SLMs 或 LLMs 的可能性,以优化和以成本效益的方式构建他们的应用程序。这是你也要涉及其他利益相关者,如产品或项目经理,来设计你整体产品愿景的步骤。指定的团队随后制定一个初始使用案例,并定义该使用案例的成功标准。一旦确定了使用案例,数据科学家将开始考虑用户提示和系统提示,并选择一个基础模型。在此阶段,强烈建议寻求解决方案架构师、顾问和公司内部专家的专业建议。

结果是一个定义了的使用案例,包括执行计划和为构建该使用案例所选定的模型。

构建

这是你细化初始计划并评估所选模型、用户提示和元提示/系统消息是否适合你的步骤。看到某件事是否有效的方法是将其付诸实践。在这个阶段,你将利用公司的沙盒/创新环境来构建解决方案,并查看它是否按预期工作。有很大可能性你将想要调整解决方案的某些元素。因此,这一步骤的部分内容是实验不同的 LLM 优化技术,如提示工程、检索增强生成RAG)或微调,以获得期望的结果。根据选择的方法,你还需要一个评估计划,这可能包括添加主题专家SMEs)来评估你的响应,使用 LLM 作为评判者,等等。我们将在接下来的章节中详细说明。

在我们进入 GenAI Ops 的第三阶段之前,让我们详细讨论所有优化技术。

当考虑优化由 LLM 驱动的解决方案时,通常有三种技术:RAG、提示和微调。通常,AI 开发者从提示开始,然后转向 RAG。在 RAG、提示和微调之间选择时,重要的问题是你要优化什么。LLM 优化不是一个线性的流程,这意味着,更常见的情况是,企业 LLM 解决方案需要这些技术的组合,或者根据用例的复杂性,一次同时使用所有三种技术。我们将在接下来的章节中详细说明这一点。

提示

提示是一种方法,你可以为你的 AI 解决方案提供详细的指令,以实现预期的输出。像人类一样,模型也需要细致的指令来提供高质量的输出。

提示可以分为两种类型:

  • 制作系统消息:这些为模型提供了一种个性或语气,以便相应地行事。系统消息也是引入护栏和减少幻觉的绝佳方式。开发者在后端配置这些。例如,你是一位编写准确 Python 代码的程序员。如果你不知道某事,就说出来。

  • 制作用户提示:这些是由用户驱动的,因此它们基本上是用户如何以自然语言与 LLM 交互。自从 ChatGPT 推出以来,我们一直在做这件事。

提示的优势如下:

提示的最佳实践

这里,我通过提示提供了相关示例,以便它能够适应我的思维过程,然后回答问题。因此,它产生了正确的输出。它不仅仅打印了41;它还展示了它是如何得出解决方案的。

  • 设计精确的元提示是一个迭代的过程。创建一个包含不同元提示和响应的电子表格对于跟踪调整不同元提示如何影响系统性能是至关重要的。

  • 开发可重用的提示模板或模式,帮助用户轻松快速地适应不同的用例。

  • 思维链CoT)提示是在模型输出其思维过程并回答最终问题时。这种提示技术非常适合复杂推理问题。让我们通过一个示例来进一步了解:

计算机生成的 AI 内容的截图可能不正确。

图 10.1:示例 CoT 提示的说明

在这里,我通过提示提供了相关示例,以便它能够适应我的思维过程,然后回答问题。因此,它产生了正确的输出。它不仅仅打印了41;它还展示了它是如何得出解决方案的。

另一个需要注意的重要事项是,由于我提供了一些示例,这被称为少样本学习。让我们解码什么是少样本学习;它指的是模型通过在提示中仅给出几个示例就能执行新任务的能力。以下是一个少样本提示的示例:

  • 任务:将情感分类为正面或负面

  • 示例 1 输入: “我喜欢这个产品!”

  • 输出:正面

  • 示例 2 输入: “这太糟糕了。”

  • 输出:负

这里需要注意的重要一点是,即使在 CoT 提示中,您也在进行少样本学习,因为您在提示中提供了示例,但主要区别在于思维链提示通常用于推理/逻辑用例,例如数学工作负载,因为它鼓励模型在给出最终答案之前逐步推理

RAG

RAG 是一种优化 LLM 的方法,使其更加接地,以便它们可以通过权威的知识库访问知识。关键是要知道,权威的知识库经过验证,以确保信息是准确和更新的。为了类比,想想 RAG 就像是一场“开卷考试”。在开卷考试中,学生被允许携带参考材料,如教科书或笔记,他们可以使用这些材料查找相关信息来回答问题。开卷考试背后的理念是,考试侧重于学生的推理技能,而不是他们记忆特定信息的能力。同样,事实性知识从 LLM 的推理能力中分离出来,并存储在外部知识源中,可以轻松访问和更新。

以下是 RAG 的优势:

  • 经济高效:微调基础模型是昂贵的,但在 LLMs 中引入新的信息到 RAG 中更便宜

  • 增强用户信任:RAG 提供准确的信息以及来源,例如研究论文中的脚注,从而提高用户对检索信息的信任

  • 保持相关性:GenAI 模型通常使用过时的信息进行训练,但 RAG 允许您使用关于您用例的最新和相关信息进行训练

RAG 引入了一个信息检索组件,它首先利用用户输入从新的数据源中检索信息。用户查询和相关信息被提供给 LLM,LLM 使用最新的知识和训练数据来创建更好的响应。

以下步骤概述了该过程:

  1. 数据收集:收集您应用程序所需的所有相关数据。例如,对于一个内部聊天机器人,这可能意味着所有关于内部数据源的知识手册

    小贴士

    确保在 RAG 应用程序中使用的数据是相关且更新的,以限制幻觉和错误响应。

  2. 数据分块:数据分块是将您的数据分解成更小、更易消化的信息块。这允许模型有效地检索相关数据块。您如何执行分块也会影响模型的表现。例如,如果您处理的是 1000 页的手册,分块应该这样进行,即每个块讨论一个特定主题。这样,当用户提问时,模型可以快速检索所需的数据块。以下列表包含了一些基于用例可以选择的分块策略。

  3. 列表需要更全面,但最相关的在企业中适用:

    • 固定标记重叠:在此技术中,文档被分割成块以在两个不同的块之间重叠信息。这对于在分块过程中不丢失信息非常重要,并确保保留所有数据。

    • 语义:在此技术中,文档基于语义相似性进行分割。首先,使用滑动窗口(通常是句子、上一句和下一句)将文档分为三个句子的句子组。为每个句子组生成嵌入,并在嵌入空间中将相似的组合并形成块。合并的相似度阈值使用百分位数、标准差和四分位距等指标确定。因此,块的大小可以在块之间变化。

    • 混合分块:这结合了基于内容类型和文档结构的多种策略。例如,文本可以按句子分块,而表格和图像则分别处理。这对于技术报告、商业文件或产品手册很有帮助。

  4. 文档嵌入:一旦完成数据分块,通过嵌入将这些数据转换为向量表示是必不可少的。嵌入是保留文本数据语义意义的数值表示。在选择合适的嵌入模型时,请记住,通过相似度搜索进行检索的有效性高度依赖于用于表示文档和查询的嵌入质量。因此,选择嵌入模型将显著影响检索精度,影响 LLM 响应的质量以及整体 RAG 应用的质量。

  5. 处理用户查询:一旦用户输入查询,它也会被转换为嵌入。然后,使用余弦相似度(或类似方法)将查询嵌入与文档嵌入进行比较,以找到最相关的信息块。

  6. 使用 LLM 生成响应:检索到的文本块和初始用户查询被输入到语言模型中。算法将使用这些信息通过聊天界面对用户的问题做出连贯的响应。

接下来,我们将探讨 RAG 的示例用例:

  • 具有内部知识库的聊天机器人,以帮助员工更快地找到信息并提高生产力。

  • 为外部客户提供个性化推荐引擎,以改善客户服务和用户体验。

  • 作为研究学习和解决复杂推理问题的智能伴侣。例如,它可以协助医生和研究人员快速检索与患者病例或医疗状况相关的最新研究成果或临床数据。

实施 RAG 的最佳实践

现在我们已经了解了 RAG 的工作原理和优势,以下是我们构建和部署了几个 RAG 解决方案后学到的几点最佳实践:

  • 数据预处理

    • 确保你的数据中包含 RAG 所需的元数据。这将提供额外的上下文信息。一些元数据的例子可能是日期或年份,如果用户可以随时提出任何时间敏感的问题。

    • 对文档进行排序可以帮助大型语言模型更好地理解上下文。假设你正在从一份文档中检索几个片段,这些片段只有在正确排序的情况下才有意义;那么,按照那个顺序插入片段是至关重要的。

    • 在执行向量搜索之前,根据特定标准过滤数据,例如使用正则表达式或元数据来缩小搜索范围。如果用例是获取最新信息,那么在执行向量搜索之前过滤数据,比如在 2024 年,是最好的。这将有助于检索相关信息,并提高延迟。

    • 在将数据输入到 RAG 系统之前,确保数据是干净和更新的。部署能够检测数据漂移的系统,以便从业者知道何时更新数据或底层模型。聊天机器人失败是因为旧数据没有给用户提供正确的信息,导致用户群流失。

    • 强健的数据管道对于适应源数据的变化至关重要。这种适应性确保了 RAG 系统即使在输入数据的性质发生变化时也能保持高效和有效。

  • 尝试不同的模型以确保最佳准确性和速度。如果你的用例更简单,从 SLM(序列到序列模型)开始可能有益,这样可以节省成本并提高速度。

  • 从简单的 RAG 架构开始,并在评估性能时进行定制。如果你同时调整分块策略和嵌入模型,你将无法了解模型性能背后的驱动因素。

  • 提前定义评估指标,例如基础性、连贯性等,并准备基准评估以进行比较。

  • RAG 系统中的可扩展设计是关于预测和解决生产中潜在延迟问题的。这将确保你的用户获得恒定的吞吐量,从而提供出色的用户体验。

  • 对于你的 RAG 系统,始终遵循分阶段推出方法。从一个有限的用户群开始,随着你对你的 AI 应用越来越有信心,逐渐增加用户数量。

  • 建立严格的数据隐私、安全和遵守数据保护法律的规定。拥有一个强大的系统来防止提示注入和恶意行为是至关重要的。请参阅nexla.com/ai-infrastructure/retrieval-augmented-generation/

  • 尽可能使用混合搜索;关键词和基于上下文的搜索技术结合了两者之长。这提高了搜索结果的准确性和相关性。请参阅medium.com/@juanc.olamendy/rag-best-practices-enhancing-large-language-models-with-retrieval-augmented-generation-6961c8b834ff

下图说明了 RAG 方法的工作原理:

img

图 10.2:RAG 的步骤

我们希望这一节能帮助您更深入地理解 RAG 的工作原理,何时使用它,以及构建时需要注意的事项。现在,让我们探索另一种强大的技术,称为微调。

微调

微调涉及在特定领域的数据集上训练预训练模型,以便为特定任务做准备。将预训练模型想象成一个在学校已经学习了一般知识的学生(例如,语言、数学和科学)。微调就像给这个学生提供特定职业的专业培训,比如法律或医学,他们在应用已经学到的知识的同时,在特定领域进行额外的实践。

下面是微调的步骤:

  1. 准备您的数据集:

    • 训练示例:这些是用于教导模型如何正确响应的具体实例或数据点。

    • 针对不希望的行为:一些示例应关注模型当前响应不理想或不正确的情况。通过识别这些问题案例,您可以提供更好的指导。

    • 理想的响应:对于这些有针对性的示例,包括您希望模型产生的完美响应。将其当前响应与期望值进行比较,有助于模型学习正确的行为。

您至少需要有 50 个演示来查看模型在微调后是否有所改进。

  1. 将数据分为训练集和测试集:

    • 将训练数据和测试数据都输入到微调任务中;这将帮助您获取两个数据集的统计数据,并计算模型在微调后的改进程度。

    • 训练模型后,您将使用这个测试集来评估其性能。通过比较模型在测试集上的预测与实际正确响应,您可以衡量其准确性和有效性。

  2. 创建新的微调模型。确定适合您用例的合适模型。进行实验或咨询专家可能有助于选择适当的模型。

  3. 评估结果,并在必要时回到步骤 1。这是最重要的步骤。在开始微调之前确定评估指标。OpenAI 默认为你提供训练损失、训练令牌准确率、验证损失和验证令牌准确率。这作为一个良好的基准,但你应该也有一种方法来比较与提示工程和 RAG 的结果,以计算在实施 RAG 或提示工程解决方案后获得的 LIFT。

微调的原因如下:

  • 如果你希望拥有模型并确保数据不会离开你基础设施的四壁,微调是最好的选择。

  • 当 SLM(序列语言模型)足以满足你的用例时,微调可能是一个正确的选择。这是一个质量与延迟之间的权衡。

  • 如果用例或领域非常狭窄,微调可能更好。一个例子是,你的企业使用高度复杂的语法从数据库中检索信息;微调模型以学习你的语法可能是一个合适的选择。

  • 如果用例如此复杂,以至于提示工程不切实际,因为你无法教授这个特定用例的所有工作原理并将其包含在提示中,微调可能是一个正确的选择。

微调的最佳实践

到现在为止,你应该已经理解了微调的为什么和怎么做。现在,让我们探索在为你的企业用例微调时需要记住的关键要点:

  • 微调的成功取决于预训练模型的质量。在选择预训练模型时,考虑其大小、训练数据类型以及训练要执行的任务非常重要。例如,如果你正在微调一个图像识别模型,你可能想选择一个在大型图像数据集上训练的预训练模型(参考saturncloud.io/blog/a-comprehensive-guide-to-fine-tuning/)。

  • 对于较小的模型,需要更多的数据长度和广度来实现优化的微调性能。重要的是要迭代不同的模型,看看哪个最适合你的用例。对于数据长度,考虑至少 100 个好的例子,包括边缘案例,以便模型能够更好地学习。

  • 逐步调整超参数以优化模型的表现。学习率、批大小和训练轮数等超参数可以显著影响模型的表现。请注意,训练轮数对训练的影响最大。标准的训练轮数是 4,批大小通常是 256,推荐的学习率乘数是 0.1 或 0.2。

  • 确保微调数据在质量和数量上都是最优的:

    • 数据集应该是多样化的,包括正确和错误的响应

    • 数据集不应存在语法、逻辑或风格问题;否则,这会降低模型的表现

    • 确保所有您的训练示例都符合预期的推理格式

微调可以是一种强大的探索技术,但对于组织来说可能成本高昂。现在,让我们探索另一种强大的技术来优化您的 GenAI 解决方案:提示。

结合 RAG、提示工程和微调:完美的三合一

这三种技术不是相互排斥的;您不必选择其中之一。根据用例,您可能希望成对使用它们,单独使用,或全部一起使用。让我们用一个例子来理解这一点。假设您正在为 XYZ 公司构建一个客户服务聊天机器人:

  • 提示工程/提示:您可以使用提示来定义聊天机器人的角色、语气和如何处理不同的查询。

  • RAG:您可以集成包含公司文档、常见问题解答和产品信息的知识库。这使得聊天机器人能够访问并利用相关信息,准确回答客户问题。

  • 微调:您可以在客户交互数据集上微调聊天机器人,教它理解常见的客户问题,提供有用的解决方案,并保持积极和专业的语气(参考www.linkedin.com/pulse/prompt-engineering-rag-fine-tuning-benefits-when-use-deependra-verma-7g8dc/)。

总结前面的讨论,以下是一个表格,帮助您选择正确的优化技术:

| 参数 | 潜在场景 | 优化技术 | 注意事项 |

| --- | --- | --- | --- |

| 准确性 | 缺少上下文过时/有偏见的信息 | RAG 提示数据预处理 | 金规则是尝试 RAG、提示或两者结合,同时提高准确性。如果 RAG 和提示未能增强用例,微调将无济于事。 |

| 一致性 | 结果不一致语气不符合预期推理不正确 | 微调提示 | RAG 可能在这里没有用,因为“结果不一致”通常意味着元提示存在问题。因此,始终从调整元提示开始,如果不起作用,再进行微调。 |

| 成本 | 每分钟高令牌数TPM)高模型成本数据类型处理 | 模型优化(混合精度训练和知识蒸馏)选择 SLM 而不是 LLM | |

| 性能 | 高延迟数据泄露 | 选择不同的模型提示优化 | |

表 10.2:选择正确的优化技术

在 RAG、提示或微调中选择最合适的技巧可能是一个具有挑战性的决定。通常情况下,两种或三种技术的组合才能创建有影响力的 AI 解决方案。现在,让我们探索这个 GenAI Ops 阶段的最佳实践。

建设阶段的最佳实践

这里有一些建设阶段的最佳实践:

  • 一个经验法则是尽可能避免微调。它很昂贵,可能不会为您的投资带来价值。

  • 从提示工程开始,并评估您的结果。提示工程的结果可以作为基线,以查看微调是否改善了情况。

  • 如果提示工程的结果令您满意,那么有 90%的几率微调会使它变得更好。如果它不与提示一起工作,那么有 25%的几率它会与提示一起工作。

  • 微调需要针对特定任务的广泛标记数据集。如果这种数据很少,那么就坚持使用 RAG。

  • 微调可能计算密集,而 RAG 利用现有数据库来补充生成模型,可能减少了对广泛训练的需求。

  • 结果是一个强大的概念验证POC),包含部署和监控应用程序的生产执行计划。

在本节中,我们探讨了构建 GenAI 解决方案的三个关键技术(RAG、微调和提示),以及它们如何结合以创建稳健的企业应用程序。我们还涵盖了每种方法的最佳实践,以确保有效实施。接下来,我们将详细探讨运营化阶段。

运营化

一旦有了 POC,就是时候在生产中部署您的应用程序了。运营化阶段包括几个主要步骤:构建 CI/CD 管道,并监控您的应用程序的道德、运营和成本指标。记住,这是一个基于 LLM 的解决方案,可能会迅速变得昂贵;因此,监控 TPM、成本使用趋势等非常重要。本节将重点关注揭示如何构建一个稳健的 LLM 系统评估策略,以及如何在生产中优化 GenAI 解决方案的性能。

评估

评估是 GenAI Ops 生命周期的重要组成部分。鉴于 LLMs 的概率性质,持续监控和评估您的 LLM 应用程序的性能是必要的。在此需要注意的是,评估在两个层面上进行:一个是 LLM 性能,另一个是 LLM 系统性能。我们将在这里讨论 LLM 系统的性能。

让我们看看为什么 GenAI 系统评估很难:

  • 系统提示和用户提示的不同版本可能会改变模型的响应,使性能变得多变且难以跟踪。

  • 缺乏良好的基准。我们将在下一节中讨论这一点。

  • 在线评估中引入人类会引入不希望的偏差。

  • 为特定用例定义正确的指标很困难。

让我们探讨一些实用的评估技术。

离线和在线评估

离线评估是在您将 LLM 的性能与预先选择的基准数据集进行比较的地方。这是一种评估诸如扎根性和事实性等方面有效的方法。以下是一些执行离线评估的策略:

  • 黄金数据集:这些是经过精心挑选的数据集,最好由行业专家提供,涵盖了多样化的输入和输出示例,作为评估 LLM(大型语言模型)能力的基准。黄金数据集应包含“真实”标签,以衡量 LLM 评估模板的性能。这是开始你的评估之旅并证明你的最小可行产品可行性的好方法;然而,这种方法不可扩展,可能会引入人为偏差。

  • 模型作为评判者:AI 评估 AI 是一种可扩展的评估方法。它更快、更经济。但正如我们所知,LLM 也可能犯错;因此,在评估你的模型时,让人类参与其中可能是有益的。

一旦你的解决方案投入生产,你可以在几个月内利用模型作为评判者,与人类一起监控性能。设定一个特定的阈值,如果预定的指标低于某个阈值,应向开发者发出警告,以便他们可以采取行动。

在线评估是评估的另一个关键方面,其中你利用真实用户数据通过直接和间接反馈来评估实时性能。ChatGPT 中的点赞点踩功能就是在线评估功能。

Chatbot Arena 进行了一项研究(arxiv.org/html/2403.04132v1),用户可以提交问题并从两个匿名的 LLM 那里获得回应。一旦他们收到回应,他们可以为回应点赞或点踩。投票过程是匿名的和随机的,以确保公平性。这些回应被收集成一个丰富的用户提示和人类偏好的数据集。这是一个很好的例子,说明了如何在企业内部模拟在线评估。

评估的最佳实践

在评估时,请注意以下一些最佳实践:

  • 当使用模型作为评判者时,使用你负担得起的最高效的模型。

  • 持续监控 LLM 系统并根据需要迭代。

  • 在线验证信息,包括使用案例专家提供反馈。没有人比他们更清楚“好”是什么样的。

  • 不要等到最后才评估模型;评估应该是开发周期的一部分。

  • 明确了解基于 LLM 的应用程序的目标;这将帮助你定义和优先考虑对应用程序最有意义的指标。例如,一些应用程序优先考虑语言生成的流畅性和连贯性,而其他应用程序则优先考虑事实准确性或特定领域的知识(参考medium.com/data-science-at-microsoft/evaluating-llm-systems-metrics-challenges-and-best-practices-664ac25be7e5)。

  • 构建评估可能很棘手。首先,探索现成的评估 SDK 以节省时间和精力。如果它们不适合你,那么你可以构建自己的评估框架。

根据你的用例,以下是一些选择正确评估指标的一般指南:

  • 提取结构化信息:你可以查看 LLM 提取信息的效果。例如,你可以查看完整性(输入中是否有不在输出中的信息?)。

  • 问答:系统回答用户问题的效果如何?你可以查看答案的准确性、礼貌性或简洁性。

  • RAG:检索到的文档和最终答案是否相关、有根据等?

本节作为评估的介绍,涵盖了在企业中执行评估的实际方法。在下一节中,我们将探讨 LLM 系统的日志记录和监控。

日志记录和监控

在运营化过程中的另一个重要步骤是日志记录和监控。这种机制有助于捕获提示、响应、评估分数以及元数据,如模型版本、输入数据等。这些数据对于调试、维护审计跟踪和检测数据或底层模型中的漂移非常重要。这也是监控你 LLM 系统成本以及用户需求变化的好方法。

组织不需要构建新的日志记录和监控系统;你可以利用任何现有的系统并集成 AI 应用程序警报。确保任何重大偏差或异常都能及时标记并发送给相关团队进行修复。你可以在《生成式 AI 应用集成模式》一书中详细了解这一点(www.packtpub.com/en-mx/product/generative-ai-application-integration-patterns-9781835887615)。

部署到生产后的最佳实践

目标是将 GenAI 解决方案部署到生产环境中。以下是一些在生产环境中使用解决方案时需要考虑的最佳实践:

  • 成本阈值:一旦 AI 解决方案投入生产,最好设置阈值。对于开发者来说,重要的是要收到关于他们分配的预算的通知。还应该有一位 IT 管理员持续接收成本更新的信息。如果成本超过阈值,可能就是分析你 AI 系统运作的时候了;可能是模型选择导致成本增加,流量超过预期等情况。

  • 缓存:通过存储频繁访问的数据,您可以在不需要重复调用我们的 API 的情况下提高响应时间。您的应用程序需要设计为尽可能使用缓存数据,并在添加新信息时使缓存失效。您可以通过几种不同的方式来实现这一点。例如,您可以根据应用程序的需要在数据库、文件系统或内存缓存中存储数据。请参阅platform.openai.com/docs/guides/production-best-practices

  • 负载均衡:考虑负载均衡技术,以确保请求均匀地分布在您的可用服务器上。请参阅platform.openai.com/docs/guides/production-best-practices

  • 人类反馈循环:实施一个系统,让用户可以标记不正确的响应,帮助模型随着时间的推移不断改进。

  • 毒性和偏差缓解:定期使用 OpenAI 的 Moderation API、Perspective API 或自定义安全分类器等工具测试偏差和不适当的输出。

  • 道德合规:确保符合法规(GDPR、HIPAA 等),保持模型生成响应的透明度。

  • 内容过滤:应用提示工程技巧、从人类反馈中进行强化学习RLHF)或微调,以防止幻觉和错误信息。

  • 自动扩展和负载管理:为云部署实现自动扩展,并通过利用量化、剪枝或知识蒸馏来优化推理成本。我们在此不详细讨论,但为任何想要审查的人提供资源(medium.com/@sahin.samia/llm-inference-optimization-techniques-a-comprehensive-analysis-1c434e85ba7c)。

在本节中,我们探讨了实施阶段,包括评估、日志记录和监控,以及一旦解决方案投入生产应考虑的最佳实践。在下一节中,我们将详细探讨一个案例研究,以了解 GenAI Ops 在企业中的应用。

案例研究 – 企业 LLM 解决方案背后的场景

LexCorp(一家虚构的公司),一家领先的专注于公司法的律师事务所,认识到 AI 革命其运营的潜力。LexCorp 拥有一支超过 200 名律师的团队,每天处理各种合同,从并购到知识产权协议。该事务所对创新的承诺使其投资于开发一个针对其独特需求的特定领域 LLM。

构建特定领域的聊天机器人涉及以下步骤:

  1. LexCorp 的聊天机器人开发始于定义业务目标,以量化聊天机器人的潜在影响。目标很简单:提供可以帮助律师提高效率并专注于重要任务的工具。

  2. 开发始于广泛的数据收集,以及确定将验证输出并提供整个开发过程支持的专家。

  3. 下一步涉及确定他们将要使用的构建聊天机器人的方法。在他们的情况下,他们在 RAG 和微调之间感到困惑,但决定从 RAG 开始,以获得高效且成本更低的优化选项。

  4. 他们构建了一个简单的用户界面,并将聊天机器人与确定的数据源联系起来。他们决定选择 GPT-4o 模型,因为它既经济实惠,又能处理多模态数据。

  5. 接下来,他们确定了他们想要用来衡量聊天机器人性能的指标,并在几周内进行了彻底的测试,以确保聊天机器人能够生成适当的响应。

  6. 为了保持大型语言模型(LLM)的更新,运维团队实施了一个强大的反馈循环。使用 AI 的律师对生成的草稿提供了持续的反馈。这些反馈被仔细分析,以确定改进的领域。定期推出更新,纳入最新的法律先例,并完善模型对复杂法律概念的理解。运维团队还监控了模型的表现,确保其达到公司对准确性和可靠性的高标准。

  7. 可靠性对 LexCorp 来说是一个关键问题。运维团队采用了多种策略来确保 LLM 的输出是可靠的。他们进行了严格的测试,模拟了各种法律场景来评估模型的表现。此外,他们建立了一个人类监督系统,其中资深律师在最终确定之前审查 AI 生成的草稿。这种双层方法确保了 LLM 的输出既准确又合法。

  8. LexCorp 对卓越的承诺推动了其 LLM 的持续改进。运维团队利用了迁移学习和强化学习等高级技术来增强模型的能力。他们还探索了整合外部法律数据库,以扩大模型的知识库。

  9. 定期进行培训会议,让律师熟悉 AI 的功能,营造一个人类专业知识与 AI 创新和谐共存的合作环境。

我们可以从 LexCorp 学到以下内容:

  1. 通过细致的数据收集、持续的反馈、严格的测试和持续的改进,该公司成功利用了通用人工智能的力量,简化了其法律起草流程。

  2. 他们从第一天起就建立了稳健的测试和评估框架,这使他们能够进行增量更新。

  3. 他们从一个团队开始,然后扩展到其他团队。在 GenAI 开发中,分阶段推出极为有益。

  4. 他们从一开始就涉及业务利益相关者,并定义了“成功”会是什么样子。这有助于他们获得产品所需的赞助。在利益相关者的帮助下,他们还创建了一个用于评估的黄金数据集。

  5. 他们构建了一个面向流程的产品,而不是以模型为中心的产品。这意味着他们没有追求最花哨的模型,而是选择了既便宜又能满足他们用例需求的模型。

  6. 他们将负责任的 AI 实践融入他们的产品中,以主动应对任何恶意攻击。

  7. 他们构建了一个简单的 UI,而不是一开始就投入大量资源将其集成到他们的遗留应用程序中。集成可以在以后管理,但第一步是让用户熟悉这项技术。

这个案例研究强调了 AI 专家和领域专业人士之间协作的重要性,以实现可靠和有影响力的 AI 解决方案。

案例研究 - 智能索赔处理平台

一家保险公司希望自动化处理汽车事故的索赔。这个过程包括以下步骤:

  • 结构化数据:保单详情、客户人口统计信息、历史索赔和承保限额

  • 非结构化数据:损坏车辆的图片、自由文本的事故描述和维修发票

人工审查既慢又不一致。目标是构建一个基于 Web 的 UI,结合机器学习推理和大型语言模型推理,以提供快速、透明的决策。

让我们看看解决方案概述。该平台使用以下内容:

  • 计算机视觉机器学习模型用于基于图像的损坏检测

  • 预测性机器学习模型:预测索赔的估计成本和欺诈概率

  • 大型语言模型推理层将机器学习输出和非结构化文本综合成一个连贯的解释,用于索赔决策

通过以下图表,我们可以可视化架构工作流程:

img

图 10.3:解决方案架构工作流程

考虑到这个可视化,让我们详细讨论架构工作流程:

  1. 数据层

    • 结构化数据:保单详情、承保限额和历史索赔(存储在关系型数据库中)

    • 非结构化数据:图像(存储在对象存储中)和事故描述(文本)

  2. 机器学习模型开发

    • 视觉模型:训练基于卷积神经网络(CNN)的模型(例如 EfficientNet 或 YOLO)进行损坏检测和严重程度评分

    • 表格模型:训练梯度提升树或神经网络进行索赔成本估计和欺诈风险预测

    • 输出标准化:确保每个模型使用相同的字段名称和结构输出数据。例如,如果一个模型返回severity_score而另一个返回damage_severity,编排层必须执行额外的工作来解释它们。标准化键确保所有下游组件,如 API 层,可以可靠地处理结果,而无需额外的映射或转换。

  3. 机器学习推理 API

    • 容器化模型:使用FastAPIFlask构建 REST 端点。

    • 端点:有一个接受图像并返回损坏分析的端点。还有一个接受结构化数据、返回成本和欺诈风险的端点。

    • 部署:托管在Azure App ServiceAWS Lambda以实现可扩展性。

    • 身份验证:使用 OAuth 或 API 密钥进行安全保护。

  4. 编排层:数据融合服务结合了机器学习 API 和用户输入的输出。此外,它还创建了一个用于推理的统一 JSON 有效负载。

  5. LLM 推理代理:以下是一个提示模板或示例:

    Context:
    - Damage: {damage_area}, severity {severity_score}
    - Estimated cost: ${estimated_cost}
    - Fraud risk: {fraud_risk}
    - Coverage limit: ${coverage_limit}
    - Customer statement: “{customer_statement}”
    Task:
    Generate a professional claim decision summary explaining approval/rejection and reasoning. 
    
  6. LLM 集成:使用Azure OpenAIOpenAI GPT API。然后,将其封装在一个执行以下操作的代理中:

    • 调用机器学习 API

    • 构建推理提示

    • 返回结构化和自然语言输出

  7. UI 层

    • 前端:React 或 Angular 仪表板;上传图片,输入文本,查看机器学习和 LLM 输出

    • 后端网关:处理对机器学习服务和 LLM 代理的 API 调用

  8. 日志、合规性和评估

    • 存储机器学习输出、LLM 推理文本和最终决策以供审计和合规性

    • 通过任务遵守和意图解析对代理性能进行稳健的评估

根据架构流程,现在让我们讨论核心设计原则:

  1. 以代理为中心的编排

    • LLM 充当决策者,而不仅仅是文本生成器

    • 它决定何时调用机器学习工具,如何解释输出以及如何结合结构化和非结构化数据

  2. 通过 API 公开工具

    • 每个机器学习模型(视觉和表格)都被封装在一个 REST API 中

    • 这些 API 使用模式(名称、描述和输入/输出格式)注册为代理的工具

    • 代理可以在推理过程中动态调用这些工具

  3. 数据融合层

    • 在推理之前,机器学习工具的输出和用户输入被标准化为单个 JSON 有效负载

    • 这确保了 LLM 看到一个干净、结构化的推理上下文

  4. 推理提示工程:代理使用以下模板提示:

    • 机器学习输出(损坏区域、严重程度、成本和欺诈风险)

    • 结构化数据(承保限额)

    • 非结构化文本(客户声明)

这里是一个示例:

Context:
Damage: {damage_area}, severity {severity_score}
Estimated cost: ${estimated_cost}
Fraud risk: {fraud_risk}
Coverage limit: ${coverage_limit}
Customer statement: “{customer_statement}”
Task:
Generate a professional claim decision summary explaining approval/rejection and reasoning. 
  1. UI 集成

    • UI 仅与代理 API 交互,而不是直接与机器学习模型交互

    • 这使得用户的工作流程简单,同时在幕后实现复杂的编排

为什么使用这种方法?

  • 可扩展性:添加新工具(例如,欺诈检测和成本优化)很容易

  • 透明度:LLM 推理提供人类可读的解释

  • 合规性:记录每个 ML 输出和 LLM 决策以供审计

以下是一些挑战:

  • 数据集成:结合结构化(政策表)和非结构化(图像和文本)数据以进行连贯推理

  • 模型互操作性:视觉和表格模型必须输出标准化的格式以供 LLM 消费

  • 提示鲁棒性:LLM 必须处理边缘情况(例如,缺失数据和冲突信号)

  • 偏差和公平性:避免由人口统计数据导致的决策偏差

  • 延迟:实时推理和推理而不降低用户体验

  • 可解释性:合规性要求每个决策都有清晰的推理

这里有一些增加的复杂性:

  • 多模态推理:LLM 解释数值分数、文本描述和图像洞察

  • 动态提示:根据缺失字段或异常进行调整

  • 审计跟踪:存储 ML 输出和 LLM 推理以供合规性使用

该解决方案展示了如何结合结构化和非结构化数据以及 ML 和 LLM 推理,将传统工作流程转变为智能、透明的系统。通过利用多模态 AI,该平台不仅加速了决策过程,还通过清晰的解释建立了信任。最终,它为保险行业可扩展、合规和以客户为中心的自动化奠定了基础。

摘要

在本章中,我们介绍了 GenAI Ops,重点关注企业如何成功构建、部署和管理 LLM 系统。我们解释了 GenAI Ops 与传统 MLOps 之间的区别,强调了在商业环境中实现 GenAI 的独特挑战。本章涵盖了 GenAI Ops 的生命周期,从构思和构建(包括 RAG、微调和提示等优化技术)到运营、评估和监控。它还提供了最佳实践和一个案例研究,说明了法律公司如何实施特定领域的 LLM 解决方案以简化合同管理。

在下一章中,我们将进一步探讨并讨论 AI 代理。

参考文献

免费订阅电子书

新框架、演进的架构、研究发布、生产分析——AI_Distilled 将噪音过滤成每周简报,供实际操作 LLM 和 GenAI 系统的工程师和研究人员阅读。现在订阅,即可获得免费电子书,以及每周的洞察力,帮助您保持专注并获取信息。

packt.link/8Oz6Y 订阅或扫描下面的二维码。

白色背景上的二维码 AI 生成的内容可能不正确

第十一章:人工智能代理解释

想象一下加入一家新公司,被大量新信息淹没,感觉自己像冒牌货,害怕向同事询问信息或帮助理解流程。你不想成为那个每次都打扰经理的小问题的新人,而你的同事正忙于赶截止日期,所以你不想成为额外的负担。这听起来熟悉吗?想象一下一个新的世界,你加入一家公司,完成了你的初步培训,并被告知有一个可以回答你大小问题的机密伙伴。这就是人工智能代理的力量。它们可以自动化复杂、重复和耗时的工作,这样你就可以将精力集中在更有生产力的事情上。

人工智能代理并不新鲜,但它们已经变得流行,因为现在 LLMs(大型语言模型)更容易获取。由 LLMs 驱动的代理工作流程使代理变得强大。

在本章中,我们将探讨以下关键主题:

  • 理解人工智能代理及其组件

  • 何时应用人工智能代理,何时避免使用它们

  • 人工智能代理类型

  • 代理框架

  • 代理可观察性

  • 与人工智能代理相关的挑战

  • 企业代理人工智能用例

  • 模型上下文协议和代理间协议

  • 实施代理人工智能的最佳实践

理解人工智能代理及其功能

代理是软件程序,它们根据用户通过代码或提示提供的配置自主执行任务。代理系统的美妙之处在于它们是动态的,并且可以随着时间的推移与外部工具互动并改进其行为。例如,一个计划假期的 AI 代理可以评估天气、预算和用户偏好,以推荐最佳旅游选项。它可以咨询外部工具,根据反馈调整建议,并随着时间的推移改进其推荐。

人工智能代理的能力

人工智能代理的四个能力使它们独特,能够处理复杂的流程:

  • 理解复杂指令:这是用户输入请求,模型理解用户需求并最终执行每个任务。例如,如果用户输入“预订飞往纽约的航班并安排住宿”,LLMs 可以通过解释位置、偏好和后勤细节来理解这个请求。

  • 规划和推理框架:这些帮助代理将任务分解成更小、更易管理的步骤。这对于金融顾问或旅行规划代理等用例非常有用。

  • 增强的工具交互:LLMs 可以与外部工具和 API 交互。这种能力使 AI 代理能够执行代码、与数据库交互以及执行网络搜索。

  • 记忆和上下文管理:LLMs 使用不同类型的记忆系统。情景记忆帮助代理回忆特定的过去交互,有助于上下文保留。语义记忆存储一般知识,增强 AI 的推理能力和将学习信息应用于各种任务的能力。工作记忆允许 LLMs 专注于当前任务,确保它们在处理多步骤流程时不会失去对整体目标的关注。

AI 代理擅长解决复杂的工作流程,它们具有理解问题、调用正确工具和记住先前对话上下文的独特能力。在下一节中,我们将深入探讨 AI 代理背后的“为什么”。

为什么需要 AI 代理?

到现在为止,你应该已经很好地理解了 AI 代理是什么,它们的技能,以及它们可能对您的企业产生的影响。让我们讨论一些企业应该考虑构建 AI 代理的原因:

  • 提高生产力:组织使用 AI 代理来实现特定目标和更高效的业务成果。

  • 降低成本:企业可以使用智能代理来减少由低效、人为错误和手动流程产生的非必要成本。

  • 信息决策:高级智能代理使用机器学习ML)收集和处理大量实时数据。这允许业务经理在战略规划下一步行动时,以更快的速度做出更好的预测。

  • 全天候可用:AI 代理全天候可用,确保无论时区或营业时间,都能及时处理客户咨询。

  • 提升客户体验:整合 AI 代理使企业能够个性化产品推荐,提供快速响应,并通过创新来提高客户参与度、转化率和忠诚度。

在本节中,我们了解到 AI 代理是自主软件程序,根据用户输入执行任务,并通过交互和反馈随着时间的推移而改进。它们由指令理解、规划框架、工具集成和记忆系统等组件组成,这些组件使复杂的工作流程成为可能。企业使用它们来提高生产力、降低成本、增强决策能力和通过全天候可用性改善客户体验。在下一节中,我们将探讨何时以及何时不应使用代理。

AI 代理 – 何时应用它们,何时避免它们

现实世界的任务复杂、繁琐且非确定性。想象一下你经营一家旅行社。一位客户登录你的网站并提交以下请求:“在 10 月份为我预订一个三天的 Malibu 之旅。我对日期很灵活。根据天气计划活动。酒店应位于市中心一英里外,我需要一辆奔驰车从机场接我。如果我的航班延误一小时,取消汽车预订。”

这个请求涉及多个层次:

  • 检查特定月份的可用性

  • 评估取消选项

  • 根据天气选择合适的活动

  • 理解个人日程和物流细节

在无法预先清晰定义工作流程的情况下,代理提供了应对复杂请求所需的灵活性。一个代理系统可以通过动态访问各种工具和 API 来处理这个请求:

  • 天气 API:提供准确的预报

  • 谷歌地图 API:用于计算旅行距离

  • 租车可用性门户:用于租车

  • 员工可用性仪表板:用于查看员工日程

  • RAG 系统:从您的知识库中检索相关答案

在本节中,我们了解到 AI 代理使系统能够摆脱僵化的工作流程,即时适应用户请求。这使得它们在不可预测或高变异性领域解决问题时非常理想。

避免使用 AI 代理的情况

虽然代理可以处理复杂性,但它们并不总是最佳选择。过度使用它们可能会引入不必要的风险和成本。以下情况下应避免使用代理:

  • 工作流程不预期执行动作:如果您构建的 AI 工作流程不涉及诸如撰写报告、预订车票或发送电子邮件等动作,建议从简单的聊天机器人开始,然后扩展到代理系统。

  • 错误容忍度低:由 LLM 驱动的代理是概率系统,这意味着它们可能会偶尔做出错误的决定。对于精度至关重要的应用程序,应避免依赖代理。

  • 高容量、低延迟的管道:代理依赖于 LLM 调用,这引入了延迟和成本。例如,对于大规模的实时分类,经典的 ML 模型或确定性方法会更好。

  • 无工具集成:如果工作流程没有外部工具,只是调用 API,则不需要代理,而是直接使用 API。当代理可以在多个工具之间选择或结合推理与动作时,它们是有用的。

在本节中,我们探讨了 AI 代理在处理复杂、动态任务中的理想性,其中工作流程无法预先定义,例如涉及多个变量和应急情况的旅行规划。然而,对于定义明确、低错误容忍度或成本敏感的任务,应避免使用它们。在下一节中,我们将探讨代理的类型和代理框架。

人工智能代理的类型

根据用例的复杂性,您可以构建单个代理或多个代理。让我们深入了解每一个,以进一步探索它们。

单个代理与多个代理

单个代理是一个执行特定任务的实体或代理。在单个代理模型中,单个 AI 实体负责所有决策过程。这使得管理和理解系统的行为更容易。它们也更容易实现,并且可以针对组织进行优化。单个代理的例子包括下棋代理和图像识别。

单个智能体的局限性如下:

  • 单个智能体在解决复杂任务和增加的计算负载方面存在困难

  • 单点故障可能导致整体系统崩溃,这使得这些模型在动态和不可预测的环境中不太稳健

多智能体或多个实体共同完成任务。多个智能体共享工作量,根据专业化和能力分配任务,这可以提高效率和性能。不同的智能体可以设计为专注于各种任务,使系统更具灵活性和适应各种挑战的能力。

例如,包括 Waymo 在内的自动驾驶汽车。传统的单个智能体模型可能难以高效地导航复杂的城市环境。然而,多智能体系统可以将任务分配给专业化的智能体,例如以下:

  • 一个智能体专注于实时交通数据分析路线优化

  • 另一个智能体负责障碍物检测和碰撞避免

  • 第三个智能体负责乘客互动和车内服务

通过协作,这些智能体可以确保更平稳、更安全、更高效的行程,展示了多智能体系统的实际优势。

多智能体的局限性如下:

  • 复杂性:开发和管理工作多个智能体需要复杂的协调和通信协议,增加了整体系统复杂性

  • 资源管理:在智能体之间高效分配资源并确保最佳性能可能具有挑战性,需要高级优化技术

在本节中,我们了解到单个智能体系统更简单且易于管理,但在复杂任务上存在困难,而多智能体系统提供了处理动态工作流程的灵活性和专业化。选择单个或多个智能体框架取决于您的用例。两者都可以提供独特的优势并具有某些局限性。在下一节中,我们将探讨构建智能体的框架。

智能体框架

从零开始构建智能体很困难。框架简化了过程,并允许开发者专注于他们的应用程序,而不是从头开始创建框架。框架旨在帮助定义工具、编排机制和内存等。

框架使不同智能体之间的协作成为可能,它们提供智能体之间交流、协调和实现共同目标的过程。它们还使智能体能够理解上下文并适应不断变化的环境。

让我们讨论一些流行的框架:

  • LangChain:一个由语言模型驱动的应用程序和智能体开发框架。它强大且灵活,因为它拥有广泛的工具和抽象。LangChain 提供了一种更简单的方式与数据源和外部工具集成,并在设计复杂智能体行为方面具有灵活性。

  • AutoGen:这是一个由微软提供的开源框架,它使开发者能够使用能够相互对话以解决问题的多个代理来开发 LLM 应用程序。AutoGen 是进行实验和快速原型设计以展示可能性的绝佳方式。它还支持自主操作和人工监督。AutoGen 的一个重要区别是其多代理通信结构。正因为如此,开发者可以设计许多专业代理共同解决复杂问题或执行困难工作的系统。

  • LlamaIndex:一个将自定义数据源连接到 LLMs 的框架。

  • Agentverse:旨在促进在多种应用中部署基于 LLM 的多个代理。

  • 代理:一个用于构建自主语言代理的开源库/框架。该库支持长期和短期记忆、工具使用、网络导航、多代理通信以及全新的功能,包括人机交互和符号控制。

  • Crew AI:一个为工程师重新设计的 AI 代理框架,提供强大而简单的功能来构建代理和自动化。这允许开发者创建一个“船员”团队,每个 AI 代理都有特定的职责,共同完成复杂任务。这个独特的方面在于它创建了更真实的人类团队动态模拟。

  • Semantic Kernel:由微软开发的这个框架旨在使将 LLMs 集成到现有应用程序中变得更加容易。它轻量级且模块化,这使得更新代码更加容易。该框架高度安全且可扩展,并促进代码重用。

如何选择合适的代理框架

代理框架是一个不断发展的领域,因此确保有一个强大的社区与之相关,能够提供有价值的资源、支持和创新,这一点非常重要。

确保框架稳定且适用于生产环境非常重要。您可以通过向开发者社区发送通知来确认这一点。

不同的框架在不同领域表现出色,例如对话代理、多代理和自主决策;因此,明确定义您希望通过这些代理实现的结果非常重要,以便您做出正确的选择。

考虑结合多个框架来构建健壮的应用程序也很重要。

在选择合适的框架时,还应考虑您团队的专长;一些框架需要软件工程专业知识,而其他框架,例如 Crew AI,可以通过提示工程进行配置。

在本节中,我们探讨了 LangChain、AutoGen 和 Semantic Kernel 等代理框架,这些框架简化了开发并促进了协作、工具集成和情境意识。在下一节中,我们将学习代理可观察性是什么以及为什么它很重要。

代理可观察性

代理可观察性是实现对 AI 代理在其生命周期内(即从开发和测试到部署和持续运行)的内部工作、决策和结果的深入、可操作的可见性的实践。代理可观察性的关键方面包括以下内容:

  • 持续监控:实时跟踪代理的行为、决策和交互,以揭示异常、意外行为或性能漂移。

  • 追踪:捕获详细的执行流程,包括代理如何通过任务、选择工具以及与其他代理或服务协作。这有助于回答不仅发生了什么,而且为什么以及如何发生。

  • 日志记录:记录代理的决策、工具调用和内部状态变化,以支持在代理 AI 工作流程中的调试和行为分析。

  • 评估:系统地评估代理输出,以质量、安全性、合规性和与用户意图的一致性,使用自动化和人工参与的方法。一些评估方法包括但不限于以下内容:

    • 人工标注:这包括直接对 LLM 结果进行评分的人类评估者,涉及不同的应用方面,如诚实、帮助性、参与度和无偏见性。

    • 图灵测试:人类评估者被要求比较真实人类和代理的结果,而不可区分的结果意味着代理可以达到类似人类的性能。

    • 协议:对应于确定如何使用指标的标准化评估协议。例如,包括现实世界模拟、社会评估、多任务评估和软件测试。

    • 评估 SDK 和框架:像微软这样的公司已经大量投资于构建评估 SDK,以自动化代理评估的过程。您可以计算代理遵守任务、规划任务和执行任务的程度。最好利用这些评估框架来推进开发。

  • 开源框架:您还可以利用如微软评估框架之类的开源框架。在评估过程中,微软引入了两个新的角色:审查员和裁判。任务描述首先被提供给每个测试用例的审查员。然后审查员向代理提问并监督对话。评估目标被允许向审查员提问以澄清任务。审查员只能提供任务描述,不能提供任何提示或解决方案。当评估目标提供解决方案时,审查员将停止对话并将解决方案传递给裁判。裁判随后将根据事实真相评估解决方案。

  • 治理:执行政策和标准以确保代理按照道德、安全和组织及监管要求操作。

代理可观察性是构建代理应用程序的关键方面。重要的是花大量时间设计代理架构,以便您能够持续评估和监控它。在下一节中,我们将探讨一些其他可观察性的最佳实践。

代理可观察性的最佳实践

现在,让我们深入了解您可以在构建代理的可观察性时在组织中实施的观察性最佳实践。这些是基于我们日复一日构建代理的实际经验:

  • 选择正确的评估方法并持续评估。一种方法并不适合所有人。对于您的组织或用例,现成的可能不会奏效。始终从它们开始是一个好主意,这样您就不必投资于构建,但如果一次迭代证明它没有提供足够的信息,最好是构建自己的评估框架。这可以通过构建一个用于评估的代理并为其提供如下指令来实现:“你是一个评估代理,你的任务是评估 XYZ 参数。”

  • 评估您的代理至关重要,无论是在开发还是生产中,以便能够监控它并对低性能采取主动措施。

  • 在您的持续集成CI)和持续部署CD)管道中集成评估和日志记录功能。自动评估和跟踪应该是您 CI/CD 管道的一部分,这样每次代码更改在发布前都会进行质量和安全测试。这种方法有助于团队尽早发现回归,并有助于确保代理在演变过程中保持可靠性。日志记录有助于您监控所有对话以进行审计和安全目的。如果检测到漂移,您总是可以回溯到日志中查看导致其发生的原因。设置警报也是一个好主意,这样如果性能低于阈值,您就可以得到通知。

  • 在发布前扫描漏洞。在部署之前,通过模拟对抗性攻击主动测试代理的安全和风险。这将帮助您测试您的应用程序,并为恶意行为者攻击等不幸事件做好准备。

在本节中,我们探讨了代理可观察性、跟踪、评估和日志记录的不同维度,以及它们对企业级应用的重要性。在下一节中,我们将揭示与构建 AI 代理相关联的挑战。

与 AI 代理相关的挑战

随着 AI 系统从静态模型发展到能够规划、推理和行动的自主代理,组织面临着超越传统机器学习关注点的全新挑战。在本节中,我们将详细讨论这些挑战:

  • 高质量数据缺乏:AI 系统可以利用通用数据,但代理需要高度专业化的数据来学习和执行任务。例如,训练一个 AI 代理在动态环境中执行复杂、细微的任务,需要详细、丰富的上下文数据,而这种数据往往不易获得。缺乏这种针对性数据可能导致训练无效,代理要么无法泛化,要么由于学习中的差距而表现出次优性能。数据隐私问题、高昂的收集成本以及现有数据集固有的偏差加剧了这一挑战。

  • 准确性较低:由于代理执行任务需要多个 LLM 调用,如果其中一个 LLM 在胡言乱语,那么代理的结果可能会不准确。在每一个阶段保持高准确性对于防止这些错误升级并使代理实现其目标至关重要。

  • 缺乏稳定的代理框架:尽管市场上有多款代理框架可用,但选择一个用于生产工作负载的框架可能具有挑战性。原因是大多数框架仍在不断发展,可能对企业的负载来说不够稳定。

  • 自主性挑战:代理可以自主执行任务,但在高度监管的环境中,每一步都需要监控和验证,这可能变得很棘手。在这种情况下,最好是完全避免使用代理,或者让人类参与其中。这些场景的例子包括为患者开具药物处方或批准某人的贷款申请。

在本节中,我们讨论了构建代理的挑战,例如缺乏高质量数据和较低的准确性。在下一节中,我们将讨论 AI 代理如何帮助企业级 AI 用例。

企业级代理 AI 用例

在本节中,让我们深入了解一些有趣的 企业级 AI 代理用例:

  • 数据任务的代理工作流程:假设用户询问一家公司 2023 年到 2024 年收入的差异。如果您部署了一个简单的 RAG 应用,LLM 首先需要检索 2023 年的数据,然后是 2024 年的数据,然后找出差异。它可能看不到 2023 年或 2024 年的收入,因为您可能只基于最新数据进行了定位。在这种情况下,代理框架可以有所帮助,因为它们可以动态规划这项任务并利用 RAG 管道,以及内存模块可以处理后续的问题。

此外,数据不再仅限于文本;它可以有多种形式,如图像和音频文件。用于数据整理、处理、收集和领域专家的代理都可以用来构建企业级应用。

  • 用于营销活动和编码工作流程的代理群:这指的是一组共同解决一个问题的代理。例如 ChatDev 这样的框架,它使您能够组建一个由工程师、设计师、产品经理、CEO 和代理组成的团队,以低成本构建基本软件。有了这个,您可以为公司填充整个营销活动或实现复杂的编码工作流程。

  • 动态定价系统:这些为拼车应用等服务提供动力。这些代理根据需求、竞争和预订时间等因素实时调整价格。这就是为什么您的 Uber 乘车费用可能在高峰时段或恶劣天气中更高。

  • 现代灌溉系统:基于模型反射代理的现代基于模型的灌溉系统。这些代理可以收集数据并就水资源需求和哪些田地部分可能需要更多关注做出明智的决策。

这些用例只是 AI 代理如何影响企业的几个例子。在下一节中,让我们来探讨 模型上下文协议MCP)和 代理到代理A2A)协议。

模型上下文协议和代理到代理协议

随着企业转向多代理 AI 架构,两个基础协议,MCP 和 A2A,正成为可扩展、互操作和智能系统的关键推动者。

MCP – 工具访问和执行

MCP,由 Anthropic 提出,标准化了 AI 代理发现和调用外部工具、API 和数据源的方式,使其更智能、更有帮助。它充当 AI 应用程序的“USB-C 端口”,为模型和外部世界之间提供通用接口。

MCP 采用客户端-服务器架构,以下是其关键组件:

  • MCP 主机:使用 LLM(如 Claude Desktop 或 IDEs)的程序,它们启动连接以访问外部数据和工具

  • MCP 客户端:嵌入在宿主应用程序中的协议客户端,与服务器保持 1:1 的连接

  • MCP 服务器:通过标准化协议公开特定功能的轻量级程序

  • 数据来源:本地(文件、数据库)和远程服务(APIs),这些服务是 MCP 服务器可以访问的

A2A – 协作和互操作性

由 Google 领导的 代理到代理A2A)协议,专注于使代理能够在平台、供应商和框架之间进行通信和协作。它使用代理卡定义结构化交互,这些代理卡描述了代理的能力、端点和认证要求。A2A 支持去中心化编排,允许代理在没有集中控制的情况下动态发现和协调任务,这对于涉及多个专业代理的复杂工作流程来说是非常理想的。

A2A 架构围绕以下关键组件促进代理之间的通信:

  • 客户端代理:制定任务并将它们传达给远程代理

  • 远程代理:执行任务以提供信息或执行操作

  • 代理卡:描述代理能力和端点的 JSON 元数据文件

  • 任务管理:定义具有生命周期阶段和输出的任务对象

  • 消息系统:允许代理交换上下文、回复和工件

虽然 MCP 提供垂直集成(代理到工具),但 A2A 实现水平集成(代理到代理)。共同,它们形成一个稳健的生态系统,用于构建模块化、多代理系统。在下一节中,我们将探讨构建代理 AI 系统的最佳实践。

实施代理 AI 的最佳实践

在本节的最后,我们希望将所有知识带回家,并分享构建 AI 代理的实用技巧和窍门。由于这个领域正在迅速发展,我们建议不仅要从这些学习,还要快速构建并从错误中学习,以便在这个领域快速进化:

  • 明确定义您的代理工作负载的目标。明确的目标将帮助您定义成功,这可能包括减少响应时间、提高客户满意度或降低运营成本;这将帮助您决定是采用单一代理还是多代理,并选择适当的代理框架进行开发过程。

  • 在选择代理的使用案例时,应关注需要自动化的流程,而不是底层模型或工具。以流程为中心将有助于您获得商业价值。

  • 您代理的质量取决于您数据的质量。在开始开发过程之前,确保您有稳健的数据管理实践。

  • 考虑将您的代理工作流程集成到您的遗留系统中,以获得最佳结果并提高现有系统的智能。

  • 确保用户界面直观,响应及时准确,提供积极的客户体验。在部署前彻底测试您的 AI 代理,以识别和解决潜在问题,确保它们满足客户期望。

  • 定期监控您的代理,以适应不断变化的需求,以及任何安全威胁。

  • 在初始阶段,计划在代理监督中包含人工,以确保流程按预期工作。

  • 实施稳健的数据隐私和安全措施,以保护您的人工智能代理处理客户信息。

  • 采用“信任但核实”的方法。在开始这段旅程时,花几个小时在代理的性能上,分析他们的响应,并有人工介入是正常的。随着信任的建立,您可以减少人工监督。

  • 如果您作为组织刚刚开始您的通用人工智能,不要立即跳到代理工作流程;先慢慢开始,然后创建更复杂的工作流程。

  • 通知用户 AI 的参与情况、工作原理以及如何提供反馈。

  • 力求在设备和端点之间提供一致的多模式体验。尽可能使用熟悉的 UI/UX 元素(例如,麦克风图标用于语音交互)并尽可能减少客户的认知负荷(例如,力求简洁的回复、视觉辅助和“了解更多”内容)。

  • 确保为代理的每个动作设置了稳健的日志记录。日志条目应存储有关执行动作的代理、所采取的动作和动作结果的信息。这对于任何所需的调试都是必要的。

  • 性能指标可以帮助你跟踪多代理系统的有效性。例如,你可以跟踪完成任务所需的时间、单位时间内完成的任务数量以及代理提出的建议的准确性。

  • 虽然使用 MCP 或 A2A 进行代理工作负载很有吸引力,但重要的是要考虑你是否需要它来满足你的用例,或者它是否是下一个闪亮的新对象。使用任何这些协议都需要维护;因此,只使用你需要的。

  • 以分阶段的方式开始你的通用人工智能之旅。从简单的检索增强生成RAG)开始,并逐步发展到代理 RAG 能力。从基础用例开始,建立信心,然后随着成熟度和基础设施的增长,扩展到更高级的代理工作流程。

从 Roomba(一款智能吸尘器)到自适应恒温器,我们家中和办公室里到处都是智能代理。现在,是时候在企业层面进行适应,以改变你服务客户和提升员工生产力的方式了。代理将改变我们的运营方式。这可能会改变工作,但希望是向好的方向发展。

在本节中,我们探讨了企业级 AI 代理如何用于动态数据处理、营销活动、定价系统和智能灌溉,利用多代理协作和外部工具。我们还讨论了成功实施需要明确的目标、稳健的数据实践、直观的用户界面、人工监督和持续的绩效监控,以确保可靠性和商业价值。

案例研究 – 基于代理的架构用于交易对手信用风险评估

交易对手信用风险CCR)指的是在合同最终结算前,金融交易中的交易对手可能违约的可能性。这种风险在场外交易OTC)衍生品、证券借贷和其他双边金融协议中尤为重要。传统的 CCR 模型往往难以捕捉金融市场动态和非线性的本质,尤其是在压力时期。

本项目的目标是构建一个模块化、智能和可扩展的系统,能够做到以下事项:

  • 摘取和处理客户和交易数据

  • 使用情境和市场感知推理分析信用风险

  • 为金融分析师和风险管理人员提供可操作的见解

  • 保持代理框架无关性,以便开发者可以使用任何框架来编排代理并在任何地方托管这些代理

这是解决方案的概述。存储库实现了一个 全栈应用程序,结合以下内容:

  • 前端:使用 Next.js 构建,提供现代用户交互界面

  • 后端:由 FastAPI (Python) 驱动,处理 API 请求、数据处理和编排 AI 代理

  • AI 代理:可以使用任何代理框架部署,例如 Azure AI;每个代理都专注于信用风险工作流程的特定方面

让我们深入了解代理架构。

基于代理的架构

系统由 五个专业代理 组成,每个代理都有独特的作用:

  1. 客户数据代理

    • 角色:从内部或外部数据源检索和处理客户特定信息

    • 功能:提取财务比率、信用评级和历史违约数据

    • 用途:为信用风险评估建立基础配置文件

  2. 交易数据代理

    • 角色:收集和处理与交易相关的数据

    • 功能:分析暴露、交易类型和合同条款

    • 用途:量化活跃交易中的潜在暴露和风险

  3. 推理代理

    • 角色:执行详细的信用风险分析

    • 功能:使用客户和交易数据,以及市场指标,来评估风险

    • 用途:基于复杂推理和概率模型生成见解和建议

  4. 编排代理

    • 角色:作为中央协调者

    • 功能:与用户接口,通过 Bing 搜索收集更多信息,并将任务委派给其他代理

    • 用途:确保工作流程顺利执行并整合所有代理的结果

以下表格列出了使用的框架和技术:

| 组件 | 技术 | 用途 |

| --- | --- | --- |

| 前端 | Next.js | UI 和交互 |

| 后端 | FastAPI (Python) | API 处理和代理编排 |

| AI 代理 | Azure AI 或任何云平台用于托管和执行 | 智能任务执行和推理 |

| DevOps | npm, virtualenv | 依赖管理和环境设置 |

表 10.1:使用的框架和技术

影响和使用案例

这种架构允许金融机构执行以下操作:

  • 自动化和扩展信用风险评估

  • 通过利用上下文和市场感知推理来提高准确性

  • 减少手动努力和运营风险

您可以在 github.com/rom212/counterparty_credit_risk 找到完整的项目。这个基于代理的系统为 CCR 评估提供了一种模块化和智能的方法,利用专业代理进行数据摄取、上下文建模和推理。该架构展示了自主代理如何将复杂的风险工作流程转化为高效、可解释和自适应的解决方案。

摘要

在本章中,我们介绍了 AI 代理如何通过动态、自主的工作流程自动化复杂任务,提高生产力和提升用户体验。它涵盖了何时以及如何使用代理,代理系统的类型,如 LangChain、AutoGen 和 Semantic Kernel 等流行框架,评估方法,以及数据任务、营销和定价等企业用例。本章以实施最佳实践结束,强调明确的目标、稳健的数据、人工监督和持续监控,以及一个真实案例研究。

在下一章中,我们将讨论构建企业级 AI 解决方案的责任 AI 实践。

参考文献

|

获取本书的 PDF 版本和独家额外内容

扫描二维码(或访问packtpub.com/unlock)。通过书名搜索此书,确认版本,然后按照页面上的步骤操作。 | imgimg |

| 注意:请妥善保管您的发票。直接从 Packt 购买不需要 发票。 |

| --- |

第五部分

负责任人工智能与治理

在本书的第五部分中,我们将提供一个关键框架,以确保人工智能解决方案是道德的、公平的、合规的和可持续的,首先定义负责任人工智能RAI)及其核心支柱(FEAT)。然后,我们将提供一份实用指南,通过治理委员会、风险评估清单(风险评分 = 可能性*影响)和战略人机交互方法来实施这些原则。本部分还探讨了值得信赖的 LLM 的独特挑战,例如“幻觉”,并概述了全球监管格局的演变,包括欧盟人工智能法案,最后展望了未来趋势,如量子计算,并展望了 2030 年完全优化、由人工智能驱动的企业的愿景。

本部分包含以下章节:

  • 第十二章**,负责任人工智能导论

  • 第十三章**,实施负责任人工智能框架、指标和最佳实践

  • 第十四章**,构建值得信赖的 LLM 和生成式人工智能

  • 第十五章**,负责任人工智能的监管和法律框架

  • 第十六章**,人工智能优化的未来:趋势、愿景和负责任实施

第十二章:责任人工智能简介

责任人工智能RAI)是一种实用方法,要求人工智能AI)系统与组织的价值观保持一致,支持商业和伦理目标。RAI 强调人工智能工具的负责任、公平和透明使用,侧重于问责制和结构化治理。

事实上,在商业环境中真正优化人工智能解决方案,RAI(责任人工智能)是不可或缺的。通过建立稳健的框架和优先考虑人类价值观,RAI 引导组织负责任地使用人工智能,将意图与实际影响相连接,并创造既服务于商业目标又承担社会责任的人工智能产品。

RAI 对于在人工智能中建立信任至关重要,因为它减少了可能导致法律、财务和声誉损害的风险,如偏见、隐私问题和不可预见的伤害。这种责任上的失败会直接阻碍人工智能解决方案的优化,限制其范围,侵蚀用户信任,并造成运营挑战。通过解决这些风险,RAI 使组织能够自信且道德地使用人工智能,促进增长和创新。通过 RAI 积极解决伦理问题也可以在市场上成为一个重要的差异化因素,有助于长期商业成功和持久性。

本章探讨了 RAI 的基础原则、其在商业中的重要性以及各种利益相关者在构建 RAI 解决方案中的作用。

我们在本章中将涵盖以下关键主题:

  • 理解相关术语——责任人工智能、伦理人工智能和可信人工智能

  • RAI 和伦理商业实践的核心支柱

  • RAI 在商业实践中的重要性

  • 谁负责使“人工智能负责任”?

  • 为什么 RAI 对优化机器学习模型很重要?

到本章结束时,你将能够区分责任人工智能、伦理人工智能和可信人工智能;理解伦理人工智能框架的基础支柱;并认识到在构建协作 RAI 生态系统中的各种利益相关者的角色。

理解相关术语——责任人工智能、伦理人工智能和可信人工智能

虽然术语 RAI、伦理人工智能和可信人工智能经常被互换使用,但它们有各自的重点:

  • 伦理人工智能:伦理人工智能关注指导人工智能发展的道德原则,如公平性、透明度和避免伤害。它关注人工智能的哲学和规范性方面,确保人工智能系统以道德上可接受的方式设计和使用。伦理人工智能解决人工智能实践中什么是正确和错误的问题,强调公平和包容的重要性,并且不受偏见的影响。

  • 可信赖的 AI:可信赖的 AI 涉及使 AI 系统可靠和安全,并确保它们能够无错误或风险地执行其预期功能。它侧重于 AI 系统的技术稳健性和可靠性,确保它们能够持续且安全地运行。可信赖的 AI 类似于一辆可靠、不会抛锚且能保障安全的汽车。

  • 负责任的 AI:RAI 是一个确保 AI 开发和部署负责任进行的框架,重点在于实际治理。它涉及创建具有明确责任界限、稳健的风险管理流程和透明决策能力的 AI 系统。RAI 解决了在 AI 系统中实施伦理原则的操作方面,使其与组织价值观和社会期望保持一致。正是 RAI 确保了系统的伦理性,这意味着它对每个人都是公平的,不歧视,无偏见,尊重隐私,并与人类价值观相一致。

RAI 作为总体框架,将伦理 AI 和可信赖 AI 的原则转化为实际的商业和技术实践。

以下这些概念之间的关键区别是:

  • 伦理 AI:关注指导 AI 目的和设计的根本道德原则(公平和非伤害性)

  • 可信赖的 AI:关注 AI 的工作效果(安全、可靠和可信赖)

  • RAI:关注 AI 的行为是否伦理(公平、包容并与社会价值观一致),以及实施所有三种实践所需的治理措施是否到位

所有这三个方面都很重要。一辆汽车(或 AI)需要是伦理的(不造成伤害)、可信赖的(运行良好)和负责任的(对社会有益),才能成为一个成功且可持续的产品。

为了说明这些概念之间的区别,想象一个在医院使用的由 AI 驱动的医疗诊断系统:

  • 一个伦理的医疗诊断系统建立在道德原则之上,主要关注非伤害性的核心思想(不做伤害)。例如,开发者验证算法设计尊重患者自主权,以及用于训练的数据供应链是道德来源并尊重隐私。这关乎系统的道德设计。

  • 一个可靠的医疗诊断系统是指一个可靠、一致且安全运作的系统。它已经在技术上得到验证,具有持续的高技术成功率、低误报/漏报率、对网络攻击的强大安全性,以及清晰的错误处理以防止系统故障。这关乎系统的技术性能和可靠性。

  • 负责任的医疗诊断系统不仅需要是伦理和值得信赖的,它还受到一个框架的约束,确保其现实世界的应用是公平和可问责的。例如,医院的伦理委员会验证系统的技术结果在所有人口统计学群体中都是公平的(公平性),其决策对医生是可解释的(透明度),如果出现误诊,有明确的问责线。RAI 在现实世界中实现了伦理和值得信赖的人工智能的原则。在人工智能术语中,RAI 确保系统是伦理的,这意味着对每个人都公平,不歧视,尊重隐私,并与人类价值观保持一致。

RAI 和商业实践中的伦理支柱

涉及人工智能的商业实践应有助于在用户和利益相关者之间建立信任,降低风险,并促进创新。伦理人工智能实践的核心原则,即公平性、伦理、问责和透明度FEAT),是 RAI 的基本支柱。许多组织现在正在转向 FEAT 原则来发展符合伦理的商业实践 RAI(更多信息,请参阅www.mas.gov.sg/news/media-releases/2018/mas-introduces-new-feat-principles-to-promote-responsible-use-of-ai-and-data-analytics):

以下图表直观地展示了人工智能治理框架的 FEAT 原则是如何相互交织并由这些核心支柱支持的:

公司治理图解,AI 生成的内容可能不正确。

图 12.1:人工智能治理框架的 FEAT 原则概述,

来自“使用 FEAT 方法避免偏见人工智能”,2022 年 4 月,麦肯锡公司,www.mckinsey.com 。版权所有©2025 麦肯锡公司。保留所有权利。经许可重印

  • 公平性在人工智能开发中力求确保某些人工智能系统不对任何个人或边缘化群体进行歧视,并提供公平待遇。实施检测和减轻人工智能模型中偏见的技术,使用多样化和代表性的训练数据,以及考虑到包容性设计人工智能系统是关键步骤。这些做法有助于防止歧视,实现公平的结果,提高所有用户的性能和可靠性。

  • 伦理涉及将伦理考量融入人工智能开发的每个阶段,以符合社会价值观并避免造成伤害。制定和遵守伦理指南,为人工智能开发者和利益相关者提供伦理培训,通过在用户和利益相关者之间建立信任和接受度来促进 RAI 的发展。

  • 问责制要求明确 AI 系统结果的职责界限。这包括进行影响评估以评估 AI 系统对个人和社会的潜在影响,并建立如伦理委员会和独立审查委员会等监督机制。这些措施有助于识别和减轻风险,促进道德结果,并将 AI 发展与社会价值观相一致。

  • 透明度是指使 AI 系统的运作对利益相关者可理解,可解释性是这一点的关键组成部分。使 AI 系统可解释不仅建立信任,还允许利益相关者理解决策是如何做出的,从而促进问责制和技术信心。这包括明确记录 AI 模型的训练方式、使用的数据以及决策过程。通过创建详细的数据表、模型卡、系统卡和透明度笔记,并与利益相关者保持开放沟通,企业可以建立信任并促进法规遵守。下一章提供了如何创建和实施这些卡片和笔记的实用指南。

除了核心的 FEAT 支柱外,一个健壮的 RAI 框架还必须解决隐私和安全问题,因为这些是支撑核心原则的周边支柱。隐私要求 AI 系统严格遵守数据保护法律和道德标准,因此用于训练、测试和运行模型的个人信息必须得到安全处理,有效匿名化,并且仅用于其预期目的。保护用户隐私是 RAI 的一个关键方面,确保道德数据处理并建立用户信任。同时,安全要求 AI 系统不仅技术上稳健且对恶意攻击有防御能力,而且不受意外伤害的影响。这包括进行安全评估和实施安全机制,如安全防护和冗余;这些对于降低风险和保护用户至关重要。例如,失效模式和影响分析FMEA)可以系统地识别 AI 系统中的潜在故障点,防止危险或歧视性输出,并建立明确的紧急停机程序,从而减轻对用户以及组织的所有潜在风险。在生产中可以实施看门狗计时器等机制,以在系统无响应时自动重启系统,而冗余系统可以在主 AI 失败时保证有备份可用。

以下图表扩展了 FEAT 原则,概述了在开发 RAI 时对每个支柱做出贡献的具体组成部分和实践:

图表的特写  AI 生成的内容可能不正确。

图 12.2:扩展 FEAT 方法以开发 RAI 的概述。

来自“使用 FEAT 方法避免偏见人工智能”的展示,2022 年 4 月,麦肯锡公司,www.mckinsey.com 。版权所有©2025 麦肯锡公司。经许可转载

隐私关乎保护与人工智能系统互动的个人数据和隐私。通过使用数据匿名化和加密等技术,并确保遵守如通用数据保护条例GDPR)等隐私法规,企业可以增强用户信任并避免法律问题。

当人工智能系统可靠且安全地运行时,安全至关重要,可以最小化潜在的危害。进行安全评估和实施安全机制,如安全防护和冗余,对于降低风险和保护用户至关重要。道德人工智能实践对商业影响重大。它们通过展示对负责任和道德技术发展的承诺,降低与人工智能部署相关的风险,并通过创造一个值得信赖的实验和开发环境来促进创新,从而提升公司的声誉。那些将道德放在人工智能首位的公司更有可能吸引顶尖人才并获得竞争优势。

让我们以一个在医院的医疗诊断系统为例,该系统利用人工智能来展示在整个项目生命周期中成功实施道德和 RAI 实践。一家医院正在实施一个人工智能系统,用于分析医学图像(X 光和 CT 扫描),以帮助医生识别特定疾病的早期迹象,旨在提高诊断的速度和一致性,同时不损害患者安全和信任。

这里是实施步骤:

  1. 建立道德指南:人工智能项目从 RAI 指导委员会设定一个基础道德原则开始:模型必须对所有患者公平地表现。他们要求训练数据必须代表目标患者群体的全部多样性(如年龄、性别和种族等人口统计特征),以防止算法偏见。这一主动步骤表明,对公平和患者安全的承诺从系统设计的第一天起就融入其中。

  2. 进行偏见审计:在开发和测试阶段,重点转向可信赖的人工智能。系统将接受严格的偏见审计,其中性能不仅仅通过整体技术成功率来衡量,还要看其在特定人口细分市场中的连贯性。如果模型对特定群体的成功率下降,它将重新训练或增强,直到性能公平且可靠,从而确认初始的道德指南得到满足。

  3. 保持透明度:为了成功部署,透明度原则被具体化。医院验证了使用该系统的每位医生都获得了模型卡片和透明度说明。这些文件清楚地说明了模型的目的、已知的局限性、用于训练的数据,以及最重要的是,它如何得出特定的诊断建议。这种清晰度促进了信任,并使人类医生能够有效地解释 AI 的输出。

  4. 保护隐私和增强安全:最终的治理框架维护了持续的隐私和安全。技术措施包括强大的加密和访问协议,以保护敏感的患者数据(隐私)。此外,实施了一项治理政策,要求人类医生始终审查和批准最终诊断,从而确保问责制并提供人类在回路的安全保障,以保障最终患者的安全。这种持续的监督完成了负责任实施的框架。

在实施上述步骤之后,医院实现了以下成果:

  • 增强信任:由于对道德人工智能实践的承诺,医院从客户和利益相关者那里获得了更高的信任。

  • 提升性能:他们的 AI 模型由于定期的偏差审计和包容性设计实践,执行得更准确、更可靠。

  • 合规性:他们成功遵守相关法规,避免了法律问题和处罚。

通过将这些商业伦理实践整合到人工智能开发中,公司可以创建既强大高效又符合社会价值观和伦理标准的人工智能系统。这种方法使人工智能技术能够对社会产生积极贡献,同时限制潜在的伤害。

RAI 是一个基本原则,通过优先考虑人类价值观、透明度、公平性、隐私、安全性和问责制来指导道德人工智能的发展。衡量其影响包括通过各种指标和评估来量化公平性、透明度和信任。将 RAI 嵌入企业可以培养创新和伦理文化,提升品牌声誉并推动长期成功。随着人工智能不断演变的格局,一种警觉和适应性的方法对企业和社会都是一项宝贵的投资。

RAI 更像是一个框架,确保人工智能系统以清晰的职责线、稳健的风险管理流程和透明的决策能力构建。正是 RAI 连接了道德人工智能开发的“为什么”和“如何”,将原则转化为实践。

RAI 在商业实践中的重要性

企业中 AI 的采用呈指数级增长,尤其是在过去两年中,这改变了行业并加速了创新。AI 技术被用于改善医疗保健、推进研究、实现可持续实践以及开发气候解决方案,等等。这种广泛的应用带来了显著的好处,但也引发了关于 AI 系统伦理影响的担忧。因此,对优先考虑透明度、公平性、问责制和隐私的伦理 AI 解决方案的需求日益增加。最终,将 RAI 实践整合并不仅仅是一个伦理合规的问题,而是一个战略性的必要举措,它促进了信任、减轻了长期风险,并为在日益 AI 驱动的世界中实现业务优化和长期发展奠定了可持续的基础。

企业正在认识到将 RAI 实践整合到其运营中解决这些问题的必要性。例如,微软和其他主要云服务提供商已经开发了全面的框架和指南,强调透明度、问责制、公平性和隐私的重要性,并协助企业采取可操作的步骤。

利益相关者(包括客户、监管机构和投资者)对 RAI 实践的要求比以往任何时候都高。客户越来越意识到 AI 的伦理影响,并要求企业有更高的透明度和问责制。他们想知道 AI 系统是如何做出决定的,使用什么数据,以及他们的隐私是如何得到保护的。这种客户期望的转变正在推动企业采用 RAI 实践,以建立信任并维护其声誉。

监管机构也在塑造快速发展的 AI 采用格局中发挥着关键作用。各国政府和监管机构正在推出新的法律和指南;例如,欧盟的 GDPR 为数据隐私和保护设定了严格的要求,企业在开发 AI 系统时必须遵守,而欧盟 AI 法案则对不遵守规定的行为实施具有法律约束力的监管并处以罚款。同样,美国的国家标准与技术研究院NIST)正在制定 AI 风险管理标准。这些监管要求正在推动企业采用 RAI 实践,以遵守规定并避免法律后果。

投资者在做出投资决策时越来越考虑 AI 的伦理影响。他们寻找优先考虑 RAI 实践并展示对伦理 AI 开发承诺的企业。采用 RAI 实践的公司被视为更值得信赖和可持续的,这使得它们对投资者更具吸引力。这种投资者期望的转变正在鼓励企业将 RAI 整合到其运营中,以获得资金并推动长期增长。

采纳 RAI 实践可以为企业带来显著的竞争优势。通过将自己定位为道德 AI 的领导者,公司可以提升其声誉,与客户建立信任,并吸引顶尖人才。道德 AI 实践还可以通过创造一个值得信赖的实验和发展环境来推动创新。

优先考虑 RAI 的企业在应对复杂的监管环境时处于更有利的地位,并能避免法律问题。它们还可以减轻与 AI 部署相关的风险,如偏见、歧视和隐私泄露,这些风险可能导致声誉损害和财务损失。通过积极应对这些风险,企业可以提高其 AI 系统的可靠性和安全性,这也会提升其整体性能和可靠性。

此外,采用 RAI 实践的公司可以在其组织内部培养创新和道德的文化。这种文化可以推动员工的参与和满意度,因为员工更有可能被激励并致力于为重视道德考量的公司工作。这反过来又可能导致更高的生产率和更好的商业成果。

本章强调了 RAI(责任人工智能)在当今企业中的深远影响,这种影响不容小觑。当前 AI 的广泛应用以及对于道德 AI 的日益关注,使得企业采纳 RAI 实践变得至关重要。此外,与利益相关者的期望保持一致并利用 RAI 的益处,公司可以培养信任、激发创新,并实现长期成功。

谁负责使“AI 负责任”?

在 AI 的开发和部署中,一个关键问题是:谁负责使“AI 负责任”?RAI 的责任不仅限于单一团队;它是在整个组织生态系统中共享和分配的职责。成功的 RAI 需要所有参与 AI 生命周期(从设计到部署)的利益相关者的持续监督和协作。成功地将负责任的 AI 付诸实践需要明确界定角色和问责制。以下结构概述了从领先的行业治理模式中改编的关键角色。

实施 RAI 中的关键角色及其责任包括以下内容:

  • 高管领导和董事会:负责在其组织中定义高级别的道德愿景,并为道德 AI 实践设定基调。他们负责建立道德准则,为 RAI 倡议分配资源,并培养责任和透明度的文化。他们对由 AI 系统造成的系统性损害承担最终责任。

  • 伦理委员会和独立审查委员会:这些机构(无论是伦理委员会还是正式委员会)提供对道德人工智能实践的监督和指导。委员会与内部和外部利益相关者合作,塑造公司的道德框架并促进负责任的人工智能文化。伦理委员会制定具体政策,进行风险评估,审查人工智能项目以确保符合道德指南,并在人工智能发展中保持问责制和透明度。

  • 人工智能开发者和数据科学家:这些专业人士负责以道德的方式设计、构建和测试人工智能模型。他们是人工智能发展的前沿。他们的角色包括实施技术缓解措施以检测和预防偏见,记录模型决策(使用模型卡),并保护用户隐私和数据权利。行业共识和领先标准建议开发者应在系统开发早期进行影响评估。

  • 部署和业务单元领导者(产品所有者和最后一公里供应商):这些人负责约束措施和人工智能在现实世界中的部署。他们确保人工智能系统按预期使用,建立明确的人机交互协议,并监控模型的表现及其对客户和利益相关者的影响。最后一公里供应商在人工智能如何打包、部署和使用于现实场景中承担重大责任。他们是将最终系统纳入业务流程并负责设置约束措施、安全应用人工智能以及定期审计以保持运营环境中的合规性和道德标准的实体。

  • 法律和合规团队:这些团队负责将外部规则转化为内部行动。他们验证系统是否符合所有相关法规(如 GDPR、特定行业的法律和新兴的人工智能法案)。他们就数据隐私协议提供建议,并确保有法律约束措施在位。

  • 政策制定者和监管机构:政府和监管机构负责制定和执行管理人工智能开发和部署的法律和指南,保护公共利益并维护人权。政策制定者必须了解人工智能技术的进步,并持续更新法规以应对新兴的伦理挑战。

  • 最终用户(外部利益相关者):最终用户在使人工智能负责任方面也扮演着角色。他们为人工智能系统提供宝贵的反馈,这有助于开发者改进他们的模型。用户应了解人工智能系统的工作原理以及他们的数据如何被使用,从而促进透明度并鼓励负责任地使用人工智能技术。

下表概述了这些责任,通过将每个关键角色映射到 RAI 生命周期的相关阶段:

| RAI 生命周期阶段 | 关键角色/利益相关者****(谁) | 核心责任****(为什么/是什么) |

| --- | --- | --- |

| 1. 规划和战略(愿景和治理) | 高级管理层和董事会 | 定义高级别的道德愿景,设定组织基调,分配 RAI 资源,并对系统性伤害承担最终责任。 |

| 道德委员会和独立审查委员会 | 提供监督和指导,制定具体政策,审查 AI 项目是否符合道德标准,并进行风险评估。 |

| 2. 构建和测试(开发) | AI 开发者和数据科学家 | 伦理设计、构建和测试模型,实施技术偏差缓解措施,在生命周期早期进行 AI 影响评估(AIA),并提供文档(例如,模型卡片)。 |

| 3. 部署和运营(问责制和合规性) | 部署和业务单元领导者 | 实施护栏,管理现实世界的部署,建立人工介入协议,并确保模型在运营中保持合规。 |

| 最后一公里供应商 | 对 AI 的打包和部署承担重大责任,设定面向客户的护栏,并定期进行审计。 |

| 法律和合规团队 | 就数据隐私协议提供建议并执行法律和监管护栏,将外部规则转化为内部行动,并验证系统合规性。 |

| 4. 部署后和反馈(外部利益相关者) | 政策制定者、监管机构和最终用户 | 政策制定者制定/执行法律。最终用户提供有关性能、公平性和安全性的关键反馈,以帮助开发者改进模型并更新法规。 |

表 12.1:RAI 生命周期中的角色和责任

前面的表格总结了在整个 RAI 生命周期中,各利益相关者的相互关联的角色和责任。这个生命周期分为四个不同的阶段:规划和战略(在设定道德范围和定义风险方面的愿景和治理),构建和测试(开发,即构建和通过彻底的压力测试来缓解偏差),部署和运营(问责制和合规性设定护栏和监督),以及部署后(管理外部利益相关者,即监控、更新和收集反馈)。表格突出了不同利益相关者如何参与这些阶段,强调了 RAI 治理的持续性和关联性。

为了培养真正的 RAI 协作方法,避免责任差距至关重要。这要求利益相关者共同努力,通过采取以下行动来参与道德 AI 实践,这些行动将在接下来的章节中讨论。

避免责任差距

避免责任差距至关重要,其中利益相关者认为责任完全在于另一组。每个利益相关者都必须了解他们在培养 RAI 和积极参与道德 AI 实践中的角色。在整个 AI 生命周期和部署后,利益相关者之间的协作和有效沟通至关重要。

例如,AI 开发者应与伦理委员会紧密合作,使他们的模型与伦理指南保持一致。商业领袖应与政策制定者互动,了解监管要求并保持合规。最后一公里的供应商应实施安全机制并定期审计,以维护 AI 部署中的伦理标准。最终用户应向开发者提供反馈,并了解 AI 技术的伦理影响。

通过协作努力并积极履行这些责任,利益相关者可以创建一个强大的 RAI 生态系统。这种集体努力确保 AI 系统不仅技术先进,而且道德上可靠。

RAI 的协作努力

考虑一个场景,InnovAIte LLC,一家致力于在多个领域开发 RAI 解决方案的前瞻性科技公司,正在开发一个用于医疗诊断的 AI 系统。公司成立了一个伦理委员会来监督项目并使其符合伦理指南。AI 开发者进行影响评估,以评估 AI 系统对病人和医疗提供者的潜在影响。商业领袖为 RAI 倡议分配资源,并与利益相关者(包括病人、医疗专业人士和监管机构)互动,了解他们的期望和担忧。政策制定者为医疗保健中 AI 的道德使用提供指南,确保 AI 系统符合相关法规。最后一公里的供应商打包和部署 AI 系统,实施安全机制并定期审计以维护伦理标准。最终用户,包括医疗提供者和病人,对 AI 系统提供反馈,帮助开发者提高其技术性能和可靠性。

这种努力还意味着 AI 系统是负责任地构建的,保护病人隐私,促进公平,并保持透明度。部署后对 AI 系统的持续监控和改进解决新的挑战,并保持系统的有效性和道德性。对所有利益相关者进行 AI 伦理使用培训和教育的努力,建立了一种责任感和意识的文化。

这样的努力有助于建立信任,推动创新,并实施 AI 技术以服务公共利益,证明成功取决于所有利益相关者履行其共同责任,确保 AI 的道德性。这个例子说明了 InnovAIte LLC 对 RAI 的基础性承诺,这一承诺将塑造其成为领先 AI 驱动企业的轨迹。

接下来,我们将探讨为什么这种承诺不仅仅是一个道德问题,而且是真正模型优化的基本驱动力。

为什么 RAI 对优化 AI 系统很重要?

在快速发展的人工智能AI)领域,优化 AI 系统以实现性能和效率是首要目标。然而,真正的优化不仅限于技术指标,还需要与伦理考量进行谨慎的平衡。RAI 实践对于通过确保 AI 系统公平、透明和负责任,最终导致更稳健和有影响力的解决方案,实现这种整体优化至关重要。本节探讨了为什么 RAI 对 AI 优化至关重要,以及它如何直接增强其现实世界价值和长期可行性。

伦理考量的重要性

乔伊·布卢阿明尼博士的工作,尤其是她的书《揭开 AI 的面纱》*,突显了即使在黄金标准的训练数据集中也存在深刻的差距和偏差。例如,一个系统可能在基准数据集上实现高性能率,但在数据集中的所有有色人种女性上却失败。这个例子强调了超越单纯模型优化的必要性,并考虑从数据到模型再到影响的全过程。仅仅关注技术性能指标(如准确性)是不够的;我们还必须解决主观成本并确保模型不会在规模上延续偏差。

忽略这些更广泛的伦理考量,仅仅关注基准成功,可能导致在现实场景中失败的模型,从而破坏任何基于有限数据集的优化感知。RAI 迫使我们优化 AI 系统以改善性能和公平的结果,而不仅仅是抽象的指标。

超越狭窄的优化

随着组织的成熟,优化超越了仅仅实现最佳模型准确性或 F1 分数。真正的优化需要从数据使用到基础设施成本对整个 AI 生命周期的战略视角,并推动与可衡量的商业价值的对齐。这种更广泛的视角对于成功扩展 AI 是必要的。

这里是优化的新维度:

  1. 优化 AI 系统性能:这不仅仅是在测试数据上测试模型的数学分数。它涉及到优化 AI 应用在现实世界中的延迟、吞吐量和决策速度。这有助于实现一个不仅准确而且足够快以提供价值的系统。

  2. 优化资源分配(成本和效率):这是 AIOps 的核心关注点。这意味着持续监控服务成本(推理成本、GPU 小时数、云存储)与产生的商业价值之间的对比。像模型压缩和高效部署这样的技术旨在优化 AI 系统以在最低可能的基础设施成本下运行。

  3. 优化伦理和以人为本的结果:这与后面讨论的 RAI 原则相一致。优化必须包括最小化偏差、促进公平性和最大化可解释性。一个在技术上完美但伦理上有害的 AI 系统并不是为了长期商业可行性而优化的。

  4. 优化反馈循环:实施一个持续学习的流程。这意味着优化收集用户反馈、监控现实世界数据漂移以及使用这些信息自动或半自动更新 AI 系统以保持其价值主张随时间推移。

实际应用和影响

在医疗保健领域,AI 正在革命性地改变我们诊断和治疗疾病、管理医疗保健系统和优化资源配置的方式。例如,AI 算法可以分析患者数据以检测疾病的早期迹象,制定个性化的治疗方案,并预测患者入院。这些应用展示了当与 RAI 实践相结合时 AI 系统的真正潜力,这些实践可以增强其在现实世界中的影响并改善患者结果。

当与 RAI 实践相结合时,医疗保健中 AI 系统的优化不仅提高了效率和性能,还建立了患者信任并促进了公平的医疗保健获取,从而最大化这些进步的积极影响和长期价值。RAI 旨在优化 AI 在关键领域的应用,以符合社会福祉和伦理标准。

挑战和最佳实践

优化 AI 系统涉及多个挑战,包括数据质量、计算需求和偏见缓解。可靠的成果依赖于高质量的数据,而有效的资源管理对于应对计算需求至关重要。通过技术如偏见检测和纠正算法来应对偏见不仅是一个伦理要求,也是优化 AI 系统性能以适用于所有用户群体的关键步骤,这有助于更广泛的采用和更可靠的成果。因此,公平性成为有效 AI 优化的关键维度。定期评估和调整 AI 系统对于保持其在现实世界环境中的性能和泛化能力是必要的。

持续学习的作用

持续学习和 AI 系统更新对于保持 AI 系统的相关性和准确性至关重要。随着更多数据的可用,AI 系统可以通过增量学习技术随着时间的推移不断改进,这些技术不仅提高了针对平衡指标集的性能,而且负责任地发展,优化其长期效用和社会价值观的契合度。这一学习和伦理精炼的迭代过程对于持续的 AI 优化至关重要,它既提高了效率也提高了性能。保持 AI 系统受控仍然是有价值和可操作的。

伦理考量与偏见缓解

伦理考量在 RAI(责任人工智能)中占据核心地位。通过积极识别和缓解偏见,以及建立透明度,我们不仅是在遵循伦理原则,而且是在构建更加稳健和可靠的 AI 系统,这些系统能够优化公平和均衡的结果,最终导致更大的信任和更广泛的接受。因此,伦理考量对于在 AI 系统中实现真正和可持续的优化至关重要。

RAI 对于 AI 优化至关重要,确保 AI 系统不仅强大高效,而且符合伦理标准,并与社会价值观保持一致。通过解决偏见,实施包括公平和透明度在内的全面评估实践,并考虑到伦理考量促进持续学习,我们可以提高 AI 系统的实际价值和长期可持续性。

这种方法促进了信任,推动了惠及所有人的创新,并有助于确保使用 AI 对社会产生积极贡献,同时最大限度地减少潜在的危害。随着我们继续推动 AI 可能性的边界,整合 RAI 实践对于实现可持续和道德的进步至关重要,这些进步真正优化了企业和社会的结果。

因此,伦理考量对于在 AI 系统中实现真正和可持续的优化至关重要。在下一节中,我们将从理论转向实践,提供在组织内部实施这些 RAI 原则的实用指南,包括框架、指标和最佳实践。

通过 RAI 赢得信任——现实案例研究

考虑这些成功实施 RAI 实践并见证积极结果的公司经验。

案例研究 1:谷歌的包容性图像识别

谷歌因其在早期图像识别 AI 中的偏见而受到批评,该 AI 难以准确识别肤色较深的人。认识到这一问题的伦理影响及其产品可用性的限制,谷歌积极应对这一问题。他们投资于更多样化的训练数据,并改进了他们的模型以减少这些偏见。对公平性的承诺不仅提高了其图像识别技术的技术性能和包容性,还增强了用户信任,并扩大了其产品对更广泛受众的吸引力。通过承担责任解决偏见,谷歌优化了其 AI 以适应更大的市场并改善了用户体验。

案例研究 2:一家金融机构的公平承保模型

一家金融机构试图利用 AI 改进其贷款审批流程。最初,他们的模型无意中表现出对某些人口群体的偏见,限制了信贷的获取,并可能导致监管审查。通过将公平性作为其 RAI 策略的核心原则,该机构采取了努力来识别和减轻这些偏见。他们分析了用于训练模型的 数据,移除或调整了歧视性特征,并实施了公平性指标来评估模型的输出。结果,他们开发了一个更公平的审批模型,扩大了客户基础,涵盖了之前未得到充分服务的细分市场。这不仅符合道德原则,还通过进入新市场并减轻与歧视性做法相关的潜在法律和声誉风险,优化了其业务。

这些例子说明,RAI 不仅仅是关于合规或避免负面后果;它可以成为业务优化的强大推动力,导致更具包容性的产品、更大的用户信任和扩大市场机会。

摘要

在本章中,我们开始了一段了解 RAI 基础原则及其在实现 AI 解决方案真正和可持续优化中不可或缺作用的旅程。我们首先定义了 RAI,强调了以道德、透明和负责任的方式开发和部署 AI 技术的重要性。这为探索更广泛的社会影响以及将道德考虑作为有效 AI 优化核心组成部分的必要性奠定了基础。

我们随后讨论了 AI 开发中的道德商业实践,强调了透明度、问责制、公平性和隐私的核心原则。通过采用这些做法,企业可以建立信任、降低风险、促进创新,最终提升其声誉和运营效率。

通过考察当前 AI 采用的格局和日益增长的道德 AI 解决方案的需求,RAI 在当今商业实践中的重要性得到了加强。我们讨论了如何满足利益相关者的期望,利用 RAI 的竞争优势,使企业成为道德 AI 的领导者,推动长期成功。

了解谁负责使 AI“负责任”揭示了这是一个涉及 AI 开发者、数据科学家、商业领袖、最后一公里供应商、伦理委员会、政策制定者和最终用户的集体努力。每个利益相关者都在确保 AI 系统以负责任的方式开发和部署中扮演着至关重要的角色,明确的责任线和协作以避免责任空白。

最后,我们探讨了为什么 RAI 不仅仅是一个道德考虑,而且是优化 AI 系统的基本驱动力。通过积极解决偏见,实施包括公平性和透明度在内的全面评估实践,以及培养具有道德考虑的持续学习,我们可以显著提高 AI 应用的现实价值、用户信任和长期可行性,从而带来更具影响力、更值得信赖和更可持续的 AI 解决方案。

随着新的 AI 进步和推理模型的兴起,理解和建立对 AI 系统的信任以负责任地构建产品和服务比以往任何时候都更加重要。RAI(可信赖 AI)是确保 AI 系统不仅技术上稳健可靠,而且在道德上合理且与社会价值观相符的最终成果。通过采用 RAI 实践,组织可以应对 AI 开发的复杂性,减轻风险,并在这个不断变化的 AI 领域中促进信任,因为这一领域需要持续适应和创新。

本章为理解 RAI 的原则和实践奠定了坚实的基础。随着我们继续前进,我们将更深入地探讨实施 RAI 的实用框架,并研究展示其影响的现实世界案例和案例研究。

免费订阅电子书

新框架、演进的架构、研究更新、生产分解——AI_Distilled 将噪音过滤成每周简报,供那些与 LLMs(大型语言模型)和 GenAI(通用人工智能)系统实际工作的工程师和研究人员阅读。现在订阅,即可获得免费电子书,以及每周的洞察力,帮助您保持专注并获取信息。

packt.link/8Oz6Y 免费订阅或扫描下面的二维码。

img

第十三章:实施 RAI 框架、指标和最佳实践

前一章阐述了理解负责任 AIRAI)原则和重要性的基本基础。然而,将这些指导理念转化为具体实践需要一种结构化和深思熟虑的方法。本章作为实施 RAI 的实用路线图,将超越理论讨论,提供可操作的战略和工具,供组织在 AI 生命周期中实施。有效地嵌入伦理考量不是一种被动的愿望,而是一个需要建立明确框架、应用相关指标和采用经过验证的最佳实践的主动过程。

本章将指导您了解道德 AI 实施策略的基本组成部分。我们将从探讨道德 AI 治理的各种框架开始,例如建立专门的 RAI 治理委员会和利用道德风险评估清单。这些框架为监督和风险缓解提供了基础结构(Mucci & Stryker, 2024)。在此基础上,我们将深入研究具体的道德治理结构和流程,包括成立 AI 伦理委员会和至关重要的常规偏见审计实践,这促进了持续的警惕和问责制。

认识到 AI 系统并非完美无缺,本章还将探讨人机交互HITL)方法的战略整合。我们将探讨在伦理考量至关重要、需要细微判断的高风险决策场景中,如何有效地融入人类监督。此外,为了超越定性评估,我们将介绍量化 RAI 的关键指标,包括公平性、可解释性、鲁棒性、隐私性和安全性。这些指标为评估和跟踪向更完善的 RAI 系统迈进提供了具体的方法。

最后,本章将概述实施 RAI 的基本最佳实践,包括数据匿名化技术、包容性数据集编目策略以及全面模型文档和透明度的关键重要性。通过采用这些实践,组织可以积极地将道德考量融入其 AI 开发和部署的工作流程。为了说明这些概念的实际应用,一个真实世界的案例研究将详细描述一家公司在建立和执行全面 RAI 计划过程中的旅程,突出所采取的步骤和取得的实际成果。

将要涵盖的关键主题包括以下内容:

  • 道德 AI 治理框架

  • 全球背景下的合规性

  • 人机交互方法

  • RAI 指标

  • 实施 RAI 的最佳实践

  • RAI 在现实世界中的应用

到本章结束时,你将具备从理解 RAI 的“为什么”到有效实施“如何做”的知识和实践指导,这将有助于建立对 AI 系统的信任,并为它们在商业和社会中的可持续和道德整合铺平道路。

道德 AI 治理框架

寻求实施 RAI(责任人工智能)的组织需要强大的治理框架。这些框架提供了确保道德考量在整个 AI 生命周期中得以整合的基本结构和指导原则,从构思和开发到部署和持续监控。建立清晰的职责线、记录的过程和监督机制对于构建可信赖和可持续的人工智能系统至关重要。本节介绍了组织可以采用以建立有效的道德 AI 治理的几个关键框架和组件。

道德 AI 治理的一个基本要素是建立 RAI 治理委员会。这些委员会通常由具有不同专业知识的个人组成,包括 AI 开发者、伦理学家、法律顾问、商业利益相关者和相关用户组的代表。RAI 治理委员会(组织的战略政策制定和监督机构)的主要作用是从道德角度提供关于 AI 开发和部署所有方面的指导。

他们的职责可能包括以下内容:

  • 定义道德指南和政策:建立明确的原则和规则,以规范组织内部人工智能的开发和使用

  • 审查 AI 项目提案:在开发开始之前评估新 AI 倡议的潜在道德影响

  • 评估模型设计和架构:确保道德考量嵌入到人工智能系统的技术设计中

  • 监控模型性能和影响:持续跟踪部署的人工智能系统的实际效果,以识别潜在的道德问题,包括偏差和公平性问题

  • 提供缓解和补救建议:识别和提出任何道德风险或危害的纠正措施

  • 维护 遵守法规和标准:了解并遵守相关的法律和道德指南

RAI 治理委员会为所有 AI 活动提供必要的政策监督和战略方向。他们的主要职责包括建立道德阈值(例如,最大允许偏差)、审查和批准系统卡片,以及决定对在道德风险评估中确定的高风险模型采取的缓解策略。

关键的是,尽管委员会建立监控要求和审查结果,但它通常不参与日常模型性能监控。这项运营责任落在机器学习操作 ( MLOps ) 团队和数据科学家身上,他们使用自动化工具(在RAI 度量部分稍后介绍)来持续跟踪模型性能、数据漂移和公平性指标,这些指标由委员会设定。

伦理风险评估清单:量化风险

另一个关键框架组件是实施伦理风险评估清单。这些清单在整个 AI 生命周期中操作化地识别潜在伦理风险。通过提示开发者和利益相关者考虑一系列伦理维度,这些清单有助于主动解决潜在的危害。

在伦理风险评估清单中,风险严重程度评分是用于优先考虑缓解努力的临界计算。确定风险评分的公式如下:

风险评分 = 可能性 ( L ) * 影响 ( I )

可能性 ( L ) 评估发生伤害的概率(例如,1=罕见,5=几乎肯定),而影响 ( I ) 评估伤害的程度(例如,1=轻微,5=灾难性)。这种明确的量化允许 RAI 治理委员会将资源集中在得分最高的风险上。

我们现在将通过一个具体的风险评估示例。

考虑一下在第十二章中讨论的医疗 AI 诊断系统。一个已识别的风险可能是:“算法偏差导致少数族裔患者群体误诊”:

  • 可能性:4(高 - 如果已知训练数据不平衡)

  • 影响:5(灾难性 - 导致患者伤害,法律行动)

  • 风险评分:4*5=20(高优先级)

所需的缓解计划将要求立即采取行动,例如使用平衡数据重新训练模型,并强制对所有受影响的群体结果进行 HITL 审查。

常见于伦理风险评估清单中的元素可能涉及以下相关问题:

  • 数据偏差:训练数据是否反映了目标用户群体?数据中是否存在可能导致不公平结果的已知限制或偏差?

  • 模型架构偏差:所选模型架构或设计复杂性是否适合任务,或者它是否本质上会导致某些场景中的系统性低估或高估?

  • 性能缓解:如果模型的输出持续存在缺陷(例如,需求预测不足),是否存在明确的人类审查员可以覆盖预测的操作程序,并且该过程是否得到记录?

  • 模型可解释性和透明度:人工智能系统的决策过程对最终用户(例如,医生或企业领导者)来说是否易于理解?是否有模型卡片和系统卡片来记录设计和限制?

  • 系统可靠性和安全性:潜在的故障模式是什么?是否有明确的 HITL 安全措施来防止灾难性或有害的输出?

  • 问责制和责任:是否有明确的审计系统决策的程序?如果人工智能造成伤害或发布错误决策,谁将明确负责?

  • 提示注入风险:对于生成式人工智能模型(LLMs),系统是否已针对提示注入和其他可能导致人工智能违反其安全对齐或泄露敏感信息的对抗性攻击进行过测试?

  • 隐私和数据安全:个人数据是否按照隐私法规进行处理?是否有匿名化和强大的安全措施来防止数据泄露?

  • 潜在的危害和滥用:人工智能系统的潜在负面后果或意外用途是什么?有什么安全措施可以防止危害?

  • 公平性和公正性:人工智能系统是否公平地对待所有个人和群体?是否考虑并评估了公平性指标?

  • 包容性和可访问性:在设计和应用人工智能系统时是否考虑了不同用户群体的需求?它是否对所有预期用户都易于访问?

通过整合如 RAI 治理委员会等框架,并利用如道德风险评估清单等工具,组织可以建立一种积极主动和系统的道德人工智能治理方法,超越临时考虑,将责任嵌入其人工智能倡议的核心。这种结构化方法不仅降低了潜在风险,而且增强了利益相关者和更广泛公众对人工智能系统的信任。

除了这些总体框架之外,建立稳健的道德治理还涉及特定的结构和实践。道德治理结构至关重要,因为它们包括建立人工智能伦理委员会、定期审查人工智能项目以及明确人工智能结果的责任。此外,实施日志记录和监控机制为人工智能系统行为提供了必要的可见性,允许检测潜在的道德问题。维护全面的文档,包括数据来源、模型开发过程和决策逻辑,对于问责制、可审计性和可追溯性至关重要。同样,使用数据版本控制进行模型开发有助于建立可重复性和跟踪变化的能力,这对于理解和解决可能随时间出现的任何道德问题至关重要。这些实践,以及更广泛的治理框架,是实现人工智能系统中问责制、可审计性、可追溯性和透明度的关键步骤。

实施透明度:模型和系统卡片

模型卡片和系统卡片是至关重要的文档工具,它们将抽象的伦理原则转化为 AI 生命周期中的实际检查,实现了透明度和问责制的原则。

模型卡片:模型的文档

模型卡片是一个结构化文档,提供了 ML 模型的关键技术背景和性能细节。它是为数据科学家、开发人员和审计员设计的“营养成分标签”:

  • 关键内容:模型细节、预期用途、训练数据描述(包括已知的偏差)、技术性能指标(特别是跨人口群体的公平性指标)以及伦理考量(潜在风险)

  • 目的:在部署前提供技术透明度,详细说明模型的局限性,作为系统卡片的主要输入

img

图 13.1:高风险医疗诊断系统模型卡片模板概述

这里展示的肺炎检测模型 v2.0 模型卡片纯粹作为一个示例模板和 RAI 最佳实践的指南。提供的结果、指标和人口统计数据是假设性的,旨在说明在医疗保健领域高风险应用中必要的详细程度。具体来说,技术术语的转换和双重标签(例如,召回率/灵敏度)是将标准机器学习术语与既定的临床诊断标准对齐的最佳实践。本文件不是真实的监管文件,应仅用于教育和参考目的。

系统卡片:部署的文档

系统卡片是一个综合性的文档,详细说明了整个 AI 解决方案,包括 ML 模型、数据管道、人工监督流程和治理政策。它是为业务所有者和法律团队准备的“用户手册”和“治理计划”:

  • 关键内容:系统概述(模型如何集成到业务流程中)、风险评估摘要、操作程序(谁监控系统和 HITL 过程)、系统维护计划和合规性状态

  • 目的:为了满足问责制需求,概述完整 AI 系统的预期用途、操作风险以及业务所有者的明确责任线

在生命周期中的集成

这些卡片的操作功能是作为强制性的关卡检查。模型卡片和系统卡片在系统投入生产之前,必须由 RAI 治理委员会审查和批准,以验证透明度和问责制是非协商的关卡在开发生命周期中。

虽然道德人工智能治理框架为负责任的创新建立了内部基础,但它们必须在更广泛的法律法规生态系统内运作。在下一节中,我们将探讨全球范围内的法规合规性。

全球范围内的法规合规性

有效的 AI 治理需要遵守多层合规结构,包括外部政府命令和内部企业标准。这是一个关键的操作挑战,因为法规在不同司法管辖区高度碎片化且持续演变。以下是不同法规的概述:

  • 全球法规框架:组织必须警惕遵守新兴的、影响巨大的法规,例如欧盟 AI 法案(该法案为 AI 部署建立基于风险的方法)、通用数据保护条例GDPR)(该条例对所有 AI 系统的数据处理产生重大影响),以及各种美国州和联邦指南。合规通常需要维护严格的数据来源记录并实施区域部署政策。

  • 公司特定法规(内部政策):除了外部法律外,许多组织还制定了严格的内部行为准则、RAI 政策和数据使用标准。这些政策通常设定了比法律最低标准更高的道德标准,反映了公司的具体价值观和对品牌声誉的承诺。法律和合规团队负责将这些内部和外部要求转化为 AI 开发团队必须遵循的可操作技术要求。

  • 文档的作用:系统卡片等工具成为至关重要的合规资产。它们记录了模型的设计、风险缓解措施以及针对特定法规要求的合规状态,为审计师和监管机构提供了清晰的尽职调查证据。

随着组织在全球和内部合规要求的复杂网络中导航,保持透明度、问责制和可追溯性变得至关重要。然而,即使是最全面的治理框架也依赖于人类判断来指导负责任的实施和监督。下一节将探讨如何通过整合人机交互方法来加强法规合规性与道德人工智能实践之间的联系。

人机交互方法

HITL 方法将人类判断整合到 AI 决策过程中。在项目的每个阶段以及持续监控和集成过程中,AI 系统都应由人类专业知识指导,而不是仅仅自动化。HITL 方法在高风险决策中尤为重要,其中人类监督可以帮助降低风险并产生用户可以信赖的道德、负责任的结果。一些例子包括在医疗诊断、金融服务和自动驾驶汽车中使用 HITL。

虽然许多 AI 系统的目标是自动化,但通过 HITL 方法整合人类判断对于实现道德、负责任和可靠的成果至关重要,尤其是在复杂或高风险场景中。HITL 策略性地在 AI 生命周期的各个阶段融入人类专业知识,确保 AI 系统不仅具有自主性,而且受到人类理解、价值观和伦理考量的指导和验证。

例如,在缓解偏差审计中识别出的风险时,人类作为安全措施的角色至关重要。当面临模型架构偏差(如伦理风险评估清单中提到的:量化风险),例如一个系统性地低估风险的模型时,这一角色至关重要。在这些情况下,人类审查员的主要职责是覆盖有偏差的低风险预测,以防止系统性伤害,从而纠正模型在运营环境中的架构缺陷。本节探讨了 HITL 如何有效实施。

这里是 HITL 的关键阶段和应用:

  1. 数据收集和标注:人类在维护用于训练 AI 模型的数据的质量、准确性和公平性方面发挥着至关重要的作用。这包括以下方面:

    • 数据标注和注释:人类专家为训练数据提供准确标签和注释,特别是在需要细微解释的复杂任务中,如医学图像分析或自然语言理解。

    • 数据验证和质量控制:人类审查和验证 AI 标记的数据,以识别和纠正错误,确保模型从可靠的信息中学习,并减轻在标记过程中引入的潜在偏差。

    • 数据中的偏差检测和缓解:人类监督对于识别数据集中嵌入的潜在偏差至关重要,这些偏差可能对自动化系统不明显。这涉及分析数据分布,并理解可能导致不公平表示的社会和历史背景。

  2. 模型开发和评估:人类专业知识在指导 AI 模型的设计和评估性能方面非常有价值,尤其是在伦理方面:

    • 特征工程和选择:领域专家可以提供见解,确定哪些特征对模型来说最相关且符合伦理,从而帮助避免使用受保护属性的代理。

    • 模型审查和批准:伦理委员会或领域专家可以审查模型的架构、训练过程和评估指标,以确保与伦理指南一致,并在部署前识别潜在风险。

    • 对抗攻击测试和鲁棒性评估:人类可以设计和监督测试来评估模型对对抗性输入的韧性,确认模型在意外条件下不会产生有害或不可靠的结果。

  3. 模型部署和监控:持续的人类监督对于验证人工智能系统按预期运行并在实际应用中不会导致意外的负面后果至关重要:

    • 异常处理和干预:当人工智能系统遇到边缘案例或模糊情况或做出不确定预测时,HITL 允许人类干预以做出最终决定或指导人工智能的反应。这在自动驾驶汽车或医疗诊断等安全关键应用中尤为重要。

    • 实时监控和异常检测:人类分析师可以监控人工智能系统的性能和日志,以寻找可能表明伦理违规、偏差放大或系统故障的不寻常行为或意外结果。

    • 审计和可解释性审查:人类可以审查可解释人工智能XAI)技术提供的解释,以验证其准确性、可理解性和伦理性。这有助于建立信任并促进问责制。

  4. 高风险决策:在人工智能决策对个人或社会产生重大影响的情况下,人机交互(HITL)通常是不可或缺的:

    • 医疗诊断和治疗建议:虽然人工智能可以提供有价值的见解,但人类医生仍保留最终决策权,考虑到患者的整体情况和伦理考量

    • 金融服务(贷款批准和风险评估):人类贷款官员或风险分析师可以审查由人工智能驱动的建议,特别是在边缘群体或复杂案件中,以促进公平并防止算法偏差

    • 刑事司法(判决和假释):虽然人工智能可能在风险评估中提供帮助,但最终的决定必须由人类法官和假释委员会根据法律和伦理原则做出

    • 自主武器系统(如果部署):围绕自主武器伦理的辩论强烈强调对致命力量决策进行人类控制的必要性

  5. 有效实施 HITL:成功实施 HITL 需要仔细考虑以下因素:

    • 明确角色和责任:规定何时以及如何进行人类干预,以及谁负责监督

    • 设计用户友好的界面:为人类审阅者提供直观的工具和信息,以便他们理解人工智能输出并做出明智的决定

    • 建立升级程序:明确界定将复杂或伦理敏感案件升级到人类专家处理的明确途径

    • 提供充分的培训:验证人类审阅者是否具备必要的领域专业知识以及对人工智能系统的理解

    • 持续评估和改进 HITL 流程:定期评估 HITL 工作流程的有效性,并根据需要做出调整

通过战略性地将人类智能和伦理判断整合到 AI 生命周期中,HITL 方法可以显著增强 AI 系统的责任感、可靠性和可信度,尤其是在具有重大社会影响的应用中。

然而,让我们也讨论一下 HITL 方法(Human-in-the-Loop)的成本和权衡。虽然对于高风险领域非常有效,但实施 HITL 系统涉及一个关键的权衡。组织必须考虑到人力成本的增加、决策过程中可能出现的延迟增加以及人类疲劳或偏见可能压倒正确 AI 推荐的风险。因此,HITL 必须战略性地部署,专注于高风险、高影响的决定,在这些决定中,降低伦理和财务风险足以证明运营成本。

RAI 的指标

RAI 管理委员会建立了要求性能监控的政策。然而,有效的监控依赖于可衡量的数据。因此,将 RAI 运营化的下一个关键步骤是定义和监控一套全面的 RAI 指标,这些指标允许 AIOps 团队持续跟踪模型性能与委员会设定的标准之间的差异。

虽然 RAI 管理委员会专注于政策监督和战略审查,但日常模型性能监控的执行则落在 AIOps 团队和数据科学家身上。这些团队使用自动化工具持续跟踪数据漂移、公平性指标以及与委员会设定的标准相比的整体模型性能。

为 RAI 优化机器学习模型需要使用各种指标进行全面的评估,这些指标量化了与伦理原则的一致性。关键指标包括以下内容:

  • 准确性和精确度(量化性能):这些是评估模型性能的基本指标;例如,在医疗保健领域,高准确性和精确度对于诊断疾病至关重要。

  • 公平性指标(量化公平性):这些指标对于防止歧视和促进公平待遇至关重要。例如,统计差异差异SPD)、差异影响和机会差异等指标有助于确保招聘算法和贷款审批系统的公平性。

  • 可解释性指标(量化透明度):这些指标有助于增强对模型决策的理解并建立信任。例如,LIME 和 SHAP 等工具,以及反事实分析,可以提供对模型预测的见解,帮助解释如金融服务领域的信用评分决策。

  • 问责制指标(量化问责制):这些包括治理和监督的可衡量方面,如影响评估的频率和彻底性、定期审计、AI 结果的职责分配的清晰度,以及针对识别出的伦理违规行为的记录响应。例如,在自动驾驶汽车中,安全事件审查和更新的记录过程作为问责制指标。

  • 隐私指标(量化隐私):确保模型的输出不会泄露敏感的 PII(个人身份信息)。差分隐私,通常通过“隐私预算”来量化,在医疗保健中保护患者数据,同时允许获得有价值的见解。

  • 安全性指标(量化安全性):这些指标有助于进行可靠性和安全性评估,以最大限度地减少潜在损害。例如,故障之间的平均时间、在安全性评估中确定的潜在故障模式的严重性,以及实施的安全机制的有效性。在工业自动化等领域,安全性是最重要的关注点,指标评估确保 AI 系统不会造成伤害。

  • 鲁棒性指标(量化可靠性和安全性):这些指标评估模型在各种条件下的稳定性和可靠性,包括噪声数据、对抗性攻击和分布变化。例如,模型在扰动数据集上的准确性或对特定对抗性攻击的韧性。

通过将这些指标整合到评估过程中,数据科学家和 AI 从业者可以自信地说,他们的模型不仅优化了性能,而且明显符合伦理标准和社会主义核心价值观。

实施 RAI 的最佳实践

实施 RAI 不是一个一次性任务,而是一项持续承诺,需要将伦理考量深深嵌入到 AI 开发和部署的框架中。以下扩展的最佳实践为努力构建道德、透明和负责任的 AI 系统的组织提供了更细致的指南。

战略治理和政策

如我们所知,有效地嵌入 RAI(责任、透明度和可解释性)始于战略层面,需要来自执行领导的明确授权。基础的最佳实践是建立 RAI 治理委员会。这个跨职能机构定义了组织的伦理原则,并设定了风险和偏差的不可协商阈值。每个 AI 项目都必须从全面的伦理风险评估清单开始,其中潜在的损害通过风险评分(可能性 * 影响)进行量化。这一初步步骤确保在编写任何代码之前,资源立即优先分配给高风险系统(如我们的医疗诊断模型)。

关键要点:战略和治理

让我们看看获得的关键见解:

  • 执行命令:确立 RAI 是从上到下推动的,被视为一项商业必要性,而不仅仅是合规职能

  • 建立监督:正式成立 RAI 治理委员会,以定义政策和审查高风险部署

  • 量化风险:使用道德风险评估清单来量化风险(可能性 * 影响)并根据产生的风险评分优先考虑缓解措施

  • 多司法管辖区合规:积极将全球法律(例如,欧盟 AI 法案、GDPR、CCPA 和 HIPAA)和内部道德规范翻译成清晰的技术要求,供开发者使用

设计即伦理

开发生命周期中的最佳实践要求采用设计即伦理的方法。这意味着道德考虑因素应融入系统设计,而不是事后改造。开发者必须严格审计训练数据中的偏差并评估模型架构本身,以确保设计不会产生系统性错误(例如,持续的低预测)。透明度通过文档化来实现。模型卡是技术细节的强制性要求,系统卡(或 AI 代理卡)是操作和治理细节的强制性要求。RAI 治理委员会对这两张卡的批准作为部署关卡检查。

关键要点:开发和文档

以下是关键见解:

  • 嵌入设计检查:不仅审计数据,还要审计模型架构本身以识别系统性偏差的来源

  • 强制性文档:在开发流程中实施模型卡(用于技术透明度)和系统卡(用于运营问责制)作为不可协商的步骤

  • 关卡检查:将 RAI 治理委员会对模型和系统卡的批准作为生产部署的强制关卡

  • 防范 LLM 威胁:对于 GenAI,作为系统设计的一部分,实施针对提示注入和其他对抗性攻击的具体防御措施

运营监控和追索

一旦部署,最佳实践侧重于持续的、现实世界的警惕。这属于 AIOps 团队的领域。监控必须超越简单的业务指标,以跟踪全面的 RAI 指标,如 SPD 和其他公平性措施。高风险系统需要强大的 HITL 协议,例如使用人类作为最终保障来覆盖有偏见或不安全的 AI 决策。一项最终要求是明确的、功能性的用户追索机制,允许受影响的个人上诉决策或报告伤害。

关键要点:监控和追索

这里是关键要点:

  • 持续监控:将日常监督责任转移到 AIOps 团队,以持续跟踪技术、伦理和公平性指标

  • 战略 HITL:有策略地使用 HITL 系统,优先考虑高风险领域(如医学诊断),在这些领域,人力成本的降低可以证明减少伤害是合理的

  • 追索机制:为用户建立一个明确、易于访问且及时的过程,以便他们报告伤害、寻求解释并请求追索或上诉自动化决策

文化融合

最可持续的最佳实践是将 RAI 融入组织的 DNA 中。这需要高层领导不断强化“高层基调”,表明道德行为与利润同样受到重视。对于工程师学习公平性指标和法务团队理解模型限制而言,跨职能培训是强制性的。最终,成功是由一种优先考虑主动责任而非被动合规的文化来定义的,使每位员工都成为 RAI 框架的积极参与者。

关键要点:文化融合

  • 领导层支持:保证执行团队积极倡导 RAI,将道德表现与职业发展和资源分配联系起来。

  • 普遍培训:在所有部门(法律、开发和产品)实施强制性的、角色特定的培训,以培养对风险和责任的共同理解。

  • 问责制:明确、不重叠的问责界限,以便每个利益相关者(从开发者到产品负责人)都能了解他们在 AI 生命周期中的具体道德责任。

通过实施这些可操作的最佳实践,组织可以超越愿望目标,构建真正符合 RAI 的系统,这些系统在实践中是道德的、透明的和可问责的。我们需要记住,这是一个持续的过程,需要持续的学习、适应和组织各层面的坚定承诺。

RAI 的实际应用

RAI 正在应用于各个行业垂直领域,展示了其推动道德和有效结果潜力。在医疗保健领域,AI 系统用于疾病诊断和治疗建议,在保护患者隐私和公平性方面给予最高重视,通过强大的道德治理结构。

金融服务业利用 AI 进行欺诈检测和反洗钱,整合 HITL 方法以增强决策能力和保持问责制。

在零售领域,AI 模型预测客户流失并个性化营销策略,同时遵守透明度和公平性原则。监控系统利用 AI 进行安全和监控,持续监控和改进以防止偏见并维护道德标准。

在冲突矿产的背景下,智能手机制造公司实施了严格的道德采购实践,以确保其产品中使用的矿产不会资助武装冲突、童工或人权侵犯。这种方法可以扩展到 AI 采购,其中道德采购保障 AI 系统得到负责任地开发和部署,考虑到涉及的材料和过程的环境和社会影响。

在教育领域,AI 通过个性化教育内容、自动化行政任务以及为学生提供多样化需求的支持,正在改变学习体验。由 AI 驱动的工具,如智能辅导系统和自适应学习平台,在保持公平性、包容性和对所有用户的可访问性的同时,增强了教育过程。

在执法领域,AI 用于犯罪分析、人脸识别和预测性执法,帮助执法机构更有效地分配资源并提高公共安全。然而,验证这些 AI 应用是否透明、无偏见并尊重个人隐私权至关重要。

在制造业中,AI 用于预测性维护、质量控制以及供应链优化。RAI 实践确保这些应用透明、公平且负责任,降低运营风险并提高效率。通过整合伦理指南,制造商可以在保持高伦理标准的同时提高生产力。

伦理治理结构的现实世界例子

为了说明组织在处理 AI 伦理治理的多样性方式,以下提供了一些供考虑的例子。

示例 1:Meta - 一家特定公司对 LLM 安全性和伦理治理的方法

Meta 通过一个多层次的系统来处理 AI 伦理问题,而不是一个单一的委员会,整合以下方面:

  • 内部团队:专门的 RAI 团队跨职能合作,在整个 AI 生命周期中解决公平性、透明度、责任和安全性问题,采用基于风险的方法

  • 外部监督:监督委员会审查涉及 AI 的内容审查决策,Meta 与外部专家和公众合作,以获得多样化的观点

  • 关键原则:Meta 在其 AI 开发和部署中强调透明度(例如,开源)、问责制、公平性、隐私保护以及分层安全方法(例如,Llama Guard)

这种结构结合了内部责任、外部输入和核心伦理原则,以指导 Meta 的 AI 实践。

Meta 的 AI 伦理治理的一个关键方面是其对 LLM 开发中安全性的处理方法,这通过分层策略实施:

  • 模型级安全:在数据准备和模型训练期间解决安全性问题

  • 系统级安全:在输入和输出阶段实施保障措施,利用 Llama Guard 4 等工具进行内容过滤

  • 透明度和报告:努力提供透明度并建立持续安全改进的反馈机制

这种多层次的方法是它们更广泛的伦理治理框架的核心组成部分,旨在在整个 LLM 生命周期中降低风险。查看 Meta AI 的负责任使用指南ai.meta.com/static-resource/responsible-use-guide/)以及他们关于 LLM 开发的公开博客文章(例如,Llama 3.2 安全性评估)。

示例 2:一家主要的企业软件提供商——为组织建立人工智能伦理文化

除了对安全性的关键关注,尤其是在 LLMs 中,建立强大的 AI 伦理文化还涵盖更广泛的伦理原则。为了建立一个可持续的 AI 伦理文化,公司必须超越政策,将伦理考量融入日常工程实践中。

该提供商通过将 RAI 视为核心产品功能,而不仅仅是合规义务的例子来体现这一点。他们成立了Aether 委员会(代表AI 和工程研究中的伦理),以向领导层提供建议并推动创新。关键的是,他们开发和执行了 RAI 标准,将他们的六个核心 RAI 原则(公平性、可靠性及安全性、隐私和安全、包容性、透明度和问责制)转化为公司每个 AI 项目的可操作要求和工具。这清楚地表明,责任由构建技术的团队承担。

根据麻省理工学院的斯隆管理学院,建立强大的 AI 伦理文化涉及几个关键要素:

  • 领导层的承诺:高级领导层的坚定支持和明显承诺对于在所有 AI 项目中优先考虑伦理考量至关重要

  • 明确的伦理指导原则:开发和传达清晰的原理和指导方针,用于人工智能的开发和部署,解决公平性、隐私和问责制等问题,以及安全性

  • 教育和培训:为员工提供全面的 AI 伦理和 RAI 实践培训,培养对伦理责任的共同理解

  • 跨职能协作:促进技术团队、伦理学家、法律专家和其他利益相关者之间的协作,以最大化在伦理决策中考虑不同观点

  • 透明度和问责制:在 AI 决策过程中建立透明度和问责机制,使审查和纠正成为可能

  • 持续监控和评估:定期监控和评估 AI 系统的伦理影响,并根据需要做出调整,适应不断发展的伦理标准和公众期望

示例 3:联合利华——一个结构化和可操作性的伦理治理流程

联合利华在实施 AI 伦理方面的旅程包括一个结构化的伦理治理方法:

  • 建立 AI 伦理委员会:一个跨职能团队,负责制定伦理准则和审查 AI 项目,提供监督和指导

  • 制定 AI 伦理框架:一个结构化的框架,用于评估 AI 应用的伦理风险和影响,促进对伦理考量的系统评估

  • 实施伦理风险评估:对每个 AI 项目进行彻底的风险评估,考虑因素包括公平性、透明度和问责制,以及安全性

  • 培训和意识提升计划:教育员工了解 AI 伦理和 RAI 实践,建立伦理意识和能力

  • 监控和报告:持续监控 AI 系统的性能和影响,并报告伦理考量,促进问责制和持续改进

您可以在《麻省理工学院斯隆管理评论》上发表的文章中了解更多关于联合利华的 AI 保证流程信息,《联合利华的 AI 伦理:从政策到流程》 (sloanreview.mit.edu/article/ai-ethics-at-unilever-from-policy-to-process/))

示例 4:深度伪造声音模仿和金融欺诈 – 治理结构在主动风险评估中的失败

本案例研究展示了治理结构未能强制执行和执行针对 AI 生成合成媒体(深度伪造)滥用的风险评估的高成本:

  • 失败背景:一位高级管理人员的深度伪造音频被用于授权从金融机构进行欺诈性电汇,绕过了标准的口头安全检查。合成媒体是使用现成的 AI 工具和公开来源的该管理人员音频生成的。

  • 治理失败:失败导致违反了金融法规(数字身份中的安全/欺诈和 KYC/AML 失败),并且没有建立稳健的内部安全政策。由于未能评估和减轻与合成媒体相关的风险(使用第三方 AI 的供应链风险),这种暴露代表了重大的责任。

以下是从 RAI 治理中吸取的教训(附带可操作方案):

  • 未能评估新的威胁:治理结构没有要求对身份验证方法进行审计,以应对现代合成媒体威胁,违反了主动风险评估的原则。(可操作方案:强制进行合成媒体风险评估(SMRA)以验证身份验证系统)

  • 缺乏新的安全措施:治理机构未能实施政策以更新安全协议,以应对易于获取的深度伪造技术的进步。(可操作方案:强制执行多模态身份验证并实施实时声学分析以检测声音深度伪造)

  • 供应链监管不足:未能控制输入(公开可用的音频)和潜在输出(伪造指令)表明在数字供应链风险管理方面存在疏漏。(可操作方案:为深度伪造事件建立明确的危机沟通协议)

最终,金融机构承担了损失,突显了与新的 AI 威胁相关的道德失败和治理缺口会导致严重的财务和声誉成本。

这些例子表明,构建道德的 AI 系统需要多方面的方法。虽然安全性至关重要,尤其是在像 LLM 这样的强大技术背景下,一个全面的道德治理框架还涵盖了更广泛的原则、组织文化和结构化流程。

在其跨领域的 RAI 基础承诺之上,InnovAIte LLC 在实施道德治理结构方面取得了显著进展。最初专注于其医疗 AI 系统,公司认识到需要可扩展的治理实践,并成立了一个 AI 伦理委员会,进行了影响评估,定期进行了偏差审计,并保持了全面的文档记录。他们使用数据版本控制进行模型开发,并记录了数据溯源和转换,以促进所有 AI 项目的问责制和可重复性。政策制定者提供了关于医疗保健中 AI 道德使用的指南,确认 InnovAIte LLC 的系统符合相关法规。最后一公里供应商打包并部署了 AI 系统,实施了安全机制并定期进行审计。最终用户提供了反馈,进一步提高了系统的可靠性和道德性。

通过整合 HITL 方法并使用 RAI 的指标,InnovAIte LLC 不仅巩固了其医疗 AI 的可信度,还开发了一个适用于其扩展 AI 项目的治理框架。这种积极主动的方法促进了信任,降低了风险,并支持了创新,随着 InnovAIte LLC 成长为领先的 AI 驱动型企业。

摘要

在本章中,我们探讨了实施 RAI 框架的关键要素。我们讨论了建立稳健的伦理治理结构、采用 HITL 方法进行监督以及利用综合指标评估 AI 模型的重要性。通过优先考虑这些要素并在 AI 开发生命周期中整合 RAI 最佳实践,企业可以确保他们的 AI 系统不仅优化了性能,而且与伦理标准和社会主义核心价值观保持一致。虽然 InnovAIte LLC 的假设性例子有助于说明伦理治理结构的设置,但现实世界的例子提供了关键的实际经验教训:这些包括像 Meta 对 LLM 安全性的方法这样的成功流程实施,以及联合利华的结构化伦理流程,以及一个主要企业软件提供商对文化关注的稳健组织变革,以及从与深度伪造声音模仿和金融欺诈相关的治理失败中汲取的关键警告。

在本章讨论的基础原则和治理结构的基础上,下一章深入探讨了开发可信赖的 LLM 所必需的具体伦理考虑和实践。随着 LLM 能力的增强和潜在影响,对它们独特的伦理挑战和建立信任的策略进行专注的审查至关重要。

加入我们,在下一章中探索关键方面,例如偏见缓解、透明度、可解释性和 AI 系统的稳健安全机制。

|

获取本书的 PDF 版本和独家额外内容

扫描二维码(或访问packtpub.com/unlock)。通过书名搜索本书,确认版本,然后按照页面上的步骤操作。 | imgimg |

| 注意:请妥善保管您的发票。直接从 Packt 购买不需要 发票。 |

| --- |

第十四章:构建可信的 LLMs 和生成 AI

大型语言模型(LLMs)彻底改变了人工智能领域,并成为快速发展的生成人工智能(GenAI)领域的基石。这些模型在生成文本、图像和视频,以及翻译和代码补全方面展现出非凡的能力。这些模型,如 GPT-5 以及市场上不断涌现的新模型,在广泛的领域具有巨大的潜力。然而,这种巨大的潜力伴随着重大的挑战,需要负责任的部署和审计。LLMs 已知会产生事实错误或不合逻辑的输出,通常被称为幻觉。此外,由于它们在反映社会偏见的广泛数据集上进行了训练,它们可以生成具有偏见和不公平的内容。本章探讨了在企业环境中创建可信 AI 应用的伦理考量和建议的最佳实践。

通用人工智能(GenAI),一个快速发展的领域,不仅超越了分析现有数据,还能创造新的内容。包括 LLMs 和生成对抗网络(GANs)在内的 GenAI 技术,通过从庞大的数据集中学习模式来创建新的、逼真的数据。LLMs,特别是为自然语言处理(NLP)而设计的,在多种语言任务上表现出色,显著推进了机器理解和生成能力。虽然检索增强生成(RAG)通过整合信息检索提供了一种提高 LLMs 输出事实准确性和连贯性的机制,但基本的伦理考量仍然至关重要。

负责任地使用和评估 LLMs 和 GenAI 至关重要,需要在创新和伦理责任之间进行谨慎的平衡。本章深入探讨了开发这些强大模型可信性的关键伦理考量,包括透明度、可解释性、偏见缓解、隐私和数据安全。我们的目标是探索促进 LLMs 和 GenAI 技术负责任和道德应用的最佳实践。

本章将涵盖以下关键主题:

  • 透明度和可解释性——构建可信 LLMs 的关键

  • 解决 LLMs 输出中的偏见并保持公平性

  • LLMs 中的隐私和数据安全

  • 开发负责任的 LLMs 指南

透明度和可解释性——构建可信 LLMs 的关键

LLMs 带来了独特的挑战,包括生成不准确或具有偏见输出的可能性。因此,透明度和可解释性(XAI)对于在 AI 应用中建立信任是必不可少的。虽然传统的机器学习模型通常很复杂,但 LLMs(具有数十亿参数)的规模带来了指数级更大的“黑盒”挑战。

对于高风险企业应用,理解 AI 系统如何以及为什么得出特定结论,尤其是如果该结论不准确、有偏见或有害,对于问责制和合规性是强制性的要求。关键的是,对于 LLM,XAI 主要关注将输出归因于输入(提示和上下文),而不是解释基础模型的内部权重,这在应用治理中是不切实际的,也不在应用治理的范围内。

LLM 可解释性——转向局部归因

传统的 XAI 技术方法(如提供特征重要性或部分依赖图)是为更简单的模型设计的。对于 LLM,这些方法被调整为提供局部、标记级的归因,这是与应用治理需求相一致必要的转变:

  • 标记级解释:XAI 对于 LLM 专注于解释为什么特定的标记或输入文本的片段对最终生成的输出有贡献,而不是试图解释整个模型的行为。这种确定有影响输入的能力对于调试偏见的输出至关重要。

  • CoT 和注意力权重:在 LLM 环境中,这些 XAI 方法最关键的结果是 思维链CoT)推理或注意力权重。这些机制表明了模型的内部处理路径,并且是 AI 审计和治理中用于识别导致偏见或不正确响应的确切提示标记的主要证据。

让我们了解为什么 XAI 对 LLM 应用和治理至关重要:

  1. 合规性和可审计性:例如欧盟 AI 法等监管框架对高风险 AI 系统的透明度提出了严格的要求。XAI 提供了必要的审计轨迹,以证明 LLM 决定不是基于受保护或偏见的属性。

  2. 偏见调查和修复:XAI 工具在评估和微调阶段(预部署)被部署。如果审计发现 LLM 表现出不公平的行为(例如,基于地理位置代理拒绝信用),XAI 帮助开发者确定驱动偏见的特定标记或输入模式,从而进行有针对性的微调以纠正模型。

  3. 信任和用户采用:在 LLM 的输出旁边提供合理的解释可以显著提高用户信任。如果 LLM 概括了一份复杂的法律文件,了解哪些源段落在摘要中被赋予最重的权重对于人类验证至关重要。

通过在 LLM 评估、审计和实时推理过程中关注局部归因和 CoT 输出,企业可以增强 LLM 应用中的信任和透明度,满足其治理框架中问责制的关键要求。

对可信 AI 应用的严格评估

要实现真正的商业价值优化,AI 应用的评估必须超越传统的机器学习指标。虽然用于分类和回归的模型可以使用 F1 分数或 AUC 等分数进行充分评估,但这些指标在衡量 GenAI 输出的安全性、可靠性和可信度时完全失效。

为了负责任和优化地部署 LLM 和 GenAI 系统,必须有一个严格以人为中心评估框架,重点关注三个核心标准:

  1. 接地性(或忠实度):接地性是事实准确性的度量,它衡量响应是否完全基于上下文。它是减轻 LLM 幻觉风险的临界指标。这表明 LLM 提出的所有事实性主张都可以直接归因并验证与提供的源材料(例如,通过 RAG 检索的文档)或已知的事实语料库。

因此,高接地性得分验证了输出是真实的,防止应用程序生成可能导致严重商业或法律后果的误导性信息。接地输出是透明的输出。

  1. 实用性(或有用性/相关性):实用性衡量 AI 应用满足用户需求并提供有形价值的程度。实用性评估生成的输出是否相关、全面,并最终对特定商业环境中的人类用户有用(例如,摘要是否抓住了要点?生成的代码是否解决了问题?)

具有高实用性的 AI 应用可以驱动积极的商业价值,减少人力投入,并最大化影响。

  1. 安全和毒性:安全指标是护栏,衡量是否符合伦理和政策边界。这评估输出是否包含有害、有偏见、有毒或不合规的内容。这种评估对于防止伤害并维护公众信任至关重要。

对于不安全的输出必须执行零容忍政策,通常需要人工介入HITL)审查高风险领域,并对所有其他领域进行自动化过滤。

这些评估技术对于建立持续审计循环至关重要,允许组织量化和管理与 LLM 部署相关的独特风险,并确保追求通用人工智能(GenAI)创新始终以责任和可衡量的积极影响为基础。

解决 AI 应用输出的偏差并保持公平性

偏见和公平性是负责任 AI 应用开发中最困难的伦理挑战之一。由于 AI 系统从它们训练的数据中学习模式,它们不可避免地反映了并经常放大现有的社会偏见。这可能导致高风险决策(如贷款申请、招聘或医疗诊断)中的不公平或歧视性结果。为了构建可信赖的 AI 应用,组织必须在整个生命周期中积极解决偏见。以下,我们讨论一些偏见缓解技术:

  • 数据中心方法:验证 LLMs(以及其他基础模型)的训练数据集是否多样化、具有代表性,并经过有害代理属性的有害代理的审计。

  • 模型中心方法:在 LLM 训练和微调过程中使用去偏算法,如对抗学习或重新加权技术。

  • 应用中心方法:实施护栏和人工审查最终 AI 应用输出,以检查在用户看到之前是否存在歧视性语言或决策。

公平性不是一个单一的指标,而是一个多维概念,需要在 AI 应用的整个生命周期中进行持续的审计和干预。组织必须定义明确的公平性指标(例如,人口统计学上的平等、平等机会,以下将解释),以适应其 AI 系统的具体环境。

LLMs 中公平性的重要性

LLMs 中的公平性不仅仅是伦理理想,它是构建可信赖和负责任的 AI 系统的关键要求。有偏见的 LLM 输出可能导致以下结果:

  • 歧视:LLMs 可能会生成基于敏感属性(如种族、性别、宗教、性取向或残疾)歧视个人或群体的内容。这可能会延续有害的刻板印象并限制边缘化社区的机会。

  • 信任侵蚀:当 LLMs 产生有偏见或不公平的输出时,用户会失去对技术的信任,阻碍其采用和接受。

  • 法律和伦理后果:有偏见的 AI 系统可能导致部署它们的组织面临法律挑战和声誉损害。

存在歧视、信任侵蚀和法律后果的可能性突显了在所有 LLM 应用中积极促进公平性的关键重要性。

LLMs 的公平性指标

公平性指标提供了可量化的措施来评估和比较 LLMs 在不同群体中的性能。这些指标与传统 LLM 质量指标(如 BLEU 或 ROUGE)不同,后者衡量的是与参考文本的语言相似度。公平性指标是任务无关的影响和伤害的度量。需要注意的是,没有单一的指标是普遍适用的,指标的选择取决于特定的用例和要解决的偏见类型:

  • 人口统计学平等:此指标检查 LLM 的输出是否在统计上独立于敏感属性。简单来说,它旨在支持不同群体以相似的比例获得积极结果。例如,在一个贷款申请 LLM 中,人口统计学平等意味着不同种族群体的贷款批准率大致相同。然而,如果群体具有不同的潜在资格分布,人口统计学平等有时会导致不公平。

  • 均衡机会:此指标关注在不同群体间平衡错误率(假阳性和假阴性)。它验证了 LLM 在准确性和错误类型方面对所有群体都表现相同。例如,在一个招聘 LLM 中,均衡机会意味着 LLM 对男性和女性候选人的假阳性(错误地预测某人会成功)和假阴性(错误地预测某人会失败)的比率相似。

  • 校准和一致性:校准评估 LLM 的预测概率是否反映了事件的真实可能性。一个校准良好的 LLM 在表示其置信度为 80%时,80%的时间将是正确的。然而,现代 LLM 通常校准不当且容易过度自信,这是一种现象,即使它们是错误的,也会声称有很高的确定性。此外,研究表明,LLM 的概率预测不一致,特别是在模型被明确提示生成数值概率时。这种明确的概率通常由于模型在数值推理方面的局限性而不可靠。为了解决这个问题,值得信赖的 LLM 系统应利用更稳健的方法进行不确定性估计:

    • 隐含概率:在可能的情况下,开发者应使用模型内部隐含概率进行固定选择任务,因为这通常更可靠。

    • 基于一致性的校准:对于通用或开放式生成,可以通过生成响应多次并测量样本之间的程度来从一致性中推导出置信度。当一致性更高时,它与更高的可靠性相关。

    • 温度缩放:这种后处理技术可以应用于模型的输出分数,以数学方式调整过度自信并提高整体校准。

    • 幻觉率:这是 LLM 的一个关键任务无关指标,幻觉率衡量生成内容在事实错误、无意义或不忠实于其来源上下文(特别是在 RAG 中)的频率。这是信任度的一个重要衡量标准,通常使用 HITL 或通过将 LLM 输出与可信知识源进行比较来评估。

偏见的讨论必须超越单一属性(例如,性别或种族)的范围,以解决交叉性偏见。交叉性偏见发生在当一个语言模型(LLM)对具有多个属性组合(例如,黑人女性和年长女性,以及男性)特征的个人表现出独特的歧视时。

这些偏见通常是不可加的,这意味着伤害不仅仅是单个偏见的总和,而是一种独特的劣势模式。例如,在基于 LLM 的简历评分研究中,与具有相似资格的白人男性候选人相比,模型对黑人男性候选人的评估分数较低。即使其他边缘化群体获得了更高的分数。这表明种族和性别的交叉如何产生一种特定的歧视结果,这种结果在单独分析种族或性别时无法捕捉到。此外,当模型对双重劣势身份进行推理时,可能会表现出不确定性或低信心,导致遗漏伤害或不可靠性。

通过使用这些指标,开发者可以量化并评估 LLM 在不同群体中的性能,这对于识别和解决偏见至关重要。为了对 LLM 输出进行公平评估,严格的测试方法至关重要。为了准确测量和分析各种模型偏见指标(如不同影响或平等机会),拥有一个多样化的黄金数据集(如测试集)至关重要。这个数据集不仅必须很大,而且还必须明确设计来代表模型将与之互动的所有相关人口统计学和交叉性群体(包括种族、性别、年龄、残疾等的组合)。黄金数据集必须包括广泛的提示的真相标签或预期响应,以便开发者可以将模型输出与无偏标准进行比较。这一步骤确认了公平性是在所有子群体中全面评估的,而不仅仅是针对大多数人口。

这些指标只是缓解 LLM 中偏见的多方面更广泛方法的一部分,我们现在将探讨这一点。

缓解 LLM 中偏见的策略

缓解 LLM 中的偏见需要一种多方面的方法,该方法在开发生命周期的各个阶段解决潜在的偏见来源。由于大多数组织使用预训练的基础 LLM,重点从复杂且昂贵的预训练偏见缓解转向后训练技术,这些技术解决应用和推理中的偏见:

  • 定期偏见审计:定期和系统地开展偏见审计对于识别和量化 LLM 中的偏见至关重要。这些审计应包括评估模型在多样化数据集上的性能,并使用各种公平性指标。偏见审计应是一个持续的过程,因为偏见可能会随着时间的推移而产生或演变。

  • 为中立性(推理缓解)进行提示工程:最实用、应用级别的缓解策略是制定详细的系统提示,指示 LLM 提供平衡、中立和非刻板化的响应。例如,指示模型“除非明确要求,否则避免所有性别特定或种族特定的术语”或“验证输出在输入假设的群体无论何种情况下都同等尊重。”这项技术在直接在使用的点上解决推理偏差方面非常有效。

  • 对齐和公平性微调(利用 LLM 减轻偏差):组织不是关注大规模预训练数据多样化,而是使用小而高质量的、明确公平的数据集对 LLM 进行微调。这个过程通常是从人类反馈中进行强化学习RLHF)的一部分,它教会 LLM 优先考虑公平和有帮助的响应,而不是有偏差或有害的响应,从而有效地将模型与组织的道德标准对齐。

  • 算法调整:在 LLM 训练期间或之后,可以使用几种算法技术来减轻偏差:

    • 对抗性去偏差:训练 LLM 以最小化其预测敏感属性的能力。实际上,这种方法是使用第二个对抗性网络来减少训练过程中的偏差。主 LLM 被训练以正确执行其任务,同时欺骗对手,对手的唯一任务是预测 LLM 内部状态中的敏感属性(如种族或性别)。这迫使 LLM 学习独立于敏感属性的预测,从而减少对其的依赖。这项技术资源密集型很高,主要被基础模型开发者使用;应用开发者应专注于微调和提示。

    • 公平性微调:在专门设计用于促进公平性的数据集上对 LLM 进行微调。

因此,通过整合这些策略,从提示工程到专门的微调和审计,企业可以主动解决其 AI 应用和治理中潜在偏差。

LLM 应用中的公平性实践示例

以下示例说明了公平性在各种 LLM 应用中的重要性:

  • 内容审核:公平性指标对于验证用于内容审核的 LLM 不会不成比例地标记或删除特定人口群体的内容至关重要。例如,LLM 不应比标准英语更有可能将用非裔美国人方言英语AAVE)写的评论标记为冒犯性。应进行偏差审计以识别和解决此类差异。

  • 客户服务自动化:在客户服务 LLMs 中,公平对所有客户都至关重要,无论他们的背景如何,都能得到公平和尊重的待遇。例如,LLM 应向不同口音或方言的客户提供相同程度的帮助和同理心。训练数据应多样化,并代表客户群体。

  • 医疗聊天机器人:在医疗 LLMs 中,公平至关重要,因为偏见的输出可能对患者的福祉产生严重后果。提供医疗信息的 LLMs 应仔细评估,以确定它们是否在诊断或治疗建议中持续存在种族或性别差异。用于训练这些 LLMs 的数据集必须全面且无偏见,反映患者群体的多样性。

这些例子表明,公平是一个特定领域和持续的挑战,需要仔细考虑背景和潜在的社会影响。接下来,我们将探讨偏见的累积性质。

解决交叉偏见

认识到偏见可以相互交织和累积至关重要。例如,一个 LLM 可能表现出对有色妇女的偏见,这种偏见大于对妇女和有色人种的个别偏见的总和。交叉偏见是在多种形式的偏见交织和累积时出现的特别复杂的挑战,它不成比例地影响各种社会身份交汇处的个人。

解决交叉偏见需要仔细考虑多个敏感属性,并开发公平指标和缓解策略,以考虑这些复杂的相互作用。这是一个持续的研究和开发领域。

在我们解决了偏见的复杂性之后,我们现在将注意力转向另一个关键的伦理考量:保护用户隐私和数据安全。

LLMs 中的隐私和数据安全

如前所述,LLMs 提出了独特的隐私挑战,包括从其训练数据中意外泄露敏感信息的风险。本节解决这些担忧,重点关注保护用户数据和防止在 LLM 输出中生成私人信息。

面向客户的 LLM 应用的安全风险

虽然 LLMs 带来了巨大的功能价值,但它们的公共性质引入了独特且重大的安全风险,需要明确缓解。主要威胁包括以下内容:

  • 提示注入:这是一个主要的攻击向量,其中用户或外部数据源嵌入欺骗性指令(例如,“忽略所有之前的指令”)以绕过模型的安全防护措施。提示注入可以是直接的(覆盖系统提示,也称为越狱)或间接的,恶意提示隐藏在外部源中,如网页或 LLM 被要求处理的文档中。

  • 不安全的输出处理:这发生在 LLM 生成的响应在发送到其他系统或显示给用户的浏览器之前没有得到适当的验证或清理。这是应用程序将 LLM 的原始文本输出视为安全的地方。攻击者可以用自己的输出替换 LLM 的输出,并控制向客户显示的内容。这通常是通过标签欺骗实现的,这是一种提示注入,它模仿应用程序的内部分隔符(例如,XML 标签或特殊令牌)来劫持模型的输出,注入代码(如 HTML 或 JavaScript),当应用程序渲染原始响应时执行跨站脚本XSS)攻击。因此,开发人员必须在处理或显示之前对所有的 LLM 输出进行清理。持续的渗透测试和安全健康监控对于防止此类攻击至关重要。

  • 敏感信息泄露:在大量数据集上训练的 LLMs 可能会无意中重现训练数据集中的机密数据、专有信息或个人可识别信息PII),尤其是在过拟合或给出相似提示时。

  • 模型拒绝服务DoS):攻击者可以通过构建复杂或递归的输入来强制 LLM 执行资源密集型操作,目的是降低合法用户的服务质量或增加运营成本。

LLM 开发和部署中的隐私风险

隐私风险是 LLMs 开发和部署中固有的,主要由于它们训练所依赖的大量数据。这些风险包括以下内容:

  • 训练数据泄露:LLMs 在大量数据集上训练,这些数据集可能包含 PII 或其他机密数据。存在风险,即 LLMs 即使没有明确编程这样做,也可能记住并在其生成的输出中重现这些敏感信息。这被称为数据泄露或模型反演。

  • 生成敏感信息:LLMs 可以被提示生成包含 PII 或其他敏感细节的文本,即使这些信息没有直接出现在训练数据中。这可能发生如果 LLM 学习到允许它根据其他线索推断敏感信息的模式。

  • 在模型训练中使用客户数据:当 LLMs 被微调或适应特定应用时,它们可能会在客户数据上训练。这引发了重大的隐私问题,因为组织必须验证这些数据的使用是道德的,并且符合隐私法规。

这些风险突出了在整个 LLM 生命周期中采取积极主动和系统化方法来处理隐私和数据安全的至关重要性,我们将现在探讨这一点。

在 LLMs 中保护隐私和数据安全策略

为了应对上一节中讨论的隐私风险,保护用户数据并在 LLM 生命周期中保持安全需要一系列战略方法和技术保障。以下是一些策略:

  • 数据匿名化和脱敏:在训练之前,数据集应仔细匿名化或脱敏,以移除或替换个人身份信息(PII)。可以使用 k-匿名性和差分隐私等技术来降低重新识别的风险。

  • 隐私保护训练技术:探索和实施隐私保护机器学习PPML)技术,如联邦学习或安全多方计算,这些技术允许模型在去中心化数据上训练,而不直接暴露数据本身。

  • 输出过滤和净化:实施强大的过滤机制,防止 LLM 生成敏感信息。这可能涉及正则表达式匹配、命名实体识别NER)和内容审查模型等技术。

  • 访问控制和数据治理:实施严格的访问控制,限制谁可以访问和使用大型语言模型(LLM)及其训练数据。建立明确的数据治理政策,概述数据的收集、使用和保护方式。

  • 透明度和用户同意:向用户透明地说明他们的数据如何用于训练和微调 LLM。在处理个人数据时,获取明确的同意。

  • 遵守隐私法规:遵守相关的隐私法规,如通用数据保护条例GDPR)、加州消费者隐私法案CCPA)和健康保险可携带性和问责法案HIPAA)。了解这些法规在 LLM 应用中的具体要求。

  • 定期安全审计:定期进行安全审计,以识别和解决 LLM 系统中可能存在的潜在漏洞。

以下示例突出了在特定、高风险领域隐私和数据安全的重要性:

  • 医疗保健:用于生成医疗摘要或患者报告的 LLM 必须精心设计,以防止敏感患者信息的泄露。为了保护患者数据,可以使用差分隐私等技术向输出添加噪声,同时保留其效用。

  • 金融:用于欺诈检测或风险评估的 LLM 必须以保护客户财务数据的方式进行训练和部署。访问控制和数据屏蔽技术对于限制对敏感信息的访问至关重要。

  • 法律:用于生成法律文件的 LLM 必须经过仔细审查,以防止无意中泄露机密信息。在应用程序设计中实施强大的输出过滤和净化机制对于避免数据泄露至关重要。

虽然基础模型是建立在通用安全措施之上的,但 LLM 的具体应用还需要额外的安全措施。在下一节中,我们将回顾在应用层面需要实施的指南,以促进负责任的部署。

负责任 AI 应用开发指南

开发负责任的 AI 应用需要对这些模型带来的独特挑战进行仔细考虑。由于 LLM 能够生成类似人类的文本,它们可能会放大偏见、产生误导性信息,或在不应用于现实世界应用时无意中侵犯隐私。为了减轻这些风险并鼓励道德部署,开发者必须在应用层面实施特定的指南。这也需要与利益相关者(包括用户、领域专家和监管机构)积极互动,以全面解决伦理问题。这些指南旨在帮助开发者导航构建公平、透明、问责制和尊重隐私的 AI 驱动系统的复杂性。

让我们探讨负责任 AI 应用的关键指南:

  • 内容过滤器:内容过滤器是防止生成有害、冒犯性或不适当内容的防线。这涉及到使用一系列技术来实施强大的内容过滤器,例如以下内容:

    • 关键词过滤:阻止特定的单词或短语

    • 毒性检测模型:识别和标记毒性语言

    • 偏见检测模型:检测和减轻偏见语言模式

    • 适应性:过滤器应具有适应性并持续更新,以应对有害内容的新形式

  • 用户披露:向用户提供清晰透明的披露是建立信任和问责制的关键部分。当用户与 AI 生成内容交互时,应明确告知用户。这促进了透明度,并使用户能够就如何使用应用程序做出明智的决定。披露的方法包括以下内容:

    • 明确标注:明确声明AI 生成内容由 AI 驱动

    • 水印:在生成的文本中嵌入微妙的标记

    • 界面设计:使用视觉提示来指示 AI 交互

  • 输出持续监控:即使在部署之后,持续的监控对于实时检测和解决潜在问题至关重要。这可能包括以下内容:

    • 用户反馈机制:允许用户报告问题内容

    • 自动异常检测:识别生成输出中的异常模式

    • 定期审计:定期审查输出以检查偏见、毒性或其他伦理问题

  • 情境意识:设计 AI 应用以对使用情境敏感对于负责任的部署至关重要。这包括以下内容:

    • 理解与特定用例相关的潜在风险和危害

    • 根据上下文调整应用的行为和安全保障

  • 人工监督:在高风险场景中,人工监督是一种不可或缺的安全保障。这可以通过以下方式实现:

    • 将人工监督纳入涉及 AI 应用的临界决策过程

    • 在错误或偏见可能产生重大后果的场景中,例如对于业务关键解决方案

    • 使用 HITL(人机交互技术)方法在自动化和人工判断之间取得平衡

这些指南不仅仅是理论概念,它们是必须在应用层面实施的实用措施,以指导 AI 系统的伦理和负责任部署。

为什么应用级指南很重要?

在金融领域,这些应用级指南的需求尤为迫切。因此,为了找到答案,我们将讨论金融领域的例子。用于风险管理、欺诈检测和客户服务等任务的 LLM 应用必须精心设计,以确保以下内容:

  • 避免可能歧视某些客户的偏见决策

  • 保护敏感的金融数据

  • 提供准确和可靠的信息

  • 保持透明度和问责制

因此,金融机构必须实施强大的内容过滤器,提供清晰的用户披露,并持续监控其 AI 应用的输出,以确保其伦理和负责任的使用。

通过仔细实施这些指南,金融机构可以在保护客户、遵守法规和维护公众信任的同时,利用 LLM(大型语言模型)的力量。以下案例研究进一步说明了这些指南在实际应用中的重要性。

伦理地部署 LLM – 案例研究和最佳实践

这个案例研究表明,在敏感领域伦理地部署 AI 应用需要积极主动、协作和以人为本的方法。我们使用了一个假设的例子来进一步探讨在伦理 AI 部署中涉及的职责和流程。

在敏感领域以伦理方式部署 AI 应用需要周密的规划和执行。一个引人注目的例子是 OpenAI 与医疗提供者的合作,共同开发 AI 症状检测器。在这个案例中,关键的伦理考虑包括以下内容:

  • 解决偏见:OpenAI 和医疗提供者勤奋地工作,通过确保 LLM 为不同患者群体提供公平和准确的信息,来识别和减轻 LLM 输出中的潜在偏见。这包括在全面且具有代表性的医疗信息数据集上训练 LLM,以及严格评估其在不同人口统计学群体中的性能。

  • 保护患者隐私:保护患者隐私至关重要。系统被设计成安全且保密地处理患者数据,遵守相关隐私法规(例如,HIPAA)。这很可能涉及数据匿名化、访问控制和安全数据存储等技术。

  • 建立信任:通过优先考虑伦理因素并展示对病人福祉的承诺,OpenAI 和医疗服务提供者培养了医疗专业人士和患者对 AI 症状检查器的信任。

建立在其在负责任人工智能(RAI)开发方面的经验之上,InnovAIte LLC 通过部署一个用于自动化的 LLM(大型语言模型)将其人工智能解决方案扩展到客户服务领域。为了展示其对伦理人工智能实践的承诺,InnovAIte LLC 成立了一个伦理委员会来监督项目并确保与不断发展的伦理指南保持一致。AI 开发者进行了全面的影响评估,评估 LLM 对客户互动的潜在影响。企业领导者为 RAI 项目分配资源,并积极与包括客户、客户服务代表和监管机构在内的利益相关者互动,以收集多样化的观点。

政策制定者为在客户服务中伦理使用人工智能提供了指南,InnovAIte LLC 勤奋地遵循这些指南以确保符合监管要求。最后一公里的供应商仔细打包并部署了人工智能应用,实施了强大的安全机制并定期进行审计以维持伦理标准。最终用户提供了宝贵的反馈,有助于人工智能应用的持续改进。

通过整合 HITL 方法并采用全面的 RAI(责任人工智能)指标,InnovAIte LLC 加强了人工智能应用的伦理性和可靠性。这些做法增强了利益相关者的信任,有效降低了风险,并促进了创新环境,进一步巩固了 InnovAIte LLC 作为负责任人工智能部署领导者的声誉。

摘要

本章探讨了开发和部署可信赖 AI 应用程序的关键伦理考量和建议做法。我们首先概述了 LLMs 呈现的独特挑战,包括其产生事实错误信息的倾向(幻觉)、放大训练数据中存在的偏见,以及数据泄露的潜在可能性。然后,我们探讨了缓解这些风险和促进负责任 LLM 开发的关键策略,重点关注透明度和可解释性、偏见与公平性,以及隐私和数据安全。正如所提到的,开发可信赖的 AI 需要一种全新的质量保证方法,这在可信赖 AI 应用程序的严格评估中得到了强调。因为传统的机器学习指标(如准确率、F1 分数)无法评估 LLMs 生成的新内容的品质,因此评估需要以人为中心。这种转变确立了衡量可信赖性和商业实用性的必要性,特别是通过如扎根性(事实准确性)和实用性(商业相关性)等标准,以实现负责任的部署。

本章还强调了在应用层面实施特定指南对于负责任 AI 部署的重要性,包括内容过滤器、用户披露和输出持续监控。为了说明成功的伦理 AI 部署,我们提供了一个真实世界的案例研究,强调 OpenAI 与医疗提供商合作开发 AI 症状检查器。这个例子展示了解决偏见和隐私问题以在 AI 应用程序中建立信任的重要性。我们进一步通过 InnovAIte LLC 的假设性例子探讨了伦理 AI 部署中的关键角色和流程。通过遵循这些原则和最佳实践,开发者和组织可以发挥 LLMs 和 GenAI 的巨大潜力,同时减轻伦理风险并构建可信赖的 AI 系统。

在下一章中,我们将探讨负责任 AI 的关键法律和监管框架,考察不同国家在治理方面的方法,以及组织如何实施有效的合规策略。

订阅免费电子书

新框架、演进的架构、研究更新、生产分解——AI_Distilled 将噪音过滤成每周简报,供实际操作 LLMs 和 GenAI 系统的工程师和研究人员阅读。现在订阅,即可获得免费电子书,以及每周的洞察力,帮助您保持专注并获取信息。

packt.link/8Oz6Y 订阅或扫描下面的二维码。

白色背景上的二维码  AI 生成的内容可能不正确。

第十五章:负责任人工智能的监管和法律框架

负责任的人工智能RAI)日益重视不仅仅是一个短暂的潮流;它反映了在道德和负责任地使用这项强大技术方面日益增长的需求。我们正处于一个关键转折点,将人工智能的开发和部署与不断发展的伦理考虑和法律规定相一致至关重要。这一旅程不仅涉及采用 AI,还需要将伦理原则和合规机制嵌入到 AI 系统的本质之中。人工智能技术的快速扩散需要发展强大的治理和监管框架,以促进负责任的创新、减轻潜在风险并适应人工智能领域的动态性质。理解和导航这一不断发展的监管环境对于寻求利用 AI 的益处、维护伦理标准并遵守法律合规的组织至关重要。

本章探讨了管理人工智能的关键法律和监管框架,并提供了在组织内实施合规的策略。

我们在本章中将涵盖以下关键主题:

  • 比较全球人工智能监管方法

  • 实施有效的 AI 合规策略

  • 应对监管挑战——案例研究

为了提供一个连贯且可操作的 RAI 治理指南,本章采用三部分结构,旨在从高级全球格局逐步过渡到实际的组织执行:

  1. 全球监管方法:我们首先通过比较塑造全球人工智能治理的核心哲学和法律模型(例如,欧盟的风险方法、美国的部门方法)来建立外部环境。这提供了必要的背景基础。

  2. 组织合规(KYAI 框架):然后,我们通过引入了解你的 AIKYAI)系统来转向组织内部所需采取的行动。本节致力于将抽象的全球原则转化为一个结构化、实用的内部框架,用于组织内的风险评估、分类和合规控制。

  3. 生成式人工智能的风险、责任和案例研究:最后,我们针对生成式人工智能带来的独特、高风险挑战进行探讨,并提供一个清晰的问责框架。然后,通过具体的、现实世界的案例研究来巩固这一材料,这些案例研究展示了成功组织如何在实际中管理这些法规和风险。

比较全球人工智能监管方法

虽然全球范围内都认识到 RAI 的需求,但不同地区正在采用不同的监管方法。

本节比较了几个关键参与者的框架:

  • 欧盟——基于风险和全面的方法:欧盟人工智能法案代表了建立全面人工智能监管的先驱努力。它采用基于风险的方法,根据人工智能系统可能造成伤害的潜力对其进行分类。

这里是其关键特性:

  • 广泛定义“AI 系统”,包括自主或半自主运行、部署后适应以及产生影响数字或物理环境的输出

  • 禁止被认为不可接受的高风险应用(例如,公共场所的社会评分或实时人脸识别)

  • 对高风险系统施加严格的强制性要求,包括透明度、数据治理和人工监督

  • 针对具有特定透明度义务的通用人工智能GPAI)模型

  • 执法包括重大罚款(高达 3500 万欧元或全球年度收入的 7%)

比较视角:欧盟的方法以其广泛的范围和强调保护基本权利而著称。它为 AI 发展和部署设定了高标准。

  • 美国 – 部门和原则基础方法:美国采取更部门化的方法,不同机构监管特定领域的 AI。它还强调伦理原则。

这里是美国方法的关键特征:

  • 人工智能权利法案概述了安全有效系统的原则、算法歧视保护、数据隐私、透明度和问责制。

  • 在医疗保健(食品药品监督管理局,或FDA)、金融(各种机构)和就业(例如,纽约市的自动化就业决策工具,或AEDT)等领域存在特定部门的法规。州级法律,如加利福尼亚消费者隐私法案CCPA),解决与 AI 相关的数据隐私问题。

需要注意的是,尽管美国主要采用针对人工智能的部门方法,但存在一定程度的地方分权,各种州和地方法律补充了联邦指南。

比较视角:美国的方法以其灵活性和在特定部门内关注创新而著称。然而,它可能导致监管格局碎片化。

  • 中国 – 以政府领导和控制为导向的方法:中国的 AI 监管受到政府优先事项的严重影响,强调控制和社交稳定。

这里是其关键特征:

  • 规章制度关注诸如 GenAI 服务、算法推荐和深度合成技术等领域

  • 强调透明度、非歧视、数据保护和内容控制

  • 政府在引导人工智能发展和部署中发挥着重要作用

比较视角:中国的做法优先考虑政府监管和社会控制,这与欧盟关注个人权利和美国强调创新形成对比。

  • 其他显著方法

    • 印度:关注“AI 普及”和伦理框架等政策,但缺乏强有力的执行机制

    • 澳大利亚:强调以人类福祉、公平和透明为中心的 AI 伦理原则

    • 新加坡和加拿大:推广基于原则的治理框架,以指导 RAI 发展

    • 日本:依靠行业自律和人工智能战略委员会的指南,通过提高人工智能操作者的数据处理、安全和透明度来促进道德人工智能发展

重要的是要注意,尽管美国主要采用部门性的人工智能监管方法,但存在一定程度的地方分权,各种州和地方法律补充了联邦指南。

下表提供了一个全球人工智能监管方法的全面比较,概述了范围、执法和重点等关键特征:

| 特性 | 欧盟 | 美国 | 中国 | 其他显著例子 |

| --- | --- | --- | --- | --- |

| 监管方法 | 基于风险和全面性 | 部门性、基于原则,具有分权化(国家和地方法律)的元素 | 以政府为主导、控制导向和创新导向 | 基于原则:新加坡(模型人工智能治理框架)和加拿大(人工智能原则)伦理导向:澳大利亚(人工智能伦理原则)发展中的:印度(人工智能普及),巴西(制定人工智能框架) |

| 范围 | 广泛定义的人工智能,按风险分类 | 特定部门(医疗保健、金融、执法等),关键部门的准则 | 关注特定的 AI 应用(生成式 AI、推荐) | 多样化,通常集中在伦理准则或特定的 AI 用途上 |

| 执法 | 强有力的,有重大罚款 | 根据部门和州/地方级别而变化,表明存在一定程度的地方分权 | 强有力的政府监督和执法 | 在某些情况下,发展中的或较少集中的执法机制 |

| 关键焦点 | 保护基本权利,管理高风险人工智能 | 在解决特定风险(偏见、隐私)的同时促进创新 | 社会稳定、政府控制、技术进步 | 伦理考量、指导原则、适应全球趋势 |

| 显著法规 | 欧盟人工智能法案 | 美国显著法规:人工智能权利法案(原则)、CCPA(州隐私法)、纽约地方法 144(地方就业法)、FDA 指南(联邦部门)、FTC(消费者保护)、NIST 人工智能(风险管理框架) | 生成式人工智能服务管理措施,算法推荐管理。中国的法规正在迅速演变。 | 模型人工智能治理框架(新加坡)、人工智能原则(加拿大)、人工智能伦理原则(澳大利亚) |

表 15.1:全球人工智能监管方法比较

这项比较分析展示了全球对人工智能监管的不同优先级,突出了在合规方面采取细致和全面方法的重要性。

跨境人工智能合规导航

对于跨国组织来说,由于管辖权要求的冲突,实现人工智能合规变得复杂,主要涉及数据本地化和数据传输。虽然一些地区(例如中国和印度)对数据本地化提出要求,限制数据处理在国内边界内进行,而其他地区(例如欧盟)则依靠严格的标准合同条款SCCs)或充分性决定来允许跨境数据流动。这迫使公司采用“最高共同分母”合规标准,即最严格的监管要求(例如,GDPR 的隐私规则)通常必须在全球范围内应用,以避免部署多个、隔离的人工智能实例。关键挑战在于在基础法律迅速变化的同时保持这种协调一致的政策。

接下来,我们将探讨组织可以实施的实用策略,以应对这一复杂的环境。

实施有效的 AI 合规策略

今天的组织必须积极应对人工智能合规,以减轻处罚、法律挑战和声誉损害的风险。这不仅需要了解不断发展的 AI 法规,还需要建立强大的 AI 治理框架。这些框架的关键组成部分是 KYAI 流程,它提供了一种结构化的方法来识别和管理符合监管要求的人工智能系统。

KYAI 流程赋予组织系统地导航人工智能合规的权力。它包括以下关键步骤:

  1. 识别:确定系统是否根据适用法规符合“人工智能系统”的定义。这通常涉及评估系统是否达到以下标准:

    • 以某种程度的自主性(自主或半自主)运行。它具有在部署后调整其行为的能力。

    • 生成可能对数字或物理环境产生重大影响的输出。

实用指南:维护组织内所有人工智能系统的全面清单,记录其功能和潜在影响。

  1. 风险评估:评估每个人工智能系统相关的潜在风险,并确定它是否属于相关法规定义的任何“高风险”类别。常见的高风险领域包括以下内容:

    • 医疗保健

    • 金融服务业

    • 关键基础设施

    • 公安执法

    • 就业决策

    • 公共安全

实用指南:进行彻底的风险评估,考虑对个人、社会和组织本身的潜在危害。如有可用的监管机构提供风险评估框架,请使用。

  1. 合规实施:确定并实施每个人工智能系统遵守监管要求的必要具体合规措施。这些措施可能包括以下内容:

    • 实施安全和安全机制

    • 维护数据质量和治理

    • 提供透明度和可解释性

    • 建立人类监督和干预协议

    • 保持详细的文档和审计跟踪

    • 定期进行审计和影响评估

实用指南:为每个 AI 系统制定详细的合规计划,分配责任和截止时间。

在 KYAI 流程之外,组织可以采用额外的合规策略来加强其整体 AI 合规态势:

  • 持续的监管培训和意识提升

    • 为员工提供关于 AI 法规和伦理考量的持续培训和教育活动

    • 培养关于 AI 合规的责任感和警觉性

实用指南:建立一个监控系统变更并向相关人员传达更新的系统。注意:团队负全部责任,并将评估下游变化并分享相关更新,因为并非所有信息都适用于所有垂直领域或组织内的业务单元BU)。

  • 独立审计和认证

    • 聘请独立的第三方审计员评估 AI 系统的合规性和道德性

    • 从认可的机构获取认证,以展示对 RAI 实践的承诺。

实用指南:选择在 AI 治理和相关行业法规方面具有专业知识的信誉良好的审计员。

  • 监管科技(RegTech)解决方案 :

    • 利用 RegTech 工具自动化合规任务,监控监管发展,并高效管理合规文档

    • 减少手动合规工作的负担,并最小化错误风险

实用指南:仔细评估 RegTech 解决方案,以确保与组织的具体需求和监管要求相一致。

通过采取主动方法并实施这些策略,组织可以有效地应对不断变化的 AI 监管环境,将道德 AI 实践融入其运营,并与利益相关者建立信任。

实施 KYAI 系统 – 注册模板

KYAI 框架只有在每个部署的 AI 模型都正式注册和分类的情况下才有效。以下模板应作为您组织内部模型注册表的起点,并定义了构建 AI 系统清单的步骤:

| 字段 | 目的 | 示例 |

| --- | --- | --- |

| 系统名称 | 唯一、内部项目标识符。 | Customer_Sentiment_Analyzer V2.0 |

| 系统负责人 | 产品负责人对系统的性能、风险和合规负责。 | 客户成功副总裁 |

| 模型类型 | 技术的分类(例如,传统机器学习、LLM/GenAI、RAG、简单启发式)。 | GenAI (LLM) |

| 主要用例 | 对系统功能及其支持的决策的简单、清晰描述。 | 总结客户反馈并自动生成帮助文档草稿 |

| 数据范围 | 模型摄入了哪些类型的数据?(PII、财务、受保护的健康信息、公开) | 客户支持记录(包含 PII) |

| 监管范围 | 哪些法规适用?(GDPR、HIPAA、AI 法案、行业法规) | GDPR(数据最小化),AI 法案(透明度) |

| 初始风险评分(1–5) | 对系统可能造成伤害的潜在性的快速、初步自我评估(1=低,5=高)。 | 4(高,由于 PII 和面向客户的特点) |

| 控制优先级 | 哪些领域需要立即关注?(公平性、安全性、可解释性) | 安全性(提示注入),公平性(摘要中的偏见) |

表 15.2:KYAI 系统注册模板

下一个部分中分享的清单是人工智能影响评估AIIA)。这是当 KYAI 系统将模型标记为高风险时使用的关键工具。

人工智能影响评估(AIIA)清单模板

AIIA 对高风险人工智能系统提供细粒度、强制性的审查。此模板设计得如此,以便在部署之前明确审查并缓解所有监管和伦理领域:

| 风险领域 | 评估问题 | 状态(是/否/不适用) | 所需缓解/行动负责人 |

| --- | --- | --- | --- |

| 公平性和偏见 | 根据测试指标,模型在所有已识别的敏感子群体(例如,种族、性别、年龄)中的性能是否公平? | | |

| 透明度 | 是否向最终用户提供了关于模型核心功能及其影响的清晰、非技术性解释(例如,模型卡片)? | | |

| 数据治理 | 所有训练和部署数据是否合法来源、准确标记,并符合所有隐私法规(例如,GDPR 和 CCPA)? | | |

| 鲁棒性和安全性 | 系统是否已针对对抗性攻击进行了测试,包括提示注入和数据中毒? | | |

| 问责制 | 对于系统作为“高风险”操作的所有决策,是否已定义明确的人类监督和干预机制? | | |

| 测试和验证 | 是否有独立第三方(或一个独立的内部验证团队)验证了系统的合规性和风险缓解控制? | | |

| 批准部署 | 系统是否已由内部人工智能治理委员会或指定的执行所有者正式批准部署? | | |

表 15.3:AIIA 清单

您的组织可以使用这些模板作为起点来正式化人工智能治理流程。使用 KYAI 注册模板进行模型注册和初始风险评估。一旦 KYAI 将系统识别为高风险,就部署 AIIA 清单模板以进行所需详细的风险分析和结构化审查流程。这些工具协同工作,为 RAI 部署提供必要的控制回路。

在我们探讨了实际合规策略之后,我们现在将深入研究导航人工智能监管复杂性的更广泛挑战。

探索人工智能监管的复杂性

人工智能监管环境正在迅速演变,为组织带来了错综复杂的挑战。走向全面人工智能治理的旅程充满了监管快速演变、跨行业技术的系统性困难。理解这些挑战对于构建有弹性的合规计划的组织至关重要:

  • 创新速度与监管速度:监管框架本质上是缓慢的,通常需要数年才能起草、辩论和实施。相比之下,新的 AI 模型、能力和风险(如新的越狱或模型攻击)可能在几个月甚至几周内出现。这种根本性的不匹配意味着法律在实施之前就有可能过时,从而形成持续的监管追赶游戏。

  • 技术中立性的挑战:监管机构力求制定技术中立的法律,这些法律规范人工智能系统的影响,而不是使用的具体技术。然而,生成人工智能的独特属性(其不透明性、其规模以及其“幻觉”倾向)不断挑战这种中立性,需要具体、规定性的规则(例如针对基础模型的规则),这些规则可能会迅速过时。

  • 监管碎片化和重叠:与其他受监管行业不同,人工智能系统受到来自多个司法管辖区重叠规则的约束(例如,GDPR、CCPA、针对特定行业的法律,如美国的 HIPAA 医疗保健行业)。对于跨国组织来说,遵守这一多样化的、经常冲突的全球、国家和州级要求,在实现统一的行业标准方面构成了巨大的障碍。

  • 前所未有的风险规模:人工智能系统引入的风险规模是传统软件所不具备的。一个部署全球的单个有缺陷的 LLM 可以瞬间影响数百万用户,导致品牌损害、市场波动和巨额监管罚款。这迫使组织从被动合规(打勾)转变为主动、以风险为首要文化的文化,在部署之前必须对潜在的灾难性失败进行建模和减轻。

人工智能监管的持续演变对企业来说是一个持续的挑战。通过采用战略性和适应性强的治理方法,组织不仅可以减轻风险,还可以建立一个促进长期成功的信任基础。

生成人工智能时代的责任、问责制和风险管理

随着人工智能系统变得更加自主和能够生成新颖内容,责任问题已不再是理论上的。强大的人工智能语言模型(LLM)和多模态生成人工智能(GenAI)模型的发展,需要明确了解当这些系统造成损害时谁应承担责任。人工智能的法律和伦理环境正在迅速演变,以应对责任、问责制和风险管理的关键概念。

危机所在:定义核心概念

让我们深入了解塑造人工智能法律和伦理方面的基础理念:

  • 责任:在人工智能的背景下,责任是指由人工智能系统造成的伤害或损害的法律责任。这可以从聊天机器人提供错误的医疗建议到 GenAI 模型生成侵犯版权的内容。与传统的软件不同,GenAI 不可预测和自发的本质使得分配责任特别具有挑战性。

  • 问责制:解释和证明人工智能系统行动和决策的义务。对于复杂的“黑盒”模型来说,这意味着组织必须明确 AI 的设计、开发和部署的责任线,始终确保有一个能够解释系统行为的人类或团队。

  • 风险管理:这是在潜在危害发生之前主动识别、评估和减轻危害的过程。对于现代 GenAI 来说,这包括解决新风险,如创建令人信服的深度伪造、大规模传播仇恨言论或无意中生成恶意或偏见内容。

先进 GenAI 的新风险

先进通用人工智能(GenAI)的扩散,包括能够生成图像、视频和代码的多模态模型,引入了一种新的风险类别,这些风险超越了传统人工智能的担忧。这些风险需要更细致的安全和治理方法。

GenAI 在商业中的应用呈指数级增长,尤其是在过去两年中,它正在改变行业并加速创新。平均而言,组织使用大约 66 个 GenAI 应用,其中 10%被归类为高风险,显著增加了潜在的攻击面(Hendren,2025 年)。

企业风险

这些威胁会影响组织的运营、数据和声誉。员工未经授权使用 GenAI,即所谓的“影子 AI”现象,是一个主要关注点。当员工使用未经批准的第三方模型时,可能导致无意中数据泄露和知识产权暴露(Safe Security,2025 年)。

一个显著的风险是未经授权使用 GenAI 工具,这可能导致机密企业数据暴露给第三方服务和模型(Oswal,2025 年)。这可能导致安全漏洞和合规性问题。

GenAI 能力风险

这些风险源于模型本身的固有行为和局限性,可能会损害其输出的完整性和可靠性:

  • 幻觉和错误信息:最新的、更复杂的模型仍然会产生“幻觉”,即事实错误或不合逻辑的输出,这些输出非常令人信服且难以检测。这在加拿大航空因其聊天机器人提供错误信息而面临诉讼的真实案例中得到了证明。

  • 提示注入:这是一种对抗性攻击的形式,其中用户的输入操纵模型绕过其安全控制或执行未预期的行为。

对抗性 AI 风险

这些是与恶意行为者使用 GenAI 执行更复杂和大规模攻击相关的风险:

  • 深度伪造和社会工程:高级生成模型可以创建超逼真的深度伪造和个性化的社会工程攻击,例如高度令人信服的钓鱼邮件,这些攻击难以与真实内容区分(英国政府,2025)

  • AI 生成代码不安全:编写代码的模型可能会引入漏洞或安全缺陷,使得生成的软件成为新的攻击向量(PwC,2024)

监管和治理风险

影响更广泛经济和社会的更广泛、系统性风险,通常源于缺乏建立的法律框架:

  • 信任侵蚀:合成媒体(包括深度伪造和超逼真机器人)的广泛可用性可能会侵蚀公众对信息的信任(AI 安全中心,2024)。

  • 法律环境演变:法律和监管环境正在迅速变化。例如,根据欧盟 AI 法案的执行可能会导致重大罚款,高达 3.5 亿欧元或全球年收入的 7%(第 99 条:处罚。欧盟 AI 法案,2025),突显了不遵守规定的严重后果。

  • 风险偏好透明度不足:缺乏公开明确的风险偏好,即组织在 AI 发展中所愿意接受的风险水平,使得监管机构和公众难以信任公司。使这些风险框架更加“可读”对于建立公众信心和推动 RAI 发展(CDT Insights,2025)至关重要。

接下来,让我们探讨一些应对这些风险的最佳实践。

建立问责框架——企业最佳实践

为了应对新的风险和不断变化的监管环境,组织必须积极构建基于几个关键实践的强大问责框架:

  • 进行 AIIA:这些评估是主动措施,旨在在 AI 系统部署前和部署期间识别、评估和减轻潜在风险和危害。AIIA 有助于定义系统的目的,确定受影响的利益相关者,映射相关法律,并评估潜在的利益和风险。

  • 建立 AI 治理委员会:企业应创建具有多元专业知识的专门治理委员会或委员会(法律、技术、伦理和商业),以监督 AI 战略、风险管理以及合规性。这些委员会确保 AI 项目与公司的价值观保持一致,并为问责制分配明确的角色和责任。

  • 优先考虑人工监督:对于高风险 AI 应用,有意义的人工监督至关重要。这意味着赋予人类理解、监控,最重要的是,覆盖或纠正系统输出的能力。对人工审查员的培训对于确保他们能够解释 AI 决策并保持对自动化偏差的健全怀疑至关重要。

RAI 是一个持续适应和创新的旅程。通过嵌入伦理原则和主动问责框架,组织可以从仅仅利用 AI 的技术能力转变为维护更高的伦理责任标准。这不仅降低了风险,还建立了在 AI 驱动未来实现可持续商业卓越所需的信任。

在建立问责框架的最佳实践基础上,以下关于案例研究的部分将探讨组织如何将这些原则实际应用于应对现实世界风险和遵守不断变化的监管环境。

应对监管挑战——案例研究

现实场景突出了主动 AI 合规的重要性以及不合规的后果。它们还说明了如何应对监管需求可以带来积极的结果。以下表格提供了一个综合的视角,展示了现实世界事件、它们引发的特定监管问题以及防止再次发生所需的组织或技术解决方案:

| 案例研究/事件 | 情况/问题(即时故障) | 监管/合规问题(“为什么”) | 所需解决方案/变更(可执行修复) |

| --- | --- | --- | --- |

| 加拿大航空聊天机器人(幻觉) | 客户服务聊天机器人提供了一项不存在的丧葬政策,导致客户受损和财务责任。 | 问责失败(模型是公司的代理人);LLM03:缺乏扎根(OWASP Top 10)。 | 技术:强制执行 RAG/扎根;实施安全/回退响应。治理:建立 AI 内容管理员角色;定义人工介入的阈值。 |

| Meta 的广告定位(偏差) | 广告投放系统根据人口统计信息不均匀地显示工作或住房广告,加剧了偏见。 | 歧视/公平(违反平等机会法律);AI 法案:高风险(用于就业服务)。 | 技术:应用处理过程中的去偏(例如,对抗性去偏)。治理:强制执行不同影响上的 AIIA;实施公平审计。 |

| Google Gemini 图像生成(不准确性) | 由于现有偏差控制的过度校正,该模型生成了历史上不准确的照片。 | 透明度/信任侵蚀(对内容护栏缺乏控制);KYAI 失败(对文化/历史伤害风险的误分类)。 | 技术:调整 RLHF 政策;为敏感类别实施输出验证过滤器。治理:为敏感内容建立 RAI 审查委员会。 |

| OpenAI ChatGPT (数据泄露) | 一个临时软件漏洞导致用户聊天历史和支付信息被暴露给其他用户。 | 隐私和安全(违反 GDPR/CCPA 数据安全要求);LLM04:拒绝服务(系统变得不可靠)。(OWASP Top 10)。 | 技术:实施强大的多租户分离逻辑;进行频繁的安全渗透测试。治理:强制进行数据保护影响评估DPIA);制定正式的泄露应对计划。 |

| 微软 Bing/Copilot(有害输出) | 模型被越狱以在长时间未监控的会话中生成侮辱性、操纵性或情感有害的文本。 | 安全和危害(违反可接受使用政策);LLM01:提示注入/越狱(OWASP Top 10)。 | 技术:实施更强的护栏和内容过滤器;执行回合限制和会话重置。治理:定义可接受使用政策;实施对有害输出的持续监控。 |

| 苹果 Siri(隐私审查) | 用户语音录音被存储并由第三方承包商手动审查,而没有完全明确的用户同意。 | 数据治理/隐私(违反 GDPR/CCPA 同意和数据处理原则)。 | 技术:实施差分隐私(数据匿名化);引入客户端处理。治理:更新隐私政策,包含明确的审查同意;实施强制数据最小化协议。 |

| Pragya Prasun & Ors. v. Union of India(印度最高法院) | 政府数字 KYC 项目要求眨眼/面部动作,导致酸攻击幸存者和视障人士自动被拒绝,无法获得基本服务(例如,银行账户和电信服务)。 | 公平/偏见(违反生命基本权利——第 21 条)和违反 2016 年残疾人权利RPwD)法,未能提供合理的便利。 | 技术:强制要求对无法满足生物识别要求的用户提供替代的非生物识别替代方案(例如,面对面验证)。治理:要求对与可访问性相关的拒绝进行人工辅助审查,并在系统架构阶段建立包容性审计和合理便利的设计。 |

表 15.4:人工智能治理失败总结和可操作的合规修复

这些案例研究共同表明,在人工智能领域,监管和法律挑战是一个持续的现实。主动合规、强大的治理和对道德设计的承诺对于降低风险和培养公众信任至关重要。我们已经审查了管理人工智能的关键法律和监管框架,并探讨了实现合规的实际策略。现在,我们将通过总结关键要点和展望未来趋势来结束这一章。

摘要

RAI 管理的挑战在于它是一个动态的、持续的过程,而不是一个静态的目标。通过建立如 KYAI 系统等强大、即时的合规结构以及通过 AIIA 进行标准化的事后审查,组织可以自信地满足当前的全球法律要求。然而,监管环境将继续受到快速技术进步的根本性重塑。下一章将重点关注前瞻性的战略必要性,探讨新兴的技术趋势(如规模定律、量子计算和代理人工智能)以及定义 2030 年 AI 驱动企业的深刻社会影响(包括可持续性和公平的 AI)。

参考文献

|

获取本书的 PDF 版本和独家额外内容

扫描二维码(或访问 packtpub.com/unlock)。通过书名搜索本书,确认版本,然后按照页面上的步骤操作。 | imgimg |

| 注意:请妥善保管您的发票。直接从 Packt 购买不需要 发票。 |

| --- |

第十六章:人工智能优化未来:趋势、愿景和负责任实施

本书探讨了人工智能的变革力量以及优化其开发和部署的至关重要性。我们强调,真正的 AI 创新不仅仅是关于最大化效率或推动技术边界;它还确保人工智能系统被负责任和道德地开发和使用。随着我们探索的结束,展望人工智能的未来变得至关重要。

这最后一章不仅将审视未来几年将塑造 AI 优化的新兴趋势,还将强调在应对这个不断发展的格局中,负责任地实施人工智能的持久重要性。通过展望 2030 年的 AI 驱动型企业,我们旨在激发一个未来,在那里人工智能的潜力得到充分实现,同时造福企业和整个社会。

在本章中,我们将涵盖以下关键主题:

  • AI 优化和负责任实施中的新兴趋势

  • 人工智能的社会影响 – 人类和可持续性

  • 预见性的视野 – 2030 年的 AI 驱动型企业

AI 优化和负责任实施中的新兴趋势

人工智能的未来将由几个关键趋势塑造,从计算能力到自主系统,这些趋势不仅承诺增强人工智能的能力,而且需要重新关注负责任的实施。本节将探讨这些新兴趋势,包括规模定律的突破、量子计算的出现、代理人工智能和可解释人工智能XAI)的演变以及人工智能在网络安全中的关键作用。这些进步都强调了主动进行道德治理的必要性,以确保并利用人工智能的力量,造福社会。

规模定律与计算的未来

人工智能的持续进步与规模定律密切相关,这些定律描述了增加模型大小、数据集大小和计算能力通常如何导致人工智能性能的提升(NVIDIA,2023;AI 安全手册,2024)。正如 NVIDIA 首席执行官黄仁勋所解释的,这些规模定律不是一维的,而是在人工智能发展的三个关键阶段上运作:预训练(如基础学习)、后训练(在特定领域的专业化)和测试时扩展(为高质量输出进行推理)。

人工智能模型在三个关键维度上增长,被称为规模定律:预训练、后训练和测试时扩展。这个概念可以用一个显示“智能”在Y轴上和“计算”在x轴上的图表来说明。随着计算资源的增加,智能也会增加,经历三个阶段:预训练,模型获得基础知识;后训练,它们在特定领域专业化;测试时扩展,它们进行“长期思考”以产生高质量输出。

这种对更多计算能力的内在需求是推动专用人工智能芯片(如 GPU 和 TPU)持续发展和广泛部署的主要催化剂,这些芯片旨在高效处理人工智能并加速这些扩展过程。随着人工智能模型变得更大、更强大,对强大的人工智能治理和可解释性的需求变得至关重要。在这些复杂的系统中实施透明度和问责制对于建立信任和减轻潜在风险至关重要。

未来人工智能的关键技术驱动因素

量子计算正成为一种变革性技术,它有潜力解决目前经典计算机难以解决的问题。以下是一些真实世界的例子:

  • 制药和材料科学:药物发现领域已经利用量子计算来加速寻找新药物和创造新材料的过程。例如,量子计算机可以模拟分子相互作用,其复杂程度是当前传统超级计算机所无法达到的,这可能导致医学和材料开发方面的突破,例如创造自修复材料。

  • 金融服务:量子计算机有潜力解决复杂的金融建模问题。它们可以通过快速分析大量数据并识别出经典计算机难以察觉的微妙模式,来优化投资组合。这可能导致更有效率的市场和更好的风险管理。

  • 基础物理和科学:例如 Google 这样的公司正在使用量子处理器来模拟粒子物理学中的基本相互作用。这类研究可能导致对宇宙最基本法则的更深入理解,例如粒子的行为以及将它们连接起来的“隐藏的弦”。

  • 供应链和物流:量子计算机的巨大计算能力可以应用于优化问题,例如管理复杂的供应链。通过找到最有效的路线和日程安排,量子计算可以显著降低成本和环境影响。

  • 人工智能与量子计算:人工智能与量子计算的融合可能解锁前所未有的计算能力,因为量子处理器可以显著加速更强大人工智能模型的训练和发展。这种协同作用有可能推动多个行业的进一步创新。

让我们详细了解一下量子计算。

正在开发量子计算机以执行传统数字计算机难以完成,甚至不可能完成的任务。它们非常适合解决复杂问题,如寻找大数的质因数、搜索庞大的数据库以及模拟量子系统。尽管还需要克服重大的科学和工程挑战,但这项技术的潜力是巨大的。

什么是量子位?

量子比特(简称量子位)是量子计算中的基本信息单元。与经典比特不同,经典比特要么是 1(开启)要么是 0(关闭),一次只能存储一个信息位,而量子比特就像一个可以同时开启、关闭和两者兼具的开关,这被称为叠加。

由于一个量子比特可以同时代表许多可能性,量子计算机可以并行处理大量的变量和潜在解决方案。这就是为什么它们承诺比任何传统超级计算机指数级更快地解决特定、复杂的问题(例如优化全球供应链或模拟新的药物分子)。

为了帮助您了解这个领域的领导者,以下是量子计算前沿公司的资源:

  • 谷歌:谷歌的量子 AI 团队专注于超导量子比特,并使用其 Sycamore 处理器实现了“量子霸权”。他们正在积极构建一个纠错逻辑量子比特系统。对于那些对其工作感兴趣的人,您可以探索谷歌量子 AI 教育资源页面( https://quantumai.google/resources )或 Cirq 开源框架( https://quantumai.google/cirq )。

  • 微软:为了将这一点置于上下文中,微软正在采用不同的、长期的方法来处理拓扑量子比特。这种方法的目标是创建本质上更稳定且对退相干具有更强抵抗力的量子比特,这可能会极大地简化纠错过程。

纠错挑战在于量子比特极其脆弱,它们存储的信息会立即被环境噪声破坏,从而破坏计算。因此,量子纠错QEC)是必不可少的:它需要将数百或数千个不稳定的物理量子比特捆绑在一起,以创建一个稳定可靠的逻辑量子比特。要了解更多关于拓扑量子计算的信息,请访问微软研究页面上的拓扑量子计算( https://www.microsoft.com/en-us/research/project/topological-quantum-computing/ )。

  • Pasqal:Pasqal 的方法使用激光操控的中性原子,这是一种根植于诺贝尔奖获奖研究的科技。这种方法提供了高量子比特数和灵活配置的潜力。需要高量子比特数有两个原因:

    • 纠错:正如所提到的,需要数百或数千个物理量子比特来创建一个可靠的逻辑量子比特。

    • 问题规模:量子计算旨在解决的现实世界问题(例如,药物发现、材料科学)的复杂性如此之大,以至于需要数百或数千个逻辑量子比特来运行必要的算法。

要了解更多信息,您可以探索 Pasqal 的中性原子技术概述及其白皮书( https://www.pasqal.com/neutral-atoms/ )。

数据存储和可访问性

人工智能不断增长的数据需求需要先进的存储解决方案。非易失性内存表达式NVMe),作为 SSD 的行业标准,通过简化部署、减少延迟和实现直接 GPU 到存储的访问,在传统存储上提供了显著的好处,这对于高效的 AI 模型训练和推理至关重要(Cisco, 2025)。这项技术提高了人工智能基础设施的能效和可扩展性。

训练大型人工智能模型的最大瓶颈通常不是 GPU 的速度,而是数据传输到 GPU 的速度。直接 GPU 到存储的访问是一种硬件优化,允许 GPU 绕过 CPU 和系统内存,直接从高速存储中提取数据。这极大地加快了数据流,使得强大的 GPU 花费更少的时间等待,更多的时间处理,这对于实现大型模型的真实可扩展性和成本效益至关重要。

可扩展的云存储解决方案提供了管理大量数据集所需的容量和成本效益。补充这些进步,机密计算可以帮助推动加密使用中数据的指针,为扩展人工智能计划提供安全基础,通过创建可信执行环境TEEs)(Guan, 2025)来确保人工智能数据和模型在处理过程中的安全性。这保护了敏感信息免受未经授权的访问,促进了安全协作,支持合规性,并促进了人工智能部署中的信任。混合存储模型和量子存储等新兴趋势具有进一步优化人工智能应用的数据存储和可访问性的潜力。人工智能驱动的个性化正在扩展,朝着超个性化体验迈进。

代理人工智能和自动化新浪潮

能够自主行动、做出决策和执行任务而无需持续人类干预的代理人工智能系统代表了人工智能能力的一个重大飞跃。最近的预测表明,这一趋势将迅速增长。到 2028 年,预计将有 33%的企业软件将具备代理人工智能功能。这将使人工智能能够自主管理大量数字店面互动,估计占 20%,以及处理 15%的日常工作决策(Gartner, 2024)。这些系统有可能在各个行业自动化复杂任务,提高效率和生产力。然而,代理人工智能的开发和部署需要仔细的伦理考量,并建立明确的负责任使用指南。

XAI 用于信任和透明度

随着人工智能系统变得更加复杂,可解释人工智能(XAI)的重要性日益增加。XAI 旨在使人工智能决策对人类透明且易于理解。XAI 对于建立人工智能系统的信任、促进问责制和促进其负责任的应用至关重要,尤其是在医疗保健和金融等关键领域。让我们更详细地看看其应用:

  • 医疗保健:XAI 正在被用于提高诊断准确性和信任度。例如,人工智能驱动的癌症检测系统可以生成详细的热图,突出乳腺摄影中的可疑区域,为医生提供诊断的视觉解释。XAI 还帮助医疗专业人员和患者理解治疗建议,通过解释哪些具体数据点,例如遗传标志或临床病史,影响了人工智能的建议。

  • 金融:XAI 为高风险金融决策提供了关键透明度。当贷款申请被拒绝时,XAI 可以为申请人提供明确的理由,例如最近的逾期付款或高信用使用率,使他们能够采取纠正措施。同样,在欺诈检测中,XAI 允许银行识别并解释可疑模式,例如来自不寻常位置的巨额交易,帮助他们平衡安全与客户体验。

然而,如果底层模型和数据被破坏,透明度和信任都是无意义的。因此,下一个关键的优化前沿是利用人工智能来对抗日益先进的数字威胁。

驱动人工智能的网络安全

我们都在见证人工智能如何通过增强威胁检测、预测漏洞和自动化攻击响应来改变网络安全领域。虽然人工智能为网络安全提供了强大的工具,但承认网络犯罪分子恶意使用人工智能的潜在性至关重要。道德人工智能的开发和部署至关重要,以确保人工智能加强网络安全而不是削弱它。

人工智能正在革命性地改变威胁检测和响应。例如,Darktrace 等公司使用人工智能来学习网络的“正常”行为,然后检测并标记任何可能表明未知或“零日”威胁的异常。IBM 的 Watson for Cybersecurity 通过分析大量安全数据并采取隔离检测到的钓鱼邮件等行动来自动化响应。在内部威胁领域,一些大型科技公司使用人工智能来分析用户活动日志,以在发生之前检测和防止数据泄露(从网络或系统中未经授权的数据传输)。

从量子计算的原始力量到 XAI 的道德必要性的人工智能优化趋势正在重新定义可能实现的内容。虽然这些技术进步承诺了无与伦比的效率和创新能力,但它们必须与对负责任实施的坚定不移承诺相结合。随着我们继续推动人工智能的边界,考虑我们解决方案的技术可行性以及它们更广泛的人类和社会影响至关重要。我们将在下一节探讨这个重要话题。

人工智能的社会影响——人类与可持续性

除了其技术能力之外,人工智能还准备对社会产生深远的影响,影响我们如何生活、工作和与世界互动。积极应对人工智能的社会影响至关重要,确保其益处得到广泛分享,其潜在风险得到缓解。

转变工作和行业

人工智能革命代表了人类与技术关系的基本转变,其影响可能像农业革命一样深刻地重塑经济和社会结构。人工智能对就业的影响复杂,既有取代工作的潜力,也有创造新工作的潜力,尽管人工智能也可能为新工作竞争。普华永道预测,到 2035 年,人工智能技术将使生产力和 GDP 增长 1.5%,从而在 2025 年之前永久性地提高经济活动水平(Amon & Paulson,2025)。该分析预测,人工智能对年度生产力增长的强劲推动将在 2030 年代初发生。这种增长的基础是,大约 40%的当前 GDP 可能受到生成式人工智能工具的实质性影响。

人工智能驱动的自动化、超个性化以及预测分析已经重塑了行业,推动了效率和创新的增长。随着人工智能的持续进步,它将通过自动化常规任务和创造人机协作的新机会来改变工作的未来。为了应对这一转变,投资于劳动力再培训和提升计划至关重要,确保个人能够适应由人工智能驱动的经济变化的需求。

人工智能与人类价值观

将以人为本的价值观融入人工智能系统至关重要。这包括优先考虑公平性、包容性、透明度和隐私,以培养对人工智能使所有人受益的信任。在医疗保健领域,人工智能具有提高疾病诊断、个性化治疗建议和改善患者护理的潜力。然而,解决与数据隐私、算法偏见以及人工智能驱动医疗保健解决方案的公平获取相关的伦理考量至关重要。

人工智能也在改变交通领域,使自动驾驶汽车和智能交通系统的开发成为可能。这一领域的伦理考量包括确保自主系统的安全性、解决责任问题以及减轻潜在的就业岗位流失。在教育领域,人工智能可以个性化学习体验并自动化行政任务。然而,保持公平性和包容性很重要,确保人工智能工具支持具有不同需求的学生,并不要加剧现有的不平等。

人工智能与可持续未来

AI 可以成为促进各个行业可持续性的强大工具。AI 驱动的解决方案可以优化能源消耗,改善资源管理,并增强气候建模,为更加环保的未来做出贡献。然而,承认支持 AI 的基础设施所产生的重要能源足迹至关重要。麦肯锡公司预测,到 2030 年,美国的数据中心将消耗全国总电力的 11%到 12%,这比目前的 3%到 4%有大幅增长(Noffsinger,2025)。这明显强调了开发节能算法、可持续存储解决方案和绿色数据中心的重要性,以最大限度地减少 AI 本身对环境的影响。

远景展望——2030 年的 AI 驱动企业

我们迄今为止已经探讨了塑造下一个十年关键技术和社会趋势的关键因素,从量子计算和深度自主到负责任的治理和 AI 驱动的可持续性。将这些要素综合成一个具体的愿景至关重要。AI 优化的真正衡量标准不在于单个试点项目,而在于创建一个完全成熟、AI 驱动的企业。

以下关于 InnovAIte LLC 的虚构案例研究将说明一家现代公司如何从今天的挑战过渡到 2030 年完全实现的 AI 企业。

到 2030 年,AI 将不再是独立的部门或工具集合;它将成为成功企业的核心。2030 年的 AI 驱动企业在其所有功能中实现了 AI 的无缝集成,促进了前所未有的效率、创新和道德责任水平。

量子计算正作为一种变革性技术出现,具有解决目前经典计算机无法解决的问题的潜力。制药等行业已经利用量子计算进行药物发现等应用。AI 与量子计算的结合可能解锁前所未有的计算能力和智能,推动进一步的创新。

如 IBM 和 Google 等公司处于这场革命的尖端,竞相在 2025 年之前推出商业量子服务。对量子计算的重大投资证明了行业对该技术的承诺。在 2022 年和 2023 年,量子计算初创公司获得了超过 12.7 亿美元的资本,这证实了推动下一个十年研究和开发所需的持续、高水平资金。相比之下,量子通信和量子传感的投资显著较低,两者在 2022 年到 2023 年间都出现了下降。同时,预计到 2030 年,代理 AI 系统的兴起将颠覆整个行业知识工作的基本结构(Heim,2025),自动化复杂任务,并要求重新评估工作场所中的人类角色。

AI 将通过辅助人才获取和个性化发展,创造一个动态和包容的劳动力,从而改变人力资源。研发将利用 AI 的预测能力加速科学突破,设计可持续解决方案,并以惊人的准确性预测未来市场需求。通过 AI 驱动的自动化、预测性维护和智能供应链优化运营,将带来前所未有的效率和资源利用。营销和销售将采用超个性化 AI 深入了解客户需求,建立持久关系,并以卓越的精确度提供定制解决方案。甚至财务和法律部门也将从 AI 的分析能力中受益,增强风险管理,遵守监管合规,并简化复杂流程。

2030 年 AI 驱动企业的关键特征是其对负责任 AI 的坚定不移的承诺。伦理考量不是事后考虑,而是深深植根于 AI 开发的每个阶段和部署中。透明度至关重要,清晰的 AI 决策过程解释有助于在员工、客户和利益相关者之间建立信任。现行的强大治理框架促进问责制,并主动识别和减轻潜在的偏见或意外后果。

这个未来的企业将认识到,AI 的真正力量不仅在于其优化流程和推动创新的能力,还在于其创造一个更可持续、更公平、更繁荣的未来为所有人的潜力。通过优先考虑伦理考量和人本价值观,2030 年的 AI 驱动企业将为智能机器时代的企业卓越树立新的标准。

InnovAIte LLC – AI 驱动企业的体现

在早期章节中建立的负责任 AI 原则基础上继续前进,InnovAIte LLC 将始终优先考虑透明度、公平性、问责制和安全性的 AI 解决方案。到 2030 年,这一承诺将使 InnovAIte LLC 成为 AI 驱动企业的有力例证,从根本上改变其运营和文化,实现创新、效率和伦理完整性的强大协同效应。

下面是它负责任 AI 创新的历程:

  • 2020 年代初:医疗保健 AI 基础和伦理框架:InnovAIte LLC 以专注于开发医疗保健领域的 AI 驱动诊断工具为起点,确立了其核心伦理原则和治理结构。

  • 2020 年代中期:主动合规和可扩展的治理:认识到 AI 监管日益重要,InnovAIte LLC 优先考虑构建敏捷和适应性强的人工智能系统,以满足不断变化的合规要求。公司将扩展其伦理治理框架,以使其 AI 倡议(包括医疗保健和金融)具有可扩展性。

  • 2020 年代后期:代理人工智能和人类-人工智能协作:重点将转向专门、半自主的代理,它们可以执行多步骤、复杂的任务(例如,初步研究、代码生成和起草法律文件)。像 InnovAIte LLC 这样的组织将开始优先考虑这些代理的治理和伦理影响,因为它们在涉及高风险决策时仍需要人类在回路中的验证。

  • 2030 年代初高度自主的企业 AI 代理:AI 代理将达到深度自主的状态,能够以最小的人类干预管理复杂、端到端的企业工作流程。这种自主性以人类在回路中的治理为特征,其中代理独立执行任务,仅将异常或关键决策标记给人类监控以进行最终验证。例子包括完全自主的合同、供应链中的动态资源分配以及仅需要人类监督而不是干预的自我优化安全协议。这种自主性解锁了预期的指数级生产力提升,并推动组织改革以实现 2030 年的企业愿景。

作为 2030 年的人工智能驱动型企业,InnovAIte 的 AI 驱动解决方案将涵盖各个领域,从金融服务到医疗保健,展示了其在所有领域应用负责任 AI 原则的承诺。以下是他们将取得的成就:

  • 开创性的伦理治理和透明度:到 2030 年,InnovAIte LLC 将建立一个领先的前沿伦理治理框架。AI 伦理委员会将深入整合到 AI 开发的每个阶段,以符合伦理指南和监管要求。公司将发布详细的透明度报告,公开解释 AI 决策过程,并与所有利益相关者建立信任。

  • 倡导持续监控和改进:InnovAIte LLC 将在其对持续监控和改进的承诺上表现出色。先进的 AI 驱动系统将主动检测和缓解偏见,以确保 AI 模型保持公平、准确并与不断发展的伦理标准保持一致。定期的更新和利益相关者反馈循环将推动 AI 系统的持续改进。

  • 拥抱利益相关者参与和包容性:InnovAIte LLC 将积极与多元化的利益相关者生态系统互动。通过研讨会、调查和协作论坛,公司将纳入广泛的观点,确保其 AI 解决方案既创新又具有社会责任感。

  • 推动 AI 在各个行业的转型:InnovAIte LLC 将在多个行业展示 AI 的变革力量。这种快速的多行业扩张将不会基于传统基础设施(这将过于乐观),而是基于高度通用的 AI 代理和模块化基础模型。2030 年代 AI 公司的核心商业模式将使这种速度成为可能,因为基本 AI 功能将是可转移的。例如,为医疗供应链开发的相同自我优化、资源分配代理可以轻松微调和重新部署到完全不同的行业:优化可持续交通中的交通流量或在智能城市中管理能源电网平衡。这种功能泛化将允许 AI 优先公司以前所未有的速度跨不同领域垂直扩展,验证 2030 年的企业愿景。

  • 在可持续 AI 领域引领潮流:InnovAIte LLC 将成为可持续 AI 实践的先驱。公司将优先考虑节能算法,运营碳中和数据中心,并开发解决气候变化和促进环境管理的 AI 驱动解决方案。

  • 负责任且敏捷地扩展 AI:InnovAIte LLC 将掌握负责任扩展 AI 解决方案的艺术。通过利用 MLOps 和稳健的治理框架,公司将高效地部署和管理 AI 系统,以实现创新和道德合规的目的。

InnovAIte LLC 的旅程将提供一个鼓舞人心的对商业未来的展望。它将证明,通过将负责任的 AI 嵌入其核心战略,组织将解锁 AI 的全部潜力,不仅推动商业成功,还能创造一个更加公平和可持续的世界。

摘要

在我们结束对 AI 未来的探索时,一个中心信息以坚定不移的清晰度出现,那就是解锁 AI 变革潜力的道路在于创新和责任的不可分割的结合。AI 优化,在其追求提高效率和开创性能力的过程中,包括由 AI 和量子计算融合带来的能力,必须由对道德原则和以人为本的价值观的坚定承诺来引导。

本章揭示了将塑造未来几年的激动人心的趋势,从 AI 模型的扩展和数据存储的演变,到越来越自主的智能体 AI 系统的兴起以及 XAI 的必要性。我们还强调了 AI 对社会产生的深远影响,其重塑产业的能力,以及确保其利益公平和可持续共享的重要性。2030 年 AI 驱动企业的愿景作为一个鼓舞人心的提醒,表明当组织优先考虑创新和责任时,什么是可能的,创造一个 AI 赋能人类进步并推动积极变革的未来。

最终,人工智能的未来并非命中注定。这是一个我们通过今天的抉择积极塑造的未来。通过拥抱负责任的 AI 创新,并促进持续的对话与合作,以应对高级 AI(如代理系统和量子增强 AI)不断变化的伦理和社会影响,我们可以应对挑战,把握未来的机遇,构建一个 AI 作为善的力量,丰富生活,创造更美好明天的世界。

参考文献

免费订阅电子书

新框架、演进的架构、研究动态、生产故障——AI_Distilled 将噪音过滤成每周简报,供那些与 LLMs 和 GenAI 系统实际工作的工程师和研究人员参考。现在订阅,即可获得免费电子书,以及每周的洞察力,帮助您保持专注并获取信息。

packt.link/8Oz6Y 订阅或扫描下面的二维码。

img

第十七章:解锁您的专属福利

您的这本书包含以下专属福利:

  • 黑色背景和黑色方块  AI 生成的内容可能不正确。 新一代 Packt 阅读器

  • img 免 DRM PDF/ePub 下载

按照以下指南操作以解锁它们。此过程只需几分钟,并且只需完成一次。

三步轻松解锁本书的免费福利

第 1 步

准备好您的购买发票以进行第 3 步。如果您有实体副本,请使用手机扫描并将其保存为 PDF、JPG 或 PNG 格式。

如需查找发票的更多帮助,请访问 www.packtpub.com/unlock-benefits/help

注意

如果您直接从 Packt 购买此书,则无需发票。在第 2 步之后,您可以直接访问您的专属内容。

第 2 步

扫描二维码或访问 packtpub.com/unlock

img

在打开的页面(类似于桌面上的图 17.1),通过名称搜索此书并选择正确的版本。

img

图 17.1:桌面上的 Packt 解锁页面

第 3 步

选择您的书籍后,登录您的 Packt 账户或免费创建一个账户。然后上传您的发票(PDF、PNG 或 JPG,最大 10MB)。按照屏幕上的说明完成此过程。

|

需要帮助?

如果遇到困难需要帮助,请访问 https://www.packtpub.com/unlock-benefits/help 获取如何查找发票等详细 FAQ。此二维码将带您到帮助页面。 | img |

注意

如果您仍然遇到问题,请联系 customercare@packt.com

posted @ 2026-07-27 16:27  绝不原创的飞龙  阅读(33)  评论(0)    收藏  举报