停止构建-AI-平台

停止构建 AI 平台

停止构建 AI 平台

TL;DR:虽然小型和中型公司在构建数据和 ML 平台方面取得了成功,但构建 AI 平台现在是一个巨大的挑战。本文讨论了三个你应该谨慎构建 AI 平台的关键原因,并提出了我对有希望的方向的看法。

免责声明:这基于个人观点,并不适用于云服务提供商和数据/ML SaaS 公司。他们应该加倍研究 AI 平台。

我从哪里来

在我之前发表在 Toward Data Science 的文章 从数据平台到 ML 平台 中,我分享了数据平台如何演变成 ML 平台的过程。这一过程适用于大多数小型和中型企业。然而,目前对于小型和中型企业来说,将他们的平台继续发展成为 AI 平台还没有明确的路径。升级到 AI 平台,路径分为两个方向:

  • AI 基础设施:当集中生成时,“新电力”(AI 推理)更有效率。这是一场大科技公司和大模型提供商的游戏。

  • AI 应用平台:不能在不断变化的土地上建造“海滩别墅”(AI 平台)。不断发展的 AI 能力和新兴的新发展范式使得找到持久的标准化的挑战性很大。

然而,即使 AI 模型继续发展,仍有一些方向可能会保持重要。这将在本文的结尾部分讨论。

AI 基础设施的高门槛

虽然 Databricks 可能只比你的 Spark 作业好几倍,但 DeepSeek 在 LLM 推理上可能比你好 100 倍。训练和部署 LLM 模型需要显著增加基础设施投资,并且同样重要的是,对 LLM 模型结构的控制。

图片

由 OpenAI ChatGPT 4o 生成的图像

这个系列中,我简要介绍了 LLM 训练的基础设施,包括并行训练策略拓扑设计训练加速。在硬件方面,除了高性能 GPU 和 TPU 之外,相当一部分成本用于网络设置和高性能存储服务。集群需要额外的 RDMA 网络来启用实例之间数据交换的非阻塞、点对点连接。编排服务必须支持复杂的作业调度、故障转移策略、硬件问题检测以及 GPU 资源抽象和池化。训练 SDK 需要促进异步检查点、数据处理和模型量化。

关于模型服务,模型提供商通常在模型开发阶段就考虑推理效率。模型提供商可能拥有更好的模型量化策略,这可以在显著减小模型尺寸的同时保持相同的模型质量。由于对模型结构的控制,模型提供商可能开发出更好的模型并行策略。这可以在 LLM 推理期间增加批量大小,从而有效提高 GPU 利用率。此外,大型 LLM 玩家具有物流优势,使他们能够以更低的价格获取路由器、主机和 GPU 芯片。更重要的是,更强的模型结构控制和更好的模型并行能力意味着模型提供商可以利用更便宜的 GPU 设备。对于依赖开源模型的模型消费者来说,GPU 的过时可能是一个更大的问题。

以 DeepSeek R1 为例。假设你正在使用 p5e.48xlarge AWS 实例,该实例提供了 8 个 NVLink 连接的 H200 芯片。这将花费你每小时 35 美元。假设你的表现与 Nvidia 相当,并实现了每秒 151 个 token 的性能。要生成 100 万个输出 token,你需要花费$64(100 万 / (151 * 3600) * $35)。DeepSeek 每百万 token 售价是多少?仅需 2 美元!DeepSeek 可以达到你云部署效率的 60 倍(假设 DeepSeek 有 50%的利润率)。

因此,大型语言模型推理能力确实像电力一样。它反映了 LLM 可以推动的多样化应用;这也意味着当集中生成时最为高效。不过,对于隐私敏感的使用案例,你仍然应该自托管 LLM 服务,就像医院有他们的应急发电机一样。

持续变化的地形

在 AI 基础设施上进行投资是一场大胆的游戏,为 AI 应用构建轻量级平台伴随着其隐藏的陷阱。随着 AI 模型能力的快速演变,没有针对 AI 应用的统一范式;因此,缺乏构建 AI 应用的坚实基础。

图片

由 OpenAI ChatGPT 4o 生成的图像

对此的简单答案是:耐心等待

如果我们从整体的角度看待数据和机器学习平台,只有在算法能力汇聚时,才会出现开发范式。
领域 算法出现 解决方案出现 大平台出现
数据平台 2004 — MapReduce (Google) 2010–2015 — Spark, Flink, Presto, Kafka 2020–Now — Databricks, Snowflake
机器学习平台 2012 — ImageNet (AlexNet, CNN 突破) 2015–2017 — TensorFlow, PyTorch, Scikit-learn 2018–Now — SageMaker, MLflow, Kubeflow, Databricks ML

| AI 平台 | 2017 — Transformers (Attention is All You Need) | 2020–2022 —ChatGPT, Claude, Gemini, DeepSeek | 2023–Now — ?? |

经过几年的激烈竞争,几个大型模型玩家仍然在竞技场上屹立不倒。然而,AI 能力的演变尚未收敛。随着 AI 模型能力的提升,现有的开发范式将迅速过时。大玩家刚刚开始尝试开发代理开发平台,新的解决方案如烤箱中的爆米花般涌现。我相信赢家最终会出现。目前,对于小型和中型公司来说,自己构建代理标准化是一个棘手的选择。

旧成功案例的路径依赖

构建 AI 平台的另一个挑战相当微妙。它关乎平台构建者的心态,是否从之前构建数据和机器学习平台的成功中产生路径依赖。

图片

由 OpenAI ChatGPT 4o 生成的图像

正如我们之前分享的,自 2017 年以来,数据和机器学习开发范式已经很好地对齐,机器学习平台最关键的任务是标准化和抽象化。然而,AI 应用的开发范式尚未确立。如果团队遵循之前构建数据和机器学习平台的成功故事,他们可能会在错误的时间优先考虑标准化。可能的方向是:

  • 构建 AI 模型网关:提供对 LLM 模型请求的集中审计和日志记录。

  • 构建 AI 代理框架:开发一个自建的 SDK,用于创建具有增强内部生态系统连接的 AI 代理。

  • 标准化 RAG 实践:构建标准数据索引流程,降低工程师构建知识服务的门槛。

这些举措确实可能具有重要意义。但投资回报率(ROI)实际上取决于您公司的规模。无论如何,您将面临以下挑战:

  • 跟上最新的 AI 发展。

  • 当客户容易绕过您的抽象时,客户的采用率。

假设数据和 ML 平台的构建者像是“壁橱整理师”,AI 构建者现在应该像“时尚设计师”。这需要拥抱新想法,进行快速实验,甚至接受一定程度的不完美。

我对有前景方向的思考

尽管前方有许多挑战,但请记住,现在在 AI 平台上工作仍然令人欣慰,因为您拥有以前没有的实质性杠杆:

  • AI 的转型能力比数据和机器学习更强大。

  • 采用 AI 的动机比以往任何时候都要强烈。

如果您选择了正确的方向和策略,您可以为您的组织带来的转型将是显著的。以下是我对在 AI 模型进一步扩展时可能经历较少干扰的方向的一些看法。我认为它们与 AI 平台化同样重要:

  • 高质量、丰富语义的数据产品:具有高精度和问责制、丰富描述和可信度量的数据产品将在 AI 模型增长的过程中“辐射”出更大的影响。

  • 多模态数据服务:OLTP、OLAP、NoSQL 和 Elasticsearch,MCP 服务器背后的可扩展知识服务可能需要多种类型的数据库来支持高性能数据服务。保持单一事实来源和性能,同时进行持续的逆向 ETL 作业具有挑战性。

  • AI DevOps:以 AI 为中心的软件开发、维护和分析。在过去 12 个月内,代码生成精度大幅提高。

  • 实验和监控:鉴于 AI 应用的增加不确定性,对这些应用的评估和监控变得更加关键。

这是我对构建 AI 平台的看法。请告诉我您对此的看法,也欢迎交流!干杯!

posted @ 2026-03-28 10:06  布客飞龙III  阅读(13)  评论(0)    收藏  举报