通才也可以深入研究
通才也可以深入研究
在“作者聚焦”系列中,TDS 编辑们与我们的社区成员就他们在数据科学和 AI 领域的职业道路、他们的写作以及他们的灵感来源进行交谈。今天,我们很高兴与 伊达·西尔弗斯克尔德*** 进行对话。**
伊达是一个通才,她接受过经济学教育,自学软件工程。她在产品和市场营销管理方面拥有专业背景,这意味着她拥有产品、营销和开发技能的独特组合。在过去的几年里,她一直在 LLM、NLP 和计算机视觉领域教学和构建,深入研究代理 AI、思维链策略和托管模型的经济学。
你学习过经济学,然后学会了编码,经历了产品、增长,现在亲自参与 AI 构建。这条通才之路给你带来了哪些专家有时会错过的视角?
我不确定。
人们认为通才知识浅薄,但通才也可以深入研究。
我认为通才是指那些有多重兴趣并渴望理解整体而不是某个部分的人。作为一个通才,你会从技术、客户、数据、市场、架构成本等方面来看待问题。这让你能够在跨领域的同时仍然做好工作。
我并不是说专家不能这样做,但通才往往适应得更快,因为他们习惯于快速掌握新事物。
你最近写了很多关于代理系统的文章。什么时候“代理”实际上优于简单的 LLM + RAG 模式,什么时候我们又过于复杂化了呢?
这取决于具体的应用场景,但一般来说,我们会将 AI 应用到很多可能不需要它的地方。如果你可以程序化地控制系统,你应该这样做。LLM 在将人类语言翻译成计算机可以理解的内容方面很出色,但它们也引入了不可预测性。
对于 RAG 来说,添加一个代理意味着增加成本,所以仅仅为了有一个代理而这样做并不是一个好主意。你可以通过使用更小的模型作为路由器来解决这个问题(但这会增加工作量)。我曾在 RAG 系统中添加了一个代理,因为我知道会有关于如何将其扩展以“行动”的问题。所以,再次强调,这取决于具体的应用场景。
当你提到代理 AI 需要“评估”时,你常用的指标有哪些?你是如何决定使用哪一个的?
我不会说你总是需要评估,但公司会要求它们,所以了解团队如何衡量产品质量是好的。如果一个产品将被很多人使用,确保你有一些评估措施。我在这里做了大量的研究,以了解已经定义的框架和指标。
通用指标可能不够。你需要一些定制的指标来满足你的用例。因此,评估因应用而异。
对于编码伙伴,你可以跟踪开发者接受完成的比例(接受率)以及整个聊天是否达到了目标(完整性)。
对于商业代理,你可能测量代理是否选择了正确的产品,以及答案是否基于商店的数据。
与安全和安全相关的指标也很重要,例如偏差、毒性和系统被破解的难易程度(越狱、数据泄露)。
对于 RAG,请参阅我的文章,我在那里分解了常用的指标。就我个人而言,我迄今为止只为 RAG 设置了指标。
在一篇文章中映射不同 AI 应用如何设置评估可能会很有趣。例如,Shopify Sidekick 用于商业代理和其他工具,如法律研究助手。
在你的 Agentic RAG Applications 文章中,你构建了一个考虑公司知识的 Slack 代理(使用 LlamaIndex 和 Modal)。最终哪个设计选择比预期更重要?
检索部分是你会遇到困难的地方,特别是分块处理。当你使用 RAG 应用时,你会将这个过程分为两部分。第一部分是获取正确的信息,确保信息的准确性非常重要,因为你不能给代理过多的无关信息。为了使其精确,分块需要相当小且与搜索查询相关。
然而,如果你使分块太小,你可能会给 LLM 提供太少的前置信息。如果分块太大,搜索系统可能会变得不精确。
我设置了一个基于文档类型的分块系统,但现在我有一个在检索后使用上下文扩展的想法。
另一个你需要记住的设计选择是,尽管检索通常从混合搜索中受益,但这可能还不够。语义搜索可以连接那些不使用确切措辞回答问题的内容,而稀疏方法可以识别确切的关键词。但是,像 BM25 这样的稀疏方法默认是基于标记的,所以普通的 BM25 不会匹配子字符串。
因此,如果你也想搜索子字符串(如产品 ID 的一部分),你需要添加一个支持部分匹配的搜索层。
还有更多,但如果我继续写下去,可能会变成一整篇文章。
在过去两年的咨询项目中,你的客户最常遇到的问题是什么,你是如何解决它们的?
我看到的问题在于,大多数公司都在寻找定制化的解决方案,这对顾问来说很好,但内部构建充满了复杂性,尤其是对于那些以前没有做过的人来说。我从麻省理工学院的研究中看到了 95%的项目失败率,这并不让我感到惊讶。我认为顾问应该擅长某些用例,在这些用例中,他们可以快速为客户实施和调整产品,因为他们已经学会了如何这样做。但我们将拭目以待。
你在 TDS 上写了关于许多不同主题的文章。你的文章想法从何而来?客户工作、你想尝试的工具,还是你自己的实验?目前你最关心的话题或问题是什么?
实际上,是各种各样的事情。这些文章也帮助我巩固了自己的知识,填补了我可能还没有自己研究过的空白。现在,我正在研究如何在小型模型(中等规模,大约 3B-7B)中应用代理系统、安全和特别是如何改进 RAG。
缩小视角:在接下来的 12-18 个月内,团队应该培养哪些非显而易见的技能(技术或文化),以真正实现 AI 生产力,而不是仅仅成为 AI 忙碌的人?
可能学会在这个领域(尤其是对商业人士来说)构建:仅仅让一个大型语言模型持续做某事,就是了解 LLMs 不可预测性的方式。这让你变得稍微谦虚一些。

浙公网安备 33010602011771号