搜索将是LLM和AI应用的未来。
在浏览LinkedIn时,我的信息流中出现了一篇有趣的文章。它的标题是“每家LLM公司都是一家搜索公司,而搜索很难:LLM检索系统的未来”。
这很有意思,因为过去几年我们一直在构建 SWIRL,旨在帮助企业扩展其搜索和 AI 基础设施。正如我们之前提到的,搜索无处不在。DEVTO 现在使用 Algolia(或许更早之前,他们就使用过 Algolia 的代码来执行搜索)来实现智能搜索。任何尝试过构建支持搜索功能的应用程序的人都知道,搜索非常复杂,涉及相关性排名和个性化等诸多因素。
这使得构建搜索功能变得困难。本文面向那些尝试构建支持搜索功能的应用程序的用户。搜索管理起来非常复杂,需要考虑诸多因素。以谷歌为例,作为搜索引擎人工智能领域的领导者,谷歌的搜索结果也饱受诟病。人们开始抱怨它的搜索结果。但我们讨论的不仅仅是谷歌。这里面有很多值得我们深入了解的内容。
那么你所在机构内部的数据呢?你工作的地方的数据呢?
企业拥有大量分散在各个部门和渠道的数据——从客户互动和销售记录到运营日志和员工反馈。
他们意识到利用这些数据构建人工智能应用程序的巨大潜力,这些应用程序可以简化运营、提升客户体验并推动创新。然而,挑战在于如何整合这些分散的数据。
数据中包含大量信息:
- 会议记录
- 孤立的应用程序
- 邮件存档
- 内部文档
- 客户支持工单
- 项目管理工具
真正的挑战在于如何检索这些信息。我们目前的做法是将所有数据流式传输到一个矢量数据库中,然后利用该数据库检索信息。这说起来简单,做起来却难。说它简单,是因为你知道在哪里搜索;说它难,是因为要管理这些矢量数据库(或任何搜索索引)。你必须:
- 不断搜集数据。
- 比较索引数据和更新后的数据。
- 必要时进行更新。
此外,如果你使用向量数据库,你还需要处理向量嵌入。但这又是另一个话题了,以后有机会再详细讨论。
那么,为什么搜索是LLM应用的未来呢?
我们产生的数据量庞大,正变得越来越难以管理。传统方法成本高昂、耗时费力,而且还存在一些安全风险。
当您的LLM(语言学习模型)能够搜索数据存储库中的信息时,它们就能提供您和您的团队所需的信息,而无需在训练记忆中搜索,也不会因为信息不存在而产生幻觉。通过提供您所需信息的上下文,这就像是查找书籍并给出答案一样简单。
我们应该把重点放在哪里?
为了开发能够有效处理内部数据的AI应用,我们需要一种高效的检索增强生成(RAG)方法。在这种情况下,检索器就是一个搜索平台。
这些属性应为:
- 它应该连接到内部数据源。
- 注意安全,尊重并遵守现有的安全解决方案。
- 理解人类语言的语境。
- 提供卓越且相关的结果。
这就是我们构建SWIRL 的方式:一个高效的检索器,能够提供良好的答案,连接多个数据提供商,并支持企业中的人工智能。
这样,一项工作就完成了。你已经拥有了数据。你只需要配置一个数据提供程序,创建一个查询,然后就能获得答案。一旦你实时获得了所需的数据,机会就无穷无尽了:
- 获取人工智能摘要。
- 利用这些数据,借助人工智能生成报告。
- 构建一个能够协助您完成任务的辅助工具。一旦解决了数据检索部分,您就可以进行更多操作。SWIRL 运行在自托管平台上,因此您的数据仍然安全无虞。
看看我们能用 SWIRL 做什么?
我可以搜索数据源并获取数据。其余的只是协调运作的方式。总的来说,它既简单又安全。
我想让你了解一下架构。请查看这张图。它展示了我们如何使用人工智能基础设施平台来实现这一点。
最棒的地方就在于:实时搜索数据。
关键在于我们应该选择一个框架,它允许我们从多个应用程序获取数据,同时又不限制最终用户。然后,启用生命周期管理(LLM)来协助您完成任务。
还有一点:最佳数据并非总是存在于 SQL 数据库中。它可能存在于团队的会议室、会议记录或其他已保存的文档中。上述架构能够帮助您找到并获得高质量的结果,让您感觉这些结果仿佛出自您之手。我们
需要的不仅仅是语义搜索,而是一个通用的搜索架构,才能缩小我们希望人工智能带来的信息鸿沟。
加入我们,共同打造人工智能基础设施软件 SWIRL
SWIRL 是一个开源项目,使用 Python 编写。我们正在开发许多实用功能,涵盖搜索和聊天界面等各个方面。如果您是 UI 专家,欢迎加入我们!
观看此视频了解如何设置 SWIRL。然后,加入我们的Slack 社区并联系我。让我们一起打造一个出色的开源 AI 平台。你可能会获得一些丰厚的奖励哦! 💐🎁
文章来源:https://dev.to/srbhr/search-will-be-the-future-of-llm-and-ai-applications-26fl


