矢量搜索成功

https://www.spaceandtime.io/blog/vector-search-to-success

原文链接为上面部分

在2022年之前,如果你想快速回忆起你最喜欢的书中的一段话,或者你刚刚看过的电影中的一段话,而你面前没有作品,你可能会求助于搜索引擎。您可以用公式良好的搜索输入提示它,解析返回的结果,访问似乎包含您的答案的SparkNotes或IMDB链接,并在几分钟内在页面上找到您要查找的文本。现在,您只需打开ChatGPT,输入“最著名的终结者语录是什么?”或“写出《双城记》的开头段落”,并在几秒钟内得到逐字的答案。

大型语言模型(LLM)最简单的用途之一是作为知识数据库。法学硕士已经接受了大量数据集的训练,这些数据集包含丰富的信息,ChatGPT等接口使检索变得容易。例如,当您提示ChatGPT从电影或书籍中返回内容时,您只是在利用模型的能力来回忆它在训练期间接触过的信息。但是,如果它没有接受过《终结者》剧本的训练,或者它的权重不重视狄更斯的作品呢?为了为最简单的用例(如基本信息检索)提供最准确和相关的结果,llm需要复杂的索引和检索机制,可以精确地访问广泛的信息。

理解法学硕士课程内容的生成和培训 LLM内容是通过一个称为下一个令牌预测的过程生成的,该过程确保响应在上下文中是适当的、多样的,并且在某种程度上反映了类似人类的理解。下面是下一个代币预测的工作原理,一步一步:

输入处理:当您键入提示或问题时,该输入将被转换为令牌:单词或单词片段。 上下文理解:该模型查看您给它的标记,并根据其训练,尝试理解上下文,其中包括从手头的主题到您可能使用的语气的所有内容。 下一个令牌预测:使用它所理解的上下文,模型然后预测最有可能的下一个令牌是什么。这不仅仅是基于前一个单词的猜测;它考虑到谈话的整个背景。 令牌选择:一旦它预测了一系列可能的下一个令牌,它就选择一个。这种选择是基于概率的——根据模型所训练的数据,最有可能出现的标记。然而,值得注意的是,这里也有一些随机性,这有助于产生更多样化和自然的反应。 输出生成:然后将选定的令牌转换回人类可读的文本。如果响应没有完成(通常在一个令牌之后就没有完成),则重复该过程。新的令牌被添加到序列中,模型根据更新后的上下文预测下一个令牌。 迭代细化:这个预测下一个标记并将其添加到序列的过程不断重复,直到模型到达一个停止点。这可能是当响应达到一定长度时,模型预测一个表示句子或段落结束的标记,或者当它完成提示中嵌入的指令时。

法学硕士培训中压缩的局限性 当LLM预测一个令牌时,它有效地检索并利用嵌入在其权重中的压缩知识来生成上下文合适的输出。通过这种方式,LLM训练镜像了数据库压缩。正如优化数据库以快速召回频繁访问的数据一样,LLM被设计为从其权重中检索特定于信息的内插内存。这种能力允许它对在训练过程中遇到的熟悉材料的查询产生精确的响应,就像查询数据库以获得良好索引的信息一样。然而,当模型遇到不太熟悉或模糊的内容时,限制就出现了。例如,当你向法学硕士询问《圣经》中的特定段落时,它会逐字逐句地引用它们,但它无法逐字逐句地引用它在训练中没有冗余“见证”过的任何概念,因为与该概念相关的权重太微不足道了。从这个意义上讲,法学硕士也类似于数据库。就像数据库可能只返回显式存储在其中的数据一样,法学硕士可能很难在培训期间没有广泛看到的主题上生成内容。

当然,法学硕士超出了这个类比的范围,因为他们内部有一个世界模型,允许他们“理解”事物,而不仅仅是查找。然而,这种过度简化有助于我们理解法学硕士在训练生成内容的方式上的一些关键限制。

法学硕士培训的进一步限制 此外,下一个令牌预测系统具有其他固有的局限性,这些局限性源于其生成文本的基本方法:

上下文窗口大小:主要约束之一是模型的上下文窗口大小——模型在进行预测时可以考虑的最大文本量(以令牌表示)。对于许多模型,包括GPT的早期版本,这个窗口不够大,无法在长对话或文档中维护上下文,这可能导致在较长的文本或复杂的讨论中失去一致性,这些讨论需要维护前面直接标记之外的上下文。 泛化与特异性:虽然这些模型是在大量数据集上训练的,但它们从这种训练中泛化的能力有时会导致它们产生通用或模糊相关的内容。他们可能会在生成高度具体或细致入微的反应时错失目标,这些反应需要详细的理解或训练数据之外的最新知识。 缺乏外部知识访问:下一个令牌预测模型仅限于其训练数据集中包含的信息。他们不能访问或合并培训后的新信息,这意味着他们很快就会过时或缺乏当前的上下文,例如最近的事件、发现或趋势主题。 重复性和可预测性:下一个标记预测的算法性质有时会导致重复或可预测的文本生成。由于模型通常倾向于统计上更有可能遵循给定上下文的标记,因此它可以陷入循环或更喜欢常见短语,从而减少输出的可变性。

解释了检索增强生成(RAG) 如前所述,法学硕士根据他们在训练期间为数据的不同方面分配的权重生成响应。这些权重反映了模型感知输入数据的各种元素的重要性或显著性。如果用户的提示包含在训练数据中没有显著表示的元素,则模型可能无法生成准确或相关的响应。

当对话超出LLM的上下文窗口时,或者当提示超出LLM自己的训练数据集中的重要权重限制时(意味着它不能准确地回忆起用户正在寻找的答案),模型通常依赖于外部向量搜索数据库,该数据库允许它搜索相关的上下文或可以附加到用户提示的新数据。这个过程被称为检索增强生成(RAG)。

“矢量搜索成功” RAG过程是通过矢量搜索数据库实现的:这是一种将数据作为矢量存储和管理的高级数据库。这些向量表示高维空间中的数据,其中每个维捕获数据含义的某些方面,从而允许表示复杂的关系和属性。在文本和语言的背景下,向量搜索数据库使用嵌入等技术将文本转换为数值向量。这种转换使系统能够通过计算在这个多维空间中它们对应向量之间的距离来测量不同文本片段之间的语义相似性。

在RAG期间,查询(即用户对LLM的输入)和存储的数据(如文章、文档或句子)都使用文本嵌入转换为向量。这些嵌入将文本数据转换为数字向量,其中相似的含义被映射到向量空间中的近似点。然后,数据库计算查询向量和存储数据向量之间的距离,以确定文本的含义之间的关联程度。数据库检索其向量最接近查询向量的数据点(文本内容),即在语义上与输入最相似的数据点。就上下文和意义而言,这些数据点被认为是“最近的邻居”。

这些最近邻提供了与上下文相关的附加信息,这些信息是基本LLM在其自己的训练数据中可能无法访问的,这可以显著提高LLM输出的准确性、相关性、丰富性和多样性。Sam Altman等人提倡“矢量搜索成功”的方法——依靠RAG来开发代理,而不是单独对模型进行微调。

RAG作为微调的替代方案 LLM的微调包括基于特定数据集的额外训练来调整模型的权重,以提高特定任务的性能或提高对某些领域的理解。这个过程不仅比创新的速度慢,这意味着经过微调的模型几乎和更新一样快就会过时,而且它也没有解决新数据的问题。

相反,RAG使模型能够实时访问外部数据库,以检索与当前查询相关的最新信息。即使底层模型最近没有更新或微调,它仍然可以生成包含最新数据的响应。模型保持相关性的时间更长,因为它们可以通过检索外部信息源来适应新的数据和不断变化的上下文。

RAG有效地弥合了深度学习和传统信息检索技术之间的差距。通过这样做,它利用了深度学习强大的上下文理解和信息检索的准确性的优势。这种混合方法允许法学硕士产生更准确、详细和上下文丰富的响应。

解决法学硕士的进一步限制 除了微调之外,RAG还解决了之前提到的与标准llm相关的挑战:

扩展上下文理解:RAG通过获取最新的或详细的信息来扩展传统法学硕士的上下文窗口,这些信息可以增强模型的响应。 增强特异性和准确性:RAG允许模型将检索文档中的特定细节注入到其响应中,而不是仅仅依赖于训练期间学习的模式,从而使它们不仅更准确,而且可以针对手头的特定查询进行定制。 减少重复性和可预测性:通过动态地为每个查询提取不同的信息集,RAG可以显著地改变模型的响应。这种可变性有助于减少在纯生成模型中常见的重复性和可预测性,因为外部数据将新的措辞和细节引入到对话中。 RAG面临的挑战和必要的演变 然而,RAG也有自己的挑战——即延迟和缺乏智能。考虑一个基于回合的代理聊天机器人对话,其中用户提交一个提示,LLM吐出一些指示它需要更多上下文的令牌,向量搜索数据库通过用户的输入提示检索最近邻上下文,然后最终将两者再次发送给LLM进行推理。然后,轮到用户回复,依此类推。

在这个系统中,每个用户提示都会启动一个多步骤操作,每个步骤都会增加总处理时间。整个过程的速度还取决于向量搜索数据库检索所需上下文的速度。如果数据库查询很复杂,或者数据库本身很大,并且没有最佳索引,那么这种检索可能会导致严重的延迟。此外,特别是在更复杂的对话中,这个生成和检索序列可能需要重复多次才能充分改进响应。这种迭代循环可能会增加延迟,导致交互速度比仅依赖于内部数据的纯生成模型更慢。

此外,ragg富集LLM的智能在很大程度上依赖于从向量搜索数据库检索到的信息的质量和相关性。如果数据库内容不全面、不更新或维护得不好,则检索信息的效用可能会受到限制,从而影响响应的总体智能。

即使检索到高质量的外部数据,挑战仍然是如何有效地将这些信息集成到LLM的现有响应框架中。该模型不仅必须包含这些外部数据,而且必须以上下文适当和一致的方式进行。模型的训练与外部数据的性质之间的不一致可能导致技术上准确但上下文脱节的响应。

下一代法学硕士 下一代法学硕士可能会将基于矢量搜索的RAG和传统的培训/微调方法结合在一起,以及结构化数据处理(例如TradFi市场数据和相关金融新闻的SQL数据库)。拥有LLM提供商“在这里”和单独的矢量搜索数据库“在那里”的概念将通过新模型进行整理,这些新模型直观地将其索引工作记忆扩展到具有tb矢量化上下文的本地ssd。

Space and Time已经向客户提供了SQL证明(一种验证SQL数据库处理的准确性和防篡改性的ZK证明),最近还提供了矢量搜索证明(Vector Search),它对矢量搜索检索也做了同样的工作。这些新颖的证据为未来的法学硕士可以整合新的背景,实时访问更广泛、更细致的数据,并整合结构化数据处理以产生更有洞察力的分析开辟了道路,所有这些都以可追溯、可验证的方式进行。这些进步最终将扩大法学硕士的应用范围,扩大其在金融服务、新闻聚合和风险评估等严重依赖即时数据的行业的效用,从而推动下一波人工智能驱动的创新。

斯科特·戴克斯特 联合创始人兼首席技术官

斯科特•戴克斯特拉是Space and Time公司的联合创始人兼首席技术官,同时也是Sotero等多家数据库和Web3技术初创公司的战略顾问。Scott拥有围绕复杂的绿地挑战和研究驱动开发建立和扩展大型工程团队的终身教职经验。Scott擅长企业级分析,曾在Teradata担任云解决方案副总裁,在那里他花了近8年的时间将Teradata从内部部署引入下一代基于云的SaaS。Scott是一位富有远见的产品领导者,在Web3、数据仓库、云和衍生品交易领域拥有产品开发专业知识。Scott痴迷于美丽的UX/UI。作为一名不折不扣的企业家,《空间与时间》是斯科特作为一家研究驱动型创业公司高管的第二次成功尝试。