До 2022 року, якщо ви хотіли швидко згадати певний уривок з улюбленої книги або цитату з фільму, який ви щойно подивилися, не маючи перед собою самого твору, ви, ймовірно, звернулися б до пошукової системи. Ви можете підказати його за допомогою добре сформульованого пошукового введення, проаналізувати результати, що повертаються, перейти за посиланням SparkNotes або IMDB, яке, здається, містить вашу відповідь, і знайти текст, який ви шукаєте, на сторінці протягом кількох хвилин. Тепер ви просто відкриваєте ChatGPT, набираєте «яка найвідоміша цитата Термінатора?» або «виписуєте початковий уривок «Повісті про два міста» і отримуєте дослівну відповідь за лічені секунди.
Одним з найпростіших застосувань великої мовної моделі (LLM) є база даних знань. LLMs були навчені на величезних наборах даних з багатою інформацією, які такі інтерфейси, як ChatGPT, полегшили отримання. Наприклад, коли ви просите ChatGPT повернути контент із фільму чи книги, ви просто використовуєте здатність моделі згадувати інформацію, з якою вона стикалася під час навчання. Але що, якщо він не був навчений за сценарієм «Термінатора» або якщо його вага не надає значення творам Діккенса? Для того, щоб забезпечити найбільш точні та релевантні результати навіть для найпростіших випадків використання, таких як пошук базової інформації, потрібні складні механізми індексування та пошуку, LLMs які можуть отримати доступ до широкого спектру інформації з точністю.
Розуміння LLM генерації контенту та навчального LLM контенту генерується за допомогою процесу, відомого як прогнозування наступного токена, який гарантує, що відповіді є контекстуально відповідними, різноманітними та певною мірою відображають людське розуміння. Ось як працює наступний прогноз токена, крок за кроком:
Обробка вхідних даних: коли ви вводите запит або запитання, ці вхідні дані перетворюються на лексеми: слова або фрагменти слів. Розуміння контексту: Модель дивиться на токени, які ви їй дали, і, ґрунтуючись на своєму навчанні, намагається зрозуміти контекст, який включає все, від теми, що розглядається, до тону, який ви можете використовувати. Прогноз наступного токена: Використовуючи контекст, який він зрозумілий, модель потім передбачає, який найімовірніший наступний токен. Це не просто вгадування на основі попереднього слова; До цього моменту він враховує весь контекст розмови. Вибір токена: Після того, як він передбачив діапазон можливих наступних токенів, він вибирає один. Цей вибір ґрунтується на ймовірності — токені, який, швидше за все, з'явиться наступним на основі даних, на яких була навчена модель. Однак варто зазначити, що тут також є певна випадковість, яка допомагає генерувати більш різноманітні та природні відповіді. Генерація виводу: вибраний маркер потім конвертується назад у зручний для читання текст. Якщо відповідь не є повною (а це часто відбувається не після одного токена), процес повторюється. Новий токен додається до послідовності, і модель прогнозує наступний токен на основі цього оновленого контексту. Ітеративне уточнення: Цей процес прогнозування наступного токена та додавання його до послідовності повторюється, доки модель не досягне точки зупинки. Це може бути, коли відповідь досягає певної довжини, модель передбачає лексему, яка означає кінець речення чи уривка, або коли вона виконує інструкції, вбудовані в підказку. Обмеження стиснення в LLM навчанні Коли токен LLM прогнозує, він ефективно отримує та використовує стислі знання, закладені в його вагах, для отримання контекстуально відповідних результатів. Таким чином, LLM тренування дзеркально відображає стиснення бази даних. Подібно до того, як база даних оптимізована для швидкого запам'ятовування даних, до яких часто звертаються, база LLM даних призначена для вилучення інформації — специфічної інтерпольованої пам'яті — зі своїх ваг. Ця здатність дозволяє йому давати точні відповіді на запити про знайомий матеріал, з яким він зіткнувся під час навчання, подібно до запиту в базі даних добре проіндексованої інформації. Однак обмеження виникають, коли модель стикається з менш знайомим або незрозумілим вмістом. Наприклад, коли ви питаєте про LLM конкретні уривки з Біблії, він цитує їх слово в слово, але не може цитувати слово в слово жодне поняття, яке він не «засвідчив» зайвим чином під час навчання, оскільки вага, пов'язана з цим поняттям, занадто незначна. У цьому сенсі також є LLM аналогом бази даних. Подібно до того, як база даних може повертати лише ті дані, які були явно збережені в ній, база LLM даних може мати проблеми зі створенням контенту на теми, які вона не бачила під час навчання.
Звичайно, LLMs вони виходять за рамки цієї аналогії, оскільки мають внутрішню модель світу, яка дозволяє їм «розуміти» речі виключно за межами простого пошуку. Однак це надмірне спрощення допомагає нам зрозуміти деякі ключові обмеження в способі LLMs створення контенту.
Подальші LLM обмеження навчання Крім того, наступна система прогнозування токенів має інші внутрішні обмеження, які випливають з її фундаментального підходу до генерації тексту:
Розмір контекстного вікна: Одним з основних обмежень є розмір контекстного вікна моделі — максимальна кількість тексту (у токенах), яку модель може враховувати при прогнозуванні. Для багатьох моделей, включаючи більш ранні версії GPT, це вікно недостатньо велике, щоб підтримувати контекст під час довгих розмов або документів, що може призвести до втрати зв'язності в довших текстах або складних дискусіях, які вимагають збереження контексту за межами безпосередньо попередніх токенів. Узагальнення vs. специфічність: Хоча ці моделі навчаються на величезних наборах даних, їхня здатність узагальнювати на основі цього навчання іноді може призвести до створення загального або невизначено релевантного контенту. Вони можуть промахнутися у створенні дуже конкретних або тонких відповідей, які вимагають детального розуміння або актуальних знань за межами їхніх навчальних даних. Відсутність доступу до зовнішніх знань: Наступні моделі прогнозування токенів обмежені інформацією, що міститься в їхніх навчальних наборах даних. Вони не можуть отримати доступ до нової інформації або включити її після навчання, а це означає, що вони можуть швидко застаріти або їм може не вистачати поточного контексту, наприклад, нещодавніх подій, відкриттів або популярних тем. Повторюваність і передбачуваність: Алгоритмічний характер передбачення наступного токена іноді може призвести до повторюваної або передбачуваної генерації тексту. Оскільки модель часто віддає перевагу токенам, які статистично з більшою ймовірністю підуть за ними з огляду на контекст, вона може розпадатися на цикли або віддавати перевагу загальним фразам, зменшуючи варіативність виходу. Пояснення Retrieval augmented generation (RAG) Як зазначалося вище, генеруйте відповіді на основі вагових коефіцієнтів, LLMs які вони призначили різним аспектам даних під час навчання. Ці ваги відображають, наскільки важливі або значущі різні елементи вхідних даних сприймаються моделлю. Якщо запит користувача містить елементи, які не були суттєво представлені в навчальних даних, модель може не згенерувати точну або релевантну відповідь.
Коли розмова виходить за межі LLMконтекстного вікна , або коли запит перевищує межу значущих ваг у LLMвласному навчальному наборі даних (це означає, що він не може згадати точну відповідь, яку шукає користувач), модель зазвичай покладається на зовнішню базу даних векторного пошуку, яка дозволяє їй шукати відповідний контекст або свіжі дані, які можуть бути додані до запиту від користувача. Цей процес відомий як пошукова розширена генерація (RAG).
«Векторний пошук до успіху» Процес RAG став можливим завдяки базі даних векторного пошуку: розширеному типу бази даних, яка зберігає та керує даними у вигляді векторів. Ці вектори представляють дані у високовимірному просторі, де кожен вимір фіксує певний аспект значення даних, дозволяючи представляти складні зв'язки та атрибути. У контексті тексту та мови бази даних векторного пошуку використовують такі методи, як вбудовування, для перетворення тексту на числові вектори. Це перетворення дозволяє системі вимірювати семантичну схожість між різними фрагментами тексту, обчислюючи відстані між відповідними векторами в цьому багатовимірному просторі.
Під час RAG як запит (тобто вхідні дані користувача в файл LLM), так і збережені дані (такі як статті, документи або речення) перетворюються на вектори за допомогою вбудовування тексту. Ці вкладення перетворюють текстові дані в числові вектори, де схожі значення відображаються на найближчі точки векторного простору. Потім база даних обчислює відстані між вектором запиту та векторами збережених даних, щоб визначити, наскільки тісно пов'язані значення текстів. База даних отримує точки даних (текстовий вміст), вектори яких найближчі до вектора запиту, тобто ті, які семантично найбільш схожі на вхідні дані. Ці точки даних вважаються «найближчими сусідами» з точки зору контексту та значення.
Ці найближчі сусіди надають контекстуально релевантну, додаткову інформацію, до якої базаLLM, можливо, не мала доступу у власних навчальних даних, що може значно підвищити точність, актуальність, багатство та різноманітність LLMрезультатів. Сем Альтман, серед інших, виступав за підхід «векторного пошуку до успіху», покладаючись на RAG для розробки агентів, а не лише на тонке налаштування моделі.
RAG як альтернатива тонкому налаштуванню Тонке налаштування передбачає LLM коригування ваги моделі на основі додаткового навчання на певному наборі даних для підвищення продуктивності для конкретних завдань або покращення розуміння в певних областях. Мало того, що цей процес повільніший, ніж темпи інновацій, а це означає, що точно налаштовані моделі застарівають майже так само швидко, як вони оновлюються, він також не вирішує проблему свіжих даних.
На противагу цьому, RAG дозволяє моделі отримувати доступ до зовнішніх баз даних у режимі реального часу для отримання найактуальнішої інформації, що відповідає поточному запиту. Навіть якщо базова модель не була нещодавно оновлена або налаштована, вона все одно може генерувати відповіді, які включають останні дані. Моделі довше залишаються актуальними, оскільки вони можуть адаптуватися до нових даних і мінливих контекстів за рахунок пошуку зовнішніх джерел інформації.
RAG ефективно долає розрив між глибоким навчанням і традиційними методами пошуку інформації. Роблячи це, він використовує сильні сторони обох — потужне розуміння контексту глибокого навчання та точність пошуку інформації. Цей гібридний підхід дозволяє LLMs створювати більш точні, детальні та контекстуально насичені відповіді.
Усуваючи подальші LLMs обмеження тонкого налаштування Beyond, RAG також вирішує раніше зазначені проблеми, пов'язані зі стандартомLLMs:
Розширення контекстуального розуміння: RAG розширює контекстне вікно традиційногоLLMs, отримуючи актуальну або детальну інформацію, яка покращує відповіді моделі. Підвищення конкретності та точності: Замість того, щоб покладатися виключно на шаблони, вивчені під час навчання, RAG дозволяє моделі вставляти конкретні деталі з отриманих документів у свої відповіді, роблячи їх не тільки більш точними, але й адаптованими до конкретного запиту. Пом'якшення повторюваності та передбачуваності: Динамічно отримуючи різні набори інформації для кожного запиту, RAG може значно змінити відповіді моделі. Ця мінливість допомагає зменшити повторюваність і передбачуваність, які часто спостерігаються в чистих генеративних моделях, оскільки зовнішні дані вводять нові формулювання та деталі в розмову. Однак виклики та необхідна еволюція RAG пов'язані зі своїми проблемами, а саме затримкою та відсутністю інтелекту. Подумайте про розмову з чат-ботом агента, де користувач надсилає запит, випльовує LLM кілька токенів, що вказує на те, що йому потрібно більше контексту, база даних векторного пошуку отримує контекст найближчого сусіда через підказку введення користувача, а потім обидва, нарешті, надсилаються знову LLM для висновку. Потім настає черга користувача відповісти і так далі.
У цій системі кожен запит користувача ініціює багатоетапну операцію, де кожен крок додає загальний час обробки. Швидкість всього процесу також залежить від того, як швидко база даних векторного пошуку зможе отримати необхідний контекст. Якщо запит до бази даних складний або сама база даних велика і не оптимально індексована, такий пошук може спричинити значні затримки. Крім того, особливо в більш складних діалогах, цю послідовність генерації та пошуку може знадобитися повторити кілька разів, щоб адекватно уточнити відповідь. Цей ітеративний цикл може посилити затримку, що призведе до повільнішої взаємодії, ніж це можливо з чисто генеративною моделлю, яка покладається виключно на внутрішні дані.
Крім того, інтелект людини, збагаченої RAG, LLM істотно залежить від якості та актуальності інформації, отриманої з бази даних векторного пошуку. Якщо вміст бази даних не є вичерпним, актуальним або добре підтримується, корисність отриманої інформації може бути обмеженою, що вплине на загальний аналіз відповідей.
Навіть коли отримуються високоякісні зовнішні дані, проблема полягає в тому, наскільки ефективно ця інформація може бути інтегрована в існуючу структуру реагування .LLM Модель повинна не тільки включати ці зовнішні дані, але й робити це у спосіб, який є контекстуально відповідним і послідовним. Невідповідність між навчанням моделі та характером зовнішніх даних може призвести до відповідей, які є технічно точними, але контекстуально розрізненими.
Наступне LLMs покоління The Next Generation, швидше за все, LLMs поєднає RAG на основі векторного пошуку та традиційні методи навчання/тонкого налаштування разом, а також структуровану обробку даних (e.g. SQL бази даних ринку TradFi та пов'язані з ними фінансові новини). Концепція наявності LLM провайдера «тут» і окремої бази даних векторного пошуку «там» буде зіставлена за допомогою нових моделей, які інтуїтивно розширюють свою індексовану робочу пам'ять до локальних SSD з терабайтами векторизованого контексту.
Space and Time вже надав клієнтам доказ SQL — доказ ZK, який перевіряє точність і захист від несанкціонованого доступу обробки бази даних SQL — і нещодавно відправив Proof of Vector Search, який робить те ж саме для пошуку векторного пошуку. Ці новітні докази відкривають шлях у майбутнє, де LLMs можна інтегрувати свіжий контекст, отримати доступ до ширшого та тоншого спектру даних у режимі реального часу та інтегрувати структуровану обробку даних для отримання більш глибокої аналітики, і все це у спосіб, який можна відстежити та перевірити. Ці досягнення в кінцевому підсумку розширять сферу застосування для LLMs, розширюючи їх корисність у секторах, які значною мірою покладаються на актуальні дані, таких як фінансові послуги, агрегація новин та оцінка ризиків, таким чином просуваючи наступну хвилю інновацій на основі штучного інтелекту.
