Vector Sök efter framgång

Före 2022, om du snabbt vill komma ihåg ett specifikt avsnitt från din favoritbok eller ett citat från en film som du precis har sett utan själva verket framför dig, skulle du förmodligen vända dig till en sökmotor. Du uppmanar den med en välformulerad sökinmatning, analyserar de returnerade resultaten, besöker SparkNotes- eller IMDB-länken som verkar innehålla ditt svar och hittar texten du letar efter på sidan inom några minuter. Nu öppnar du helt enkelt ChatGPT, skriver "vilket är det mest kända Terminator-citatet?" eller "skriv ut det inledande avsnittet av A Tale of Two Cities" och få ditt ordagranta svar tillbaka på några sekunder.

En av de enklaste användningsområdena för en stor språkmodell (LLM) är som en databas med kunskap. LLM:er har utbildats i stora datamängder med rik information, vilka gränssnitt som ChatGPT har gjort det enkelt att hämta. När du uppmanar ChatGPT att returnera innehåll från en film eller bok, till exempel, utnyttjar du helt enkelt modellens förmåga att återkalla information som den har utsatts för under sin träning. Men vad händer om det inte tränades på Terminator-manuset, eller om dess vikter inte ger betydelse för Dickens verk? För att leverera de mest exakta och relevanta resultaten även för de enklaste användningsfallen, såsom grundläggande informationshämtning, behöver LLMs sofistikerade indexerings- och hämtningsmekanismer som kan komma åt ett brett spektrum av information med precision.

Förstå LLM-innehållsgenerering och utbildning LLM-innehåll genereras genom en process som kallas nästa token-förutsägelse, som säkerställer att svaren är kontextuellt lämpliga, varierade och i viss mån återspeglar en mänsklig förståelse. Så här fungerar nästa tokenförutsägelse, steg för steg:

Inmatningsbearbetning: När du skriver en uppmaning eller en fråga omvandlas den inmatningen till tokens: ord eller ordbitar. Kontextförståelse: Modellen tittar på tokens du har gett den och, baserat på dess träning, försöker förstå sammanhanget, vilket inkluderar allt från ämnet till hands till tonen du kanske använder. Förutsägelse av nästa token: Med hjälp av sammanhanget som det förstås förutsäger modellen sedan vad den mest sannolika nästa token är. Det är inte bara att gissa baserat på det omedelbart föregående ordet; det tar hänsyn till hela konversationskontexten fram till den punkten. Tokenval: När den har förutspått ett antal möjliga nästa token, väljer den en. Det här urvalet är baserat på sannolikhet - den token som med största sannolikhet kommer nästa baserat på data som modellen tränades på. Det är dock värt att notera att det finns en viss slumpmässighet även här, vilket hjälper till att generera mer varierade och naturligt klingande svar. Utdatagenerering: Den valda token konverteras sedan tillbaka till text som kan läsas av människor. Om svaret inte är komplett (vilket det ofta inte är efter bara en token) upprepas processen. Den nya token läggs till i sekvensen, och modellen förutsäger nästa token baserat på detta uppdaterade sammanhang. Iterativ förfining: Denna process att förutsäga nästa token och lägga till den i sekvensen upprepas tills modellen når en stopppunkt. Detta kan vara när svaret når en viss längd, modellen förutsäger en token som anger slutet på en mening eller passage, eller när den uppfyller instruktionerna som är inbäddade i prompten. Begränsningar av kompression i LLM-träning När en LLM förutsäger en token, hämtar och använder den effektivt den komprimerade kunskapen som är inbäddad i dess vikter för att producera kontextuellt lämpliga utdata. På detta sätt speglar LLM-träning databaskomprimering. Precis som en databas är optimerad för att snabbt återkalla data som ofta används, är en LLM utformad för att hämta information – specifika interpolerade minnen – från dess vikter. Denna förmåga gör det möjligt för den att producera exakta svar på frågor om bekant material som den har stött på under sin utbildning, ungefär som att fråga efter en databas för välindexerad information. Begränsningar uppstår dock när modellen stöter på mindre välbekant eller oklart innehåll. Till exempel, när du ber LLM om specifika ställen i Bibeln, citerar den dem ord för ord, men den kan inte citera ord för ord något begrepp som det inte överflödigt har "bevittnat" under träningen, eftersom vikterna förknippade med det konceptet är alltför obetydlig. Även i den meningen är LLM analog med en databas. Precis som en databas kanske bara returnerar data som explicit har lagrats i den, kan en LLM kämpa med att generera innehåll om ämnen som den inte har sett i stor utsträckning under utbildningen.

Naturligtvis ligger LLM:er utanför ramen för denna analogi, eftersom de har en världsmodell internt som tillåter dem att "förstå" saker rent utöver bara uppslagningar. Men denna alltför förenkling hjälper oss att förstå några av de viktigaste begränsningarna i det sätt som LLM:er tränas för att generera innehåll.

Ytterligare begränsningar av LLM-utbildning Dessutom har nästa tokenförutsägelsesystem andra inneboende begränsningar som härrör från dess grundläggande tillvägagångssätt för att generera text:

Kontextfönsterstorlek: En av de primära konst