قبل عام 2022 ، إذا كنت تريد أن تتذكر بسرعة مقطعا معينا من كتابك المفضل أو اقتباسا من فيل شاهدته للتو بدون العمل نفسه أمامك ، فمن المحتمل أن تتحول إلى محرك بحث. يمكنك مطالبتها بإدخال بحث جيد الصياغة ، وتحليل النتائج التي تم إرجاعها ، وزيارة رابط SparkNotes أو IMDB الذي يبدو أنه يحتوي على إجابتك ، والعثور على النص الذي تبحث عنه على الصفحة في غضون بضع دقائق. الآن ، يمكنك ببساطة فتح ChatGPT ، واكتب "ما هو اقتباس Terminator الأكثر شهرة؟" أو "اكتب المقطع الافتتاحي ل A Tale of Two Cities" واحصل على إجابتك الحرفية مرة أخرى في ثوان.
أحد أبسط الاستخدامات لنموذج لغة كبير (LLM) هو كقاعدة بيانات للمعرفة. LLMs تم تدريبهم على مجموعات بيانات واسعة من المعلومات الغنية ، والتي جعلت واجهات مثل ChatGPT من السهل استردادها. عندما تطالب ChatGPT بإرجاع محتوى من فيلم أو كتاب ، على سبيل المثال ، فأنت ببساطة تستفيد من قدرة النموذج على تذكر المعلومات التي تعرض لها أثناء تدريبه. ولكن ماذا لو لم يتم تدريبه على نص Terminator ، أو إذا كانت أوزانه لا تعطي أهمية لأعمال ديكنز؟ ومن أجل تقديم أدق النتائج وأكثرها صلة حتى بالنسبة لأبسط حالات الاستخدام، مثل استرجاع المعلومات الأساسية، LLMs تحتاج إلى آليات متطورة للفهرسة والاسترجاع يمكنها الوصول إلى طائفة واسعة من المعلومات بدقة.
يتم إنشاء فهم LLM إنشاء المحتوى ومحتوى التدريب LLM من خلال عملية تعرف باسم التنبؤ المميز التالي ، والتي تضمن أن تكون الاستجابات مناسبة للسياق ومتنوعة وتعكس إلى حد ما الفهم الشبيه بالإنسان. إليك كيفية عمل التنبؤ التالي بالرمز المميز ، خطوة بخطوة:
معالجة الإدخال: عند كتابة مطالبة أو سؤال ، يتم تحويل هذا الإدخال إلى رموز مميزة: كلمات أو أجزاء من الكلمات. فهم السياق: ينظر النموذج إلى الرموز المميزة التي قدمتها له ، وبناء على تدريبه ، يحاول فهم السياق ، والذي يتضمن كل شيء من الموضوع المطروح إلى النغمة التي قد تستخدمها. توقع الرمز المميز التالي: باستخدام السياق الذي يفهمه ، يتنبأ النموذج بعد ذلك بالرمز المميز التالي الأكثر احتمالا. انها ليست مجرد التخمين على أساس الكلمة السابقة مباشرة. إنه يفكر في السياق الكامل للمحادثة حتى تلك النقطة. اختيار الرمز المميز: بمجرد أن يتنبأ بمجموعة من الرموز المميزة التالية المحتملة ، فإنه يختار واحدا. يعتمد هذا التحديد على الاحتمال - الرمز المميز الذي من المرجح أن يأتي بعد ذلك بناء على البيانات التي تم تدريب النموذج عليها. ومع ذلك ، تجدر الإشارة إلى أن هناك بعض العشوائية هنا أيضا ، مما يساعد على توليد استجابات أكثر تنوعا وطبيعية. توليد الإخراج: ثم يتم تحويل الرمز المميز المحدد مرة أخرى إلى نص يمكن قراءته بواسطة الإنسان. إذا لم تكتمل الاستجابة (والتي غالبا ما لا تكون بعد رمز مميز واحد فقط) ، تتكرر العملية. تتم إضافة الرمز المميز الجديد إلى التسلسل ، ويتنبأ النموذج بالرمز المميز التالي بناء على هذا السياق المحدث. التحسين التكراري: تتكرر عملية التنبؤ بالرمز المميز التالي وإضافته إلى التسلسل حتى يصل النموذج إلى نقطة توقف. قد يكون هذا عندما تصل الاستجابة إلى طول معين ، أو يتنبأ النموذج برمز مميز يدل على نهاية الجملة أو المقطع ، أو عندما يفي بالتعليمات المضمنة في الموجه. حدود الضغط في LLM التدريب عندما يتنبأ رمز LLM مميز ، فإنه يسترد ويستخدم بشكل فعال المعرفة المضغوطة المضمنة في أوزانه لإنتاج مخرجات مناسبة للسياق. بهذه الطريقة ، LLM يعكس التدريب ضغط قاعدة البيانات. مثلما يتم تحسين قاعدة البيانات لاستدعاء البيانات التي يتم الوصول إليها بشكل متكرر بسرعة ، تم تصميم قاعدة LLM البيانات لاسترداد المعلومات - ذكريات محفورة محددة - من أوزانها. تسمح هذه الإمكانية لها بإنتاج ردود دقيقة على الاستفسارات حول المواد المألوفة التي واجهتها أثناء تدريبها ، تماما مثل الاستعلام عن قاعدة بيانات للحصول على معلومات مفهرسة جيدا. ومع ذلك ، تنشأ القيود عندما يواجه النموذج محتوى أقل دراية أو غامضا. على سبيل المثال، عندما تسأل LLM عن مقاطع محددة في الكتاب المقدس، فإنه يقتبس منها كلمة بكلمة، لكنه لا يستطيع أن يقتبس كلمة بكلمة أي مفهوم لم "يشهده" بشكل متكرر أثناء التدريب، لأن الأوزان المرتبطة بهذا المفهوم غير مهمة للغاية. وبهذا المعنى أيضا ، فإن LLM قاعدة البيانات مماثلة. مثلما قد تقوم قاعدة البيانات فقط بإرجاع البيانات التي تم تخزينها صراحة داخلها ، LLM يمكن أن تكافح مع إنشاء محتوى حول مواضيع لم ترها على نطاق واسع أثناء التدريب.
بالطبع ، LLMs خارج نطاق هذا القياس ، لأن لديهم نموذجا عالميا داخليا يسمح لهم "بفهم" الأشياء بما يتجاوز مجرد عمليات البحث. ومع ذلك ، يساعدنا هذا التبسيط المفرط على فهم بعض القيود الرئيسية في الطريقة التي LLMs يتم تدريبها لإنشاء المحتوى.
مزيد من القيود على LLM التدريب علاوة على ذلك ، فإن نظام التنبؤ الرمزي التالي له قيود متأصلة أخرى تنبع من نهجه الأساسي في إنشاء النص:
حجم نافذة السياق: أحد القيود الأساسية هو حجم نافذة سياق النموذج - الحد الأقصى لمقدار النص (بالرموز المميزة) الذي يمكن للنموذج مراعاته عند إجراء تنبؤ. بالنسبة للعديد من الطرز ، بما في ذلك الإصدارات السابقة من GPT ، فإن هذه النافذة ليست كبيرة بما يكفي للحفاظ على السياق عبر المحادثات أو المستندات الطويلة ، مما قد يؤدي إلى فقدان التماسك في النصوص الطويلة أو المناقشات المعقدة التي تتطلب الحفاظ على السياق بعد الرموز المميزة السابقة مباشرة. التعميم مقابل الخصوصية: بينما يتم تدريب هذه النماذج على مجموعات بيانات واسعة ، فإن قدرتها على التعميم من هذا التدريب يمكن أن تقودها أحيانا إلى إنتاج محتوى عام أو غامض الصلة. قد يفوتهم الهدف في توليد استجابات محددة للغاية أو دقيقة تتطلب فهما مفصلا أو معرفة حديثة خارج بيانات التدريب الخاصة بهم. نقص الوصول إلى المعرفة الخارجية: تقتصر نماذج التنبؤ بالرمز المميز التالي على المعلومات الواردة في مجموعات بيانات التدريب الخاصة بهم. لا يمكنهم الوصول إلى معلومات جديدة أو دمجها بعد التدريب ، مما يعني أنها يمكن أن تصبح قديمة بسرعة أو تفتقر إلى السياق الحالي ، مثل الأحداث الأخيرة أو الاكتشافات أو الموضوعات الشائعة. التكرار والقدرة على التنبؤ: يمكن أن تؤدي الطبيعة الخوارزمية للتنبؤ بالرمز المميز التالي في بعض الأحيان إلى إنشاء نص متكرر أو يمكن التنبؤ به. نظرا لأن النموذج غالبا ما يفضل الرموز المميزة التي من المرجح إحصائيا اتباعها بالنظر إلى السياق ، فقد يقع في حلقات أو يفضل العبارات الشائعة ، مما يقلل من تباين المخرجات. شرح استرجاع الجيل المعزز (RAG) كما ذكرنا سابقا ، LLMs قم بإنشاء استجابات بناء على الأوزان التي خصصوها لجوانب مختلفة من البيانات أثناء التدريب. تعكس هذه الأوزان مدى أهمية أو أهمية العناصر المختلفة لبيانات الإدخال التي ينظر إليها النموذج. إذا تضمنت مطالبة المستخدم عناصر لم يتم تمثيلها بشكل كبير في بيانات التدريب، فقد يفشل النموذج في إنشاء استجابة دقيقة أو ذات صلة.
عندما تتجاوز المحادثة نافذة السياق LLM، أو عندما تتجاوز المطالبة حد الأوزان الكبيرة في LLMمجموعة بيانات التدريب الخاصة ب (بمعنى أنها لا تستطيع تذكر الإجابة التي يبحث عنها المستخدم بالضبط) ، يعتمد النموذج عادة على قاعدة بيانات بحث متجهة خارجية ، مما يسمح لها بالبحث عن السياق ذي الصلة أو البيانات الجديدة التي يمكن إلحاقها بمطالبة من المستخدم. تعرف هذه العملية باسم الجيل المعزز للاسترجاع (RAG).
"البحث المتجه لتحقيق النجاح" أصبحت عملية الفريق الاستشاري للاتصالات الراديوية ممكنة من خلال قاعدة بيانات البحث عن المتجهات: وهي نوع متقدم من قواعد البيانات التي تخزن البيانات وتديرها كمتجهات. تمثل هذه المتجهات البيانات في مساحة عالية الأبعاد ، حيث يلتقط كل بعد بعض جوانب معنى البيانات ، مما يسمح بتمثيل العلاقات والسمات المعقدة. في سياق النص واللغة ، تستخدم قواعد بيانات البحث المتجه تقنيات مثل التضمين لتحويل النص إلى متجهات رقمية. يمكن هذا التحويل النظام من قياس أوجه التشابه الدلالي بين أجزاء مختلفة من النص عن طريق حساب المسافات بين المتجهات المقابلة لها في هذا الفضاء متعدد الأبعاد.
أثناء RAG، يتم تحويل كل من الاستعلام (أي إدخال المستخدم إلى LLM) والبيانات المخزنة (مثل المقالات أو المستندات أو الجمل) إلى متجهات باستخدام تضمينات النص. تحول هذه التضمينات البيانات النصية إلى متجهات رقمية حيث يتم تعيين معاني مماثلة إلى نقاط قريبة في الفضاء المتجه. ثم تقوم قاعدة البيانات بحساب المسافات بين متجه الاستعلام ومتجهات البيانات المخزنة لتحديد مدى ارتباط معاني النصوص. تسترجع قاعدة البيانات نقاط البيانات (المحتوى النصي) التي تكون متجهاتها أقرب إلى متجه الاستعلام ، أي تلك الأكثر تشابها من الناحية الدلالية مع الإدخال. تعتبر نقاط البيانات هذه "أقرب الجيران" من حيث السياق والمعنى.
يوفر هؤلاء الجيران الأقرب معلومات إضافية ذات صلة بالسياق ربما لم تتمكن القاعدة LLM من الوصول إليها داخل بيانات التدريب الخاصة بها ، والتي يمكن أن تحسن بشكل كبير من دقة وأهمية وثراء وتنوع مخرجات ULLM'. دعا سام ألتمان ، من بين آخرين ، إلى نهج "البحث المتجه لتحقيق النجاح" - بالاعتماد على RAG لتطوير العوامل ، بدلا من الضبط الدقيق للنموذج وحده.
RAG كبديل للضبط الدقيق LLM يتضمن الضبط الدقيق ضبط أوزان النموذج بناء على تدريب إضافي على مجموعة بيانات محددة لتحسين الأداء لمهام معينة أو تحسين الفهم في مجالات معينة. هذه العملية ليست أبطأ من وتيرة الابتكار فحسب ، مما يعني أن النماذج المضبوطة الدقيقة تصبح قديمة بنفس سرعة تحديثها تقريبا ، كما أنها لا تعالج مشكلة البيانات الجديدة.
وعلى النقيض من ذلك، يمكن الفريق الاستشاري للنموذج من النفاذ إلى قواعد البيانات الخارجية في الوقت الفعلي لاسترجاع أحدث المعلومات ذات الصلة بالاستعلام المطروح. حتى إذا لم يتم تحديث النموذج الأساسي أو ضبطه مؤخرا، فلا يزال بإمكانه إنشاء استجابات تتضمن أحدث البيانات. تظل النماذج ذات صلة لفترة أطول لأنها يمكن أن تتكيف مع البيانات الجديدة والسياقات المتغيرة من خلال استرجاع مصادر المعلومات الخارجية.
ويسد الفريق الاستشاري بشكل فعال الفجوة بين التعلم العميق والتقنيات التقليدية لاسترجاع المعلومات. من خلال القيام بذلك ، فإنه يستفيد من نقاط القوة في كليهما - الفهم السياقي القوي للتعلم العميق ودقة استرجاع المعلومات. يسمح LLMs هذا النهج الهجين بإنتاج استجابات أكثر دقة وتفصيلا وثراء بالسياق.
ويتناول الفريق الاستشاري للاتصالات الراديوية أيضا التحديات التي سبق ذكرها والمرتبطة بالمعيار LLMsفيما يتعلق بما يلي:LLMs
توسيع نطاق الفهم السياقي: يوسع الفريق الاستشاري للاتصالات الراديوية نافذة السياق التقليدية LLMs من خلال جلب معلومات محدثة أو مفصلة تعزز استجابات النموذج. تعزيز الخصوصية والدقة: بدلا من الاعتماد فقط على الأنماط المكتسبة أثناء التدريب، يسمح الفريق الاستشاري للاتصالات الراديوية للنموذج بإدخال تفاصيل محددة من الوثائق المسترجعة في ردوده، مما يجعلها ليس أكثر دقة فحسب، بل مصممة أيضا وفقا للاستعلام المحدد المطروح. التخفيف من التكرار والقدرة على التنبؤ: من خلال سحب مجموعات مختلفة من المعلومات ديناميكيا لكل استعلام، يمكن للفريق الاستشاري للاتصالات الراديوية أن يغير استجابات النموذج بشكل كبير. يساعد هذا التباين في تقليل التكرار والقدرة على التنبؤ التي غالبا ما ترى في النماذج التوليدية البحتة ، حيث تقدم البيانات الخارجية صياغة وتفاصيل جديدة في المحادثة. ومع ذلك، فإن التحديات والتطور الضروري للفريق الاستشاري للاتصالات الراديوية RAG تأتي مع تحدياتها الخاصة - وهي الكمون ونقص الذكاء. فكر في محادثة chatbot للوكيل القائم على الأدوار حيث يرسل المستخدم مطالبة ، ويبصق LLM بعض الرموز المميزة التي تشير إلى أنه يحتاج إلى مزيد من السياق ، وتسترجع قاعدة بيانات البحث المتجه سياق أقرب جار عبر موجه إدخال المستخدم ، ثم يتم إرسال كلاهما أخيرا إلى LLM مرة أخرى للاستدلال. بعد ذلك ، حان دور المستخدم للرد ، وهكذا.
في هذا النظام ، يبدأ كل موجه مستخدم عملية متعددة الخطوات حيث تضيف كل خطوة إلى إجمالي وقت المعالجة. تعتمد سرعة العملية بأكملها أيضا على مدى سرعة قاعدة بيانات البحث المتجه في استرداد السياق الضروري. إذا كان استعلام قاعدة البيانات معقدا أو كانت قاعدة البيانات نفسها كبيرة وغير مفهرسة على النحو الأمثل ، فقد يؤدي هذا الاسترجاع إلى تأخيرات كبيرة. بالإضافة إلى ذلك ، خاصة في الحوارات الأكثر تعقيدا ، قد يلزم تكرار تسلسل التوليد والاسترجاع هذا عدة مرات لتحسين الاستجابة بشكل مناسب. يمكن أن تؤدي هذه الدورة التكرارية إلى مضاعفة زمن الوصول ، مما يؤدي إلى تفاعلات أبطأ مما قد يكون ممكنا مع نموذج توليدي بحت يعتمد فقط على البيانات الداخلية.
وعلاوة على ذلك، فإن ذكاء الفريق الاستشاري المعني LLM بتكنولوجيا المعلومات والاتصالات يعتمد اعتمادا كبيرا على جودة وأهمية المعلومات المستخلصة من قاعدة بيانات البحث عن المتجهات. إذا لم يكن محتوى قاعدة البيانات شاملا أو محدثا أو يتم صيانته جيدا ، فقد تكون فائدة المعلومات المسترجعة محدودة ، مما يؤثر على الذكاء العام للردود.
وحتى عند استرجاع بيانات خارجية عالية الجودة، يظل التحدي قائما في مدى فعالية دمج هذه المعلومات في إطار الاستجابة الحالي ل LLM. يجب ألا يتضمن النموذج هذه البيانات الخارجية فحسب ، بل يجب أن يفعل ذلك بطريقة مناسبة ومتماسكة من حيث السياق. يمكن أن يؤدي عدم التوافق بين تدريب النموذج وطبيعة البيانات الخارجية إلى استجابات دقيقة تقنيا ولكنها مفككة من حيث السياق.
الجيل القادم من LLMs من المرجح أن يمزج الجيل القادم من LLMs RAG القائم على البحث المتجه وطرق التدريب / الضبط التقليدية معا ، جنبا إلى جنب مع معالجة البيانات المنظمة (قواعد بيانات e.g. SQL لبيانات سوق TradFi والأخبار المالية المرتبطة بها). سيتم تجميع مفهوم وجود LLM مزود "هنا" وقاعدة بيانات منفصلة للبحث عن المتجهات "هناك" عبر نماذج جديدة تعمل بشكل حدسي على توسيع ذاكرتها العاملة المفهرسة إلى محركات أقراص الحالة الصلبة المحلية مع تيرابايت من السياق المتجه.
لقد قدم المكان والزمان بالفعل إثبات SQL - وهو دليل ZK يتحقق من دقة معالجة قاعدة بيانات SQL والتلاعب بها - للعملاء وتم شحنها مؤخرا Proof of Vector Search ، والذي يفعل الشيء نفسه لاسترجاع البحث المتجه. تفتح هذه البراهين الجديدة الطريق لمستقبل يمكن فيه LLMs دمج سياق جديد ، والوصول إلى نطاق أوسع وأكثر دقة من البيانات في الوقت الفعلي ، ودمج معالجة البيانات المنظمة للحصول على تحليلات أكثر ثاقبة ، كل ذلك بطريقة يمكن تتبعها والتحقق منها. وستؤدي هذه التطورات في نهاية المطاف إلى توسيع نطاق التطبيقات LLMsلتوسيع نطاق فائدتها في القطاعات التي تعتمد بشكل كبير على البيانات الحديثة، مثل الخدمات المالية، وتجميع الأخبار، وتقييم المخاطر، وبالتالي دفع الموجة التالية من الابتكار القائم على الذكاء الاصطناعي إلى الأمام.
