الاسترجاع المعزّز بالتوليد (RAG) — توسيع معرفة النماذج اللغوية

تخيّل أنك تسأل مساعدًا ذكيًا: «ما آخر التطوّرات في مجال الطاقة المتجدّدة؟» إن كان النموذج قد دُرِّب قبل أشهر أو سنوات، فقد يأتي جوابه قديمًا، لأنه لا يعرف شيئًا خارج بيانات تدريبه.

لماذا تحتاج النماذج اللغوية إلى بيانات خارجية

تخيّل أنك تسأل مساعدًا ذكيًا: «ما آخر التطوّرات في مجال الطاقة المتجدّدة؟» إن كان النموذج قد دُرِّب قبل أشهر أو سنوات، فقد يأتي جوابه قديمًا، لأنه لا يعرف شيئًا خارج بيانات تدريبه.

هذا هو القيد الجوهري في معظم النماذج اللغوية الكبيرة: معرفتها ثابتة عند لحظة التدريب. فبخلاف الإنسان الذي يستطيع البحث في الإنترنت أو قراءة الأخبار أو الرجوع إلى قاعدة بيانات، لا يستطيع النموذج بطبيعته الوصول إلى معلومة جديدة بعد أن ينتهي تدريبه.

وهنا يأتي دور الاسترجاع المعزّز بالتوليد (Retrieval-Augmented Generation – RAG). فبدلًا من الاعتماد على ما «يتذكّره» النموذج فقط، يربط RAG النموذج بمصادر بيانات خارجية، فيساعده على توليد إجابات أدقّ وأحدث وأكثر صلة بالموضوع.

لماذا يهمّ هذا؟

وبهذه الطريقة يستطيع النظام جلب معرفة حديثة عند الطلب، فيصبح أكثر نفعًا وقابلية للتكيّف مع مجالات مختلفة.

توضيح ضروري لا يضمن RAG صحّة المعلومة. ما يفعله أنه يُسند الجواب إلى مصادر محدّدة يمكن مراجعتها، ويمنح النظام معرفة أحدث ووصولًا إلى بيانات متخصّصة. أما إذا كان المصدر نفسه خاطئًا أو ناقصًا، أو إذا استرجع النظام مقاطع غير مناسبة، فقد يبقى الجواب خاطئًا.

كيف يعمل RAG: الاسترجاع ثم التوليد

على المستوى العام، يضيف RAG خطوة بحث قبل توليد الجواب. فبدلًا من أن يولّد النظام الرد من معرفته الداخلية وحدها، يسترجع أولًا بيانات خارجية ثم يدمجها في الجواب.

وتسير العملية على ثلاث خطوات:

  1. الاسترجاع — يبحث النظام في قاعدة بيانات أو واجهة برمجية أو مستودع مستندات عن المعلومات ذات الصلة.
  2. إضافة السياق — تُدمج البيانات المسترجَعة مع سؤال المستخدم الأصلي، فيصبح الموجّه أغنى بالسياق.
  3. التوليد — يستخدم النموذج البيانات المسترجَعة ومعرفته المدرَّبة معًا لصياغة الجواب النهائي.

ومعنى هذا أن النموذج لا يخمّن ولا يؤلّف معلومة من العدم، بل يبني رده على مادة موجودة يمكن تتبّعها.

مثال توضيحي: مساعد قانوني بدون RAG ومعه

مثال افتراضي الحكم القضائي الوارد أدناه مثال افتراضي صيغ لتوضيح الفكرة فقط، ولا يشير إلى قرار حقيقي. والغرض منه إظهار الفرق بين إجابة عامة وإجابة مُسندة إلى مصدر يمكن مراجعته.

بدون RAG:

مع RAG:

المكوّنات الأساسية في منظومة RAG

لكي يعمل RAG، يحتاج إلى ثلاثة مكوّنات: مصدر المعرفة، و مكوّن الاسترجاع، والنموذج المولِّد. ويوضّح الشكل 7 كيف تتفاعل هذه المكوّنات لتعزيز ردود النموذج بمعرفة خارجية.

مخطط مسار الاسترجاع المعزّز بالتوليد: المستخدم، ثم الاستعلام، ثم مكوّن الاسترجاع المتصل بمصدر المعرفة، ثم إضافة السياق، ثم النموذج المولِّد، ثم الإجابة
الشكل 7: مسار عملية RAG خطوةً خطوة: الاسترجاع ← إضافة السياق ← التوليد

1. مصدر المعرفة: من أين تأتي المعلومة

هو قاعدة البيانات الخارجية أو محرك البحث أو مخزن المستندات الذي يجلب النظام منه المعلومات. وقد يكون:

2. مكوّن الاسترجاع: كيف نجد البيانات المناسبة

يعمل هذا المكوّن كمحرك بحث خاص بالنظام، فيجد أكثر البيانات صلةً بالسؤال قبل أن يولّد النموذج جوابه. ويستخدم أساليب مثل:

3. النموذج المولِّد: دمج ما استُرجع مع ما تعلّمه النموذج

بعد إيجاد البيانات المناسبة، يمزج النموذج بينها وبين قدرته على الاستدلال ليصوغ جوابًا متكاملًا. وهذه الخطوة تسعى إلى:

تطبيقات واقعية لـ RAG

RAG ليس فكرة نظرية؛ هو يشغّل أدوات فعلية في قطاعات متعدّدة.

1. دعم العملاء

تستخدم الشركات أنظمة محادثة قائمة على RAG تسترجع الأجوبة من قواعد المعرفة الداخلية، فتقصّر زمن الانتظار وترفع دقّة الإجابات.

2. المساعدات في الرعاية الصحية

تُدمج النماذج الطبية مع أوراق بحثية حديثة وقواعد بيانات إكلينيكية لمساعدة الأطباء في الوصول إلى معلومات دقيقة ومحدّثة.

3. الاستشارات القانونية والامتثال

يساعد RAG الأدوات القانونية في جلب تحديثات السوابق القضائية، فيصل المحامون إلى أحدث الأحكام بسرعة.

4. محرّكات البحث المعزّزة

محرّكات مثل Perplexity AI وخصائص التلخيص في محرّكات البحث الكبرى تستخدم RAG لاسترجاع البيانات وتلخيصها في صيغة حوارية.

أهم ما نخرج به من هذا الفصل

بهذا نكون أكملنا أساسيات الذكاء الاصطناعي التوليدي: النماذج، وكيف نوجّهها، وكيف نوصلها بالمعرفة الخارجية. في الجزء التالي ننتقل خطوة أبعد: كيف تتحوّل هذه القدرات إلى نظام يخطّط ويستخدم الأدوات وينفّذ المهام — أي إلى وكيل ذكاء اصطناعي.