Статті

HYBRID RAG-QA МЕТОД ДЛЯ ПОБУДОВИ ГРАФА ЗНАНЬ В КОНТЕКСТІ МАЛОРЕСУРСНОЇ МОВИ

Д. А. Ляшко
Національний університет водного господарства та природокористування, м. Рівне
Ю. В. Турбал
Національний університет водного господарства та природокористування, м. Рівне
Ю. Є. Климюк
Національний університет водного господарства та природокористування, м. Рівне
Ключові слова
граф знань побудова графа знань вилучення відношень малоресурсні мови пошуково-доповнена генерація (RAG) системи запитань-відповідей (QA)

Анотація

У статті представлено комплексний аналіз сучасних методів побудови графів знань (Knowledge Graph Construction, KGC) знеструктурованих текстових даних, що становлять основу для широкого спектра інтелектуальних застосунків – від семантичного пошуку та систем запитань-відповідей до рекомендаційних сервісів та аналітики даних. Робота критично розглядає ключові парадигми KGC, серед яких конвеєрний підхід, спільне вилучення сутностей та відношень, генеративні Seq2Seq-моделі, фреймворки на базі багатокрокового запитання-відповіді (QA) та методи із залученням великих мовних моделей (LLM). Для кожної з парадигм окреслено їхні сильні сторони та фундаментальні обмеження: від каскадного поширення помилок і втрати структурної інформації під час лінеаризації до труднощів генерації повних шаблонів запитань і проблем галюцинацій та фактологічної  непослідовності LLM.Окрему увагу зосереджено на проблематиці побудови графів знань у малоресурсних мовах, де відсутність достатніх корпусів, анотованих даних та інструментів робить використання традиційних підходів малоефективним. У цьому контексті розглянуто сучасні стратегії: використання опорних мов, few-shot та метанавчання, промпторієнтовані методи для генерації синтетичних даних, а також архітектури пошуково-доповненої генерації (RAG). Наведено приклади  успішного застосування цих стратегій у різних мовних середовищах і галузях, зокрема у біомедичних дослідженнях та для афро-азійських мов.У статті запропоновано гібридну методологію RAG-QA, яка поєднує сильні сторони обох підходів: фактологічну надійність та «заземлення» інформації, що забезпечує модуль ретривера, із контрольованістю та інтерпретованістю, які надає формулювання задачі у вигляді багатокрокового QA. Такий синергетичний підхід дозволяє чітко узгоджувати побудований граф знань із заданою онтологією, мінімізувати ризики помилок та підвищувати точність вилучення  сутностей і відношень у складних умовах дефіциту даних.

Біографії авторів

Д. А. Ляшко, Національний університет водного господарства та природокористування, м. Рівне
аспірант
Ю. В. Турбал, Національний університет водного господарства та природокористування, м. Рівне
д.т.н., професор
Ю. Є. Климюк, Національний університет водного господарства та природокористування, м. Рівне
к.т.н., доцент