Teoria gier poprawia jakość modeli językowych
Naukowcy z Laboratorium Informatyki i Sztucznej Inteligencji MIT (CSAIL) wprowadzili przełomową metodę, która podniosła zdolności rozumienia i generowania tekstu przez sztuczną inteligencję (SI). Aby zrozumieć na czym polega cały „kejs” spróbujmy wyobrazić sobie grę, w której dwóch graczy przekazuje sobie tajne wiadomości za pomocą nietypowych zdań (coś jak w filmie „Casino”). Celem tej gry jest osiągnięcie pełnego zrozumienia przekazywanej informacji. Naukowcy z MIT opracowali podobną „grę” dla systemów SI, nazwali ją „grą zgodności”, gdzie jedna część systemu SI generuje zdania, a druga je rozumie i ocenia.
W grze zgodności, dwie części systemu SI współpracują ze sobą zgodnie z określonymi zasadami. Badacze odkryli, że traktowanie tej interakcji jako gry poprawia zdolność SI do udzielania poprawnych i spójnych odpowiedzi na pytania. Metodę tę przetestowano na różnych zadaniach, takich jak rozumienie tekstu, rozwiązywanie problemów matematycznych i prowadzenie rozmów. We wszystkich przypadkach systemy SI osiągnęły lepsze wyniki.
Tradycyjnie, duże modele językowe odpowiadają na dwa sposoby: generując odpowiedzi bezpośrednio z modelu lub używając modelu do oceniania zestawu wcześniej zdefiniowanych odpowiedzi (ocena dyskryminacyjna). Podejścia te mogą prowadzić do różniących się i czasem niezgodnych wyników. Na przykład na pytanie „Kto jest prezydentem Stanów Zjednoczonych?” mogłoby wygenerować odpowiedź „Joe Biden” w generacyjnym podejściu, ale odpowiedź ta mogłaby zostać zakwestionowana przez podejście dyskryminacyjne, które mogłoby podać „Donald Trump”.
Aby zniwelować powstały dysonans, naukowcy z MIT zaproponowali nową metodę opartą na teorii gier, gdzie cały proces jest traktowany jako skomplikowana gra z użyciem słów i zdań. Znalezienie tzw. „przybliżonych równowag” prowadzi do nowego algorytmu dekodowania zwanego „rankingiem równowagi”. Metoda ta, gdy była testowana na wielu zadaniach, takich jak rozumienie tekstu, rozwiązywanie problemów matematycznych i dialog, systematycznie poprawiała wyniki modeli.
Wdrożenie podejścia gry zgodności do zadań takich jak odpowiadanie na pytania wiąże się z istotnymi wyzwaniami obliczeniowymi. Na przykład, przy użyciu zbiorów danych takich jak MMLU, model musi zastosować mechanizm do każdej kwerendy i osiągnąć zgodę między komponentami generatywnym i dyskryminacyjnym dla każdego pytania i jego możliwych odpowiedzi. System miał trudności z zadaniami matematycznymi, gdzie nie mógł generować błędnych odpowiedzi, co jest kluczowym elementem zrozumienia procesu dochodzenia do poprawnej odpowiedzi.
Athul Jacob, doktorant z MIT, wraz ze swoimi współpracownikami zaprezentował swoją pracę na Międzynarodowej Konferencji na temat Uczenia się Reprezentacji (ICLR), gdzie została wyróżniona jako „spotlight paper”. Badania te otrzymały również nagrodę „best paper award” na warsztatach NeurIPS R0-FoMo w grudniu 2023 roku. Przyszłe prace obejmują ulepszanie bazowego modelu poprzez integrację wyników obecnej metody, co może prowadzić do bardziej wiarygodnych i jednolitych wyników.
Efekty, które udało się zaobserwować, pozwalają na wprowadzenie zmian w uczeniu maszynowym, dzięki czemu rozwój sztucznej inteligencji ma szansę znacznie przyspieszyć. Ta innowacyjna metoda otwiera nowe perspektywy w dziedzinie SI, zwiększając możliwości rozumienia i generowania tekstu przez maszyny, co ma potencjał do rewolucjonizowania różnych sektorów, od edukacji po zaawansowane technologie przemysłowe.
