
LLM dla początkujących: czy AI faktycznie myśli?
Wpis z cyklu: Od zera do AI Mastera. Konkrety o sztucznej inteligencji, podane bez zbędnej waty.
Czym są Duże Modele Językowe (LLM)?
Duży Model Językowy (LLM) to nie jest żadna "prawdziwa magia" ani elektroniczny mózg. To po prostu gigantyczny program komputerowy, który przemielił niemal cały dostępny internet. Dzięki temu nauczył się niezwykle płynnie udawać, że z nami rozmawia, pisze maile czy tłumaczy skomplikowane żarty. Możesz o nim myśleć jak o inteligentnej autokorekcie z telefonu, tylko podkręconej do absolutnych granic możliwości.
Jak to w ogóle działa, skoro maszyna fizycznie nie rozumie znaczenia wypowiadanych słów? Cała tajemnica opiera się na zaawansowanym zgadywaniu prawdopodobieństwa i pewnym genialnym wynalazku z 2017 roku. Tak z prostego autouzupełniania zbudowaliśmy najpotężniejszego cyfrowego rozmówcę na planecie.
Od głupiego zgadywania do rewolucji Transformerów
Stare programy do przetwarzania języka działały na bardzo krótką metę. Analizowały jedno lub dwa poprzednie słowa, żeby zgadnąć trzecie. Program po prostu tracił wątek po kilku słowach i kompletnie zapominał, o czym było pierwsze zdanie. Do bardzo prostych zadań to wystarczało, do generowania spójnej logiki - bezużyteczny szajs.
Zasady gry wywróciły się do góry nogami w 2017 roku, kiedy badacze z Google opublikowali dokument "Attention Is All You Need". Wtedy właśnie narodziła się zupełnie nowa architektura sieci neuronowych: Transformer. To był absolutny przełom, który ubił przestarzałe metody.
Transformery nie czytają słowo po słowie. One potrafią skanować cały szeroki kontekst naraz, utrzymując w pamięci powiązania między bardzo odległymi od siebie wątkami tekstu.
Jeśli w jednym akapicie napiszesz, że twój pies wabi się Burek, a trzy strony dalej zapytasz o spacer, model z kontekstu wyciągnie, że idziesz ze szczekającym Burkiem. To właśnie niesamowita umiejętność skupiania uwagi na kluczowych fragmentach tekstu sprawiła, że nowoczesne maszyny zaczęły brzmieć tak bezczelnie ludzko.
Co tak naprawdę oznacza "Duży" w nazwie modelu?
Słowo "duży" absolutnie nie odnosi się do fizycznej wielkości serwerów, na których uruchamia się ten kod. Oznacza dwie niezwykle konkretne zmienne: niewyobrażalną liczbę parametrów oraz terabajty danych użytych do żmudnego treningu.
Parametry w modelu językowym to w uproszczeniu małe, cyfrowe pokrętła, którymi system reguluje swoją wiedzę. Nowoczesne modele komercyjne nie mają ich tysięcy. Mają ich setki miliardów, a te najdroższe nawet biliony. Każde z tych wirtualnych pokręteł pomaga w ułamku sekundy podjąć decyzję, jakie dokładnie słowo powinno paść w odpowiedzi jako absolutnie następne.
Żeby odpowiednio zestroić te wszystkie miliardy pokręteł, model dosłownie wchłania całą zawartość Wikipedii, miliony zdigitalizowanych książek, artykuły naukowe i surowe kody z GitHuba. Staje się cyfrową gąbką, zbudowaną wyłącznie po to, by błyskawicznie weryfikować ekstremalnie złożoną siatkę powiązań między poszczególnymi słowami.
Stochastyczna papuga, czyli dlaczego model w ogóle cię nie rozumie
Codzienna rozmowa z AI sprawia wrażenie obcowania z kimś empatycznym i inteligentnym. Zdejmijmy jednak różowe okulary. Te potężne systemy kompletnie nie rozumieją fizycznego świata. Nie wiedzą, jak pachnie parzona kawa, nie odczuwają smutku i nie mają najmniejszej świadomości własnego istnienia na serwerach wielkich korporacji.
W świecie inżynierów te maszyny to po prostu stochastyczne papugi, oparte wyłącznie na chłodnej statystyce prawdopodobieństwa. Kiedy prosisz o przepis na domową szarlotkę, system nie wyobraża sobie gorącego ciasta. On precyzyjnie wylicza, że po wpisanym słowie "weź", z gigantycznym prawdopodobieństwem w tym kontekście wystąpi słowo "jedno", a po nim wystąpi słowo "jajko" lub "jabłko".
Rozmowa z modelem językowym to od początku do końca wciąż tylko czysta matematyka. Kiedy algorytm wypluwa z siebie rzekomo świadomą odpowiedź, wykonuje jedynie gigantyczne działanie oparte na ułamkach prawdopodobieństwa.
Świadomość tego ukrytego mechanizmu jest kluczowa. Tłumaczy błyskawicznie, dlaczego potężne maszyny czasami tak spektakularnie się wywalają na prostych zagadnieniach. Jeśli w zbiorach treningowych notorycznie powielał się ludzki błąd lub głupota, maszyna ten błąd bez mrugnięcia okiem powtórzy. Algorytm w pełni wierzy swoim wyliczeniom, że statystycznie to właśnie to zdanie jest w danej chwili najbardziej pożądane.