Sztuczna inteligencja · Lokalne modele LLM
Lokalne modele LLM
Lokalny model językowy dla firmy: LLM on-premise lub w prywatnej chmurze UE, dotrenowanie i RAG na dokumentach firmy, ewaluacja i Zero Data Retention.
Słownik
RAG (Retrieval-Augmented Generation, po polsku: generowanie wspomagane wyszukiwaniem) to technika, w której aplikacja przed wygenerowaniem odpowiedzi wyszukuje fragmenty dokumentów firmy i przekazuje je modelowi językowemu jako kontekst. Model odpowiada na podstawie aktualnych źródeł, które może wskazać, a firma nie musi dotrenowywać modelu na swoich dokumentach.
RAG to sposób na połączenie modelu językowego z wiedzą, której model nie zna: dokumentami, procedurami, umowami czy bazą wiedzy firmy. Nazwa pochodzi z angielskiego Retrieval-Augmented Generation i opisuje dwa kroki. Najpierw system wyszukuje (retrieval) fragmenty dokumentów pasujące do pytania. Potem model generuje odpowiedź (generation), opierając się na tych fragmentach, które dostaje razem z pytaniem.
Technikę opisali w 2020 r. badacze w pracy „Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks”. Dziś to najczęstszy sposób budowania firmowych asystentów, którzy odpowiadają na pytania o wewnętrzne dokumenty - bo nie wymaga trenowania modelu, a nowy dokument jest dostępny od razu po zaindeksowaniu.
Przykład demonstracyjny: pracownik działu obsługi pyta „ile dni ma klient na reklamację usługi abonamentowej?”. System znajduje dwa fragmenty regulaminu i jeden z procedury reklamacyjnej, a model odpowiada w dwóch zdaniach z odnośnikami do tych dokumentów. Gdy regulamin się zmieni, wystarczy zaindeksować nową wersję - model zacznie odpowiadać na jej podstawie.
RAG i dotrenowanie (ang. fine-tuning) rozwiązują różne problemy. RAG dostarcza modelowi wiedzę przy każdym pytaniu, a dotrenowanie zmienia sam model - jego język, styl i sposób wykonywania zadań. W praktyce:
Szczegółowe porównanie w tabeli pokazujemy na stronie o lokalnych modelach językowych.
RAG wprowadza do aplikacji nowe elementy - indeks, wyszukiwanie, kontekst przekazywany modelowi - i każdy z nich trzeba zabezpieczyć. OWASP opisuje te zagrożenia na liście OWASP Top 10 for LLM Applications:
Dlatego aplikację z RAG testuje się tak jak każdą aplikację z danymi i uprawnieniami: z kontami w różnych rolach, z próbami dostępu do cudzych dokumentów i z dokumentami zawierającymi złośliwe instrukcje. Taki test jest częścią testu penetracyjnego aplikacji lub API.
Wrażenie z pokazu to za mało. Jakość systemu z RAG ocenia się na zbiorze testowym: zestawie pytań z oczekiwanymi odpowiedziami i dokumentami źródłowymi. Mierzy się osobno dwa etapy - czy wyszukiwanie znajduje właściwe fragmenty i czy model poprawnie z nich korzysta - bo słaba odpowiedź może wynikać z każdego z nich. Zbiór testowy uzupełnia się potem o trudne przypadki z codziennego użycia.
Asystentów z RAG budujemy w infrastrukturze firmy albo w chmurze prywatnej w UE - zobacz lokalne modele językowe dla firm. Kiedy własny model ma sens, a kiedy wystarczy usługa w chmurze, piszemy w artykule własny LLM czy model w chmurze.
RAG nie zmienia modelu - dostarcza mu wiedzę przy każdym pytaniu, z dokumentów wyszukanych w indeksie. Dotrenowanie zmienia sam model: jego język, styl i sposób wykonywania zadań. Dlatego RAG lepiej sprawdza się przy wiedzy, która często się zmienia i wymaga wskazania źródła, a dotrenowanie - przy specjalistycznym języku i stałym formacie odpowiedzi. Porównanie obu podejść pokazujemy na stronie o lokalnych modelach językowych.
Nie, ale wyraźnie je ogranicza, jeśli wyszukiwanie zwraca właściwe fragmenty, a aplikacja wymaga od modelu odpowiedzi wyłącznie na ich podstawie i ze wskazaniem źródeł. Model nadal może błędnie streścić dokument albo połączyć fragmenty, które do siebie nie pasują - dlatego jakość odpowiedzi mierzy się na zbiorze testowym z oczekiwanymi wynikami.
Tak. Indeks dokumentów, wyszukiwanie i model językowy mogą działać w infrastrukturze firmy albo w chmurze prywatnej w UE. Wtedy ani dokumenty, ani pytania użytkowników nie trafiają do zewnętrznego dostawcy usługi AI.
Sztuczna inteligencja · Lokalne modele LLM
Lokalny model językowy dla firmy: LLM on-premise lub w prywatnej chmurze UE, dotrenowanie i RAG na dokumentach firmy, ewaluacja i Zero Data Retention.
Słownik
Test penetracyjny (pentest) - co to jest, jak przebiega, jakie są rodzaje testów i podejścia black box, grey box, white box oraz czym różni się od skanu.
AI w firmie
Własny LLM czy API w chmurze: porównanie kosztów, danych i jakości, polityki danych dostawców API, pamięć GPU, licencje modeli, AI Act i pytania przed decyzją.
Opisz krótko, czego potrzebujesz - wrócimy z propozycją kolejnych kroków.
lub zadzwoń pod numer +48 575 621 877