Prywatny LLM: dane, hosting w UE i on-premise
Gdzie przetwarzać firmowe dane z LLM? Porównujemy własny serwer, hosting w UE i izolację sieci. Dostęp, logi oraz RODO w projekcie Syntalith.
Syntalith
„Dane zostają u nas” wymaga doprecyzowania. Czy chodzi o budynek firmy, jej konto chmurowe, region UE czy zakaz udostępniania treści dostawcy modelu? Każda odpowiedź prowadzi do innej architektury i kosztu.
Prywatny LLM daje możliwość wyboru miejsca inferencji, czyli obliczania odpowiedzi. Cała aplikacja obejmuje jednak więcej komponentów. W Syntalith zaczynamy od mapy danych: dokumentu wejściowego, kolejnych usług, odpowiedzi i miejsc, w których powstają kopie.
Trzy środowiska do rozważenia
| Środowisko | Kiedy je sprawdzić | Co pozostaje do zorganizowania |
|---|---|---|
| Serwer w firmie | Ograniczenia sieciowe, posiadany sprzęt, wymóg lokalnego przetwarzania | Dostęp administracyjny, zasilanie, aktualizacje i odtwarzanie |
| Prywatna instalacja w regionie UE | Własny sprzęt byłby trudny w utrzymaniu lub obciążenie się zmienia | Umowa, role dostawców, regiony usług pomocniczych i kopii |
| Środowisko odłączone od sieci | Praca ma być możliwa bez zewnętrznych połączeń | Dostarczenie zależności, kontrolowany import plików i aktualizacji |
On-premise określa lokalizację. Air gap opisuje odłączenie od innych sieci. Te właściwości nie są zamienne. Serwer w biurze może automatycznie wysyłać logi do usługi chmurowej, jeśli tak skonfigurowano monitoring.
Sprawdź każdy krok dokumentu
Skan trafia do OCR, tekst do wyszukiwarki, fragmenty do modelu, a odpowiedź do aplikacji. Każdy etap może zostawiać pliki tymczasowe i logi. Model embeddingowy, który tworzy reprezentację dokumentu do wyszukiwania, również może działać lokalnie albo jako zewnętrzna usługa.
Przygotowując prywatne wdrożenie, ustalamy miejsce tych obliczeń i wyłączamy zbędne przesyłanie treści. Sprawdzamy też narzędzia używane przez agenta: odwołanie do CRM lub wyszukiwarki internetowej jest osobnym przepływem danych.
Uprawnienia muszą działać przed odpowiedzią
Pracownik sprzedaży i prawnik mogą korzystać z tego samego modelu, ale widzieć inne dokumenty. Aplikacja powinna ograniczać wyszukiwanie zgodnie z uprawnieniami użytkownika. Instrukcja w prompcie nie zastępuje kontroli dostępu.
Testujemy również sytuacje po zmianie roli, odebraniu uprawnień i usunięciu dokumentu. Indeks, pamięć podręczna i zapis rozmowy mogą wymagać osobnej aktualizacji. Zakres logowania powinien pozwalać wyjaśnić błąd bez bezterminowego przechowywania pełnej treści każdej sprawy.
RODO obejmuje sposób przetwarzania
RODO wymaga m.in. określenia podstawy przetwarzania, ograniczenia danych i czasu przechowywania oraz odpowiednich zabezpieczeń. W zależności od relacji z wykonawcą potrzebne są właściwe ustalenia dotyczące powierzenia. Przetwarzanie poza EOG podlega dodatkowym regułom transferu.
To zagadnienia do oceny przez osoby odpowiedzialne za ochronę danych. Syntalith dostarcza opis techniczny, przepływ danych i konfigurację zabezpieczeń. Sam fakt użycia lokalnych wag lub serwera w UE nie rozstrzyga zgodności konkretnego procesu.
Model dostrojony na poufnych przykładach również wymaga ochrony. Ograniczamy dostęp do zbioru treningowego, adapterów i wag. W ocenie sprawdzamy, czy model nie odtwarza niepożądanych fragmentów danych.
Co ustalić przed ofertą
Najbardziej przydatne są konkretne wymagania: dozwolony region, brak połączeń z internetem podczas działania, role użytkowników, czas retencji i sposób odzyskania po awarii. „Najwyższe bezpieczeństwo” nie określa żadnego z tych parametrów.
Wdrożenie prywatnego LLM w Syntalith może obejmować model, środowisko, integrację i utrzymanie. Przekaż wymagania działu IT lub inspektora ochrony danych. Ustalimy, które elementy można zrealizować w wybranym środowisku i co trzeba sprawdzić w pilotażu.
Oceńmy prywatne AI w warunkach Twojej firmy
Pomagamy firmom i osobom prywatnym dobrać sprzęt, uruchomić model i sprawdzić go na własnych zadaniach. Możesz zacząć od komputera, który już masz, albo od rozmowy przed zakupem.
Prywatne modele LLM i fine-tuning