Lokalny LLM na komputerze: od czego zacząć
Chcesz uruchomić AI na swoim komputerze? Jak dobrać model, pamięć i narzędzia. Syntalith pomaga osobom prywatnym oraz firmom, także przed zakupem sprzętu.
Syntalith
Lokalny model może pomóc w pracy z notatkami, pisaniu kodu i przeszukiwaniu własnych dokumentów. Pierwsza instalacja nie wymaga budowy serwerowni. Wymaga za to dopasowania oczekiwań do komputera: mały model na laptopie i duży asystent dla zespołu mają inne potrzeby.
Pomagamy osobom prywatnym i firmom rozpocząć pracę z lokalnym AI. Możesz przyjść ze sprzętem, który już masz, albo z zadaniem i budżetem przed zakupem.
Najpierw wybierz jedno zastosowanie
Zapisz kilka rzeczy, które chcesz robić regularnie. Przy porządkowaniu krótkich notatek liczy się polszczyzna i wygoda. Przy programowaniu dochodzą narzędzia, terminal i dostęp do repozytorium. Przy skanach potrzebny jest model rozumiejący obraz lub dodatkowy OCR.
Własne pliki można podłączyć przez wyszukiwarkę RAG. Samo pobranie modelu nie sprawia, że zna on dokumenty zapisane na dysku. Aplikacja musi je odczytać i wybrać fragmenty do odpowiedzi. Od początku warto ustalić, których folderów nie powinna otwierać.
Co sprawdzić w komputerze
| Element | Dlaczego ma znaczenie |
|---|---|
| RAM i pamięć GPU | Muszą pomieścić model, kontekst i pracujące aplikacje |
| Karta i system operacyjny | Decydują o zgodności z wybranym silnikiem |
| Wolne miejsce na dysku | Wagi, kolejne wersje i dokumenty mogą zajmować dużo miejsca |
| Długość materiałów | Cała książka wymaga innej konfiguracji niż pojedyncza wiadomość |
| Liczba użytkowników | Współdzielona usługa potrzebuje testu kolejki oraz uprawnień |
W Apple Silicon pamięć jest współdzielona, więc nie przenosimy wprost wymagań VRAM z kart NVIDIA. Praca na CPU też jest możliwa dla wspieranych modeli, ale oczekiwany czas odpowiedzi trzeba sprawdzić. Nie kupuj komputera na podstawie samej liczby parametrów modelu.
Jak dobrać pierwszy model
Zacznij od wariantu, który mieści się z zapasem. Qwen, Gemma i polskie modele mają różne rozmiary oraz zastosowania. Lista możliwości będzie inna dla komputera z niewielką pamięcią niż dla stacji z dużą kartą graficzną.
Kwantyzacja zmniejsza pamięć potrzebną na wagi przez zapis z niższą precyzją. Sprawdź jednak odpowiedzi: oszczędność pamięci może zmienić zachowanie. Nasz opis Q4, Q5 i W4A16 pokazuje różnice na konkretnym eksperymencie z Qwenem.
Narzędzia takie jak Ollama upraszczają uruchamianie wspieranych modeli. Przy bardziej wymagającej instalacji można użyć innego silnika. Aplikacja do rozmowy, serwer i plik wag są odrębnymi elementami, które muszą do siebie pasować.
Czy lokalnie oznacza offline?
Model może działać bez wysyłania promptów do zewnętrznego dostawcy, jeśli obliczenia i potrzebne komponenty pracują na miejscu. Pierwsze pobranie plików zwykle wymaga internetu. Późniejsze wyszukiwanie w sieci, chmurowe funkcje aplikacji lub synchronizacja historii mogą nadal przesyłać dane.
W konfiguracji sprawdzamy faktyczną trasę danych. Serwera modelu nie trzeba wystawiać do publicznego internetu. Gdy ma korzystać z niego telefon lub drugi komputer, dobieramy prywatny dostęp oraz logowanie. Pomocny jest przewodnik po dostępie zdalnym.
Jeśli dopiero planujesz zakup
Ustal budżet razem z zadaniem i dopuszczalnym czasem oczekiwania. Wynajęty GPU może pomóc sprawdzić większy model przed zakupem. Mniejszy wariant może natomiast wystarczyć na obecnym komputerze. Te dwie próby ograniczają ryzyko wydania pieniędzy na konfigurację niedopasowaną do pracy.
Syntalith pomaga uruchomić lokalny LLM: dobiera sprzęt i model, instaluje narzędzia, sprawdza prywatność oraz pokazuje obsługę. Prześlij system, ilość pamięci, model karty graficznej i opis zastosowania. Jeśli sprzętu jeszcze nie ma, zacznij od samego opisu.
Oceńmy prywatne AI w warunkach Twojej firmy
Pomagamy firmom i osobom prywatnym dobrać sprzęt, uruchomić model i sprawdzić go na własnych zadaniach. Możesz zacząć od komputera, który już masz, albo od rozmowy przed zakupem.
Prywatne modele LLM i fine-tuning