Uruchamianie modeli AI na własnym komputerze wymaga nie tylko odpowiedniego procesora lub karty graficznej. Równie ważne są pamięć operacyjna oraz miejsce na dysku, ponieważ pojedynczy model może zajmować od kilkuset megabajtów do kilkudziesięciu gigabajtów. Wyjaśniamy krok po kroku, jak dobrać SSD i RAM do lokalnych modeli AI, aby komputer działał płynnie i nie wymagał kosztownej rozbudowy po kilku miesiącach.

  • 16 GB RAM wystarcza głównie do mniejszych modeli 1B–8B, szczególnie w wersjach skwantyzowanych.
  • 32 GB RAM to najbardziej uniwersalny wybór do modeli 8B–14B i codziennego korzystania z lokalnego AI.
  • Rozmiar pliku modelu nie jest równy całkowitemu zużyciu pamięci — potrzebny jest również zapas na kontekst, aplikację i system.
  • Dysk NVMe o pojemności 1 TB jest rozsądnym minimum, jeżeli użytkownik zamierza testować więcej niż kilka modeli.
  • Szybszy SSD skraca ładowanie modelu, ale nie zastąpi brakującego RAM-u i zazwyczaj nie zwiększy znacząco szybkości generowania tekstu po załadowaniu modelu.

Krok 1. Sprawdź wielkość modelu i jego kwantyzację

Pierwszym krokiem nie powinno być wybieranie konkretnego dysku czy zestawu pamięci, ale określenie, jakie modele mają działać na komputerze. O wymaganiach sprzętowych decydują przede wszystkim:

  • liczba parametrów modelu, na przykład 4B, 8B, 14B, 32B lub 70B,
  • poziom kwantyzacji,
  • długość kontekstu,
  • obsługa obrazów lub dźwięku,
  • liczba modeli uruchamianych jednocześnie.

Litera „B” oznacza miliard parametrów. Model 8B zawiera około 8 miliardów parametrów, ale nie oznacza to automatycznie, że potrzebuje dokładnie 8 GB pamięci. Duże znaczenie ma sposób zapisania wag modelu.

Dlaczego kwantyzacja zmienia wymagania sprzętowe?

Kwantyzacja polega na zapisaniu wag modelu z mniejszą precyzją. Pozwala to zmniejszyć rozmiar pliku i zużycie pamięci, zwykle kosztem niewielkiego pogorszenia jakości odpowiedzi. Format 4-bitowy zajmuje znacznie mniej miejsca niż FP16, dlatego warianty takie jak Q4_K_M są często dobrym punktem wyjścia do lokalnego uruchamiania modeli.

Różnicę dobrze widać na przykładzie modelu Qwen3 8B. Wariant Q4_K_M zajmuje około 5,2 GB, Q8_0 około 8,9 GB, a wersja FP16 około 16 GB. W przypadku Gemma 3 12B pliki mają odpowiednio około 8,1 GB dla Q4_K_M, 13 GB dla Q8_0 i 24 GB dla FP16.

Do codziennego czatu, streszczania dokumentów i prostego programowania najlepiej zacząć od Q4_K_M lub Q5. Wersje Q8 i FP16 mają sens głównie wtedy, gdy użytkownik dysponuje dużą ilością pamięci i zależy mu na ograniczeniu strat wynikających z kompresji.

Krok 2. Oblicz, ile RAM będzie potrzebne

Plik modelu jest najważniejszą, ale nie jedyną częścią zapotrzebowania na pamięć. Podczas pracy miejsce w RAM-ie lub VRAM-ie zajmują także:

  • pamięć podręczna kontekstu, czyli KV cache,
  • dane robocze programu,
  • tokenizer i dodatkowe moduły modelu,
  • system operacyjny,
  • przeglądarka oraz inne aplikacje,
  • bufor używany przy przenoszeniu części obliczeń między CPU a GPU.

Dlatego model zajmujący 8 GB na dysku nie powinien być uruchamiany na komputerze, na którym dostępne jest dokładnie 8 GB pamięci. Potrzebny jest wyraźny zapas.

LM Studio oficjalnie rekomenduje co najmniej 16 GB RAM, zaznaczając, że modele językowe mogą zużywać dużo pamięci. Program pozwala również oszacować wymagania konkretnego modelu przed jego uruchomieniem, z uwzględnieniem długości kontekstu, akceleracji GPU i obsługi obrazu.

Ile RAM do modeli 7B i 8B?

Modele 7B–8B w kwantyzacji Q4 zajmują zazwyczaj około 5–6 GB. Na komputerze z 16 GB RAM mogą działać poprawnie, pod warunkiem że użytkownik nie ustawi bardzo długiego kontekstu i nie pozostawi w tle wielu ciężkich programów.

Do regularnej pracy lepsze będzie jednak 32 GB RAM. Pozwala to jednocześnie korzystać z przeglądarki, edytora kodu, narzędzia do obsługi dokumentów oraz lokalnego interfejsu AI bez ciągłego przenoszenia danych do pliku wymiany.

Ile RAM do modeli 12B i 14B?

Modele 12B–14B w wersjach Q4 zajmują około 8–10 GB. Teoretycznie można próbować uruchamiać je na komputerze z 16 GB RAM, ale margines bezpieczeństwa jest niewielki.

32 GB RAM należy traktować jako rozsądne minimum do modeli tej klasy. Większa pamięć umożliwia ustawienie dłuższego kontekstu i pozostawia miejsce na indeksowanie dokumentów, modele embeddingowe oraz inne aplikacje.

Ile RAM do modeli 27B i 32B?

Przykładowe modele Q4 tej wielkości zajmują około 17–20 GB. Gemma 3 27B w Q4_K_M ma około 17 GB, a Qwen3 32B około 20 GB.

Na komputerze z 32 GB RAM ich uruchomienie może być możliwe, ale system będzie miał mały zapas. 64 GB RAM jest znacznie bezpieczniejszym wyborem i pozwala korzystać z modelu bez zamykania większości programów działających w tle.

Ile RAM do modeli 70B?

Model Llama 3.3 70B w kwantyzacji Q4_K_M zajmuje około 43 GB. Oprócz samych wag potrzebna jest pamięć na kontekst, środowisko uruchomieniowe i system.

64 GB RAM to dolna granica dla prób uruchamiania modeli 70B w Q4. Wygodniejsza konfiguracja powinna mieć 96 lub 128 GB pamięci, zwłaszcza gdy model ma korzystać z dłuższego kontekstu.

Krok 3. Uwzględnij długość kontekstu

Kontekst określa, ile tokenów model może jednocześnie uwzględniać podczas generowania odpowiedzi. Im jest dłuższy, tym większa jest pamięć podręczna KV i tym więcej RAM-u lub VRAM-u zajmuje uruchomiony model.

Zwiększenie kontekstu z kilku do kilkudziesięciu tysięcy tokenów może zauważalnie podnieść zużycie pamięci. Ollama wprost informuje, że ustawienie większej długości kontekstu zwiększa wymagania pamięciowe.

Długi kontekst jest przydatny między innymi podczas:

  • analizowania obszernych dokumentów PDF,
  • pracy z dużym repozytorium kodu,
  • prowadzenia długich rozmów bez usuwania historii,
  • obsługi agentów i narzędzi,
  • pracy z lokalną bazą wiedzy.

Do zwykłego czatu nie trzeba od razu ustawiać 64K czy 128K. Rozpoczęcie od 4K–8K pozwala ograniczyć zużycie pamięci, a kontekst można zwiększyć dopiero wtedy, gdy rzeczywiście jest potrzebny.

Modele multimodalne, które analizują obrazy, mogą wymagać dodatkowych plików projektora oraz pamięci roboczej. Nie należy więc zakładać, że dwa modele o tej samej liczbie parametrów będą miały identyczne wymagania.

SSD i RAM do lokalnych modeli AI jak dobrać – praktyczny poradnik i rozwiązania
Źródło: Canva Pro

Krok 4. Dobierz pojemność dysku SSD

Lokalne modele zajmują znacznie więcej miejsca, niż może sugerować rozmiar pojedynczego pobrania. Użytkownicy często przechowują kilka wariantów tego samego modelu, na przykład Q4, Q5 i Q8, a także modele do embeddingów, rozpoznawania obrazów czy transkrypcji.

Przykładowe rozmiary skwantyzowanych modeli pokazują skalę potrzeb:

  • model 4B może zajmować około 2,5–3,5 GB,
  • model 8B około 5 GB,
  • model 14B około 9 GB,
  • model 30B–32B około 19–20 GB,
  • model 70B około 43 GB.

Sama instalacja Ollama na Windows wymaga kilku gigabajtów, natomiast przechowywane modele mogą łącznie zajmować dziesiątki lub setki gigabajtów.

Czy SSD 512 GB wystarczy?

Dysk 512 GB może wystarczyć, jeżeli komputer służy głównie do pracy biurowej i użytkownik chce zachować dwa lub trzy mniejsze modele. Trzeba jednak uwzględnić miejsce zajmowane przez system, aktualizacje, aplikacje i prywatne pliki.

Do komputera kupowanego specjalnie z myślą o lokalnym AI lepiej wybrać co najmniej 1 TB.

Kiedy warto wybrać SSD 2 TB?

Pojemność 2 TB jest rozsądnym wyborem dla osoby, która:

  • regularnie porównuje różne modele,
  • przechowuje modele 14B–32B,
  • korzysta z lokalnej bazy dokumentów,
  • generuje obrazy lub dźwięk,
  • nie chce stale usuwać i ponownie pobierać plików.

Modele mogą być pobierane warstwowo, a różne aplikacje nie zawsze współdzielą te same pliki. Ten sam model zapisany przez Ollama, LM Studio i osobne środowisko Python może więc zajmować miejsce kilka razy.

Dla kogo SSD 4 TB?

Dysk 4 TB ma sens przy dużej bibliotece modeli 32B–70B, pracy z generowaniem obrazów, przechowywaniu zbiorów danych lub korzystaniu z kilku środowisk lokalnego AI.

Niezależnie od pojemności nie należy zapełniać SSD do ostatnich gigabajtów. Praktycznie warto pozostawić około 15–20% wolnego miejsca, aby system, aktualizacje i operacje tymczasowe miały odpowiedni zapas.

Krok 5. Wybierz odpowiedni typ SSD

NVMe czy SATA?

Do nowego komputera najlepszym wyborem będzie wewnętrzny SSD NVMe. Oferuje wyższe prędkości odczytu niż SATA, dzięki czemu:

  • szybciej ładuje duże modele,
  • sprawniej przełącza się między modelami,
  • skraca czas indeksowania dokumentów,
  • lepiej radzi sobie z plikiem wymiany przy chwilowym braku pamięci.

Programy oparte na llama.cpp mogą korzystać z mapowania pliku modelu w pamięci. Gdy dostępnego RAM-u jest za mało, częstsze odczyty z dysku mogą wyraźnie obniżać wydajność. Zarówno dokumentacja llama.cpp, jak i LM Studio ostrzegają, że model większy od dostępnej pamięci może powodować częste operacje dyskowe i spadki szybkości.

Dysk SATA nadal może być używany jako magazyn modeli lub tańszy dysk dodatkowy. Do aktywnego uruchamiania dużych modeli lepszy będzie jednak NVMe.

Czy potrzebny jest SSD PCIe 5.0?

W większości domowych zastosowań NVMe PCIe 4.0 jest wystarczający. Dysk PCIe 5.0 może skrócić kopiowanie i pierwsze ładowanie bardzo dużych plików, ale po umieszczeniu modelu w pamięci szybkość generowania zależy przede wszystkim od procesora, GPU, przepustowości pamięci i konfiguracji modelu.

Z tego powodu lepiej zainwestować w większą ilość RAM-u lub pojemniejszy SSD PCIe 4.0 niż dopłacać wyłącznie do najwyższych wyników odczytu sekwencyjnego.

TLC czy QLC?

Dysk z pamięcią TLC jest bezpieczniejszym wyborem do komputera, na którym modele będą często pobierane, aktualizowane i usuwane. Zwykle zapewnia stabilniejsze osiągi podczas długiego zapisu.

QLC może być rozsądnym rozwiązaniem dla dużego, tańszego magazynu, z którego modele są przede wszystkim odczytywane. Przy podobnej cenie i pojemności warto jednak wybrać TLC.

Krok 6. Dopasuj konfigurację do wielkości modeli

Poniższe wartości są praktycznymi zaleceniami dla modeli w kwantyzacji Q4 lub Q5, uruchamianych pojedynczo z umiarkowanym kontekstem. Nie dotyczą trenowania modeli ani pełnego fine-tuningu.

ModeleMinimalny sensowny RAMWygodna ilość RAMZalecana pojemność SSD
1B–4B16 GB16–32 GB512 GB–1 TB
7B–9B16 GB32 GB1 TB
12B–14B32 GB32–64 GB1–2 TB
27B–32B32 GB64 GB2 TB
70B w Q464 GB96–128 GB2–4 TB

Najbardziej uniwersalnym zestawem jest obecnie 32 GB RAM i SSD NVMe 1–2 TB. Taka konfiguracja pozwala komfortowo korzystać z popularnych modeli 7B–14B oraz testować część większych modeli w mocniejszej kwantyzacji.

Osoby zainteresowane modelami około 30B powinny celować w 64 GB RAM. Do modeli 70B lepiej od razu rozważyć platformę obsługującą 96 lub 128 GB pamięci.

Krok 7. Sprawdź wymagania przed zakupem podzespołów

Przed zamówieniem pamięci lub dysku warto przeprowadzić prostą weryfikację.

1. Znajdź dokładny wariant modelu

Sprawdź nie tylko liczbę parametrów, ale również:

  • format pliku,
  • poziom kwantyzacji,
  • rozmiar pobierania,
  • maksymalną długość kontekstu,
  • informację o obsłudze obrazu.

Model 8B w Q4 może zajmować około 5 GB, podczas gdy ten sam model w FP16 będzie potrzebował kilkunastu gigabajtów.

2. Oszacuj zużycie pamięci

W LM Studio można użyć polecenia:

lms load –estimate-only nazwa-modelu

Estymator uwzględnia między innymi długość kontekstu, offloading na GPU, Flash Attention oraz obsługę obrazu.

3. Sprawdź wykorzystanie pamięci po uruchomieniu

W Ollama polecenie:

ollama ps

pokazuje załadowane modele, ustawiony kontekst i sposób podziału obliczeń między CPU oraz GPU.

Dodatkowo można obserwować Menedżera zadań w Windows albo monitor zasobów w Linuxie i macOS. Najważniejsze jest pole dostępnej pamięci, a nie wyłącznie całkowita ilość RAM-u.

4. Sprawdź możliwości rozbudowy komputera

Przed zakupem pamięci należy zweryfikować:

  • maksymalną pojemność obsługiwaną przez płytę główną lub laptop,
  • liczbę dostępnych gniazd,
  • zgodność z DDR4 lub DDR5,
  • obsługiwane pojemności pojedynczych modułów,
  • to, czy pamięć jest wlutowana.

W komputerze przeznaczonym do eksperymentowania z lokalnym AI lepiej pozostawić możliwość zwiększenia pamięci do 64 lub 128 GB. Laptop z wlutowanymi 16 GB może szybko stać się ograniczeniem, nawet jeżeli początkowo ma obsługiwać wyłącznie mniejsze modele.

Najczęstsze błędy przy wyborze RAM-u i SSD

Najczęstsze błędy przy wyborze RAM-u i SSD wynikają z niedopasowania podzespołów do płyty głównej, procesora i rzeczywistych zastosowań komputera. Problemy powodują między innymi niezgodny standard pamięci, zbyt niska pojemność, niewłaściwy format dysku lub zakup nośnika wykorzystującego interfejs, którego komputer nie obsługuje. Przed zakupem warto więc sprawdzić specyfikację sprzętu, liczbę dostępnych złączy oraz maksymalne obsługiwane parametry.

Kupowanie większego SSD zamiast dodatkowego RAM-u

SSD może pomieścić więcej modeli, ale nie umożliwi płynnego uruchomienia modelu, który nie mieści się w pamięci. Plik wymiany na szybkim NVMe może zapobiec zamknięciu programu, lecz zazwyczaj oznacza duży spadek wydajności.

Wybieranie modelu wyłącznie na podstawie liczby parametrów

Dwa modele o tej samej liczbie parametrów mogą mieć różne rozmiary plików, kontekst i wymagania. Zawsze trzeba sprawdzić konkretny wariant i kwantyzację.

Ustawianie maksymalnego kontekstu bez potrzeby

Model wspierający 128K nie musi przez cały czas pracować z takim kontekstem. Jego zmniejszenie jest jednym z najprostszych sposobów na ograniczenie zużycia pamięci.

Przechowywanie modeli tylko na dysku systemowym

Kilka dużych pobrań może szybko zająć większość partycji systemowej. Warto wcześniej skonfigurować aplikację tak, aby zapisywała bibliotekę modeli na większym SSD.

Uruchamianie modeli z dysku HDD

Klasyczny dysk twardy może służyć do archiwizacji rzadko używanych modeli. Do bieżącej pracy jest jednak zbyt wolny, zwłaszcza gdy aplikacja korzysta z mapowania pamięci i musi regularnie odczytywać fragmenty modelu.

Jaki zestaw RAM i SSD wybrać do lokalnego AI?

Do prostego czatu i modeli 1B–8B wystarczy 16 GB RAM oraz SSD 1 TB, ale taki komputer będzie miał ograniczone możliwości rozbudowy zastosowań.

Najbardziej opłacalna konfiguracja dla większości użytkowników to 32 GB RAM i NVMe 1–2 TB. Pozwala wygodnie korzystać z modeli 8B–14B, lokalnych baz dokumentów i podstawowych narzędzi do programowania.

Do modeli 27B–32B warto wybrać 64 GB RAM i SSD 2 TB. Użytkownik zainteresowany modelami 70B powinien rozważyć 96 lub 128 GB pamięci oraz dysk 2–4 TB.

Przy ograniczonym budżecie ważniejsza będzie większa ilość RAM-u niż dopłata do najszybszego SSD. Dysk można później stosunkowo łatwo dołożyć lub wymienić, natomiast rozbudowa pamięci w laptopach i małych komputerach często jest niemożliwa.