RTX 4090 48 GB — test w AI. Kiedy bije RTX 5090?

Film jest o tym, jak ta karta powstała i jak brzmi. Ten tekst jest po to, żebyś mógł sprawdzić liczby, przeliczyć, czy Twój model się zmieści, i zdecydować, czy warto wydać te pieniądze. Wszystkie wyniki z materiału są niżej, w tabelach, do których można wrócić.
Skrót dla niecierpliwych
| Co to jest | RTX 4090 przelutowany na 48 GB VRAM w konfiguracji clamshell. Modyfikacja Pawła Ostrówki, karta pożyczona do testów. |
|---|---|
| Ile kosztuje | ok. 13 000 zł łącznie z bazową kartą |
| Kiedy wygrywa | gdy model nie mieści się w 24 GB, ale mieści w 48 GB. Wtedy bije zwykłą 4090 nawet sześciokrotnie i zostawia w tyle droższego RTX-a 5090 |
| Kiedy przegrywa | w grach (zero różnicy) i przy modelach powyżej 48 GB, gdzie wygrywa szybszy rdzeń 5090 |
| Dla kogo | home laby, lokalne LLM-y, fine-tuning, generowanie obrazu na dużych modelach. Nie dla graczy. |
Czy Twój model się zmieści?
To jest cały temat. Nie „która karta jest szybsza”, tylko „czy model wejdzie w pamięć”. Jeśli wejdzie, liczą się rdzenie. Jeśli nie wejdzie, backend zaczyna przerzucać warstwy do RAM-u i wydajność leci na łeb na szyję, niezależnie od tego, ile TFLOP-ów ma karta.
| Model | Rozmiar | 24 GB 4090 / 3090 | 32 GB 5090 | 48 GB 4090 mod | 96 GB 6000 BW |
|---|---|---|---|---|---|
| GPT-OSS-20B | 12 GB | tak | tak | tak | tak |
| Qwen3.5 35B Q4_K_M | 22 GB | tak | tak | tak | tak |
| Qwen3.5 35B Q8_0 | ok. 33 GB | nie | nie | tak | tak |
| Hermes-3-70B | 43 GB | nie | nie | tak | tak |
| GPT-OSS-120B | 63 GB | nie | nie | nie | tak |
| Flux 2 | 67 GB | nie | nie | nie | tak |
Cały sens tej modyfikacji mieści się w dwóch wierszach tej tabeli. To wąskie okno między 32 a 48 GB decyduje o tym, czy wydajesz 13 tysięcy sensownie, czy wyrzucasz je w błoto.
Zasada w trzech krokach
- Model mieści się w 24 GB — obie 4090 są identyczne, decyduje moc rdzenia. Dodatkowa pamięć nie daje nic.
- Model nie mieści się w 24 GB, ale mieści w 48 GB — wersja 48 GB deklasuje zwykłą 4090 i wyprzedza droższego 5090. Jedyny scenariusz, dla którego warto robić ten mod.
- Model przekracza 48 GB — przewaga znika, bo warstwy i tak lecą do RAM-u. Wygrywa szybszy rdzeń, więc 5090 wychodzi na prowadzenie.
Wyniki: LLM-y
Testy robiłem na Threadripperze 7980X ze 128 GB konwencjonalnego RAM-u, żeby największe modele w ogóle dało się załadować i żeby nic się nie wywalało.

Ollama
| Tokeny/s | GPT-OSS-20B 12 GB | Hermes-3-70B 43 GB | GPT-OSS-120B 63 GB |
|---|---|---|---|
| RTX 6000 Blackwell 96 GB | 233,55 | 43,30 | 174,49 |
| RTX 5090 32 GB FE | 246,77 | 8,39 | 21,38 |
| RTX 4090 48 GB | 171,22 | 26,56 | 18,05 |
| RTX 4090 24 GB FE | 171,29 | 4,49 | 15,56 |
| RTX 3090 24 GB | 121,95 | 4,00 | 14,07 |
| DGX Spark (GB10, 128 GB) | 49,77 | 5,13 | 38,20 |
| GMKtec EVO-X2 (Ryzen AI Max+ 395) | 48,46 | 5,50 | brak pamięci |
Przy 12 GB obie 4090 idą łeb w łeb: 171,22 wobec 171,29 tokena na sekundę. Różnica na poziomie szumu pomiarowego, bo to ten sam rdzeń.
Przy 43 GB robi się jatka. Wersja z 48 GB wykręca 26,56 tokena na sekundę, zwykła 4090 ledwie 4,49. Prawie sześciokrotnie, przy identycznym krzemie. RTX 5090 za 16,5 tysiąca dostaje 8,39 i ląduje trzy razy niżej od karty, którą przelutował jeden gość w Polsce.
Przy 63 GB cała przewaga paruje. 4090 wraca poniżej 5090, a na drugie miejsce wskakuje DGX Spark ze swoimi 128 GB pamięci unified. Zwróć uwagę na 6000 Blackwell: 174 tokeny na sekundę wobec 18 na zmodowanej 4090. To nie jest przewaga architektury, tylko tego, że model po prostu mieści się w pamięci.

llama.cpp
| Tokeny/s | GPT-OSS-20B 12 GB | Qwen3.5 35B Q4_K_M 22 GB |
|---|---|---|
| RTX 6000 Blackwell 96 GB | 257,9 | 191,5 |
| RTX 5090 32 GB FE | 260,4 | 189,3 |
| RTX 4090 48 GB | 184,6 | 152,6 |
| RTX 4090 24 GB FE | 181,0 | 152,4 |
| RTX 3090 24 GB | 152,9 | 119,6 |
| GMKtec EVO-X2 | 76,7 | — |
| DGX Spark (GB10) | 61,0 | — |
Ollama bywa niedopracowana i mocno ogranicza wybór modeli, więc jeśli chcesz wycisnąć więcej, sięgnij po llama.cpp. Trend powtarza się co do joty.
Qwen3.5 w wariancie Q4_K_M mieści się wszędzie, tylko że to nie jest pełna precyzja. Przy dokładniejszym Q8_0, o jakości praktycznie takiej samej jak 16-bitowy, model przestaje mieścić się w 24 GB i znowu otwiera się przepaść na korzyść wersji 48 GB, która wyprzedza również 5090. A przy modelu ważącym 82 GB sensownie wypada już tylko 6000 Blackwell.
Surowa moc, czyli dowód, że to ten sam krzem
Skrypt mamf-finder.py mnoży macierze, czyli robi to, co stanowi fundament uczenia maszynowego. Pamięć nie ma tu nic do rzeczy i właśnie o to chodzi (maksymalne TFLOP-y):
| Sprzęt | float8_e4m3fn | bfloat16 | float32 |
|---|---|---|---|
| RTX 6000 Blackwell 96 GB | 702,6 | 388,4 | 64,8 |
| RTX 5090 32 GB FE | 474,0 | 240,4 | 63,5 |
| RTX 4090 24 GB FE | 338,3 | 170,7 | 49,6 |
| RTX 4090 48 GB | 331,3 | 167,0 | 47,8 |
| DGX Spark (GB10, 128 GB) | 212,9 | 109,0 | 17,9 |
| RTX 3090 24 GB | brak wsparcia | 75,0 | 20,1 |
| GMKtec EVO-X2 | brak wsparcia | 26,6 | 6,2 |
Dwa procent różnicy między wersją 24 a 48 GB, na korzyść oryginału. To zwykły rozrzut taktowania rdzenia. Mod nie dodaje mocy obliczeniowej i nie taki jest jego cel: dokłada wyłącznie miejsce.
Gry: nie ma o czym mówić
Cyberpunk 2077 w 4K z path tracingiem alokuje jakieś 12 GB i praktycznie nie ma dziś tytułu, który przekroczyłby bufor 24 GB. Testy w 4K na Ryzenie 7 9800X3D i 32 GB RAM-u (2 × 16 GB, 6000 MT/s):
| Gra (4K) | RTX 4090 48 GB | RTX 4090 FE 24 GB |
|---|---|---|
| Cyberpunk 2077, Ultra — AVG / 1% low | 61 / 46 FPS | 61 / 45 FPS |
| Borderlands 4, Złodupiec (RT) — AVG / 1% low | 35 / 27 FPS | 36 / 27 FPS |
Dziedzictwo Hogwartu, identyczna historia. Po włączeniu ray tracingu też bez zmian. Jeśli szukasz karty do grania, ten tekst nie jest dla Ciebie i możesz przestać czytać.

Ile to kosztuje i co za te pieniądze
| Karta | VRAM | Cena | Do czego |
|---|---|---|---|
| RTX 4090 24 GB | 24 GB GDDR6X | ok. 9 000 zł | gry i modele do 24 GB |
| RTX 4090 48 GB (mod) | 48 GB GDDR6X | ok. 13 000 zł | modele 24–48 GB, multi-GPU |
| RTX 5090 | 32 GB GDDR7 | od 16 500 zł | gry i modele do 32 GB |
| RTX 6000 Ada | 48 GB GDDR6 | ponad 30 000 zł | to samo co mod, tylko z gwarancją |
Na koszt moda składa się bazowa karta za jakieś 9 tysięcy plus około 4 tysiące za samą przeróbkę: PCB z chłodzeniem (ok. 1 100 zł), pamięci i robocizna.
Kluczowe porównanie to ostatni wiersz. RTX 6000 Ada ma ten sam rdzeń AD102 i te same 48 GB, ale kosztuje ponad dwa razy więcej. Ada ma 11% więcej rdzeni CUDA, za to zmodowana 4090 nadrabia szybszą pamięcią GDDR6X zamiast GDDR6, co w LLM-ach akurat się przydaje. Płacisz więc 17 tysięcy różnicy za gwarancję, oficjalne wsparcie i święty spokój. Czy to dużo, każdy musi ocenić sam.
Jak w ogóle da się dolutować drugie 24 GB
Nie kupujesz większych kości i nie podmieniasz ich na PCB. Zwykła 4090 ma dwanaście miejsc na kości GDDR6X, największa dostępna kość ma 2 GB i dwanaście razy dwa daje 24 GB. Koniec możliwości.
Rozwiązaniem jest clamshell: pamięci lutowane po obu stronach płytki. Specyfikacja GDDR to dopuszcza, obie kości przechodzą wtedy w tryb x8, pracują równolegle w tym samym cyklu zegara i razem tworzą jeden układ logiczny. Na poziomie przesyłania danych wygląda to jak pojedynczy czip. Tak działały Titan X Maxwell czy RTX 3090.
Do tego trzeba spełnić trzy warunki naraz:
- PCB z padami po obu stronach — oryginalna płytka 4090 ich nie ma, więc potrzebna jest modyfikowana
- rdzeń wspierający clamshell — AD102 wspiera, bo pracuje w tym trybie w RTX 6000 Ada. To celowe wsparcie na poziomie krzemu, nie przypadek
- BIOS — według VideoCardz moderzy ogarnęli go dzięki wyciekowi danych z NVIDII, który dał im wewnętrzne narzędzia
Reszta to lutowanie BGA: odlutowanie rdzenia i wszystkich pamięci z oryginalnej karty, a potem przylutowanie dwudziestu czterech kości i rdzenia na nową płytkę. Masa etapów, na każdym coś może pójść nie tak. Szacun dla Pawła, że miał psychę się tego podjąć. Cały proces od kuchni pokazuje na swoim kanale i tłumaczy go zdecydowanie lepiej ode mnie. Modyfikację wykonuje też na zlecenie.
Efekt końcowy jest tak bezproblemowy, że aż podejrzany: wkładasz kartę do komputera, instalujesz najnormalniejszy sterownik NVIDII i system pokazuje GeForce’a RTX 4090 z 47,5 GB pamięci. Bez żadnego kombinowania.
Dlaczego turbina
Karta jest głośna, słowo „suszarka” nabiera przy niej nowego wydźwięku, ale pod obciążeniem trzyma 66°C. Ta krzywa wentylatorów ma uzasadnienie: takie karty lądują w serwerach i home labach, gdzie kilka sztuk stoi jedna obok drugiej. Turbina przepycha powietrze przez całą obudowę i wyrzuca na zewnątrz, zamiast rozdmuchiwać po bokach.
To zresztą prowadzi do najciekawszego zastosowania. Dwie, trzy albo cztery takie karty dają odpowiednio 96, 144 lub 192 GB pamięci i dopiero wtedy otwierają się modele, przy których cała reszta tej listy się poddaje.
Obraz, wideo i fine-tuning
Mechanika jest ta sama, tylko progi inne. Flux 1 w 512 i 1024 pikselach mieści się wszędzie, więc różnicy między kartami praktycznie nie widać. Flux 2 waży 67 GB i tu różnica już jest, choć nie tak spektakularna jak przy LLM-ach, bo z dedykowanych kart tylko 6000 Blackwell ładuje całość. Przy wideo LTX 2.19B w FP8 mieści się nawet w 24 GB, a przewaga pojawia się dopiero przy cięższym wariancie BF16.
48 GB przydaje się też przy fine-tuningu, czyli douczaniu modeli nowych konceptów. Tak uczyłem Fluksa 2 generowania mojego Rica, co pokazywałem w materiale o DGX Spark. Sprawdzi się również wtedy, gdy chcesz trzymać jednocześnie załadowany model językowy i backend ComfyUI z własnym modelem, żeby korzystać naraz z LLM-a i generowania obrazów.
Werdykt
Ta karta rozwiązuje jeden bardzo konkretny problem: modele między 32 a 48 GB, których nie chcesz uruchamiać na pół gwizdka. Jeśli to Twój problem, nie ma dziś tańszego sposobu, żeby go rozwiązać w ekosystemie CUDA. Jeśli nie jest, płacisz 4 tysiące za pamięć, która będzie stała pusta.
Za: 48 GB za mniej niż połowę ceny RTX 6000 Ada, szybsza pamięć GDDR6X niż w Adzie, multi-GPU do 192 GB, chłodzenie stworzone do racków, zwykły sterownik NVIDII, modyfikacja dostępna w Polsce.
Przeciw: hałas jak z suszarki, zero zysku w grach, przepadająca gwarancja, ryzykowny wieloetapowy proces lutowania, brak przewagi powyżej 48 GB i żadnego oficjalnego wsparcia NVIDII.
Dla zapalonych home labowiczów to naprawdę ciekawa opcja. Dla mnie i dla graczy nie ma najmniejszego sensu. Ale ja lubię ciekawe rzeczy, Wy lubicie ciekawe rzeczy, więc takiego jednorożca po prostu warto było omówić.

FAQ
Około 13 000 zł: 9 000 zł za bazową kartę i mniej więcej 4 000 zł za samą modyfikację, czyli PCB z chłodzeniem, pamięci i robociznę. Dla porównania RTX 6000 Ada z tym samym rdzeniem i 48 GB kosztuje ponad 30 000 zł.
Nie. W 4K wyniki są identyczne jak na zwykłej 4090 — w Cyberpunku 2077 to 61 FPS na obu kartach. Żadna obecna gra nie przekracza bufora 24 GB, więc dodatkowa pamięć nie daje w gamingu nic.
Wtedy, gdy model nie mieści się w 32 GB pamięci 5090, ale mieści w 48 GB. W Hermes-3-70B (43 GB) 4090 48 GB osiąga 26,56 tokena na sekundę wobec 8,39 na 5090. Po przekroczeniu 48 GB przewaga znika i 5090 wraca na prowadzenie.
To konfiguracja clamshell: pamięci lutowane po obu stronach specjalnie przygotowanego PCB, gdzie każda para kości pracuje w trybie x8 jako jeden układ logiczny. Wymaga wsparcia ze strony rdzenia AD102, dwudziestu czterech kości GDDR6X po 2 GB i zmodyfikowanego BIOS-u.
Nie. Karta działa na zwykłym sterowniku NVIDII i w systemie widoczna jest jako GeForce RTX 4090 z 47,5 GB dostępnej pamięci.
Dwie, trzy lub cztery karty dają odpowiednio 96, 144 lub 192 GB VRAM. Chłodzenie turbinowe jest tu kluczowe, bo karty stoją w racku jedna obok drugiej.