Przejdź do treści
← powrót do bloga

RTX 4090 48 GB — test w AI. Kiedy bije RTX 5090?

Film jest o tym, jak ta karta powstała i jak brzmi. Ten tekst jest po to, żebyś mógł sprawdzić liczby, przeliczyć, czy Twój model się zmieści, i zdecydować, czy warto wydać te pieniądze. Wszystkie wyniki z materiału są niżej, w tabelach, do których można wrócić.

Skrót dla niecierpliwych

Co to jestRTX 4090 przelutowany na 48 GB VRAM w konfiguracji clamshell. Modyfikacja Pawła Ostrówki, karta pożyczona do testów.
Ile kosztujeok. 13 000 zł łącznie z bazową kartą
Kiedy wygrywagdy model nie mieści się w 24 GB, ale mieści w 48 GB. Wtedy bije zwykłą 4090 nawet sześciokrotnie i zostawia w tyle droższego RTX-a 5090
Kiedy przegrywaw grach (zero różnicy) i przy modelach powyżej 48 GB, gdzie wygrywa szybszy rdzeń 5090
Dla kogohome laby, lokalne LLM-y, fine-tuning, generowanie obrazu na dużych modelach. Nie dla graczy.

Czy Twój model się zmieści?

To jest cały temat. Nie „która karta jest szybsza”, tylko „czy model wejdzie w pamięć”. Jeśli wejdzie, liczą się rdzenie. Jeśli nie wejdzie, backend zaczyna przerzucać warstwy do RAM-u i wydajność leci na łeb na szyję, niezależnie od tego, ile TFLOP-ów ma karta.

ModelRozmiar24 GB
4090 / 3090
32 GB
5090
48 GB
4090 mod
96 GB
6000 BW
GPT-OSS-20B12 GBtaktaktaktak
Qwen3.5 35B Q4_K_M22 GBtaktaktaktak
Qwen3.5 35B Q8_0ok. 33 GBnienietaktak
Hermes-3-70B43 GBnienietaktak
GPT-OSS-120B63 GBnienienietak
Flux 267 GBnienienietak

Cały sens tej modyfikacji mieści się w dwóch wierszach tej tabeli. To wąskie okno między 32 a 48 GB decyduje o tym, czy wydajesz 13 tysięcy sensownie, czy wyrzucasz je w błoto.

Zasada w trzech krokach

  • Model mieści się w 24 GB — obie 4090 są identyczne, decyduje moc rdzenia. Dodatkowa pamięć nie daje nic.
  • Model nie mieści się w 24 GB, ale mieści w 48 GB — wersja 48 GB deklasuje zwykłą 4090 i wyprzedza droższego 5090. Jedyny scenariusz, dla którego warto robić ten mod.
  • Model przekracza 48 GB — przewaga znika, bo warstwy i tak lecą do RAM-u. Wygrywa szybszy rdzeń, więc 5090 wychodzi na prowadzenie.

Wyniki: LLM-y

Testy robiłem na Threadripperze 7980X ze 128 GB konwencjonalnego RAM-u, żeby największe modele w ogóle dało się załadować i żeby nic się nie wywalało.

Ollama

Tokeny/sGPT-OSS-20B
12 GB
Hermes-3-70B
43 GB
GPT-OSS-120B
63 GB
RTX 6000 Blackwell 96 GB233,5543,30174,49
RTX 5090 32 GB FE246,778,3921,38
RTX 4090 48 GB171,2226,5618,05
RTX 4090 24 GB FE171,294,4915,56
RTX 3090 24 GB121,954,0014,07
DGX Spark (GB10, 128 GB)49,775,1338,20
GMKtec EVO-X2 (Ryzen AI Max+ 395)48,465,50brak pamięci

Przy 12 GB obie 4090 idą łeb w łeb: 171,22 wobec 171,29 tokena na sekundę. Różnica na poziomie szumu pomiarowego, bo to ten sam rdzeń.

Przy 43 GB robi się jatka. Wersja z 48 GB wykręca 26,56 tokena na sekundę, zwykła 4090 ledwie 4,49. Prawie sześciokrotnie, przy identycznym krzemie. RTX 5090 za 16,5 tysiąca dostaje 8,39 i ląduje trzy razy niżej od karty, którą przelutował jeden gość w Polsce.

Przy 63 GB cała przewaga paruje. 4090 wraca poniżej 5090, a na drugie miejsce wskakuje DGX Spark ze swoimi 128 GB pamięci unified. Zwróć uwagę na 6000 Blackwell: 174 tokeny na sekundę wobec 18 na zmodowanej 4090. To nie jest przewaga architektury, tylko tego, że model po prostu mieści się w pamięci.

llama.cpp

Tokeny/sGPT-OSS-20B
12 GB
Qwen3.5 35B Q4_K_M
22 GB
RTX 6000 Blackwell 96 GB257,9191,5
RTX 5090 32 GB FE260,4189,3
RTX 4090 48 GB184,6152,6
RTX 4090 24 GB FE181,0152,4
RTX 3090 24 GB152,9119,6
GMKtec EVO-X276,7
DGX Spark (GB10)61,0

Ollama bywa niedopracowana i mocno ogranicza wybór modeli, więc jeśli chcesz wycisnąć więcej, sięgnij po llama.cpp. Trend powtarza się co do joty.

Qwen3.5 w wariancie Q4_K_M mieści się wszędzie, tylko że to nie jest pełna precyzja. Przy dokładniejszym Q8_0, o jakości praktycznie takiej samej jak 16-bitowy, model przestaje mieścić się w 24 GB i znowu otwiera się przepaść na korzyść wersji 48 GB, która wyprzedza również 5090. A przy modelu ważącym 82 GB sensownie wypada już tylko 6000 Blackwell.

Surowa moc, czyli dowód, że to ten sam krzem

Skrypt mamf-finder.py mnoży macierze, czyli robi to, co stanowi fundament uczenia maszynowego. Pamięć nie ma tu nic do rzeczy i właśnie o to chodzi (maksymalne TFLOP-y):

Sprzętfloat8_e4m3fnbfloat16float32
RTX 6000 Blackwell 96 GB702,6388,464,8
RTX 5090 32 GB FE474,0240,463,5
RTX 4090 24 GB FE338,3170,749,6
RTX 4090 48 GB331,3167,047,8
DGX Spark (GB10, 128 GB)212,9109,017,9
RTX 3090 24 GBbrak wsparcia75,020,1
GMKtec EVO-X2brak wsparcia26,66,2

Dwa procent różnicy między wersją 24 a 48 GB, na korzyść oryginału. To zwykły rozrzut taktowania rdzenia. Mod nie dodaje mocy obliczeniowej i nie taki jest jego cel: dokłada wyłącznie miejsce.

Gry: nie ma o czym mówić

Cyberpunk 2077 w 4K z path tracingiem alokuje jakieś 12 GB i praktycznie nie ma dziś tytułu, który przekroczyłby bufor 24 GB. Testy w 4K na Ryzenie 7 9800X3D i 32 GB RAM-u (2 × 16 GB, 6000 MT/s):

Gra (4K)RTX 4090 48 GBRTX 4090 FE 24 GB
Cyberpunk 2077, Ultra — AVG / 1% low61 / 46 FPS61 / 45 FPS
Borderlands 4, Złodupiec (RT) — AVG / 1% low35 / 27 FPS36 / 27 FPS

Dziedzictwo Hogwartu, identyczna historia. Po włączeniu ray tracingu też bez zmian. Jeśli szukasz karty do grania, ten tekst nie jest dla Ciebie i możesz przestać czytać.

Ile to kosztuje i co za te pieniądze

KartaVRAMCenaDo czego
RTX 4090 24 GB24 GB GDDR6Xok. 9 000 złgry i modele do 24 GB
RTX 4090 48 GB (mod)48 GB GDDR6Xok. 13 000 złmodele 24–48 GB, multi-GPU
RTX 509032 GB GDDR7od 16 500 złgry i modele do 32 GB
RTX 6000 Ada48 GB GDDR6ponad 30 000 złto samo co mod, tylko z gwarancją

Na koszt moda składa się bazowa karta za jakieś 9 tysięcy plus około 4 tysiące za samą przeróbkę: PCB z chłodzeniem (ok. 1 100 zł), pamięci i robocizna.

Kluczowe porównanie to ostatni wiersz. RTX 6000 Ada ma ten sam rdzeń AD102 i te same 48 GB, ale kosztuje ponad dwa razy więcej. Ada ma 11% więcej rdzeni CUDA, za to zmodowana 4090 nadrabia szybszą pamięcią GDDR6X zamiast GDDR6, co w LLM-ach akurat się przydaje. Płacisz więc 17 tysięcy różnicy za gwarancję, oficjalne wsparcie i święty spokój. Czy to dużo, każdy musi ocenić sam.

Jak w ogóle da się dolutować drugie 24 GB

Nie kupujesz większych kości i nie podmieniasz ich na PCB. Zwykła 4090 ma dwanaście miejsc na kości GDDR6X, największa dostępna kość ma 2 GB i dwanaście razy dwa daje 24 GB. Koniec możliwości.

Rozwiązaniem jest clamshell: pamięci lutowane po obu stronach płytki. Specyfikacja GDDR to dopuszcza, obie kości przechodzą wtedy w tryb x8, pracują równolegle w tym samym cyklu zegara i razem tworzą jeden układ logiczny. Na poziomie przesyłania danych wygląda to jak pojedynczy czip. Tak działały Titan X Maxwell czy RTX 3090.

Do tego trzeba spełnić trzy warunki naraz:

  • PCB z padami po obu stronach — oryginalna płytka 4090 ich nie ma, więc potrzebna jest modyfikowana
  • rdzeń wspierający clamshell — AD102 wspiera, bo pracuje w tym trybie w RTX 6000 Ada. To celowe wsparcie na poziomie krzemu, nie przypadek
  • BIOS — według VideoCardz moderzy ogarnęli go dzięki wyciekowi danych z NVIDII, który dał im wewnętrzne narzędzia

Reszta to lutowanie BGA: odlutowanie rdzenia i wszystkich pamięci z oryginalnej karty, a potem przylutowanie dwudziestu czterech kości i rdzenia na nową płytkę. Masa etapów, na każdym coś może pójść nie tak. Szacun dla Pawła, że miał psychę się tego podjąć. Cały proces od kuchni pokazuje na swoim kanale i tłumaczy go zdecydowanie lepiej ode mnie. Modyfikację wykonuje też na zlecenie.

Efekt końcowy jest tak bezproblemowy, że aż podejrzany: wkładasz kartę do komputera, instalujesz najnormalniejszy sterownik NVIDII i system pokazuje GeForce’a RTX 4090 z 47,5 GB pamięci. Bez żadnego kombinowania.

Dlaczego turbina

Karta jest głośna, słowo „suszarka” nabiera przy niej nowego wydźwięku, ale pod obciążeniem trzyma 66°C. Ta krzywa wentylatorów ma uzasadnienie: takie karty lądują w serwerach i home labach, gdzie kilka sztuk stoi jedna obok drugiej. Turbina przepycha powietrze przez całą obudowę i wyrzuca na zewnątrz, zamiast rozdmuchiwać po bokach.

To zresztą prowadzi do najciekawszego zastosowania. Dwie, trzy albo cztery takie karty dają odpowiednio 96, 144 lub 192 GB pamięci i dopiero wtedy otwierają się modele, przy których cała reszta tej listy się poddaje.

Obraz, wideo i fine-tuning

Mechanika jest ta sama, tylko progi inne. Flux 1 w 512 i 1024 pikselach mieści się wszędzie, więc różnicy między kartami praktycznie nie widać. Flux 2 waży 67 GB i tu różnica już jest, choć nie tak spektakularna jak przy LLM-ach, bo z dedykowanych kart tylko 6000 Blackwell ładuje całość. Przy wideo LTX 2.19B w FP8 mieści się nawet w 24 GB, a przewaga pojawia się dopiero przy cięższym wariancie BF16.

48 GB przydaje się też przy fine-tuningu, czyli douczaniu modeli nowych konceptów. Tak uczyłem Fluksa 2 generowania mojego Rica, co pokazywałem w materiale o DGX Spark. Sprawdzi się również wtedy, gdy chcesz trzymać jednocześnie załadowany model językowy i backend ComfyUI z własnym modelem, żeby korzystać naraz z LLM-a i generowania obrazów.

Werdykt

Ta karta rozwiązuje jeden bardzo konkretny problem: modele między 32 a 48 GB, których nie chcesz uruchamiać na pół gwizdka. Jeśli to Twój problem, nie ma dziś tańszego sposobu, żeby go rozwiązać w ekosystemie CUDA. Jeśli nie jest, płacisz 4 tysiące za pamięć, która będzie stała pusta.

Za: 48 GB za mniej niż połowę ceny RTX 6000 Ada, szybsza pamięć GDDR6X niż w Adzie, multi-GPU do 192 GB, chłodzenie stworzone do racków, zwykły sterownik NVIDII, modyfikacja dostępna w Polsce.

Przeciw: hałas jak z suszarki, zero zysku w grach, przepadająca gwarancja, ryzykowny wieloetapowy proces lutowania, brak przewagi powyżej 48 GB i żadnego oficjalnego wsparcia NVIDII.

Dla zapalonych home labowiczów to naprawdę ciekawa opcja. Dla mnie i dla graczy nie ma najmniejszego sensu. Ale ja lubię ciekawe rzeczy, Wy lubicie ciekawe rzeczy, więc takiego jednorożca po prostu warto było omówić.

FAQ

Ile kosztuje RTX 4090 z 48 GB pamięci?

Około 13 000 zł: 9 000 zł za bazową kartę i mniej więcej 4 000 zł za samą modyfikację, czyli PCB z chłodzeniem, pamięci i robociznę. Dla porównania RTX 6000 Ada z tym samym rdzeniem i 48 GB kosztuje ponad 30 000 zł.

Czy RTX 4090 48 GB jest szybszy w grach?

Nie. W 4K wyniki są identyczne jak na zwykłej 4090 — w Cyberpunku 2077 to 61 FPS na obu kartach. Żadna obecna gra nie przekracza bufora 24 GB, więc dodatkowa pamięć nie daje w gamingu nic.

Kiedy RTX 4090 48 GB bije RTX 5090?

Wtedy, gdy model nie mieści się w 32 GB pamięci 5090, ale mieści w 48 GB. W Hermes-3-70B (43 GB) 4090 48 GB osiąga 26,56 tokena na sekundę wobec 8,39 na 5090. Po przekroczeniu 48 GB przewaga znika i 5090 wraca na prowadzenie.

Jak działa modyfikacja 4090 na 48 GB?

To konfiguracja clamshell: pamięci lutowane po obu stronach specjalnie przygotowanego PCB, gdzie każda para kości pracuje w trybie x8 jako jeden układ logiczny. Wymaga wsparcia ze strony rdzenia AD102, dwudziestu czterech kości GDDR6X po 2 GB i zmodyfikowanego BIOS-u.

Czy RTX 4090 48 GB potrzebuje specjalnych sterowników?

Nie. Karta działa na zwykłym sterowniku NVIDII i w systemie widoczna jest jako GeForce RTX 4090 z 47,5 GB dostępnej pamięci.

Ile kart można połączyć i ile to daje pamięci?

Dwie, trzy lub cztery karty dają odpowiednio 96, 144 lub 192 GB VRAM. Chłodzenie turbinowe jest tu kluczowe, bo karty stoją w racku jedna obok drugiej.

← powrót do bloga