Table of Contents

32 GB sull’etichetta del prodotto non significano 32 GB disponibili per un carico Qwen 27B. Sistema operativo, runtime, KV cache, formato del modello, driver e disposizione delle schede cambiano il risultato. Una scheda economica con capacità sufficiente può perdere nel trattamento del prompt o nei tempi di configurazione.

Per ottobre 2026, confronta memoria utilizzabile e lavoro completato per dollaro, non il solo numero di GB di VRAM.

Questa guida mostra i modi pratici per eseguire un modello Qwen 27B a qualità 6 bit con una finestra di contesto ampia. Separa specifiche pubblicate e risultati di test riportati. Il risultato in token al secondo di una persona non è una proprietà universale di una GPU.

Perché 32 GB sono l’obiettivo

Il fabbisogno di memoria parte dai pesi. Un modello denso 27B legge l’intero insieme di parametri durante la generazione. Con quantizzazione a 6 bit, i pesi occupano circa 20,5 GB prima delle allocazioni del runtime e della memoria di contesto.

Un contesto da 128K token aggiunge un’altra grande allocazione. La dimensione esatta della KV cache cambia con architettura, precisione della cache, impostazioni del batch e backend. Una stima pratica vicina a 8 GB porta pesi e cache a circa 28,5 GB, prima della quota del sistema e del runtime di inferenza.

ConfigurazioneCosa supporta
GPU discreta da 24 GBPesi a 4 bit con contesto ridotto, oppure offload parziale
GPU discreta da 32 GBPesi a 6 bit con un obiettivo utile di contesto 128K
Due GPU da 16 GBModello diviso con meno margine per il runtime
64 GB di memoria unificataContesti e modelli più grandi, entro il limite di allocazione GPU

L’obiettivo di 32 GB serve al dimensionamento, non è una garanzia. Un modello può caricarsi lasciando troppo poco spazio per un prompt lungo, un batch maggiore, ingressi multimodali o un secondo processo.

Il video è un riferimento pratico utile

Il video seguente confronta i modi principali per arrivare a 32 GB nell’IA locale. Serve come riferimento per prezzi riportati, difficoltà di configurazione e risultati runtime. Questo articolo offre un confronto separato basato su specifiche hardware, comportamento della memoria, supporto software e costo totale di possesso.

La memoria utilizzabile conta più di quella dichiarata

Memoria unificata Apple

Apple silicon usa un pool condiviso tra CPU e GPU. Apple propone configurazioni Mac mini con 32 GB di memoria unificata, ma il pool completo non è un’allocazione grafica dedicata. Anche macOS, applicazione e runtime d’inferenza richiedono spazio.

Alcune sessioni llama.cpp riportano circa 22.906 MB disponibili su un sistema da 32 GB. Sono circa 21,3 GiB, con poco spazio per un modello 27B a 6 bit e una KV cache grande. Il limite esatto dipende da sistema operativo, runner, pressione della memoria e opzioni di avvio.

Apple silicon resta interessante per sistemi silenziosi. llama.cpp tratta Metal come backend di prima classe. Apple evita inoltre i problemi di driver e consumo di molte schede usate da data center. Il compromesso è un throughput inferiore a una GPU discreta di fascia alta e un margine di memoria meno prevedibile.

Due schede da 16 GB

Due schede da 16 GB forniscono 32 GB di VRAM fisica, ma il runtime richiede buffer per dispositivo e spazio di comunicazione. Una scheda può mostrare 13,4 GB usati e l’altra 14,4 GB. La capacità restante non è una riserva pulita di 4 GB per il contesto.

Conta anche il metodo di divisione. Il layer splitting assegna livelli diversi a schede diverse. Aumenta la capacità, ma le schede attraversano il modello a turno. Il tensor splitting distribuisce il lavoro dello stesso livello su entrambe. Aumenta la comunicazione, ma fa contribuire direttamente entrambi i dispositivi.

MetodoVantaggio principaleCosto principale
Layer splitEspansione semplice della capacitàUna scheda spesso attende mentre l’altra lavora
Tensor splitPiù calcolo parallelo in alcuni carichiPiù tuning e traffico tra dispositivi
Offload CPU più GPUModelli oltre la VRAM totaleGrande penalità quando la CPU gestisce livelli frequenti

Un piano a due schede richiede un backend testato prima dell’acquisto. Generazione PCIe, distanza degli slot, alimentazione, driver e quantizzazione esatta influenzano il risultato.

Opzioni a scheda singola

RTX 5090

NVIDIA indica 32 GB di GDDR7 e 1.792 GB/s di banda memoria per RTX 5090. Offre ampio supporto CUDA, strumenti maturi e molti frontend testati. La tabella GPU CUDA attuale indica compute capability 12.0.

Il problema è il prezzo. Una 5090 nuova offre una via pulita ai 32 GB, ma il costo compete con mesi di noleggio di un acceleratore. Consuma inoltre fino a 575 W di potenza grafica totale, quindi il sistema richiede alimentatore e raffreddamento seri.

Radeon AI PRO R9700

La R9700 è un’opzione AMD da 32 GB con alta banda memoria e, in molte offerte, un prezzo iniziale inferiore alla 5090. Il suo valore dipende molto dal runtime. Il percorso llama.cpp predefinito produce un risultato utile, mentre un backend comunitario più rapido ottiene risultati molto maggiori sulla stessa scheda in alcuni test riportati.

Questo mostra perché un confronto GPU richiede due colonne di velocità. La velocità decode misura i token generati. La velocità prefill misura quanto rapidamente il backend legge il prompt prima del primo token. Una codebase da 50.000 token rivela un prefill debole anche quando il decode sembra accettabile.

Intel Arc Pro B70

Arc Pro B70 punta ai carichi professionali con 32 GB di memoria. È interessante per il rapporto capacità-prezzo, ma il percorso software richiede più verifiche dell’hardware CUDA. Supporto GGUF standard, build corrette, impostazioni draft-token e maturità del backend cambiano il risultato.

Un prezzo inferiore non compensa le ore spese a trovare una build funzionante. Per chi sperimenta, questo lavoro fa parte del progetto. Per una workstation usata ogni giorno, il supporto di driver e applicazioni ha un valore concreto.

Schede usate da data center

Tesla V100

Le Tesla V100 usate da 32 GB attirano attenzione perché il prezzo della scheda sembra basso. Il sistema completo costa di più. Una scheda passiva da data center richiede flusso d’aria, chassis o shroud adatto, adattatori di alimentazione e un host con abbastanza spazio PCIe.

Anche l’età del software pesa. La tabella GPU CUDA attuale si concentra sulle architetture più nuove e non include V100 nella tabella architetture attuale. Prima dell’acquisto, controlla versione CUDA, ramo driver, backend e fork comunitario.

Prevedi un sistema V100 funzionante, non una scheda nuda. Una scheda vicina a 680 dollari può diventare un progetto da circa 1.000 dollari dopo raffreddamento, adattatori e piattaforma host. I prezzi usati salgono quando un carico IA locale popolare porta acquirenti verso lo stesso acceleratore ritirato.

AMD Instinct MI50

MI50 offre un buon prezzo usato per gigabyte, ma il supporto software attuale è un limite serio. Una scheda che richiede uno stack ROCm vecchio o un fork comunitario non equivale a una scheda consumer recente con supporto applicativo comune.

Il divario nel trattamento del prompt conta più del prezzo. Un confronto ha misurato circa 128 token al secondo su MI50 contro circa 2.652 token al secondo su una scheda recente da 32 GB. Una codebase da 50.000 token richiederebbe minuti sul percorso lento e secondi su quello veloce prima della generazione.

MI50 risponde a un caso d’uso ristretto. È adatta a chi preferisce capacità alla velocità interattiva e accetta la manutenzione dei driver. È una scelta debole per analisi rapide di codebase quando il prefill conta.

Il software fa parte della GPU

llama.cpp supporta CUDA, HIP, Metal, Vulkan, SYCL e altri backend. Supporta anche inferenza ibrida CPU-GPU e multi-GPU. Queste funzioni non danno prestazioni identiche tra vendor e formati modello.

La stessa scheda mostra spesso grandi differenze tra:

  • Build applicativa predefinita con impostazioni conservative.
  • Build llama.cpp ottimizzata con kernel specifici del backend.
  • Fork comunitario con previsione speculativa o multi-token.
  • Formato modello modificato pensato per un percorso di accelerazione.

I risultati riportati nel confronto includono circa 27 token al secondo per un percorso AMD 32 GB predefinito, circa 46 token al secondo con previsione multi-token e valori molto maggiori su un backend specializzato. Il risultato mostra margine software. Non promette lo stesso risultato in una nuova installazione.

Registra backend, commit, file modello, quantizzazione, lunghezza contesto, lunghezza prompt, dimensione batch e stato energetico per ogni benchmark. Senza questi campi, token al secondo è un numero pubblicitario.

Noleggiare invece di acquistare

Noleggiare una GPU veloce cambia il calcolo. Un prezzo riportato vicino a 0,69 dollari l’ora per una RTX 5090 rende un acquisto da 4.400 dollari pari a circa 6.377 ore di noleggio, prima di elettricità, host, manutenzione e valore di rivendita.

Sono quasi nove mesi di noleggio continuo, oppure circa due anni a otto ore al giorno. Un desktop a due schede da circa 1.560 dollari equivale a circa 2.261 ore allo stesso prezzo. La 5090 noleggiata evita anche calore, rumore, configurazione dei driver e guasti locali.

UsoPrimo test migliore
Poche ore a settimanaModello ospitato o GPU a noleggio
Progetto breveNoleggia una scheda classe 5090 e misura il carico reale
Uso interattivo quotidianoAcquista dopo aver testato backend e contesto
Agenti attivi di notteL’hardware posseduto è più facile da giustificare
Dati privati con carico stabileHardware posseduto con isolamento di rete

Noleggia prima di acquistare quando modello, backend o contesto restano incerti. Un fine settimana di misure costa meno di una workstation sbagliata.

Consigli per l’acquisto

Due RTX 5060 Ti da 16 GB

Due schede da 16 GB offrono un percorso CUDA pratico per chi ha bisogno di 32 GB e vuole tutorial, driver e frontend comuni. Usa tensor splitting solo dopo aver verificato formato modello e backend. Layer splitting è più semplice, ma spesso lascia prestazioni inutilizzate.

Servono anche una scheda madre con due slot utilizzabili, potenza sufficiente e flusso d’aria tra le schede. Una coppia di schede diventa una vera workstation quando si include il costo della piattaforma.

Una scheda da 32 GB

Scegli una scheda singola da 32 GB quando affidabilità, garanzia e distribuzione semplice contano più del prezzo minimo per la memoria. R9700 e RTX 5090 rappresentano versioni diverse della scelta. AMD punta su capacità e prezzo. NVIDIA punta su ampiezza software e supporto CUDA maturo.

Una V100 o MI50 usata

Scegli hardware data center usato solo se il progetto include test dei driver, raffreddamento e manutenzione del backend. Il prezzo della scheda è la prima riga del budget, non l’ultima.

Apple silicon

Scegli un sistema Apple silicon da 32 GB quando silenzio, bassi consumi a riposo e desktop compatto contano più del throughput massimo. Controlla l’allocazione mostrata dal runner esatto prima di presumere che tutti i 32 GB siano disponibili.

Noleggio cloud

Scegli il noleggio quando il carico è occasionale, il modello cambia spesso o la risposta rapida conta più della proprietà locale. Spegni l’istanza dopo il test. Il tempo inattivo elimina rapidamente il vantaggio di prezzo.

Una scheda di confronto migliore

Prima di acquistare, registra questi valori per ogni candidato:

  • Memoria modello utilizzabile dopo l’overhead del runtime.
  • Formato dei pesi e dimensione attesa del modello.
  • Dimensione della KV cache al contesto obiettivo.
  • Velocità prefill con un prompt rappresentativo.
  • Velocità decode quando il contesto è pieno.
  • Versione backend e driver necessaria per il risultato.
  • Consumo a riposo e sotto carico alla tariffa elettrica locale.
  • Costo host, raffreddamento, adattatori, storage e garanzia.
  • Equivalente a noleggio per le ore previste.

Il test più utile usa un prompt del carico reale. Per il coding, usa una codebase rappresentativa. Per la ricerca, usa un documento lungo con il normale flusso di recupero o incolla. Misura tempo al primo token, trattamento prompt, velocità di generazione, memoria, qualità e potenza.

Raccomandazione finale

Acquista due RTX 5060 Ti da 16 GB per la build CUDA da 32 GB con meno attrito. Usa tensor split solo dopo un test breve che confermi il backend.

Acquista una singola scheda da 32 GB per una workstation più pulita. Preferisci la scheda con il percorso software migliore per il tuo runner, non quella con meno dollari per gigabyte.

Usa V100 o MI50 solo se accetti il progetto di manutenzione. Un acceleratore economico con prefill debole non è conveniente per prompt lunghi di codice.

Noleggia una GPU di classe 5090 quando l’uso è irregolare. Il test a noleggio fornisce dati reali su memoria, velocità e contesto prima di una spesa importante.

La domanda sui 32 GB non è quindi «Quale scheda ha il gigabyte meno costoso?». È «Quale sistema lascia memoria utilizzabile sufficiente, legge il mio carico rapidamente, funziona con il mio software e ripaga il prezzo con un uso regolare?»

Riferimenti

Prossimi passi

Usa la scheda con un prompt rappresentativo prima dell’acquisto. Confronta tempo al primo token, trattamento prompt, decode, memoria, potenza e costo totale della piattaforma. Per un progetto breve, noleggia prima e conserva il risultato misurato con la decisione d’acquisto.