Table of Contents

L’IA locale è un’opzione pratica per attività delimitate con controlli chiari. Per sostituire il lavoro affidato a ChatGPT o Claude devono combaciare capacità del modello, memoria utilizzabile e un agente in grado di ispezionare e verificare l’output.

Un modello adatto alla workstation richiede strumenti appropriati e velocità sufficiente per ripetere i tentativi. Questo articolo separa risultati dei benchmark, stime della memoria e prove di attività completate, così puoi valutare ogni elemento per conto proprio.

Punti chiave

  • Capacità: i punteggi di riferimento descrivono specifiche impostazioni di valutazione, non la tua build locale quantizzata.
  • Memoria: calcola insieme pesi, cache del contesto e sovraccarico del runtime.
  • Velocità: ripetere una conversazione dell’agente misura il servizio, non la correttezza.
  • Verifica: un agente richiede controlli adeguati al risultato richiesto.
  • Scelta: confronta attività ripetute, tempo di riparazione e costo totale prima di acquistare hardware.

Leggere i punteggi nel contesto

L’Artificial Analysis Intelligence Index aggrega diverse valutazioni in un punteggio di riferimento. La classifica dei modelli e i risultati dell’hardware locale riportano le seguenti voci selezionate, verificate il 6 ottobre 2026.

Modello e impostazionePunteggio indiceDistribuzione in questo confronto
Qwen3.8 27B, xhigh34Pesi scaricabili
GLM-5.3, max45Pesi scaricabili
GPT-6 Astra, max53Servizio ospitato
Claude Opus 5.5, max con fallback58Servizio ospitato

I punti dell’indice non sono percentuali di intelligenza o successo. Un divario di 13 punti tra GLM e Claude non dimostra una differenza del 13% nei risultati di programmazione. Le impostazioni di ragionamento contano quando confronti lo stesso modello.

La metodologia di valutazione pubblicata descrive la configurazione dei test. Alcune valutazioni includono strumenti e infrastruttura per agenti. Considera il punteggio come un risultato ottenuto in quelle condizioni. Non trasferirlo direttamente a una copia locale compressa eseguita da un’altra applicazione.

ChatGPT e Claude sono prodotti, mentre la tabella confronta modelli sottostanti selezionati. Abbonamento, modello scelto, strumenti disponibili e contesto dell’attività introducono altre differenze. Parti da un’attività ripetuta e prova l’intera configurazione.

Calcolare l’intera richiesta

La compatibilità della memoria parte da tre allocazioni. I pesi contengono i parametri appresi. La cache chiave-valore, o cache KV, conserva i dati di attenzione usati durante l’inferenza. Buffer del runtime e altro software consumano lo spazio restante.

Required memory = resident weights + context cache + runtime allowance
Available memory = physical capacity - operating system and application reserve

La quantizzazione riduce la precisione di memorizzazione dei pesi. Una precisione inferiore riduce la memoria necessaria, con qualità dipendente dal modello e dalla build quantizzata. La precisione della cache è un’impostazione separata. Un file di pesi Q4 non dimostra una cache a quattro bit.

Per un esempio approssimativo limitato ai pesi, 27 miliardi di parametri a 16 bit richiedono circa 50,3 GiB. Otto bit richiedono circa 25,1 GiB e quattro bit circa 12,6 GiB. Le dimensioni pubblicate dei file includono anche metadati, packing e precisione mista. Usa i file esatti per pianificare la distribuzione.

La scheda del modello Qwen3.8-27B e la scheda del modello GLM-5.3 descrivono architetture diverse. Un modello mixture-of-experts attiva solo una parte dei parametri per token, ma gli altri pesi richiedono comunque spazio. L’offload cambia posizione e latenza, non elimina i pesi.

Partire dai file pubblicati

La dimensione del download offre un punto di partenza più concreto del numero di parametri. Le build Qwen e GLM pubblicate da Unsloth mostrano quanto cambia lo spazio richiesto con la quantizzazione scelta.

Build quantizzataDimensione pubblicata, GB decimaliGiB approssimativi
Qwen3.8 27B Q4_016.115.0
Qwen3.8 27B Q8_029.027.0
GLM-5.3 UD-Q4_K_XL467434.9
GLM-5.3 UD-IQ2_M239222.6

Fonti dei file: Qwen Q4_0 , Qwen Q8_0 , frammenti GLM UD-Q4_K_XL e frammenti GLM UD-IQ2_M . Valori arrotondati verificati il 6 ottobre 2026. Le conversioni GiB dividono i byte decimali per 2³⁰.

Queste sono dimensioni dei file dei pesi, non misure della memoria residente totale. Caricamento, cache, buffer temporanei e componenti aggiuntivi del modello influenzano il processo in esecuzione. Non confrontare un download da 29 GB con un’allocazione da 30 GiB senza convertire le unità.

Il contesto cambia la compatibilità

La cache di attenzione di Qwen offre un esempio calcolato. La configurazione pubblicata specifica 64 livelli, attenzione completa ogni quattro livelli, quattro teste key-value e dimensione della testa pari a 256.

Full-attention KV bytes per token:
16 layers × 4 KV heads × 256 dimensions × 2 (K and V) × 2 bytes
= 65,536 bytes

8,192 tokens  = 0.5 GiB
32,768 tokens = 2.0 GiB

Questo componente di cache calcolato presume chiavi e valori a 16 bit per una sequenza. Esclude stato dell’attenzione lineare, buffer del runtime, overhead dell’allocatore e componenti opzionali di visione o speculative decoding. Serve spazio anche per queste allocazioni.

Per un budget indicativo, aggiungi 3–5 GiB per le allocazioni restanti alle dimensioni arrotondate dei pesi. Questa tolleranza è un’ipotesi da sostituire con misure del runtime scelto.

Build e contestoIntervallo di pianificazione calcolato
Qwen Q4_0, 8K18.5–20.5 GiB
Qwen Q8_0, 8K30.5–32.5 GiB
Qwen Q8_0, 32K32.0–34.0 GiB

Un’allocazione utilizzabile da 30 GiB lascia spazio all’esempio Q4, mentre gli scenari Q8 la superano secondo queste ipotesi. Una riserva misurata più piccola cambia il limite. Un prompt breve riuscito non dimostra capacità sufficiente per una lunga sessione di programmazione.

Le richieste simultanee aggiungono un’altra dimensione. Ollama documenta la crescita della memoria del contesto con richieste parallele e controlli separati per la precisione della cache. La cache Q8 usa circa metà della memoria della cache F16, mentre Q4 usa circa un quarto, con compromessi di qualità dipendenti dal modello. Consulta le FAQ del runtime Ollama .

Adattare l’hardware all’allocazione

Una RTX 5090 offre 32 GB di memoria grafica dedicata. Un DGX Spark con 128 GB usa memoria condivisa. Artificial Analysis documenta entrambe le configurazioni nei risultati hardware. Più capacità permette allocazioni maggiori, ma non dimostra la velocità di servizio.

Scenario hardwareImplicazione pratica
RTX 5090, 32 GBQwen Q4 lascia più margine di contesto rispetto a Q8
DGX Spark, 128 GBSpazio per entrambe le build Qwen, con overhead del runtime necessario
Mac Studio, 256 GBI set di pesi maggiori sono candidati, secondo runtime e limiti di allocazione

GLM UD-Q4_K_XL supera tutte e tre le capacità prima della cache. Anche il set di pesi IQ2 da circa 222,6 GiB supera un sistema da 128 GB. Su un Mac da 256 GB, la fattibilità dipende dall’allocazione realmente accessibile alla GPU e dall’overhead restante. Le specifiche Apple definiscono opzioni hardware, non un’allocazione di inferenza garantita.

Un budget utilizzabile ipotetico di 240 GiB lascia circa 17,4 GiB dopo quei pesi IQ2. Un budget da 192 GiB fallisce con i soli pesi. Nessuno dei due budget dimostra un valore predefinito del sistema operativo, supporto a cache compressa, throughput utile o qualità IQ2 accettabile. Richiedi una configurazione del runtime dimostrata prima di acquistare hardware per questo carico.

La velocità è un risultato separato

Il benchmark di inferenza locale di Artificial Analysis riproduce un carico registrato di 168 turni del modello. I suoi risultati per laptop e workstation elencano i seguenti tempi per le configurazioni Qwen3.8 27B testate.

SistemaTempo di riproduzione del servizio
DGX Spark, 128 GB24.2 minuti
RTX 50904.9 minuti
Mac Studio, 256 GBNessun risultato in questo confronto

Il risultato RTX richiede circa un quinto del tempo dello Spark. Le configurazioni di servizio contano, quindi questo non è un rapporto hardware universale. Le build testate differiscono anche dagli esempi di pianificazione GGUF precedenti.

Il tempo di riproduzione esclude l’esecuzione degli strumenti e impone lunghezze di risposta registrate. Non valuta se le risposte risolvono l’attività originale. Una misura su MacBook non dimostra le prestazioni del Mac Studio.

Dare feedback all’agente

Un sistema di esecuzione per agenti fornisce strumenti, contesto, ciclo d’azione e verifica. Il modello scrive o sceglie le azioni dentro questo sistema. Per un export CSV, le capacità utili includono leggere i file del progetto, modificare il codice, eseguire test e ricevere gli errori risultanti.

Considera un’attività di export indicativa, non un esperimento misurato. L’agente scrive una funzione di download, ma l’output usa un formato data errato. Una revisione visiva non vede il problema. Un test apre il file esportato e confronta le date con il formato richiesto. L’agente riceve l’errore, cambia il formatter e ripete il controllo.

Componente mancanteErrore probabile
Contesto pertinenteModifica un file non correlato
Strumenti di esecuzioneDescrive una correzione senza applicarla
Passo di verificaSi ferma dopo codice plausibile
Feedback degli erroriRipete un approccio fallito

LangChain riporta un passaggio dal 52,8% al 66,5% su Terminal Bench 2.0 mantenendo fisso GPT-5.2-Codex. Il suo rapporto sull’ingegneria degli agenti descrive indicazioni di verifica, contesto dell’ambiente, rilevamento di modifiche ripetute e cambiamenti al budget di ragionamento.

Abbinare i controlli al lavoro

Un controllo superato dimostra solo ciò che copre. Un test CSV che valida i nomi delle colonne lascia non verificati formato delle date, virgolette, Unicode e controllo degli accessi. Definisci il risultato richiesto prima di scegliere la verifica.

AttivitàProva utile di completamento
Modifica del codiceTest pertinenti più ispezione del comportamento risultante
Risposta di ricercaFonti recuperate che sostengono le singole affermazioni
Prenotazione o rimborsoStato salvato corretto e conformità alla politica applicabile
Export di un documentoOutput analizzato che corrisponde a campi e formati richiesti

Lo studio τ-bench valuta agenti che interagiscono con strumenti, utenti e regole di dominio. Il suo articolo di ricerca confronta lo stato finale del database con i risultati attesi. Questo mostra perché un testo di conferma fluido non basta a verificare una transazione.

Locale non significa offline

L’inferenza locale stabilisce dove gira il modello. L’applicazione circostante stabilisce ancora dove viaggiano documenti, query di ricerca, tracce e risultati degli strumenti. Un modello locale di programmazione collegato a ricerca remota o strumenti cloud resta un sistema in rete.

Ollama dichiara di non ricevere prompt o risposte per l’esecuzione locale e documenta come disattivare le funzioni cloud. Questa è una dichiarazione specifica del runtime, non una garanzia di privacy per ogni agente collegato. Verifica endpoint del modello e ogni integrazione nella documentazione del runtime .

Percorso datiCosa controllare
Endpoint di inferenzaProcesso locale, server remoto o fallback automatico
Ricerca e recuperoQuery e frammenti di documenti inviati all’esterno
Connessioni agli strumentiFile e record esposti a ogni servizio
Log e traccePosizione, contenuto conservato e accesso

Un flusso ibrido richiede una regola esplicita per il trasferimento. Per esempio, mantieni locale l’estrazione di documenti privati e invia per l’analisi ospitata solo risultati aggregati approvati. Esamina il materiale in uscita. Un riepilogo contiene ancora dati sensibili se conserva nomi, dettagli dei clienti o risultati riservati.

Testare prima di acquistare

Scegli un’attività ripetuta con una condizione di fine chiara. Confronta la configurazione locale con il prodotto ospitato che usi, inclusi i suoi strumenti. Fornisci a entrambi gli stessi input e criteri di accettazione, poi ripeti l’attività con esempi rappresentativi.

  1. Registra la configurazione: file esatto del modello, quantizzazione, versione backend, limite del contesto e impostazione di ragionamento.
  2. Definisci il successo: artefatto atteso, comportamento richiesto ed effetti collaterali vietati.
  3. Misura il completamento: tempo trascorso, controlli superati, tentativi falliti e riparazioni manuali.
  4. Includi il costo di proprietà: hardware, elettricità, tariffe API, manutenzione e tempo personale.
  5. Classifica i fallimenti: errori di ragionamento, limiti di memoria, latenza, contesto mancante o verifica mancante.

L’inferenza locale è adatta alle attività in cui qualità e latenza valutate soddisfano i requisiti. Un modello ospitato resta utile quando capacità aggiuntiva riduce errori o lavoro di revisione. Un flusso ibrido assegna attività diverse a ciascun sistema dopo aver definito quali dati possono uscire dalla macchina.

Calcolare il costo per risultato accettato

Il tempo di riparazione umano spesso cambia l’economia. Una risposta locale rapida che richiede dieci minuti di correzione consuma più tempo di lavoro di una risposta più lenta che supera la revisione. Conta i risultati accettati insieme alla spesa d’inferenza.

Cost per accepted task =
(hardware allocation + electricity + service fees + maintenance + review time)
÷ accepted tasks

Costo di revisione indicativo: con una tariffa ipotetica di 30 $ l’ora, otto minuti di correzione costano 4 $ per attività. Cento attività simili consumano 400 $ di tempo di revisione. Sono esempi aritmetici, non tassi di errore misurati dei modelli locali.

Confronta risultati equivalenti. Includi i tentativi rifiutati nel tempo e nel costo. Per hardware di proprietà, distribuisci il prezzo d’acquisto su un periodo e un volume di attività realistici. Per un servizio ospitato, includi abbonamento o API applicabili e il lavoro di revisione ancora necessario.

Per i dettagli hardware, continua con la guida a modello locale, GPU e contesto . Per capacità e prezzi, leggi il confronto della memoria DGX Spark . Usa i risultati delle tue attività per scegliere la configurazione minima che soddisfa requisiti di qualità, velocità e dati.

Video di riferimento

Riferimenti