Qualsiasi Mac con Apple Silicon e almeno 16 GB di RAM esegue un modello AI in locale in meno di dieci minuti, completamente gratis, senza account e senza inviare alcun dato. Questa guida è il percorso di configurazione: quale strumento installare, quale modello scaricare, i comandi esatti da digitare e le prestazioni da aspettarsi sul proprio chip. È aggiornata alla generazione M5: a inizio settembre 2026 sono già in vendita il MacBook Air M5 e i MacBook Pro M5, M5 Pro e M5 Max, mentre Apple ha appena rinnovato anche Mac mini, ora disponibile con chip M6 o M5 Pro, e Mac Studio, con chip M5 Max e M5 Ultra: l'annuncio è del 25 agosto 2026, le consegne partono dal 22 settembre e la configurazione top di gamma del Mac Studio da 512 GB arriva a fine ottobre. Nulla di tutto questo cambia la procedura di installazione. È sempre la memoria unificata, non la generazione del chip, a decidere quali modelli può eseguire.
Se pensa di comprare ricondizionato invece che nuovo, i tempi contano. Secondo il monitoraggio di RefurbMe, in Italia un Mac mini ricondizionato compare sul mercato dopo una mediana di 349 giorni dal lancio Apple (dato di luglio 2026), e su tutta la storia della gamma Mac mini seguita da RefurbMe lo sconto mediano è del 74 % rispetto al prezzo Apple originale. Questa seconda cifra copre anche i modelli più vecchi: è un riferimento di famiglia, non lo sconto sull'ultimo modello uscito. Entrambi i dati vengono dalla pagina statistiche Mac mini di RefurbMe.
Se non ha ancora comprato un Mac, o si chiede se quello che ha già abbia abbastanza RAM, parta dalla nostra guida al miglior Mac per l'AI nel 2026. Copre le fasce hardware, i prezzi dei ricondizionati e quanta RAM serve davvero prima di spendere.
Per tutti gli altri: questo articolo presuppone che abbia già un Mac con Apple Silicon e voglia far girare un modello oggi stesso.
Perché eseguire l'AI in locale sul Mac
Eseguire l'AI in locale offre qualcosa che nessun servizio cloud può garantire: il controllo completo. I suoi dati non lasciano mai il dispositivo, nessun prompt viene salvato su un server di terze parti e nessuno può leggere le sue conversazioni.
Privacy a livello hardware. Ogni query inviata a ChatGPT o a Claude viaggia verso un data center, viene registrata e può essere usata per l'addestramento. L'AI in locale tiene tutto sul suo Mac. Per chi lavora con dati sensibili di clienti, documenti legali, cartelle cliniche o progetti personali, questa differenza conta moltissimo. È direttamente rilevante anche per la conformità al GDPR.
Nessuna dipendenza da internet. Dopo lo scaricamento iniziale del modello, tutto funziona completamente offline. Può lavorare in aereo, in un luogo remoto o durante un'interruzione di rete senza alcuna interruzione del servizio.
Nessun limite d'uso. I servizi cloud rallentano gli utenti più intensivi. L'AI in locale Le permette di eseguire migliaia di query al giorno, generare documenti lunghi o inserire l'inferenza in un ciclo di codice senza mai sbattere contro un tetto.
Velocità competitiva sui prompt brevi. L'inferenza locale su un chip Apple Silicon moderno, come un M4 Pro o il più recente M5 Pro, genera risposte in millisecondi sui prompt più corti, eliminando la latenza di andata e ritorno in rete che le API cloud aggiungono.
Cosa serve prima di iniziare
Una breve lista di controllo prima di partire:
- Un Mac con Apple Silicon. M1 o successivo. I Mac Intel possono tecnicamente eseguire l'AI in locale tramite llama.cpp, ma senza memoria unificata e accelerazione GPU le prestazioni sono scarse. L'AI in locale davvero praticabile comincia con l'M1.
- Almeno 16 GB di RAM. I Mac da 8 GB eseguono modelli minuscoli da 3B ma non riescono a fare nulla di davvero utile. 16 GB è il minimo pratico per modelli da 7B-8B. Da 24 a 48 GB si sbloccano i modelli da 14B-32B, vicini alla qualità di GPT-4. Come riferimento, l'attuale MacBook Air M5 arriva fino a 32 GB, un MacBook Pro M5 Max raggiunge i 128 GB, e l'attuale Mac Studio con chip M5 Ultra sale fino a 512 GB di memoria unificata (la configurazione da 512 GB comincia a essere consegnata a fine ottobre 2026): il tetto dei modelli eseguibili scala con la macchina scelta.
- Circa 10-50 GB di spazio libero su disco. I file dei modelli vanno da 2 GB (un modello da 3B) a 45 GB (un modello da 70B a quantizzazione Q4).
- macOS Sonoma o successivo. Le versioni precedenti di macOS funzionano ma non hanno alcune ottimizzazioni Metal.
Deve aggiornare o comprare un Mac prima? Consulti miglior Mac per l'AI nel 2026 per i prezzi dei ricondizionati e i chip consigliati.
Requisiti di RAM in base alla dimensione del modello
Il file del modello deve stare nella memoria unificata insieme a macOS, alla cache KV (la memoria della finestra di contesto) e a qualunque altra app in esecuzione. Una regola pratica: il file del modello non dovrebbe superare il 60-70 % della RAM totale.
| Dimensione modello | RAM necessaria | Modelli di esempio | Livello di capacità |
|---|---|---|---|
| 3B-4B | 8 GB minimo | Llama 3.2 3B, Phi-4 Mini, Gemma 3 4B | Domande e risposte di base, riassunti |
| 7B-8B | 16 GB minimo | Qwen 3 8B, Llama 3.1 8B, Mistral 7B | Chat generica, aiuto nel codice, scrittura |
| 12B-14B | 24 GB minimo | Qwen 3 14B, DeepSeek-R1-Distill-14B | Ragionamento solido, scrittura professionale |
| 30B-32B | 36-48 GB | Qwen 3 32B, DeepSeek-R1-Distill-32B | Qualità vicina a GPT-4 per la maggior parte dei compiti |
| 70B | 64-96 GB | Llama 3.3 70B, Qwen 2.5 72B | Livello frontiera, rivaleggia con i modelli cloud |
| 200B+ | 128 GB+ | Qwen3 235B-A22B, DeepSeek V3 (quantizzato) | Massima capacità, livello ricerca |
Una nota sulla quantizzazione: i modelli sono distribuiti in diversi formati di precisione. Q4_K_M è lo standard per l'uso in locale. Riduce un modello da 70B da circa 140 GB (float32 completo) a 40-45 GB, mantenendo gran parte della qualità. Q8 è di qualità superiore ma quasi il doppio della dimensione. Q3 e formati inferiori mostrano un calo di qualità evidente sui compiti di ragionamento complesso.
Il punto pratico: 16 GB è il minimo per un'AI davvero utile. Da 24 a 48 GB si aprono i modelli vicini alla qualità di GPT-4. Da 64 GB in su può eseguire modelli di livello frontiera completamente offline.
I 4 migliori strumenti per eseguire l'AI su Mac
Quattro strumenti dominano la scena dell'AI in locale su Mac. Sono tutti gratuiti. La scelta dipende dal suo modo di lavorare.
Ollama
Ollama è lo strumento di riferimento per chi sviluppa. Funziona come servizio in background ed espone un'API compatibile con OpenAI, quindi può puntare qualsiasi app o script che usa l'SDK OpenAI direttamente sulla sua macchina. L'installazione richiede un solo comando da terminale. Anche lo scaricamento dei modelli è altrettanto semplice: ollama pull qwen3:8b recupera e salva il modello in automatico.
Ollama usa circa 100 MB di RAM di overhead, supporta decine di modelli dalla sua libreria su ollama.com ed è concesso in licenza MIT. È indicato per chi sviluppa e vuole integrare l'AI in locale nelle applicazioni, eseguire l'AI come servizio di backend o automatizzare flussi di lavoro da terminale.
LM Studio
LM Studio è l'opzione più amichevole per chi vuole un'esperienza visiva simile a ChatGPT. È un'app nativa per macOS con model browser, gestore degli scaricamenti e interfaccia di chat completa. Non serve toccare il terminale.
LM Studio supporta sia i modelli GGUF (con llama.cpp sotto il cofano) sia i modelli in formato MLX. I modelli MLX via LM Studio sono più efficienti in memoria e in genere il 20-30 % più veloci su Apple Silicon rispetto alla controparte GGUF. L'app usa circa 500 MB di RAM di overhead ed è gratuita per uso personale. È indicata per chi scrive, per ricercatori, per utenti non tecnici e per chiunque cerchi un sostituto privato di ChatGPT.
MLX (il framework di Apple)
MLX è il framework open source di apprendimento automatico di Apple, costruito appositamente per Apple Silicon. Espone API in Python, Swift, C++ e C e offre l'inferenza più veloce disponibile su hardware Mac. MLX può anche affinare (fine-tuning) i modelli in locale, cosa che nessun altro strumento di questo elenco supporta senza configurazioni aggiuntive.
Il compromesso è una curva di apprendimento più ripida: si lavora direttamente in Python o Swift invece che tramite un'interfaccia grafica. MLX è indicato per ingegneri di machine learning, ricercatori che cercano le massime prestazioni e sviluppatori che costruiscono applicazioni AI native per le piattaforme Apple.
llama.cpp
llama.cpp è il motore di inferenza di base su cui si appoggia Ollama. Offre il controllo massimo su ogni parametro di inferenza: lunghezza del contesto, temperatura, penalità di ripetizione, dimensione del batch e altro. Usare llama.cpp direttamente è indicato per utenti esperti che vogliono regolare ogni aspetto del comportamento del modello e sono a proprio agio con un flusso di lavoro da riga di comando.
Guida rapida alla scelta: se scrive codice, parta da Ollama. Se vuole un'app di chat visiva, parta da LM Studio. Se le serve la massima velocità e lavora in Python, usi MLX direttamente.
Avvio rapido: il primo modello locale in 5 minuti
La strada più veloce per eseguire l'AI in locale su Mac è Ollama. Da zero a modello in funzione in meno di cinque minuti.
Passo 1: installi Ollama. Visiti ollama.com e scarichi l'app per macOS. La trascini nella cartella Applicazioni e la apra. Ollama funziona come servizio nella barra dei menu.
Passo 2: apra il Terminale ed esegua il primo modello. Prema Cmd + Spazio, digiti «Terminale» e prema Invio. Digiti poi uno di questi comandi in base alla RAM disponibile:
- Mac da 8 GB:
ollama run llama3.2:3b - Mac da 16 GB:
ollama run qwen3:8b - Mac da 24 GB:
ollama run qwen3:14b - Mac da 48 GB o più:
ollama run qwen3:32b
Ollama scarica il modello in automatico (di norma 2-20 GB a seconda della dimensione) e la porta direttamente in una sessione di chat interattiva. Nessun account richiesto. Nessun dato inviato altrove.
Passo 3: inizi a chattare. Digiti il suo prompt e prema Invio. La prima risposta richiede qualche secondo mentre il modello si carica in memoria. Le risposte successive partono subito.
Preferisce un'interfaccia visiva? Usi LM Studio. Nessun terminale richiesto:
- Scarichi LM Studio da lmstudio.ai e lo apra.
- Clicchi sulla scheda Search, trovi un modello (Qwen 3 8B è un buon punto di partenza) e clicchi su Download.
- Una volta scaricato, clicchi su Chat nella barra laterale, selezioni il modello e cominci a scrivere.
Entrambi gli strumenti sono completamente gratuiti. Nessun abbonamento, nessun account, nessun dato trasmesso a server esterni.
Benchmark delle prestazioni: cosa aspettarsi
Le velocità reali di generazione dei token variano in base a configurazione, modello e backend. Ecco cosa mostrano in modo costante i test della community:
| Configurazione | Modello | Backend | Velocità (token/s) |
|---|---|---|---|
| M4 base 16 GB | Llama 3.2 3B Q4 | Ollama | 40-55 |
| M3 Pro 36 GB | Llama 3.1 8B Q4 | Ollama | 25-35 |
| M4 Pro 48 GB | Qwen 3 32B Q4 | MLX | 12-22 |
| M4 Max 64 GB | Qwen 3 8B Q4 | MLX | 95-110 |
| M4 Max 64 GB | Llama 3.3 70B Q4 | Ollama | 8-15 |
| M3 Max 96 GB | Llama 3 70B Q4 | Ollama | 10-15 |
| M2 Ultra 192 GB | Qwen3 235B Q4 | MLX | circa 30 |
Per contestualizzare questi numeri: 15-20 token al secondo corrispondono a una velocità di lettura comoda per la maggior parte delle persone. Oltre 10 token al secondo è pienamente utilizzabile per una chat interattiva. Sotto i 5 token al secondo si sente lento in una conversazione a botta e risposta, anche se può restare pratico per riassunti in batch o compiti singoli.
Il backend MLX è costantemente il 20-30 % più veloce del backend llama.cpp di Ollama sullo stesso hardware. Se la velocità pura conta, usi modelli in formato MLX in LM Studio o tramite la libreria Python MLX.
Una sfumatura importante: la banda di memoria conta più della generazione del chip per la velocità di inferenza. La generazione dei token richiede di far scorrere continuamente i pesi del modello attraverso le unità di calcolo. Un M3 Max con 400 GB/s di banda genera token più velocemente di un M4 base con 120 GB/s per lo stesso modello, anche se l'M4 ha un Neural Engine più recente. La stessa logica vale per la generazione M5: un chip M5 base è veloce, ma sono i livelli Pro e Max, con banda molto più alta e pool di memoria più grandi, a fare davvero la differenza sui modelli grandi. Per il quadro completo della banda per ogni chip, veda la nostra guida al miglior Mac per l'AI.
I migliori modelli AI da eseguire in locale nel 2026
Non tutti i modelli open source sono uguali. Ecco le opzioni migliori per caso d'uso, testate e classificate dalla community a inizio 2026:
| Caso d'uso | Modello consigliato | RAM minima | Perché |
|---|---|---|---|
| Chat generica | Qwen 3 8B Q4 | 16 GB | Il migliore tuttofare in questa fascia |
| Assistente di programmazione | Qwen 2.5 Coder 32B Q4 | 48 GB | Punteggi più alti nei benchmark di coding |
| Ragionamento e matematica | DeepSeek-R1-Distill-14B Q4 | 24 GB | Specialista nel ragionamento a catena |
| Scrittura creativa | Llama 3.3 70B Q4 | 96 GB | Ottima narrazione su testi lunghi |
| Lavori con dati sensibili | Qualsiasi modello locale | 16 GB+ | Zero trasmissione verso il cloud |
| Multilingue | Qwen 3 (qualsiasi dimensione) | 16 GB+ | Supporta nativamente 29 o più lingue |
I modelli sono ospitati su Hugging Face e disponibili direttamente nella libreria di Ollama e nel model browser di LM Studio. Non serve visitare Hugging Face, a meno che non cerchi varianti specializzate o rifinite (fine-tuned).
Un buon punto di partenza per la maggior parte degli utenti: Qwen 3 8B copre chat generica, aiuto leggero nel codice, riassunti e assistenza alla scrittura in un unico scaricamento da 5 GB che gira bene su qualsiasi Mac con 16 GB di memoria unificata.
Il panorama dei modelli open continua a muoversi in fretta, e nuove versioni di queste stesse famiglie arrivano di continuo. I consigli qui sopra sono le scelte comprovate e ampiamente testate. Quando apre la libreria di Ollama o il model browser di LM Studio, troverà versioni più recenti accanto a queste. Il metodo di selezione non cambia: faccia corrispondere il file del modello a circa il 60-70 % della memoria unificata, preferisca la quantizzazione Q4_K_M e scelga il modello di qualità più alta che ci sta.
Risoluzione dei problemi più comuni
Il modello si carica ma genera testo senza senso. Probabilmente sta usando una quantizzazione Q3 o inferiore su un modello che richiede almeno Q4 per mantenere la qualità. Riscarichi il modello in Q4_K_M: in Ollama, ollama pull qwen3:8b-q4_K_M. In LM Studio, filtri la ricerca dei modelli su Q4_K_M.
L'inferenza è estremamente lenta. Apra Monitoraggio Attività e controlli la scheda GPU. Se l'uso della GPU è a zero, il modello sta girando sulla CPU. In LM Studio, apra le impostazioni e attivi Metal/MLX. In Ollama, verifichi di avere l'ultima versione: brew upgrade ollama oppure scarichi l'ultimo installer da ollama.com.
Errori di memoria esaurita. Il modello è troppo grande per la sua RAM. Passi a un modello più piccolo (qwen3:8b invece di qwen3:14b) o a una quantizzazione inferiore (Q4 invece di Q8). Chiuda le altre app prima di caricare il modello.
La prima risposta è lenta ma le successive sono veloci. È normale. Il modello impiega qualche secondo a caricarsi in memoria unificata al primo prompt. Dopodiché le risposte partono subito. macOS può liberare la memoria del modello dopo un periodo di inattività, facendo ripartire un altro primo prompt lento.
Il processo di Ollama non si chiude. Lo chiuda dall'icona nella barra dei menu. Se non funziona, digiti pkill ollama nel Terminale.
Ha già un Mac? Ne vuole uno più potente?
Se il suo Mac attuale è limitato dalla RAM e non riesce a eseguire la dimensione di modello di cui ha davvero bisogno, di norma conviene fare l'upgrade. La RAM di Apple Silicon è saldata, quindi l'unico modo per aggiungere memoria è comprare un Mac nuovo, o ricondizionato.
Il ricondizionato è la scelta più sensata perché il chip e la banda di memoria non invecchiano. Un MacBook Pro ricondizionato con M4 Pro o M5 Pro e 48 GB esegue i modelli esattamente come uno nuovo, spesso con uno sconto del 30-40 % sul prezzo di listino. RefurbMe confronta le offerte dei venditori affidabili in un unico posto: in Italia Certideal è spesso tra le fonti più convenienti per i Mac con Apple Silicon, insieme a Back Market, Amazon Renewed, eBay Refurbished e al programma di ricondizionati certificati dell'Apple Store. Consulti la nostra guida al miglior Mac per l'AI per i prezzi aggiornati dei ricondizionati su Mac mini, MacBook Pro e Mac Studio. Se ha già scelto un desktop compatto, la nostra guida su come scegliere un Mac mini ricondizionato analizza ogni modello in base al rapporto qualità-prezzo.
Per saperne di più sulla durata e la convenienza del Mac nel tempo: quanto durano i MacBook, se i MacBook ricondizionati sono una buona scelta e il ruolo del ricondizionato nell'economia circolare.
Se ha ancora un vecchio Mac Intel e si chiede se l'upgrade valga la pena per i carichi di lavoro AI, la nostra guida su se i Mac Intel sono ormai superati analizza il divario di prestazioni nel dettaglio.
Domande frequenti
Ultimo aggiornamento: 1 set 2026 · Pubblicato il: 18 mag 2026






