AI & Infrastruttura

Un'AI da 27 miliardi di parametri in azienda, senza cloud

Frederico Mafli 22 agosto 2026 2 min

In FremaTech volevamo rispondere a una domanda concreta: si puo' far girare un modello di intelligenza artificiale serio, da 27 miliardi di parametri, direttamente in azienda, senza mandare un solo dato nel cloud? La risposta e' si, e lo abbiamo fatto unendo due normali PC con schede video diverse.

Il problema

I modelli davvero capaci non entrano nella memoria di una sola scheda video di fascia consumer. La via comoda e' il cloud, ma il cloud significa due cose che a molte aziende non vanno bene: i dati escono di casa, e si paga a consumo per sempre. Comprare una scheda professionale da decine di migliaia di franchi non e' un'alternativa realistica per una PMI.

La soluzione: due GPU in rete

Usiamo una funzione poco conosciuta di llama.cpp che distribuisce un singolo modello su piu' computer collegati in rete locale. La scheda video del PC principale tiene la maggior parte del modello, e una seconda scheda, anche di un vecchio PC, aggiunge la memoria mancante attraverso il cavo di rete. Il risultato sul nostro banco di prova: un modello da 27 miliardi di parametri che genera testo a circa 22 parole al secondo, con una finestra di contesto di 96.000 token, tutto su hardware che avevamo gia'.

Perche' conta per un'azienda

Tre motivi concreti.

  • Privacy assoluta: contratti, fatture, documenti e codice restano fisicamente in sede, non transitano da nessun server esterno.
  • Costo marginale zero: una volta acceso, il sistema non fattura per ogni domanda, a differenza degli abbonamenti cloud.
  • Know-how: chi controlla la propria infrastruttura AI puo' adattarla ai propri flussi invece di dipendere dalle scelte di un fornitore.

Open source

Abbiamo pubblicato tutto il codice, la guida e le misure come progetto open source su GitHub: https://github.com/FremaTech/llama-rpc-dual-gpu . E' pensato per chi vuole replicare l'esperimento, ma racconta anche il metodo con cui affrontiamo l'AI: soluzioni misurabili, riproducibili e sotto il tuo controllo. Se stai pensando a un assistente AI privato per la tua azienda, senza dati nel cloud, e' esattamente il tipo di progetto che realizziamo.

Altre lingue

Deutsch: /blog/geteilte-gpus-lokales-llm English: /blog/shared-gpus-local-llm

Vuoi sapere come sta il tuo sito?

Scrivi l'indirizzo e in mezzo minuto vedi cosa vede chi ti cerca: sicurezza, scadenze, telefono, aggiornamento. Gratis, senza registrazione.