Logo bettersorted
Scheda grafica in un computer – immagine simbolica per l'hardware AI
Consulenza IA

Di quale hardware ha bisogno una propria IA? Server GPU per le medie imprese

AutoreMuhamed Alahmed
Pubblicato il
Tempo di lettura6 min.
Brevemente spiegato

Per una propria IA è decisiva soprattutto la memoria grafica (VRAM). Come regola pratica, un modello ridotto a 4 bit richiede circa 0,6–0,7 GB di VRAM per ogni miliardo di parametri, più una riserva. I modelli piccoli funzionano su una singola scheda grafica, quelli grandi richiedono server GPU. Invece di acquistare, le PMI possono noleggiare server GPU in Germania.

Il più importante in breve

  • Ciò che conta è la memoria grafica (VRAM), non il processore.
  • Regola pratica: 0,6–0,7 GB di VRAM per miliardo di parametri (4 bit) più riserva.
  • Tre livelli: Test computer, un server GPU, più GPU o servizio modello.
  • Per molte PMI è Noleggiare in Germanial’ingresso migliore.

Se una propria IA viene eseguita in azienda, a decidere soprattutto è un valore: la memoria grafica (VRAM) della scheda grafica. Come regola generale, un modello linguistico ridotto a 4 bit richiede circa 0,6 fino a 0,7 GB di VRAM per miliardo di parametri – più una riserva per testi più lunghi e più utenti. I modelli piccoli e medi funzionano su una scheda grafica, quelli grandi richiedono server GPU. Invece di acquistare hardware, le PMI possono anche in data center tedeschi in affitto.

Perché proprio la scheda grafica?

I modelli linguistici calcolano con enormi tabelle di numeri. Le schede grafiche sono specializzate proprio in questo tipo di calcolo e sono molto più veloci dei normali processori. Affinché il modello risponda rapidamente, deve entrare completamente nella memoria della scheda grafica. Se la memoria non è sufficiente, diventa molto lento oppure non funziona affatto.

Tecnico al lavoro sull'hardware del server

Regole empiriche per il fabbisogno di memoria

I seguenti valori sono valori orientativi approssimativi per modelli con quantizzazione a 4 bit e un utente; a seconda del modello e delle impostazioni, possono variare:

  • Modelli piccoli (circa 8 miliardi di parametri): circa 6–8 GB di VRAM – adatto a molte schede grafiche attuali.
  • Modelli medi (circa 20–30 miliardi): circa 16–24 GB di VRAM – una singola scheda potente.
  • Modelli grandi (circa 70 miliardi): circa 40–48 GB di VRAM – scheda professionale o due schede.
  • Modelli molto grandi (100 miliardi e oltre): più schede professionali o server specializzati.

Si aggiunge inoltre memoria per il «contesto» – cioè i testi che il modello deve tenere in considerazione contemporaneamente – e per ulteriori utenti simultanei. Pianificate quindi sempre un margine di riserva.

Tre livelli tipici di ampliamento

Livello 1: Sperimentazione su hardware esistente

Un computer da postazione con una buona scheda grafica o un Mac recente con molta memoria condivisa è sufficiente per testare modelli piccoli con Ollama. Ideale per il pilot, non per l’uso in team.

Fase 2: Un server GPU per il team

Un server con una scheda grafica ad alte prestazioni esegue un modello di medie dimensioni per un piccolo team, ad esempio come assistente interno o per la ricerca nei documenti. I provider tedeschi noleggiano questo tipo di server; Hetzner, ad esempio, offre un server dedicato con una NVIDIA RTX 4000 SFF Ada con 20 GB di memoria grafica.

Fase 3: Più schede grafiche o un servizio di modelli

Per modelli di grandi dimensioni o molti utenti simultanei servono più schede professionali. In questi casi spesso conviene confrontare l’opzione con un servizio di modelli in Germania, in cui non gestite un server ma pagate solo l’utilizzo – vedi Ospitare modelli di IA in conformità al GDPR.

Acquistare o noleggiare?

  • Acquistare conviene in caso di utilizzo costantemente elevato, con una sala server disponibile e personale IT interno.
  • Noleggiare è flessibile, senza investimento iniziale, con alimentazione elettrica professionale, raffreddamento e connessione di rete – e può essere scalato verso l’alto o verso il basso, se necessario.
  • Elettricità e calore non dimenticare: i server GPU consumano molta più energia della normale tecnologia d’ufficio e necessitano di raffreddamento.
  • Ricambi e manutenzione: Se l’unica scheda grafica si guasta, l’IA si ferma. I server a noleggio vengono sostituiti dal fornitore.

Errori tipici

  • Memoria grafica insufficiente: Il modello non entra o funziona solo molto rallentato.
  • Pianificato solo per un utente: Più richieste simultanee richiedono riserve aggiuntive.
  • Modello troppo grande: Spesso un modello di dimensioni medie con una buona base di conoscenza tramite RAG è migliore di uno enorme senza.
  • Azienda sottovalutata: aggiornamenti, backup dei dati e monitoraggio richiedono tempo o un fornitore di servizi.

Per gli interessati alla tecnologia

  • Per il funzionamento multiutente sono adatti server di inferenza come vLLM, che aggregano le richieste e gestiscono la memoria in modo efficiente.
  • Con modelli MoE tutti i parametri devono essere caricati in memoria, anche se per ogni risposta ne viene elaborata solo una parte.
  • Le schede grafiche per data center offrono più memoria e correzione degli errori (ECC), ma sono nettamente più costose delle schede consumer.

bettersorted punta per i propri clienti su componenti aperti e trasparenti – gestito su server in Germania e riunito nel automaisa Hub. Forniamo consulenza in modo neutrale rispetto ai produttori, siamo consulenti registrati presso il BAFA e coach autorizzati INQA. La consulenza e l’introduzione accompagnata possono essere finanziate tramite il INQA-Coaching con un finanziamento dell’80%; il percorso adatto lo indica il Controllo degli incentivi. Per un primo colloquio senza impegno: Contatto.

Esempio: calcolo per un team di 15 persone

Uno scenario illustrativo: 15 dipendenti utilizzano un assistente IA interno, per lo più non contemporaneamente; i picchi arrivano a tre o quattro richieste in parallelo. È richiesto un modello di medie dimensioni (circa 30 miliardi di parametri, 4 bit). Come regola empirica servono circa 18–21 GB di memoria grafica per il modello, più una riserva per il contesto e le richieste parallele: una scheda da 24 GB è al limite, con 32–48 GB si è più comodi. In alternativa, si può combinare un modello leggermente più piccolo con una buona ricerca documentale, che gira su una scheda da 20 GB.

Domande al provider prima del noleggio

  1. Quale scheda grafica, quanta memoria grafica, quanta memoria RAM?
  2. Ubicazione del data center e contratto di nomina a responsabile del trattamento?
  3. Con quale rapidità viene sostituito l’hardware difettoso?
  4. Sono previsti impegni di disponibilità e backup dei dati?
  5. Il server può essere ampliato in seguito o se ne può aggiungere un secondo?

Energia e sostenibilità

Sotto carico, i server GPU consumano molte volte più di un PC da ufficio. Un modello di dimensioni medie, che svolga il compito richiesto, non è solo più economico, ma anche più efficiente di uno molto grande. I data center con energia rinnovabile e raffreddamento efficiente sono un ulteriore criterio di selezione.

Costi e finanziamenti

I costi per un’infrastruttura IA propria si compongono di tre parti: Configurazione (pianificazione, installazione, integrazione, test), esercizio continuativo (server o hosting, aggiornamenti, monitoraggio, backup dei dati) e accompagnamento dei collaboratori (formazione, regole, referenti). Non indichiamo prezzi fissi, perché l’entità e la situazione di partenza variano molto. Il software stesso, nelle soluzioni open source, non comporta costi di licenza.

Non viene finanziata la tecnologia, bensì la Consulenza e introduzione accompagnata: Tramite il INQA-Coaching lo Stato copre a livello nazionale l’80 % dei costi di coaching (fino a 11.520 €, voucher fino al 30.06.2028). Un’analisi preliminare può essere sovvenzionata tramite il BAFA-Beratungsförderung – con l’80 % nei nuovi Länder, a Lüneburg e Treviri, altrimenti il 50 %, per domande fino al 31.12.2026. Per gli investimenti, alcuni Länder offrono programmi propri – vedi Possibilità di finanziamento per le aziende in Germania.

Domande frequenti

Quanta memoria grafica serve per una propria IA?

Come regola generale, circa 0,6–0,7 GB per miliardo di parametri con quantizzazione a 4 bit, più una riserva. Un modello con circa 8 miliardi di parametri richiede quindi circa 6–8 GB, uno con 70 miliardi circa 40–48 GB.

È sufficiente un normale PC da ufficio per l’IA?

Per i modelli piccoli da provare, a volte sì. Per l’utilizzo in team serve un computer o server con una scheda grafica potente.

Una PMI dovrebbe acquistare o noleggiare un server GPU?

Per la maggior parte delle PMI, il noleggio in un data center tedesco è il miglior punto di partenza: nessun investimento iniziale, gestione professionale e adattamento flessibile. L’acquisto conviene soprattutto in caso di utilizzo costantemente elevato e di un reparto IT interno.

L’IA può funzionare anche senza scheda grafica?

I modelli piccoli funzionano anche sul processore, ma in modo decisamente più lento. Per l’uso quotidiano in team, una scheda grafica è di fatto un requisito.

Aggiornamento: ottobre 2026.

Ritratto di Muhamed Alahmed, fondatore di bettersorted
Sull'autore

Muhamed Alahmed

Con oltre 10 anni di esperienza nell’IT, sviluppo soluzioni che non solo funzionano dal punto di vista tecnico, ma creano anche un valore aggiunto concreto e aprono nuovi spazi di manovra.

Più su bettersorted →

Altri articoli

Newsletter

Rimanete aggiornati sui temi dell'IA

Aggiornamenti brevi su automazione IA, finanziamenti e nuovi articoli — niente spam, disiscrivibile in qualsiasi momento.

Utilizziamo Brevo come piattaforma di marketing. Inviando il modulo, accetti che i tuoi dati vengano trasferiti secondo la informativa sulla privacy di Brevo .

ChiamareScrivereModulo di contatto