bettersorted Logo
Grafikkarte in einem Computer – Symbolbild für KI-Hardware
KI Beratung

Welche Hardware braucht eine eigene KI? GPU-Server für den Mittelstand

AutorMuhamed Alahmed
Veröffentlicht am
Lesezeit5 Min.
Kurz erklärt

Für eine eigene KI ist vor allem der Grafikspeicher (VRAM) entscheidend. Als Faustregel braucht ein auf 4 Bit verkleinertes Modell etwa 0,6 bis 0,7 GB VRAM pro Milliarde Parameter plus Reserve. Kleine Modelle laufen auf einer einzelnen Grafikkarte, große brauchen GPU-Server. Statt zu kaufen, können KMU GPU-Server in Deutschland mieten.

Das Wichtigste in Kürze

  • Entscheidend ist der Grafikspeicher (VRAM), nicht der Prozessor.
  • Faustregel: 0,6–0,7 GB VRAM pro Milliarde Parameter (4 Bit) plus Reserve.
  • Drei Stufen: Testrechner, ein GPU-Server, mehrere GPUs oder Modell-Dienst.
  • Für viele KMU ist Mieten in Deutschland der bessere Einstieg.

Ob eine eigene KI im Unternehmen läuft, entscheidet vor allem ein Wert: der Grafikspeicher (VRAM) der Grafikkarte. Als Faustregel braucht ein auf 4 Bit verkleinertes Sprachmodell rund 0,6 bis 0,7 GB VRAM pro Milliarde Parameter – plus Reserve für längere Texte und mehrere Nutzer. Kleine und mittlere Modelle laufen auf einer Grafikkarte, große brauchen GPU-Server. Statt Hardware zu kaufen, können KMU GPU-Server auch in deutschen Rechenzentren mieten.

Warum ausgerechnet die Grafikkarte?

Sprachmodelle rechnen mit riesigen Zahlentabellen. Grafikkarten sind auf genau diese Art von Rechnung spezialisiert und viel schneller als normale Prozessoren. Damit das Modell zügig antwortet, muss es vollständig in den Speicher der Grafikkarte passen. Reicht der Speicher nicht, wird es entweder sehr langsam oder läuft gar nicht.

Techniker arbeitet an Server-Hardware

Faustregeln für den Speicherbedarf

Die folgenden Werte sind grobe Orientierungswerte für Modelle mit 4-Bit-Quantisierung und einen Nutzer; je nach Modell und Einstellungen weichen sie ab:

  • Kleine Modelle (um 8 Mrd. Parameter): etwa 6–8 GB VRAM – passt auf viele aktuelle Grafikkarten.
  • Mittlere Modelle (um 20–30 Mrd.): etwa 16–24 GB VRAM – eine leistungsfähige Einzelkarte.
  • Große Modelle (um 70 Mrd.): etwa 40–48 GB VRAM – Profikarte oder zwei Karten.
  • Sehr große Modelle (100 Mrd. und mehr): mehrere Profikarten oder spezialisierte Server.

Hinzu kommt Speicher für den „Kontext“ – also die Texte, die das Modell gleichzeitig im Blick haben soll – und für weitere gleichzeitige Nutzer. Planen Sie deshalb immer Reserve ein.

Drei typische Ausbaustufen

Stufe 1: Ausprobieren auf vorhandener Hardware

Ein Arbeitsplatzrechner mit guter Grafikkarte oder ein aktueller Mac mit viel gemeinsamem Arbeitsspeicher reicht, um kleine Modelle mit Ollama zu testen. Ideal für den Pilot, nicht für den Betrieb im Team.

Stufe 2: Ein GPU-Server für das Team

Ein Server mit einer leistungsfähigen Grafikkarte betreibt ein mittelgroßes Modell für ein kleines Team – etwa als interner Assistent oder für die Dokumentensuche. Deutsche Anbieter vermieten solche Server; Hetzner bietet zum Beispiel einen dedizierten Server mit einer NVIDIA RTX 4000 SFF Ada mit 20 GB Grafikspeicher.

Stufe 3: Mehrere Grafikkarten oder ein Modell-Dienst

Für große Modelle oder viele gleichzeitige Nutzer braucht es mehrere Profikarten. Hier lohnt oft der Vergleich mit einem Modell-Dienst in Deutschland, bei dem Sie keinen Server betreiben, sondern nur die Nutzung bezahlen – siehe KI-Modelle DSGVO-konform hosten.

Kaufen oder mieten?

  • Kaufen lohnt sich bei dauerhaft hoher Auslastung, vorhandenem Serverraum und eigenem IT-Personal.
  • Mieten ist flexibel, ohne Anfangsinvestition, mit professioneller Stromversorgung, Kühlung und Netzanbindung – und lässt sich bei Bedarf hoch- oder herunterskalieren.
  • Strom und Wärme nicht vergessen: GPU-Server verbrauchen deutlich mehr Energie als normale Bürotechnik und brauchen Kühlung.
  • Ersatz und Wartung: Fällt die einzige Grafikkarte aus, steht die KI. Mietserver werden vom Anbieter getauscht.

Typische Fehler

  • Zu wenig Grafikspeicher: Das Modell passt nicht oder läuft nur stark verlangsamt.
  • Nur für einen Nutzer geplant: Mehrere gleichzeitige Anfragen brauchen zusätzliche Reserve.
  • Zu großes Modell: Oft reicht ein mittleres Modell mit guter Wissensbasis per RAG besser als ein riesiges ohne.
  • Betrieb unterschätzt: Updates, Datensicherung und Überwachung brauchen Zeit oder einen Dienstleister.

Für Technik-Interessierte

  • Für den Mehrbenutzerbetrieb eignen sich Inferenz-Server wie vLLM, die Anfragen bündeln und den Speicher effizient verwalten.
  • Bei MoE-Modellen müssen alle Parameter in den Speicher, auch wenn pro Antwort nur ein Teil rechnet.
  • Rechenzentrums-Grafikkarten bieten mehr Speicher und Fehlerkorrektur (ECC), sind aber deutlich teurer als Endkundenkarten.

bettersorted setzt für seine Kundinnen und Kunden auf offene, einsehbare Bausteine – betrieben auf Servern in Deutschland und gebündelt im automaisa Hub. Wir beraten herstellerneutral, sind beim BAFA registrierter Berater und autorisierter INQA-Coach. Die Beratung und begleitete Einführung lassen sich über das INQA-Coaching mit 80 % fördern; den passenden Weg zeigt der Förder-Check. Für ein unverbindliches Erstgespräch: Kontakt.

Beispiel: Rechenweg für ein Team von 15 Personen

Ein illustratives Szenario: 15 Mitarbeitende nutzen einen internen KI-Assistenten, meist nicht gleichzeitig; Spitzen liegen bei drei bis vier parallelen Anfragen. Gewünscht ist ein mittelgroßes Modell (rund 30 Mrd. Parameter, 4 Bit). Nach Faustregel braucht es etwa 18–21 GB Grafikspeicher für das Modell plus Reserve für Kontext und parallele Anfragen – eine Karte mit 24 GB ist knapp, mit 32 bis 48 GB komfortabel. Alternativ lässt sich ein etwas kleineres Modell mit guter Dokumentensuche kombinieren, das auf einer 20-GB-Karte läuft.

Fragen an den Hoster vor der Miete

  1. Welche Grafikkarte, wie viel Grafikspeicher, wie viel Arbeitsspeicher?
  2. Standort des Rechenzentrums und Vertrag zur Auftragsverarbeitung?
  3. Wie schnell wird defekte Hardware getauscht?
  4. Gibt es Verfügbarkeitszusagen und Datensicherung?
  5. Lässt sich der Server später vergrößern oder ein zweiter ergänzen?

Energie und Nachhaltigkeit

GPU-Server verbrauchen unter Last ein Vielfaches eines Büro-PCs. Ein mittelgroßes Modell, das die Aufgabe erfüllt, ist nicht nur günstiger, sondern auch sparsamer als ein riesiges. Rechenzentren mit Ökostrom und effizienter Kühlung sind ein zusätzliches Auswahlkriterium.

Kosten und Förderung

Die Kosten für eigene KI-Hardware setzen sich aus drei Teilen zusammen: Einrichtung (Planung, Installation, Anbindung, Tests), laufender Betrieb (Server oder Hosting, Updates, Überwachung, Datensicherung) und Begleitung der Mitarbeitenden (Schulung, Regeln, Ansprechpartner). Feste Preise nennen wir nicht, weil Umfang und Ausgangslage stark variieren. Die Software selbst verursacht bei Open-Source-Lösungen keine Lizenzkosten.

Gefördert wird nicht die Technik, sondern die Beratung und begleitete Einführung: Über das INQA-Coaching übernimmt der Bund bundesweit 80 % der Coachingkosten (bis zu 11.520 €, Schecks bis 30.06.2028). Eine vorgelagerte Analyse lässt sich über die BAFA-Beratungsförderung bezuschussen – mit 80 % in den neuen Bundesländern, Lüneburg und Trier, sonst 50 %, für Anträge bis 31.12.2026. Für Investitionen bieten manche Länder eigene Programme – siehe Fördermöglichkeiten für Unternehmen in Deutschland.

Häufig gestellte Fragen

Wie viel Grafikspeicher braucht eine eigene KI?

Als Faustregel etwa 0,6 bis 0,7 GB pro Milliarde Parameter bei 4-Bit-Quantisierung, plus Reserve. Ein Modell mit rund 8 Milliarden Parametern braucht damit etwa 6 bis 8 GB, eines mit 70 Milliarden etwa 40 bis 48 GB.

Reicht ein normaler Büro-PC für KI?

Für kleine Modelle zum Ausprobieren manchmal ja. Für den Betrieb im Team braucht es einen Rechner oder Server mit leistungsfähiger Grafikkarte.

Sollte ein KMU einen GPU-Server kaufen oder mieten?

Für die meisten KMU ist Mieten in einem deutschen Rechenzentrum der bessere Einstieg: keine Anfangsinvestition, professioneller Betrieb und flexible Anpassung. Kaufen lohnt sich vor allem bei dauerhaft hoher Auslastung und eigener IT.

Kann KI auch ohne Grafikkarte laufen?

Kleine Modelle laufen auch auf dem Prozessor, allerdings deutlich langsamer. Für den Alltag im Team ist eine Grafikkarte praktisch Voraussetzung.

Stand: Oktober 2026.

Portrait von Muhamed Alahmed, Gründer von bettersorted
Über den Autor

Muhamed Alahmed

Mit über 10 Jahren IT-Erfahrung entwickle ich Lösungen, die nicht nur technisch funktionieren, sondern echten Mehrwert schaffen und Freiräume eröffnen.

Mehr über bettersorted →

Weitere Beiträge

Newsletter

Bleiben Sie auf dem Laufenden zu KI-Themen

Kurze Updates zu KI-Automatisierung, Förderungen und neuen Beiträgen — kein Spam, jederzeit abbestellbar.

Wir verwenden Brevo als Marketing-Plattform. Mit dem Absenden stimmst du der Übertragung deiner Daten gemäß der Datenschutzerklärung von Brevo zu.

AnrufenSchreibenKontaktformular