bettersorted Logo
Grafikkort i en dator – symbolbild för AI-hårdvara
AI-rådgivning

Vilken hårdvara behöver en egen AI? GPU-servrar för medelstora företag

FörfattareMuhamed Alahmed
Publicerad den
Lästid5 min.
Kort förklarat

För en egen AI är framför allt grafikminnet (VRAM) avgörande. Som tumregel behöver en modell som har minskats till 4 bitar ungefär 0,6 till 0,7 GB VRAM per miljard parametrar plus marginal. Små modeller körs på ett enskilt grafikkort, stora behöver GPU-servrar. I stället för att köpa kan små och medelstora företag hyra GPU-servrar i Tyskland.

Det viktigaste i korthet

  • Det avgörande är grafikminnet (VRAM), inte processorn.
  • Tumregel: 0,6–0,7 GB VRAM per miljard parametrar (4 bit) plus reserv.
  • Tre steg: Testdator, en GPU-server, flera GPU:er eller modelltjänst.
  • För många små och medelstora företag är Att hyra i Tysklandden bättre starten.

Om en egen AI körs i företaget avgörs det framför allt av ett värde: grafikminnet (VRAM) i grafikkortet. Som tumregel behöver en språkmodell som har minskats till 4 bitar ungefär 0,6 till 0,7 GB VRAM per miljard parametrar – plus reserv för längre texter och flera användare. Små och medelstora modeller körs på ett grafikkort, stora behöver GPU-servrar. I stället för att köpa hårdvara kan små och medelstora företag också hyra GPU-servrar i tyska datacenter hyra.

Varför just grafikkortet?

Språkmodeller räknar med enorma taltabeller. Grafikkort är specialiserade på just den här typen av beräkningar och mycket snabbare än vanliga processorer. För att modellen ska kunna svara snabbt måste den få plats helt i grafikkortets minne. Om minnet inte räcker blir det antingen mycket långsamt eller så fungerar det inte alls.

Tekniker arbetar med serverhårdvara

Tumregler för minnesbehovet

Följande värden är grova riktvärden för modeller med 4-bitars kvantisering och en användare; beroende på modell och inställningar kan de avvika:

  • Små modeller (cirka 8 miljarder parametrar): cirka 6–8 GB VRAM – passar på många aktuella grafikkort.
  • Medelstora modeller (cirka 20–30 miljarder): cirka 16–24 GB VRAM – ett kraftfullt enskilt kort.
  • Stora modeller (cirka 70 miljarder): cirka 40–48 GB VRAM – proffskort eller två kort.
  • Mycket stora modeller (100 miljarder och mer): flera proffskort eller specialiserade servrar.

Dessutom tillkommer minne för ”kontexten” – alltså de texter som modellen ska ha överblick över samtidigt – och för ytterligare samtidiga användare. Planera därför alltid in marginal.

Tre typiska utbyggnadsnivåer

Nivå 1: Testa på befintlig hårdvara

En arbetsstation med bra grafikkort eller en aktuell Mac med mycket delat arbetsminne räcker för att testa små modeller med Ollama. Idealisk för piloten, inte för drift i teamet.

Steg 2: En GPU-server för teamet

En server med ett kraftfullt grafikkort kör en medelstor modell för ett litet team – till exempel som intern assistent eller för dokumentsökning. Tyska leverantörer hyr ut sådana servrar; Hetzner erbjuder till exempel en dedikerad server med ett NVIDIA RTX 4000 SFF Ada med 20 GB grafikminne.

Steg 3: Flera grafikkort eller en modelltjänst

För stora modeller eller många samtidiga användare krävs flera proffskort. Här lönar det sig ofta att jämföra med en modelltjänst i Tyskland, där du inte driver någon server utan bara betalar för användningen – se Värd för AI-modeller i enlighet med GDPR.

Köpa eller hyra?

  • Köpa lönar sig vid varaktigt hög beläggning, befintligt serverrum och egen IT-personal.
  • Hyra är flexibelt, utan initial investering, med professionell strömförsörjning, kylning och nätanslutning – och kan vid behov skalas upp eller ned.
  • El och värme glöm inte: GPU-servrar förbrukar betydligt mer energi än vanlig kontorsutrustning och behöver kylning.
  • Reservdelar och underhåll: Om det enda grafikkortet går sönder står AI:n stilla. Hyresservrar byts ut av leverantören.

Typiska fel

  • För lite grafikminne: Modellen får inte plats eller körs bara kraftigt för långsamt.
  • Planerad endast för en användare: Flera samtidiga förfrågningar kräver extra reservkapacitet.
  • För stor modell: Ofta räcker en medelstor modell med bra kunskapsbas via RAG bättre än en jättestor utan.
  • Verksamheten underskattas: Uppdateringar, säkerhetskopiering och övervakning tar tid eller kräver en tjänsteleverantör.

För teknikintresserade

  • För drift med flera användare lämpar sig inferensservrar som vLLM, som samlar förfrågningar och hanterar minnet effektivt.
  • Vid MoE-modeller måste alla parametrar in i minnet, även om bara en del beräknas per svar.
  • Grafikkort för datacenter erbjuder mer minne och felkorrigering (ECC), men är betydligt dyrare än konsumentkort.

bettersorted använder för sina kunder öppna, insynsbara byggstenar – driftas på servrar i Tyskland och samlas i automaisa Hub. Vi ger leverantörsneutral rådgivning, är registrerad rådgivare hos BAFA och auktoriserad INQA-coach. Rådgivning och guidad införande kan finansieras via INQA-Coaching med 80 % stöd; den lämpliga vägen visas av stödchecken. För ett förutsättningslöst första samtal: Kontakt.

Exempel: beräkning för ett team på 15 personer

Ett illustrativt scenario: 15 medarbetare använder en intern KI-assistent, oftast inte samtidigt; topparna ligger på tre till fyra parallella förfrågningar. Önskat är en medelstor modell (cirka 30 miljarder parametrar, 4 bit). Enligt tumregeln behövs ungefär 18–21 GB grafikminne för modellen plus marginal för kontext och parallella förfrågningar – ett kort med 24 GB är snävt, med 32 till 48 GB är det bekvämt. Alternativt kan en något mindre modell kombineras med bra dokumentsökning, som körs på ett kort med 20 GB.

Frågor till hostern före hyran

  1. Vilket grafikkort, hur mycket grafikminne, hur mycket arbetsminne?
  2. Plats för datacentret och avtal om personuppgiftsbiträde?
  3. Hur snabbt byts defekt hårdvara ut?
  4. Finns det tillgänglighetsåtaganden och säkerhetskopiering?
  5. Går det att utöka servern senare eller lägga till en andra?

Energi och hållbarhet

GPU-servrar förbrukar under belastning mångdubbelt mer än en kontors-PC. En medelstor modell som uppfyller uppgiften är inte bara billigare, utan också mer energieffektiv än en stor. Datacenter med grön el och effektiv kylning är ett ytterligare urvalskriterium.

Kostnader och stöd

Kostnaderna för egen AI-hårdvara består av tre delar: Installation (planering, installation, anslutning, tester), löpande drift (server eller hosting, uppdateringar, övervakning, säkerhetskopiering) och stöd till medarbetarna (utbildning, regler, kontaktpersoner). Vi anger inga fasta priser eftersom omfattning och utgångsläge varierar kraftigt. Själva programvaran medför inga licenskostnader för open source-lösningar.

Det är inte tekniken som finansieras, utan Rådgivning och vägledd införande: Genom INQA-Coaching täcker staten 80 % av coachningskostnaderna i hela landet (upp till 11.520 €, checkar till 30.06.2028). En förhandsanalys kan subventioneras via BAFA-Beratungsförderung – med 80 % i de nya förbundsländerna, Lüneburg och Trier, annars 50 %, för ansökningar till 31.12.2026. För investeringar erbjuder vissa delstater egna program – se Finansieringsmöjligheter för företag i Tyskland.

Vanliga frågor

Hur mycket grafikminne behöver en egen AI?

Som tumregel cirka 0,6 till 0,7 GB per miljard parametrar vid 4-bitars kvantisering, plus marginal. En modell med omkring 8 miljarder parametrar behöver därmed cirka 6 till 8 GB, en med 70 miljarder cirka 40 till 48 GB.

Räcker en vanlig kontors-PC för AI?

För små modeller för att testa ibland, ja. För drift i team behövs en dator eller server med kraftfullt grafikkort.

Ska ett litet eller medelstort företag köpa eller hyra en GPU-server?

För de flesta små och medelstora företag är det bättre att hyra i ett tyskt datacenter som första steg: ingen initial investering, professionell drift och flexibel anpassning. Att köpa lönar sig framför allt vid varaktigt hög belastning och egen IT.

Kan AI också köras utan grafikkort?

Små modeller körs också på processorn, men betydligt långsammare. För vardagsbruk i teamet är ett grafikkort i praktiken en förutsättning.

Status: oktober 2026.

Porträtt av Muhamed Alahmed, grundare av bettersorted
Om författaren

Muhamed Alahmed

Med över 10 års IT-erfarenhet utvecklar jag lösningar som inte bara fungerar tekniskt, utan också skapar verkligt värde och öppnar upp utrymme.

Mer om bettersorted →

Fler inlägg

Nyhetsbrev

Håll dig uppdaterad om AI-frågor

Korta uppdateringar om AI-automatisering, stöd och nya inlägg — inget spam, kan när som helst avregistreras.

Vi använder Brevo som vår marknadsföringsplattform. Genom att skicka in formuläret godkänner du att dina uppgifter överförs enligt Brevos integritetspolicy .

RingSkrivKontaktformulär