KI & Infrastruktur

Eine KI mit 27 Milliarden Parametern im Unternehmen, ohne Cloud

Frederico Mafli 22 agosto 2026 2 min

Bei FremaTech wollten wir eine konkrete Frage beantworten: Kann man ein ernstzunehmendes KI-Modell mit 27 Milliarden Parametern direkt im Unternehmen betreiben, ohne ein einziges Datum in die Cloud zu senden? Die Antwort ist ja - und wir haben es geschafft, indem wir zwei gewoehnliche PCs mit unterschiedlichen Grafikkarten verbunden haben.

Das Problem

Wirklich leistungsfaehige Modelle passen nicht in den Speicher einer einzelnen Consumer-Grafikkarte. Der bequeme Weg ist die Cloud, aber Cloud bedeutet zwei Dinge, die fuer viele Unternehmen nicht in Frage kommen: Die Daten verlassen das Haus, und man zahlt dauerhaft nach Verbrauch. Eine professionelle Karte fuer Zehntausende Franken zu kaufen ist fuer einen KMU keine realistische Alternative.

Die Loesung: zwei GPUs im Netzwerk

Wir nutzen eine wenig bekannte Funktion von llama.cpp, die ein einzelnes Modell auf mehrere im lokalen Netzwerk verbundene Rechner verteilt. Die Grafikkarte des Haupt-PCs haelt den groessten Teil des Modells, und eine zweite Karte - auch aus einem alten PC - ergaenzt den fehlenden Speicher ueber das Netzwerkkabel. Das Ergebnis auf unserem Pruefstand: ein Modell mit 27 Milliarden Parametern, das mit rund 22 Woertern pro Sekunde Text erzeugt, bei einem Kontextfenster von 96.000 Token - alles auf Hardware, die wir bereits besassen.

Warum das fuer ein Unternehmen wichtig ist

Drei konkrete Gruende.

  • Absolute Privatsphaere: Vertraege, Rechnungen, Dokumente und Code bleiben physisch im Haus und laufen ueber keinen externen Server.
  • Keine Grenzkosten: Einmal eingeschaltet, berechnet das System nicht jede Anfrage, anders als Cloud-Abonnements.
  • Know-how: Wer die eigene KI-Infrastruktur kontrolliert, kann sie an die eigenen Ablaeufe anpassen, statt von einem Anbieter abhaengig zu sein.

Open Source

Wir haben den gesamten Code, die Anleitung und die Messwerte als Open-Source-Projekt auf GitHub veroeffentlicht: https://github.com/FremaTech/llama-rpc-dual-gpu . Es richtet sich an alle, die das Experiment nachbauen wollen, zeigt aber auch unsere Herangehensweise an KI: messbare, reproduzierbare Loesungen unter Ihrer Kontrolle. Wenn Sie ueber einen privaten KI-Assistenten fuer Ihr Unternehmen nachdenken, ohne Daten in der Cloud, ist das genau die Art von Projekt, die wir umsetzen.

Weitere Sprachen

Italiano: /blog/gpu-condivise-llm-locale English: /blog/shared-gpus-local-llm

Vuoi sapere come sta il tuo sito?

Scrivi l'indirizzo e in mezzo minuto vedi cosa vede chi ti cerca: sicurezza, scadenze, telefono, aggiornamento. Gratis, senza registrazione.