Eine KI mit 27 Milliarden Parametern im Unternehmen, ohne Cloud
Bei FremaTech wollten wir eine konkrete Frage beantworten: Kann man ein ernstzunehmendes KI-Modell mit 27 Milliarden Parametern direkt im Unternehmen betreiben, ohne ein einziges Datum in die Cloud zu senden? Die Antwort ist ja - und wir haben es geschafft, indem wir zwei gewoehnliche PCs mit unterschiedlichen Grafikkarten verbunden haben.
Das Problem
Wirklich leistungsfaehige Modelle passen nicht in den Speicher einer einzelnen Consumer-Grafikkarte. Der bequeme Weg ist die Cloud, aber Cloud bedeutet zwei Dinge, die fuer viele Unternehmen nicht in Frage kommen: Die Daten verlassen das Haus, und man zahlt dauerhaft nach Verbrauch. Eine professionelle Karte fuer Zehntausende Franken zu kaufen ist fuer einen KMU keine realistische Alternative.
Die Loesung: zwei GPUs im Netzwerk
Wir nutzen eine wenig bekannte Funktion von llama.cpp, die ein einzelnes Modell auf mehrere im lokalen Netzwerk verbundene Rechner verteilt. Die Grafikkarte des Haupt-PCs haelt den groessten Teil des Modells, und eine zweite Karte - auch aus einem alten PC - ergaenzt den fehlenden Speicher ueber das Netzwerkkabel. Das Ergebnis auf unserem Pruefstand: ein Modell mit 27 Milliarden Parametern, das mit rund 22 Woertern pro Sekunde Text erzeugt, bei einem Kontextfenster von 96.000 Token - alles auf Hardware, die wir bereits besassen.
Warum das fuer ein Unternehmen wichtig ist
Drei konkrete Gruende.
- Absolute Privatsphaere: Vertraege, Rechnungen, Dokumente und Code bleiben physisch im Haus und laufen ueber keinen externen Server.
- Keine Grenzkosten: Einmal eingeschaltet, berechnet das System nicht jede Anfrage, anders als Cloud-Abonnements.
- Know-how: Wer die eigene KI-Infrastruktur kontrolliert, kann sie an die eigenen Ablaeufe anpassen, statt von einem Anbieter abhaengig zu sein.
Open Source
Wir haben den gesamten Code, die Anleitung und die Messwerte als Open-Source-Projekt auf GitHub veroeffentlicht: https://github.com/FremaTech/llama-rpc-dual-gpu . Es richtet sich an alle, die das Experiment nachbauen wollen, zeigt aber auch unsere Herangehensweise an KI: messbare, reproduzierbare Loesungen unter Ihrer Kontrolle. Wenn Sie ueber einen privaten KI-Assistenten fuer Ihr Unternehmen nachdenken, ohne Daten in der Cloud, ist das genau die Art von Projekt, die wir umsetzen.
Weitere Sprachen
Italiano: /blog/gpu-condivise-llm-locale English: /blog/shared-gpus-local-llm
Vuoi sapere come sta il tuo sito?
Scrivi l'indirizzo e in mezzo minuto vedi cosa vede chi ti cerca: sicurezza, scadenze, telefono, aggiornamento. Gratis, senza registrazione.