Joinery

Lokale KI

Ein offenes Sprachmodell auf dem eigenen Server: was ein kleines Unternehmen wissen muss

Eine Workstation im Schrank erledigt heute das meiste von dem, was Ihr Team in ChatGPT kopiert. Wie die Maschine aussieht, welche Modelle darauf laufen, was der Betrieb kostet und wo es noch hakt.

Die Frage kommt inzwischen in fast jedem Erstgespräch, meist von dem Partner, der die Datenschutzunterlagen unterschreibt: Geht das auch, ohne dass unsere Akten auf einen amerikanischen Server wandern? Die Antwort im Jahr 2026 lautet ja, für den größten Teil der täglichen Arbeit, und die Maschine dafür ist kleiner, als die meisten erwarten.

Der Fachbegriff ist On-Premise-LLM. Gemeint ist ein großes Sprachmodell, die Art Programm, die hinter ChatGPT steckt, als Software auf Hardware, die Sie kontrollieren: eine Workstation im Büro, ein Server in Ihrem Rack oder ein dedizierter Server, gemietet auf den Namen Ihres Unternehmens in einem Rechenzentrum in Ihrem Land. Das Modell ist eine Datei. Sie laden es einmal herunter, und ab dann bleibt jede Frage und jedes Dokument auf dieser Maschine.

Wie die Maschine aussieht

Drei Größen decken fast jedes Unternehmen mit 5 bis 50 Mitarbeitern ab.

AufbauWas es istFür wenHardware-Budget, grob
WorkstationEin Desktop-Rechner mit einer starken Grafikkarte (24 bis 48 GB Grafikspeicher), unter dem Schreibtisch oder im SchrankEin Team von 10 bis 20 Leuten mit Alltagsaufgaben: Mail, Entwürfe, Zusammenfassungen, Fragen zu Dokumenten3.000 bis 8.000 EUR
ServerEine Rack-Maschine mit zwei bis vier Grafikkarten, oder eine Workstation-Karte mit 96 GBUnternehmen mit hohem Volumen oder mehreren Agenten gleichzeitig15.000 bis 40.000 EUR
Gemieteter dedizierter ServerEine Maschine mit Grafikkarte in einem Rechenzentrum in Ihrem Land, auf Ihren Namen, sonst niemand daraufUnternehmen ohne Serverraum oder mit verteiltem TeamEine Monatsmiete, kein Kauf

Apples Desktop-Rechner mit großem gemeinsamem Speicher sind eine vierte Möglichkeit, die kleinen Teams gut passt. Sie sind leise und sparsam, und sie halten ein großes Modell im Speicher, um den Preis langsamerer Ausgabe als bei einer eigenen Grafikkarte.

Der Grafikspeicher ist die Zahl, die zählt. Sie entscheidet, welche Modelle passen und wie viele Leute gleichzeitig fragen können. Alles andere ist gewöhnliche Bürohardware.

Welche Modelle darauf laufen

Offene Modelle sind die, die Sie herunterladen und selbst betreiben können. Mehrere Familien sind reif genug für Büroarbeit: Metas Llama, Alibabas Qwen, die Modelle von Mistral, Googles Gemma und eine wachsende Zahl weiterer. Sie kommen in Größen, gemessen in Milliarden Parametern. Ein Modell der Klasse 7 bis 14 Milliarden läuft schnell auf einer Karte und erledigt Sortieren und Auslesen gut. Modelle der Klasse 30 bis 70 Milliarden schreiben und schließen spürbar besser und wollen eine stärkere Karte oder zwei. Darüber sind Sie im Server-Bereich.

Die meisten Unternehmen betreiben ein mittelgroßes Modell in komprimierter Form („quantisiert“ heißt das Fachwort), was den Speicherbedarf etwa halbiert, bei kaum sichtbarem Qualitätsverlust. Der Aufbau sollte so gebaut sein, dass sich das Modell tauschen lässt: Die offenen Modelle werden alle paar Monate besser, und das Modell vom Herbst ist im Frühjahr abgelöst.

Was heute zuverlässig geht

  • Eingehende Mails lesen und sortieren, Antworten aus Ihren eigenen Dokumenten und Ihrer Preisliste entwerfen.
  • Lange Dateien zusammenfassen: Verträge, Ausschreibungen, transkribierte Besprechungen.
  • Fragen zu einem indexierten Bestand an Firmendokumenten beantworten, mit der Quelle neben der Antwort.
  • Felder aus Rechnungen, Formularen und Lieferscheinen auslesen.
  • Texte übersetzen und im Stil des Hauses umschreiben.

Wo die größten Cloud-Modelle noch vorn liegen: lange Schlussketten, schwere Mathematik, ungewöhnliche Programmieraufgaben und sehr lange Dokumente, die auf einmal im Speicher gehalten werden müssen. Für eine Kanzlei, die eine 300-Seiten-Akte zusammenfasst, oder ein Ingenieurbüro, das eine komplexe Berechnung prüft, kann ein Cloud-Modell weiterhin die bessere Wahl sein. Ein vernünftiger Aufbau nutzt standardmäßig das lokale Modell und fragt einen Menschen, bevor etwas an ein Cloud-Modell geht.

Was der Betrieb kostet

Strom: Eine Workstation unter Last zieht etwa so viel wie ein Heizlüfter auf kleiner Stufe, und die meiste Zeit des Tages steht sie im Leerlauf. Rechnen Sie mit einigen zehn Euro im Monat, bei einem Server mehr. Wartung: Jemand muss Updates einspielen, den Füllstand der Platte beobachten und das Modell tauschen, wenn ein besseres erscheint. Das sind ein paar Stunden im Monat für einen IT-Partner oder eine Betreuung. Gebühren pro Nutzer fallen bei einem offenen Modell nicht an, und genau dieser Posten macht Cloud-Abos teuer, sobald ein Team über zehn Leute wächst.

Der faire Vergleich ist das Abo, das Sie sonst für das ganze Team über drei Jahre kaufen würden. Bei Unternehmen mit mehr als zehn Nutzern gewinnt die Maschine bei den Kosten oft im zweiten Jahr, und bei der Datenfrage vom ersten Tag an.

Die Datenschutzseite

Mit dem Modell auf eigener Hardware fällt der KI-Anbieter für diese Arbeit aus Ihrer Liste der Auftragsverarbeiter. Kundendaten bleiben im Land, und das Anfrageprotokoll liegt auf einer Platte, die Ihr Datenschutzbeauftragter lesen kann. Ihre eigenen Pflichten bleiben: Die Verarbeitung muss weiterhin dokumentiert werden, Zugriffe müssen geregelt sein, und die Mitarbeiter müssen wissen, was in das System darf. Ein lokales Modell macht diese Antworten kürzer. Es lässt sie nicht verschwinden.

Wann es sich nicht lohnt

Ein Unternehmen mit fünf Leuten, das KI ein paar Mal pro Woche nutzt, ist mit einem sorgfältig eingestellten Cloud-Abo besser bedient. Ein Unternehmen, dessen Arbeit vor allem aus schwerem Schlussfolgern besteht, wird sich über ein mittelgroßes Modell ärgern. Und ein Unternehmen, in dem niemand die Maschine verantworten will, auch nicht über einen IT-Partner, sollte keine kaufen. In jedem dieser Fälle sagen wir das im Gespräch und schlagen den kleineren Schritt vor.

Joinery richtet lokale KI für Unternehmen mit 5 bis 50 Mitarbeitern ein, indexiert die Dokumente auf der Maschine und baut die ersten Agenten, die daraus arbeiten. Die Hardware gehört Ihnen, die Modelle sind offen, die Protokolle bleiben auf Ihrer Platte. So läuft die Einrichtung lokaler KI.

Frederik Theissen
Frederik Theissen

Gründer von Joinery. Ehemaliger Neurowissenschaftler, dann Data Scientist für quantitatives Risikomanagement bei einem Krypto-Hedgefonds und Lead Data Scientist bei Accointing by Glassnode. Arbeitet seit Dezember 2022 täglich mit großen Sprachmodellen. LinkedIn