SENSUS MEDIA Logo
Lexikon

On-Premise-KI / Self-Hosted LLM – Definition & Bedeutung

KI & Automatisierung
Kurz erklärt:

On-Premise-KI (Self-Hosted LLM) bedeutet, ein Sprachmodell nicht über die Cloud eines Anbieters zu nutzen, sondern auf eigenen Servern oder auf gemanagter Infrastruktur in Deutschland zu betreiben. Anfragen und Dokumente gehen dann an keinen externen KI-Dienst.

Was ist On-Premise-KI?

Bei On-Premise-KI läuft das Sprachmodell dort, wo das Unternehmen es kontrolliert: im eigenen Rechenzentrum, auf gemieteten dedizierten Servern oder bei einem Hosting-Partner in Deutschland. Möglich ist das mit Open-Weight-Modellen, deren Gewichte frei verfügbar sind, etwa Llama von Meta (für Unternehmen mit Sitz in der EU gelten bei Llama 4 Lizenzeinschränkungen), Gemma von Google, Mistral, Qwen oder gpt-oss von OpenAI. Die Anfragen und Dokumente werden nicht an einen externen KI-Dienst geschickt.

Wann lohnt sich ein selbst gehostetes Sprachmodell?

  • Sensible Daten: Personal-, Finanz- oder Gesundheitsdaten und Geschäftsgeheimnisse sollen die eigene Umgebung nicht verlassen.
  • Hohe Volumen: Bei sehr vielen gleichartigen Anfragen, etwa Produkttexte für ein großes Sortiment, können eigene Modelle günstiger sein als nutzungsabhängige API-Kosten.
  • Planbarkeit: Das Modell ändert sich nicht ungefragt durch Updates des Anbieters, Ergebnisse bleiben reproduzierbar.
  • Offline- oder Speziallösungen: etwa in der Produktion oder in abgeschotteten Netzen.

Was braucht man dafür?

Sprachmodelle laufen am effizientesten auf Grafikprozessoren (GPUs). Wie viel Leistung nötig ist, hängt von der Modellgröße, der Zahl gleichzeitiger Anfragen und der gewünschten Antwortgeschwindigkeit ab. Kleinere Modelle mit einigen Milliarden Parametern laufen bereits auf einer einzelnen GPU, große Modelle brauchen mehrere. Für den Betrieb werden Laufzeitumgebungen wie vLLM oder Ollama eingesetzt, dazu Monitoring, Updates und Zugriffsschutz, siehe MLOps.

Grenzen

Die leistungsstärksten Modelle der großen Anbieter sind nicht als Open Weights verfügbar. Für anspruchsvolle Aufgaben wie komplexes Schlussfolgern oder sehr lange Dokumente sind Cloud-Modelle oft noch überlegen. Viele Unternehmen kombinieren deshalb beides: selbst gehostete Modelle für sensible Daten und Massenaufgaben, Cloud-Modelle mit EU-Verarbeitung für den Rest. Mehr zu den Abwägungen unter Datensouveränität.

In der Praxis

Wir betreiben Open-Source-Modelle auf gemanagter Infrastruktur in Deutschland oder beim Kunden und binden sie so an, dass ein späterer Wechsel des Modells keinen Umbau erfordert. Mehr unter KI-Entwicklung und Hosting.

Verwandte Begriffe & Leistungen

In der Praxis: Welche offenen Modelle sich für den Eigenbetrieb eignen, zeigt unsere Seite zu Open-Source-LLMs. Betriebsmodelle, Hardware-Richtwerte und Kosten beschreibt die Seite KI-Infrastruktur und LLM-Hosting.

Häufige Fragen

Sind selbst gehostete Modelle so gut wie ChatGPT?

Für viele Aufgaben wie Zusammenfassen, Klassifizieren, Extrahieren oder Antworten auf Basis von Dokumenten ja. Bei sehr anspruchsvollem Schlussfolgern sind die größten Cloud-Modelle oft noch vorne.

Was kostet On-Premise-KI?

Die Kosten hängen vor allem von der GPU-Leistung ab, die Modellgröße und Last erfordern. Bei hohen Volumen kann ein eigenes Modell günstiger sein als nutzungsabhängige API-Preise.

Dürfen Open-Source-Modelle kommerziell genutzt werden?

Die meisten verbreiteten Modelle erlauben kommerzielle Nutzung, die Lizenzen unterscheiden sich aber im Detail. Die Lizenz sollte vor dem Einsatz geprüft werden.

Bereit, gemeinsam Großes zu schaffen?

Lass uns unverbindlich über dein Projekt sprechen.