SENSUS MEDIA Logo
KI-Modelle · Open Source

Open-Source-Sprachmodelle: Llama, Gemma, Qwen & Co. selbst betreiben

Offene Sprachmodelle lassen sich auf eigenen Servern oder bei einem Hosting-Partner in Deutschland betreiben. Anfragen und Dokumente gehen an keinen externen KI-Dienst, die Kosten sind planbar, und das Modell ändert sich nur, wenn du es willst. Wir wählen das passende Modell, passen es an und betreiben es.

Warum offene Modelle aufgeholt haben

Noch vor wenigen Jahren lagen Open-Source-Modelle weit hinter den kommerziellen Angeboten. Inzwischen erreichen offene Modelle bei vielen Unternehmensaufgaben eine Qualität, die für den produktiven Einsatz reicht: Zusammenfassen, Klassifizieren, Extrahieren, Antworten auf Basis von Dokumenten und Texte nach Vorgabe. Mehrere große Anbieter veröffentlichen Modelle mit offenen Gewichten, die sich frei herunterladen und betreiben lassen.

Der größte Vorteil ist die Kontrolle: Ein selbst betriebenes Modell sendet keine Daten an Dritte, lässt sich mit eigenen Beispielen anpassen und bleibt stabil, bis du es bewusst aktualisierst. Hintergründe erklärt der Lexikon-Eintrag On-Premise-KI.

Verbreitete offene Modellfamilien

Welche passt, entscheiden Aufgabe, Sprache, Hardware und Lizenz.

  • Llama (Meta)

    Weit verbreitete Modellfamilie mit großem Ökosystem, unter einer eigenen Lizenz von Meta. Wichtig für Unternehmen in der EU: Die multimodalen Llama-4-Modelle darf ein Unternehmen mit Hauptsitz in der EU laut Lizenz nicht selbst nutzen, textbasierte Llama-3-Modelle schon. Wir prüfen das vor jedem Einsatz.

  • Gemma (Google)

    Kompakte, effiziente Modelle von Google, seit Gemma 4 unter Apache 2.0, gut geeignet für den Betrieb auf einzelnen GPUs.

  • Qwen (Alibaba)

    Leistungsstarke Familie mit vielen Größen und Spezialvarianten, großteils unter freier Lizenz.

  • DeepSeek

    Modelle mit starken Fähigkeiten im Schlussfolgern, deren Gewichte offen verfügbar sind.

  • gpt-oss (OpenAI) & Phi (Microsoft)

    Offene Modelle der großen US-Anbieter, gpt-oss für anspruchsvolle Aufgaben, Phi als kompakte Variante.

  • Mistral

    Offene Modelle des europäischen Anbieters Mistral AI, viele unter freier Lizenz.

Betrieb: Hardware, Laufzeit und Pflege

Offene Modelle laufen am effizientesten auf Grafikprozessoren. Wir dimensionieren die Hardware nach Modellgröße, erwarteter Last und gewünschter Antwortzeit und nutzen Laufzeitumgebungen wie vLLM für hohe Parallelität oder Ollama für schlanke Setups. Durch Quantisierung lassen sich viele Modelle mit geringem Qualitätsverlust auf kleinerer Hardware betreiben.

Betrieben wird auf gemanagten GPU-Servern in Deutschland oder in deinem Rechenzentrum, mit Zugriffsschutz, Monitoring und einem geregelten Prozess für Modell-Updates. Mehr dazu unter KI-Infrastruktur. Wenn ein Modell für eine Aufgabe noch nicht gut genug ist, passen wir es mit eigenen Beispielen an, siehe Modelltraining.

Lizenzen und Herkunft prüfen

„Open Source“ ist bei Sprachmodellen nicht einheitlich. Manche Modelle stehen unter freien Lizenzen wie Apache 2.0 oder MIT, andere unter eigenen Lizenzen mit Einschränkungen, etwa für sehr große Anbieter oder bestimmte Nutzungen. Ein Beispiel: Die Lizenz der multimodalen Llama-4-Modelle schließt Unternehmen mit Hauptsitz in der EU aus. Wir prüfen die Lizenz deshalb vor jedem Einsatz.

Bei Modellen aus China wie Qwen oder DeepSeek gilt: Selbst betrieben senden sie keine Daten an den Hersteller. Wir testen sie trotzdem gezielt auf ihr Antwortverhalten bei den Themen deines Anwendungsfalls und empfehlen sie nur, wenn sie dafür passen. Die Apps und Cloud-Dienste dieser Anbieter nutzen wir für Unternehmensdaten nicht.

Lizenzen offener Modelle im Überblick

Ob ein Modell kommerziell und selbst betrieben genutzt werden darf, steht in der Lizenz. Die Übersicht ersetzt keine Prüfung im Einzelfall (Stand: September 2026).

Lizenzen offener Modelle im Überblick
Llama
Gemma
Qwen
DeepSeek
gpt-oss
Phi
Lizenzeigene Lizenz von MetaApache 2.0 ab Gemma 4, ältere: Gemma-Bedingungenüberwiegend Apache 2.0MIT (neuere Modelle)Apache 2.0MIT
Kommerziell nutzbarja, mit Auflagenjajajajaja
Hinweismultimodale Llama-4-Modelle nicht für Unternehmen mit Sitz in der EUältere Versionen mit NutzungsregelnLizenz je Modell prüfenNutzung nur selbst betrieben empfohlenoffene Modelle von OpenAIkompakte Modelle von Microsoft

Was kosten Open-Source-LLMs im Unternehmen?

Für offene Modelle fallen keine Lizenzgebühren pro Anfrage an. Die Kosten liegen in der Hardware oder den gemieteten GPU-Servern, im Betrieb und in der Pflege. Bei geringem Volumen ist ein Cloud-Modell deshalb oft günstiger, bei hohem Volumen oder strengen Datenschutzanforderungen kippt die Rechnung zugunsten des eigenen Betriebs.

Wir rechnen beide Varianten mit deinem erwarteten Volumen durch. Richtwerte zur Hardware je Modellgröße stehen auf unserer Seite zur KI-Infrastruktur.

Stand: September 2026. Modelle, Tarife und Konditionen ändern sich häufig; wir prüfen den aktuellen Stand vor jedem Projekt.

Vom Modellvergleich zum eigenen Betrieb

Offene Modelle testen wir gegeneinander, bevor Hardware angeschafft oder gemietet wird.

  1. Schritt 1

    Anforderungen & Lizenz

    Anforderungen an Datenschutz, Sprache und Aufgabe klären, Lizenz prüfen.

  2. Schritt 2

    Modelle vergleichen

    Mehrere offene Modelle mit deinen Testfällen vergleichen.

  3. Schritt 3

    Team & IT vorbereiten

    Teams und IT auf Betrieb und Grenzen des Modells vorbereiten.

  4. Schritt 4

    Betrieb in Deutschland

    Betrieb auf gemanagten Servern in Deutschland oder bei dir, mit Monitoring.

Häufige Fragen zu Open-Source-LLMs

Sind Open-Source-Modelle so gut wie ChatGPT?

Für viele Unternehmensaufgaben ja. Bei sehr anspruchsvollem Schlussfolgern oder sehr langen Kontexten sind die größten kommerziellen Modelle oft noch vorne. Ein Test mit echten Fällen zeigt, ob ein offenes Modell reicht.

Welches offene Modell ist das beste?

Das hängt von Aufgabe, Sprache, verfügbarer Hardware und Lizenz ab. Wir vergleichen mehrere Kandidaten mit deinen Testfällen.

Was kostet der Betrieb eines eigenen Modells?

Vor allem die GPU-Infrastruktur, abhängig von Modellgröße und Last. Bei hohen Volumen ist das oft günstiger als nutzungsabhängige API-Preise.

Kann man Open-Source- und Cloud-Modelle kombinieren?

Ja. Viele Anwendungen nutzen ein selbst betriebenes Modell für sensible Daten und ein Cloud-Modell für anspruchsvolle Aufgaben ohne vertrauliche Inhalte.

Eigene KI ohne Datenabfluss

Wir wählen das passende offene Modell für deinen Anwendungsfall, testen es mit echten Fällen und betreiben es in Deutschland.