SENSUS MEDIA Logo
KI-Entwicklung · Infrastruktur

KI-Infrastruktur: Sprachmodelle sicher betreiben, in der EU oder bei dir

Eine KI-Anwendung ist nur so verlässlich wie ihr Betrieb. Wir planen und betreiben die Infrastruktur für deine KI: Cloud-Modelle mit EU-Verarbeitung, Open-Source-Modelle auf GPU-Servern in Deutschland oder on-premise, dazu Monitoring, Kostenkontrolle und Updates.

Die Architekturfrage hinter jeder KI-Anwendung

Wo läuft das Modell, wo liegen die Daten, und wer kann darauf zugreifen? Diese Fragen entscheiden über Datenschutz, Kosten, Geschwindigkeit und Abhängigkeit von einzelnen Anbietern. Eine pauschal richtige Antwort gibt es nicht. Ein Chatbot für öffentliche Produktfragen stellt andere Anforderungen als ein Assistent, der Personalakten oder Kalkulationen verarbeitet.

Wir planen die Infrastruktur deshalb pro Anwendungsfall und kombinieren bei Bedarf: leistungsstarke Cloud-Modelle für allgemeine Aufgaben, selbst gehostete Modelle für sensible Daten oder hohe Volumen. Die Anwendung selbst bauen wir so, dass sich das Modell später wechseln lässt, ohne sie neu zu entwickeln. Hintergründe erklären die Lexikon-Einträge zu Datensouveränität und On-Premise-KI.

Drei Betriebsmodelle

  • Cloud-Modelle mit EU-Verarbeitung

    Modelle von OpenAI, Anthropic, Google oder Mistral über Plattformen mit Rechenzentren in der EU, Auftragsverarbeitung und Trainingsausschluss.

  • Gemanagte GPU-Server in Deutschland

    Open-Source-Modelle wie Gemma, Qwen, Mistral oder gpt-oss auf dedizierten Servern, von uns betrieben. Die Verarbeitung findet auf Servern in Deutschland statt.

  • On-Premise bei dir

    Betrieb im eigenen Rechenzentrum oder in abgeschotteten Netzen, mit unserer Unterstützung bei Einrichtung und Wartung.

Betriebsmodelle im Vergleich

Welches Modell passt, hängt von Datenschutz, Volumen und Modellwahl ab. Viele Anwendungen kombinieren zwei Betriebsmodelle.

Betriebsmodelle im Vergleich
Cloud-Modelle in der EU
Gemanagte GPU-Server in Deutschland
On-Premise bei dir
DatenkontrolleAuftragsverarbeitung beim AnbieterServer in Deutschland, von uns betriebenja, vollständig in deinem Haus
Modellauswahlstärkste kommerzielle ModelleOpen-Source-ModelleOpen-Source-Modelle
Einstiegsaufwandgeringmittelhoch
Laufende Kostennach Nutzung pro Anfragemonatlich für Server und BetriebHardware, Strom, Betrieb
Skalierung bei Lastspitzenjanach Serverausstattungnach eigener Hardware
Wartung und Updatesbeim Anbieterdurch unsdurch uns oder deine IT

Was zum Betrieb gehört

Ein Modell bereitzustellen ist der kleinere Teil der Arbeit. Im Betrieb geht es um Verfügbarkeit, Antwortzeiten, Sicherheit und Kosten. Für selbst gehostete Modelle setzen wir Laufzeitumgebungen ein, etwa vLLM für hohe Parallelität oder Ollama für schlanke Setups, und dimensionieren die GPU-Leistung nach Modellgröße und Last.

Dazu kommen ein Gateway, das Zugriffe, Rechte und Kontingente steuert, Monitoring von Qualität, Fehlern und Antwortzeiten, eine Kostenaufstellung pro Anwendungsfall und ein geregelter Prozess für Modell-Updates mit Tests vor dem Wechsel. Diese Praxis nennt man MLOps oder LLMOps. Wir betreiben KI-Infrastruktur mit derselben Sorgfalt wie unsere Shop-Infrastruktur: mit Backups, Updates und Alarmierung.

Hardware-Richtwerte für selbst gehostete Modelle

Wie viel GPU-Speicher ein Modell braucht, lässt sich grob abschätzen: In voller Genauigkeit (16 Bit) belegt jeder Parameter etwa zwei Byte. Durch Quantisierung auf 8 oder 4 Bit sinkt der Bedarf auf etwa die Hälfte oder ein Viertel, meist mit geringem Qualitätsverlust. Dazu kommt Speicher für den Kontext gleichzeitiger Anfragen.

  • Kleine Modelle (bis etwa 10 Milliarden Parameter): laufen quantisiert auf einer einzelnen GPU mit 16 bis 24 GB Speicher, gut für Klassifikation, Extraktion und einfache Assistenten.
  • Mittlere Modelle (etwa 20 bis 40 Milliarden Parameter): brauchen eine GPU mit 48 bis 80 GB oder zwei kleinere.
  • Große Modelle (70 Milliarden Parameter und mehr): brauchen mehrere GPUs oder eine starke Quantisierung, lohnen sich nur bei hohem Volumen oder besonderen Datenschutzanforderungen.

Das sind Richtwerte; die tatsächliche Dimensionierung hängt von Antwortzeit, Zahl gleichzeitiger Nutzer und Kontextlänge ab. Welche offenen Modelle infrage kommen, zeigt unsere Seite zu Open-Source-LLMs, Grundlagen stehen im Lexikon unter On-Premise-KI.

Was kostet LLM-Hosting?

Bei Cloud-Modellen zahlst du nach Nutzung, also pro verarbeitetem Text. Das ist bei geringem und schwankendem Volumen fast immer günstiger. Bei selbst gehosteten Modellen fallen feste monatliche Kosten für GPU-Server, Betrieb und Updates an, unabhängig davon, wie viel die Anwendung genutzt wird.

Wo die Grenze liegt, hängt von Volumen, Modellgröße und Datenschutzanforderung ab. Wir rechnen beide Varianten mit deinen erwarteten Anfragen durch, bevor Hardware angeschafft oder gemietet wird. Oft ist eine Kombination sinnvoll: ein kleines Modell auf eigener Hardware für sensible Daten und große Mengen, ein Cloud-Modell für anspruchsvolle Aufgaben ohne vertrauliche Inhalte.

Was du von uns bekommst

  • Architektur-Beratung

    Welches Betriebsmodell passt zu Daten, Volumen und Budget, mit Kostenvergleich.

  • Sicherheit & Zugriff

    Gateway, Rollen, Kontingente und Protokollierung, damit nur Berechtigte das Modell nutzen.

  • Monitoring & Kosten

    Qualität, Antwortzeiten, Auslastung und Kosten pro Anwendungsfall im Blick.

Häufige Fragen zur KI-Infrastruktur

Ist ein eigenes Sprachmodell günstiger als eine API?

Bei hohen, gleichmäßigen Volumen oft ja, bei wenigen Anfragen meist nicht. Wir rechnen beide Varianten für deinen Anwendungsfall durch.

Welche Hardware braucht ein selbst gehostetes Modell?

Das hängt von Modellgröße, Parallelität und gewünschter Geschwindigkeit ab. Kleinere Modelle laufen auf einer einzelnen GPU, größere brauchen mehrere.

Können Cloud- und eigene Modelle kombiniert werden?

Ja, das ist oft die beste Lösung. Ein Gateway entscheidet je nach Anwendung und Datenklasse, welches Modell genutzt wird.

Wer kümmert sich um Updates?

Auf Wunsch wir, inklusive Tests neuer Modellversionen gegen deine Testfälle, bevor sie produktiv gehen, zum Beispiel über e-levator.

Wo soll deine KI laufen?

Wir vergleichen Betriebsmodelle für deinen Anwendungsfall nach Datenschutz, Kosten und Aufwand.