Frage Nachvollziehbar belegt

Fachwissen für digitale Entscheidungen

Wie bleibt der KI-Dienst bei Modell- oder Serverausfällen verfügbar?

Kurzantwort

Verfügbarkeit entsteht durch getrennte Fehlerdomänen: mindestens 2 Dienstinstanzen, Health-Checks, Load Balancer, replizierte Zustandsdaten und einen getesteten Rückfall. Zwei Prozesse auf demselben Server schützen nicht vor dessen Ausfall. Für Modellfehler braucht es zusätzlich versionierte Artefakte, Canary-Rollout und sofortigen Rollback.

Fehlerdomänen statt doppelter Prozesse

Der Dienst wird in Schichten betrachtet: Gateway, Inferenz, Vektor- und Metadatenspeicher, Identity Provider sowie Quellsysteme. Jede Schicht erhält ein definiertes Ausfallverhalten. Mindestens 2 Inferenzinstanzen erhöhen die Verfügbarkeit nur, wenn sie nicht dieselbe einzige Stromversorgung, GPU, Maschine oder andere gemeinsame Fehlerursache teilen. Ein Load Balancer sendet neue Anfragen nur an Instanzen, deren Readiness-Prüfung erfolgreich ist.

Health-Checks müssen mehr als einen laufenden Prozess erkennen. Qdrant stellt beispielsweise /healthz, /livez und /readyz bereit; das Serving-System sollte vergleichbare Liveness- und Readiness-Signale liefern. Readiness darf erst positiv sein, wenn Modell und notwendige Ressourcen geladen sind. Sonst erhält ein frisch gestarteter, aber noch nicht nutzbarer Prozess Produktionsverkehr. Zeitlimits, begrenzte Wiederholungen und Circuit Breaker verhindern Fehlerketten.

Zustandsdaten werden passend zum RPO repliziert und zusätzlich gesichert. Qdrant weist darauf hin, dass der standardmäßige Replication Factor 1 keine zusätzliche Kopie bietet; ein Faktor 2 verdoppelt die betreffenden Datenkopien und damit den Speicherbedarf. Replikation schützt dennoch nicht vor logischem Löschen. Backup und Restore-Test bleiben erforderlich.

Bei einem Modellwechsel laufen alte und neue Version parallel. Ein Canary erhält einen kleinen, kontrollierten Teil der Last; Qualitäts-, Fehler- und Latenzmetriken entscheiden über Ausbau oder Rollback. Ein technisches Fallback kann ein kleineres geprüftes Modell, eine reine Suche oder eine klare Nichtverfügbarkeitsmeldung sein. Es darf keine scheinbar vollständige Antwort mit ungeprüfter Qualität erzeugen. Kubernetes PodDisruptionBudgets begrenzen freiwillige Unterbrechungen, schützen aber laut Dokumentation nicht vor allen unfreiwilligen Ausfällen. Deshalb werden regelmäßig Übungen für Instanz-, Knoten-, Modell- und Datenspeicherausfall durchgeführt.

Kernfakten

Mindestaufbau
2 Instanzen in getrennten Fehlerdomänen plus Load Balancer
Qdrant-Replikation
Replication Factor 1 ohne Zusatzkopie; Faktor 2 benötigt etwa doppelte Kopien
Modellwechsel
Canary und getesteter Rollback mit versionierten Artefakten

Quellen

Alle externen Angaben nachvollziehbar belegt.
  1. 01
  2. 02
  3. 03

Bereit für Ihr nächstes Projekt?

Kostenloses Erstgespräch - ohne Verkaufsdruck, mit klaren Antworten.

Beratung anfragen