Eine API für jeden LLM-Anbieter. Betrieben auf Schweizer Infrastruktur.

LiteLLM ist ein quelloffenes KI-Gateway und gibt deinen Teams einen API-Endpunkt für mehr als 100 LLM-Anbieter. VSHN rollt LiteLLM auf Schweizer Cloud-Infrastruktur aus und betreibt es, mit Routing über mehrere Anbieter, Kostenerfassung und Daten, die in der Schweiz bleiben.

Beratung buchen
100+ LLM-Anbieter
seit 2014 DevOps-Firma
ISO 27001 zertifiziert

Einheitliches KI-Gateway

Mit LiteLLM Anfragen über eine einzige API im OpenAI-Format an mehr als 100 LLM-Anbieter leiten. VSHN rollt deinen LiteLLM-Proxy auf Kubernetes aus und betreibt ihn, damit deine Anwendungen ohne Codeänderung zwischen Anthropic, OpenAI, Mistral und selbst betriebenen Modellen wechseln können, alles über Schweizer Infrastruktur, mit vollständiger Protokollierung und Nachvollziehbarkeit der Anfragen.

Kostenerfassung und Budgetkontrolle

Die meisten LLM-Anbieter kennen Ausgabenlimits nur auf Kontoebene, eine einzelne Person kann also das Budget der ganzen Organisation aufbrauchen. LiteLLM ergänzt Ausgabenobergrenzen pro Person, pro Team und pro Projekt, mit Kostenerfassung in Echtzeit. VSHN richtet Budgetalarme, Ausgabenlimits und die Berichte zur internen Weiterverrechnung ein, damit du jederzeit weisst, was deine KI-Workloads kosten, und Mittel über Abteilungen verteilen kannst, ohne aus dem Ruder laufende Kosten zu riskieren.

Rate Limiting und Guardrails

Schütze deine LLM-Infrastruktur mit Rate Limiting pro Person, Inhaltsfilterung und Prüfung der Anfragen. VSHN konfiguriert das Guardrail-Framework von LiteLLM auf Kubernetes, mit Anbindung an SSO und RBAC, damit nur berechtigte Personen und Anwendungen auf bestimmte Modelle zugreifen, mit einstellbarer Drosselung gegen ausufernde Kosten.

Lastverteilung über mehrere Anbieter

LLM-Anfragen für Zuverlässigkeit und Kostenoptimierung über mehrere Anbieter und Modellinstanzen verteilen. Unsere Engineers richten die Lastverteilung von LiteLLM auf OpenShift und Kubernetes ein, mit Failover-Routing, Auswahl nach Latenz und Health Checks der Anbieter. So bleiben deine KI-Anwendungen auch dann ansprechbar, wenn einzelne Anbieter ausfallen.

Daten bleiben in der Schweiz

Die Protokolle des LiteLLM-Proxys, die API-Schlüssel und die Metadaten der Anfragen bleiben in Schweizer Rechenzentren. VSHN betreibt auf Exoscale, Cloudscale und weiteren Schweizer Cloud-Anbietern, was die DSGVO-Konformität und den Datenstandort für Organisationen sichert, die kontrollieren müssen, wohin ihre Prompts und Antworten geleitet und wo sie protokolliert werden. Mehr dazu in unserer Souveränitätsbewertung.

Observability und Auswertung

Latenz der Anfragen, Tokenverbrauch, Fehlerraten und Leistung der Anbieter über dein ganzes LLM-Gateway hinweg beobachten. VSHN bindet Prometheus, Grafana und die Analyse-Dashboards von LiteLLM in deine Plattform ein, damit du weisst, welche Modelle am besten abschneiden, wo die Engpässe liegen und wann Routing oder Skalierung anzupassen sind.

Häufige Fragen zu LiteLLM

Welche Plattformen unterstützt VSHN für LiteLLM-Workloads?

VSHN rollt LiteLLM auf APPUiO (unserer verwalteten Kubernetes-Plattform), auf Red Hat OpenShift, auf privater Cloud-Infrastruktur im Unternehmen und bei souveränen Cloud-Partnern aus und betreibt es dort. Alle Plattformen laufen in Schweizer oder europäischen Rechenzentren, mit einem SLA von bis zu 99,99 Prozent Verfügbarkeit. Wir helfen dir, die passende Plattform nach deinen Anforderungen an Compliance, Leistung und Budget zu wählen.

Welche Cloud-Anbieter stehen für LiteLLM zur Verfügung?

VSHN betreibt auf mehreren Schweizer Cloud-Anbietern, darunter Exoscale und Cloudscale, sowie bei europäischen souveränen Cloud-Partnern. LiteLLM selbst kann Anfragen an über 100 LLM-Anbieter weiterleiten, die Infrastruktur des Proxys und sämtliche Protokolle der Anfragen bleiben dabei auf Schweizer Servern. Die gesamte Infrastruktur läuft unter einem einzigen SLA, mit Support rund um die Uhr aus unserem Betriebsteam.

Wie funktioniert LiteLLM als KI-Gateway?

LiteLLM arbeitet als Proxy und übersetzt Anfragen in eine einheitliche API im OpenAI-Format, unabhängig vom Anbieter dahinter. Der Zusatzaufwand an Latenz ist gering, dafür kommen Kostenerfassung, Rate Limiting, Lastverteilung und Zugriffssteuerung über SSO dazu. VSHN rollt LiteLLM auf Kubernetes aus, hochverfügbar, mit automatischer Skalierung und vollständiger Observability für produktive Workloads.

Wie kalkuliert und offeriert VSHN ein LiteLLM-Mandat?

Jedes Mandat beginnt mit einem kostenlosen Architekturgespräch, in dem wir deine Nutzungsmuster, die gewünschten Anbieter und die regulatorischen Randbedingungen aufnehmen. Danach liefert VSHN ein schriftliches Scope-Dokument mit einer Offerte in CHF, zum Festpreis oder nach Aufwand. Typische Mandate umfassen das Ausrollen des Gateways, die Konfiguration der Anbieter, den Aufbau der Observability und automatisierte Backups für Konfigurationsdaten und Protokolle. In der Scoping-Phase entsteht keine Verpflichtung.

Welche LLM-Anbieter kann ich über LiteLLM anbinden?

LiteLLM unterstützt über 100 Anbieter, darunter OpenAI, Anthropic, Mistral, Cohere und Azure OpenAI, dazu selbst betriebene Modelle über vLLM oder Ollama, quelloffene Modelle wie Llama, Apertus (das Schweizer KI-Grundlagenmodell) und Qwen eingeschlossen. VSHN konfiguriert die Anbindung der Anbieter, die Verwaltung der API-Schlüssel und das Failover-Routing auf Kubernetes, damit deine Anwendungen einen einzigen verlässlichen Endpunkt bekommen, unabhängig davon, welche Modelle dahinterstehen.

Wie stellt VSHN die Datenhoheit bei LiteLLM sicher?

Der LiteLLM-Proxy, sämtliche Protokolle der Anfragen, die API-Schlüssel und die Konfiguration laufen in Schweizer Rechenzentren, betrieben von Schweizer oder europäischen souveränen Cloud-Anbietern. Der betriebliche Zugriff erfolgt durch Engineers in der Schweiz. Du bestimmst, welche externen LLM-Anbieter Prompts erhalten, und für die Compliance-Berichterstattung liefern wir Audit-Trails. Wie VSHN im EU Cloud Sovereignty Framework abschneidet, steht in unserer Souveränitätsbewertung.

Kann VSHN LiteLLM in bestehende Infrastruktur einbinden?

Ja. LiteLLM stellt eine zu OpenAI kompatible Standard-API bereit, bestehende Anwendungen brauchen also keine Codeänderung. VSHN bindet LiteLLM ausserdem an MCP-Server, an Pipelines für Retrieval Augmented Generation und an betreutes PostgreSQL mit pgvector als Vektorspeicher an, mit automatisierten Backups und einem SLA von bis zu 99,99 Prozent wie bei allen unseren verwalteten Datenbankdiensten.

Welches Monitoring und welche Observability liefert VSHN für LiteLLM?

VSHN bindet Prometheus und Grafana in jede verwaltete Plattform ein, mit eigenen Dashboards für LiteLLM-spezifische Kennzahlen: Latenz der Anfragen (p50, p95, p99), Tokens pro Anfrage, Kosten pro Anbieter, Fehlerraten und Trefferquote des Caches. Alarmregeln benachrichtigen dein Team und unser Operations Center rund um die Uhr, sobald Messwerte Schwellen überschreiten. So fallen Probleme auf, bevor sie bei den Nutzenden ankommen.

Wie starte ich mit der LiteLLM-Beratung von VSHN?

Melde dich über das Formular unten für ein kostenloses Erstgespräch. Wir nehmen deine heutigen Nutzungsmuster, die gewünschten Anbieter und die regulatorischen Randbedingungen auf und schlagen dann eine Architektur auf APPUiO, OpenShift oder deiner bevorzugten Infrastruktur vor. Die Beratung zu LiteLLM ist Teil der breiteren Praxis von VSHN rund um den Betrieb von LLM. Das Gesamtbild steht auf llmops.ch.

Beratung zu LiteLLM buchen

Erzähl uns von deiner Anbieterlandschaft und deinen Anforderungen an das Gateway. VSHN bietet ein kostenloses Erstgespräch zur LiteLLM-Architektur, zum Routing über die Anbieter und einen Vorschlag mit klarem Umfang für deine Installation.

Kostenloses Gespräch buchen

Oder stelle deine Frage