On-Premise-KI skaliert flexibel und schrittweise: Sie können horizontal skalieren (weitere Server hinzufügen) oder vertikal skalieren (leistungsstärkere GPUs). Die onprem.ai Software verwaltet alle Systeme zentral und verteilt die Last automatisch.
Skalierungsstrategien
Horizontal skalieren (mehr Server)
Vorteil:
- Kapazität wächst in 2-GPU-Schritten
- Keine Ersetzung bestehender Hardware erforderlich
- Flexible Erweiterung vom S1 über S2 bis zu den Rechenzentrums-Konfigurationen DC4 und DC8
Alle Konfigurationen im Überblick: Server-Seite
Vertikal skalieren (leistungsstärkere GPUs)
Vorteil:
- Höhere Performance und mehr Speicher pro Server
- Weniger Verwaltungsaufwand
Die Software unterstützt das gesamte NVIDIA-Spektrum von der RTX PRO 6000 Blackwell bis zu den Rechenzentrums-GPUs H100, H200 und GH200. Details zu den unterstützten GPUs: Software-Seite
Hybrid-Ansatz
Kombination:
- Basis-Server für Standard-Workloads
- Leistungsstarke Server für kritische Anwendungen
- Zentrale Verwaltung über die onprem.ai Software
Skalierung ohne Datenverlust
Vorteile der modularen Architektur:
- Server können hinzugefügt werden, ohne bestehende Konfigurationen zu ändern
- Modelle bleiben auf allen Servern verfügbar
- Keine Datenmigration erforderlich
- Rolling Updates ohne Ausfallzeiten, Self-Healing bei Ausfällen
Kosten bei Skalierung
On-Premise:
- Zusätzliche Hardware nur bei Bedarf
- Keine Nutzungsabhängigkeit, vorhersehbare Kosten
Cloud:
- Jeder zusätzliche Nutzer bedeutet mehr Token-Kosten
- Unvorhersehbare Rechnungen
Je mehr Nutzer, desto schneller amortisiert sich die eigene Hardware. Was das für Ihr Team konkret bedeutet, zeigt der Kostenrechner mit Break-even und Restwert über drei Jahre.
Nächste Schritte
- Kostenrechner öffnen und Skalierung planen
- Kontakt aufnehmen für individuelle Skalierungsoptionen
Quellen und weiterführende Informationen:
- Klein starten und skalieren (Skalierungsstrategien)
- On-Premise AI für KMU (Skalierung und Cluster)