Member of Inception Program

Wie skaliert die On-Premise-KI-Lösung?

On-Premise-KI skaliert flexibel und schrittweise: Sie können horizontal skalieren (weitere Server hinzufügen) oder vertikal skalieren (leistungsstärkere GPUs). Die onprem.ai Software verwaltet alle Systeme zentral und verteilt die Last automatisch.

Skalierungsstrategien

Horizontal skalieren (mehr Server)

Vorteil:

  • Kapazität wächst in 2-GPU-Schritten
  • Keine Ersetzung bestehender Hardware erforderlich
  • Flexible Erweiterung vom S1 über S2 bis zu den Rechenzentrums-Konfigurationen DC4 und DC8

Alle Konfigurationen im Überblick: Server-Seite

Vertikal skalieren (leistungsstärkere GPUs)

Vorteil:

  • Höhere Performance und mehr Speicher pro Server
  • Weniger Verwaltungsaufwand

Die Software unterstützt das gesamte NVIDIA-Spektrum von der RTX PRO 6000 Blackwell bis zu den Rechenzentrums-GPUs H100, H200 und GH200. Details zu den unterstützten GPUs: Software-Seite

Hybrid-Ansatz

Kombination:

  • Basis-Server für Standard-Workloads
  • Leistungsstarke Server für kritische Anwendungen
  • Zentrale Verwaltung über die onprem.ai Software

Skalierung ohne Datenverlust

Vorteile der modularen Architektur:

  • Server können hinzugefügt werden, ohne bestehende Konfigurationen zu ändern
  • Modelle bleiben auf allen Servern verfügbar
  • Keine Datenmigration erforderlich
  • Rolling Updates ohne Ausfallzeiten, Self-Healing bei Ausfällen

Kosten bei Skalierung

On-Premise:

  • Zusätzliche Hardware nur bei Bedarf
  • Keine Nutzungsabhängigkeit, vorhersehbare Kosten

Cloud:

  • Jeder zusätzliche Nutzer bedeutet mehr Token-Kosten
  • Unvorhersehbare Rechnungen

Je mehr Nutzer, desto schneller amortisiert sich die eigene Hardware. Was das für Ihr Team konkret bedeutet, zeigt der Kostenrechner mit Break-even und Restwert über drei Jahre.

Nächste Schritte


Quellen und weiterführende Informationen: