Member of Inception Program

Apertus v1.5 70B auf einer einzelnen NVIDIA RTX PRO 6000 Blackwell

Apertus v1.5 70B wird als rund 145 GB (135 GiB) BF16 Gewichte ausgeliefert und benötigt offiziell zwei H200 Rechenzentrums-GPUs. Wir zeigen, wie es auf einer einzelnen NVIDIA RTX PRO 6000 Blackwell mit 96 GB VRAM läuft, mit Vision Input, nativem Tool Calling und einem 192k-Kontextprofil (229k gemessenes Maximum). Dank dreistufiger Mixed-Precision Quantisierung (NVFP4 + FP8) decodiert es 55% schneller als FP8, verwendet 32% weniger Gewichtsspeicher und behält 99% der FP8-MMLU-Qualität.