Das Buch, aus dem diese Architektur stammt
Die fehlende Ebene ist nicht am Reißbrett entstanden. Sie ist das Ergebnis von 398 Seiten darüber, wie man diese Arbeit heute von Hand macht — jede Station des Anfragepfads, jede Rechnung, jeder Betriebsfehler, der schon jemandem passiert ist.
Der Enterprise AI Platform Lab Guide beschreibt den Handbetrieb vollständig: GPU-Infrastruktur und NVIDIA-Stack, GPU-Sharing, vLLM und KServe, Distributed Inference, Gateway, Identity, Governance, Observability, FinOps und Kapazitätsplanung. Wer wissen will, warum nyrvex so geschnitten ist, findet dort die Begründung — mit Labs, die auf einer einzelnen Karte laufen.
Vorausgesetzt wird Produktionserfahrung mit Kubernetes, GitOps, Identity-Providern, Secret-Verwaltung und Monitoring. Das Buch fängt dort an, wo die aufhören.
- Umfang
- 398 Seiten · 17 Kapitel · 4 Anhänge
- Format
- PDF, A4 · 7,4 MB
- Englisch
- 386-seitige Ausgabe bei Leanpub, ab 25 $
- Lizenz
- CC BY-ND 4.0 — Weitergabe im Unternehmen ausdrücklich erlaubt
PDF kostenlos herunterladen Englische Ausgabe kaufen
Der Download liegt beim Autor auf thomaszachmann.de. Keine Anmeldung, keine Adresse, kein Newsletter davor.
Sechs Teile, von der GPU bis zur Referenzarchitektur
- I
Grundlagen der LLM-Inferenz
Was auf der Karte tatsächlich passiert: Prefill und Decode, der KV-Cache, die VRAM-Bilanz, Batching als zentraler Hebel, Modellformate und Quantisierung.
- II
GPU-Infrastruktur
Wie aus einer Karte eine Plattform-Ressource wird: NVIDIA-Software-Stack, GPUs unter Kubernetes, GPU-Sharing und Multi-Tenancy.
- III
Model Serving
vLLM von der Architektur bis in den Produktionsbetrieb, Distributed Inference, KServe und das übrige Serving-Ökosystem.
- IV
Der Enterprise-Layer
AI Gateway mit LiteLLM, Identity, Autorisierung und Secrets, AI Security, Governance und Compliance.
- V
Betrieb
Observability und FinOps, RAG-Infrastruktur betreiben, Model Lifecycle, GitOps und Delivery.
- VI
Synthese
Referenzarchitekturen und Kapazitätsplanung in drei Größenordnungen — durchgerechnet, von unter hundert bis zu mehreren tausend Nutzern.
Vier Anhänge folgen: Interview- und Whiteboard-Training, das Referenz-Repository, Kommando- und Konfigurationsreferenz, Glossar und Sachregister.
NVIDIA ist eine Marke der NVIDIA Corporation. Alle weiteren Produktnamen sind Marken der jeweiligen Inhaber. Dieses Buch ist eine unabhängige Veröffentlichung und steht in keiner Verbindung zu ihnen.