nyrvex.

Lab Guide

Enterprise AI Platform

GPU-Infrastruktur, Model Serving und der Betrieb drumherum — aufgebaut an einem Referenz-Lab, das sich nachbauen lässt. Das Buch, aus dem die nyrvex-Architektur stammt.

Ausgabe 398 Seiten · 17 Kapitel · 4 Anhänge · Stand September 2026
PDF, A4 · kostenlos · CC BY-ND 4.0
Das Buch
Umschlag des Lab Guide Enterprise AI Platform

Das Buch, aus dem diese Architektur stammt

Die fehlende Ebene ist nicht am Reißbrett entstanden. Sie ist das Ergebnis von 398 Seiten darüber, wie man diese Arbeit heute von Hand macht — jede Station des Anfragepfads, jede Rechnung, jeder Betriebsfehler, der schon jemandem passiert ist.

Der Enterprise AI Platform Lab Guide beschreibt den Handbetrieb vollständig: GPU-Infrastruktur und NVIDIA-Stack, GPU-Sharing, vLLM und KServe, Distributed Inference, Gateway, Identity, Governance, Observability, FinOps und Kapazitätsplanung. Wer wissen will, warum nyrvex so geschnitten ist, findet dort die Begründung — mit Labs, die auf einer einzelnen Karte laufen.

Vorausgesetzt wird Produktionserfahrung mit Kubernetes, GitOps, Identity-Providern, Secret-Verwaltung und Monitoring. Das Buch fängt dort an, wo die aufhören.

Umfang
398 Seiten · 17 Kapitel · 4 Anhänge
Format
PDF, A4 · 7,4 MB
Englisch
386-seitige Ausgabe bei Leanpub, ab 25 $
Lizenz
CC BY-ND 4.0 — Weitergabe im Unternehmen ausdrücklich erlaubt

PDF kostenlos herunterladen Englische Ausgabe kaufen

Der Download liegt beim Autor auf thomaszachmann.de. Keine Anmeldung, keine Adresse, kein Newsletter davor.

Inhalt

Sechs Teile, von der GPU bis zur Referenzarchitektur

  • I

    Grundlagen der LLM-Inferenz

    Was auf der Karte tatsächlich passiert: Prefill und Decode, der KV-Cache, die VRAM-Bilanz, Batching als zentraler Hebel, Modellformate und Quantisierung.

  • II

    GPU-Infrastruktur

    Wie aus einer Karte eine Plattform-Ressource wird: NVIDIA-Software-Stack, GPUs unter Kubernetes, GPU-Sharing und Multi-Tenancy.

  • III

    Model Serving

    vLLM von der Architektur bis in den Produktionsbetrieb, Distributed Inference, KServe und das übrige Serving-Ökosystem.

  • IV

    Der Enterprise-Layer

    AI Gateway mit LiteLLM, Identity, Autorisierung und Secrets, AI Security, Governance und Compliance.

  • V

    Betrieb

    Observability und FinOps, RAG-Infrastruktur betreiben, Model Lifecycle, GitOps und Delivery.

  • VI

    Synthese

    Referenzarchitekturen und Kapazitätsplanung in drei Größenordnungen — durchgerechnet, von unter hundert bis zu mehreren tausend Nutzern.

Vier Anhänge folgen: Interview- und Whiteboard-Training, das Referenz-Repository, Kommando- und Konfigurationsreferenz, Glossar und Sachregister.

NVIDIA ist eine Marke der NVIDIA Corporation. Alle weiteren Produktnamen sind Marken der jeweiligen Inhaber. Dieses Buch ist eine unabhängige Veröffentlichung und steht in keiner Verbindung zu ihnen.