Effiziente neuronale Inferenz: Quantisierung und Kompression

Analysieren Sie Quantisierung und verwandte Verfahren für effiziente Inferenz.

Sie suchen Schritt-für-Schritt-Tutorials zu einzelnen KI-Tools?

Kursübersicht

Behandelt werden neuronale Quantisierung, gelernte Schrittweitenquantisierung, Inferenzleistung und weitere Effizienzverfahren für große Sprachmodelle. Sie unterscheiden Repräsentations- und Rechenkompromisse von tatsächlichen Hardwareeffekten, vergleichen Kompressionsverfahren und planen aufgabenspezifische Qualitäts- und Latenzprüfungen. Die englischsprachigen Videos werden mit originären analytischen Lernmaterialien ergänzt.

Erklären, wie geringere numerische Präzision Speicherung, Rechenoperationen und Vorhersagequalität verändern kann. Quantisierung mit Pruning, Distillation und Low-Rank Adaptation danach vergleichen, was jeweils verändert wird. Eine hardwarebewusste Evaluation komprimierter Inferenz mit Qualität, Latenz, Speicher und Einsatzannahmen entwerfen.

Erfahrung mit neuronalen Netzen und Modellevaluation ist empfehlenswert. Kenntnisse zu numerischer Präzision, Inferenz und grundlegenden Hardwaremetriken sind hilfreich; kein bestimmter Beschleuniger oder Rahmenwerk ist erforderlich.

Erfahrene Lernende, die fortgeschrittene KI-Kenntnisse vertiefen und anwenden möchten

Menschen, die am besten mit Beispielen, Anleitung und praktischen Übungen lernen

Fachleute, Kreative und unabhängige Entwickler, die wiederholbare Abläufe suchen

Lektion 1 ist kostenlos

4 lektionen · Fortgeschritten · Vollständiger Kurs.

Kursinhalt mit offener Lizenz · CC BY-lizenziert · Lizenz verifiziert

Dieser Kurs verwendet CC BY-lizenziertes Material mit Namensnennung des Inhaltsanbieters oder Uploaders. Die Wiedergabe der Lektionen ist erst nach Anmeldung und bestandener Veröffentlichungs- und Lizenzprüfung verfügbar.