Analyseer quantisatie en verwante technieken voor efficiënte neurale inferentie.
Bestudeer quantisatie van neurale netwerken, een methode met aangeleerde stapgrootte, inferentie-efficiëntie en een bredere verzameling technieken voor LLM-efficiëntie. Je onderscheidt representatie- en rekentrade-offs van hardware-effecten, vergelijkt compressiemethoden en ontwerpt taakgerichte kwaliteits- en latencycontroles. De video's zijn Engelstalig; het oorspronkelijke materiaal is analytische begeleiding, geen transcript.
Leg uit hoe lagere numerieke precisie opslag, rekenwerk en voorspellingskwaliteit kan veranderen. Vergelijk quantisatie met pruning, distillatie en low-rank adaptation op basis van wat ze veranderen. Ontwerp een hardwarebewuste evaluatie van gecomprimeerde inferentie met kwaliteit, latency, geheugen en implementatieaannames.
Ervaring met neurale netwerken en modelevaluatie is aanbevolen. Kennis van numerieke precisie, inferentie en basale hardwarematen helpt; een specifieke accelerator of framework is niet vereist.
Ervaren cursisten die geavanceerde AI-vaardigheden willen verdiepen en toepassen
Mensen die het beste leren met voorbeelden, begeleide lessen en praktische oefeningen
Professionals, makers en zelfstandige bouwers die een herhaalbare werkwijze zoeken
Les 1 is gratis
4 lessen · Gevorderd · Volledige cursus.
Deze cursus gebruikt CC BY-gelicentieerd materiaal met naamsvermelding van de inhoudsprovider of uploader. Lesvideo’s zijn alleen na aanmelding beschikbaar wanneer de publicatie- en licentiecontroles zijn geslaagd.