Efficiënte neurale inferentie: quantisatie en compressie

Analyseer quantisatie en verwante technieken voor efficiënte neurale inferentie.

Op zoek naar stapsgewijze tutorials voor afzonderlijke AI-tools?

Cursusoverzicht

Bestudeer quantisatie van neurale netwerken, een methode met aangeleerde stapgrootte, inferentie-efficiëntie en een bredere verzameling technieken voor LLM-efficiëntie. Je onderscheidt representatie- en rekentrade-offs van hardware-effecten, vergelijkt compressiemethoden en ontwerpt taakgerichte kwaliteits- en latencycontroles. De video's zijn Engelstalig; het oorspronkelijke materiaal is analytische begeleiding, geen transcript.

Leg uit hoe lagere numerieke precisie opslag, rekenwerk en voorspellingskwaliteit kan veranderen. Vergelijk quantisatie met pruning, distillatie en low-rank adaptation op basis van wat ze veranderen. Ontwerp een hardwarebewuste evaluatie van gecomprimeerde inferentie met kwaliteit, latency, geheugen en implementatieaannames.

Ervaring met neurale netwerken en modelevaluatie is aanbevolen. Kennis van numerieke precisie, inferentie en basale hardwarematen helpt; een specifieke accelerator of framework is niet vereist.

Ervaren cursisten die geavanceerde AI-vaardigheden willen verdiepen en toepassen

Mensen die het beste leren met voorbeelden, begeleide lessen en praktische oefeningen

Professionals, makers en zelfstandige bouwers die een herhaalbare werkwijze zoeken

Les 1 is gratis

4 lessen · Gevorderd · Volledige cursus.

Cursusinhoud met open licentie · CC BY-gelicentieerd · licentie geverifieerd

Deze cursus gebruikt CC BY-gelicentieerd materiaal met naamsvermelding van de inhoudsprovider of uploader. Lesvideo’s zijn alleen na aanmelding beschikbaar wanneer de publicatie- en licentiecontroles zijn geslaagd.