Inférence neuronale efficace : quantification et compression

Analysez quantification et techniques connexes pour accélérer l’inférence neuronale.

Vous cherchez des tutoriels pas à pas sur des outils d’IA précis ?

Présentation du cours

Le parcours examine quantification des réseaux, quantification à pas appris, efficacité d’inférence et méthodes plus larges d’efficacité des grands modèles de langue. Distinguez compromis de représentation et de calcul des effets matériels, comparez les méthodes de compression et concevez des contrôles de qualité et de latence adaptés à la tâche. Les vidéos en anglais sont accompagnées de notes analytiques originales, non de transcriptions.

Expliquer comment une précision numérique réduite peut modifier stockage, calcul et qualité des prédictions. Comparer quantification, élagage, distillation et adaptation de faible rang selon ce que chaque méthode modifie. Concevoir une évaluation de l’inférence compressée tenant compte du matériel, de la qualité, de la latence et de la mémoire.

Une expérience des réseaux de neurones et de l’évaluation est recommandée. Les notions de précision numérique, d’inférence et de mesures matérielles sont utiles ; aucun accélérateur ni environnement particulier n’est requis.

Aux apprenants expérimentés souhaitant approfondir et appliquer des compétences avancées en IA

Aux personnes qui apprennent mieux avec des exemples, des leçons guidées et de la pratique

Aux professionnels, créateurs et développeurs indépendants recherchant une méthode reproductible

La leçon 1 est gratuite

4 leçons · Avancé · Cours complet.

Contenu de cours sous licence ouverte · sous licence CC BY · licence vérifiée

Ce cours utilise du contenu sous licence CC BY attribué à son fournisseur ou à la personne qui l’a mis en ligne. La lecture des leçons est disponible uniquement après authentification et validation des contrôles de publication et de licence.