Analysez quantification et techniques connexes pour accélérer l’inférence neuronale.
Le parcours examine quantification des réseaux, quantification à pas appris, efficacité d’inférence et méthodes plus larges d’efficacité des grands modèles de langue. Distinguez compromis de représentation et de calcul des effets matériels, comparez les méthodes de compression et concevez des contrôles de qualité et de latence adaptés à la tâche. Les vidéos en anglais sont accompagnées de notes analytiques originales, non de transcriptions.
Expliquer comment une précision numérique réduite peut modifier stockage, calcul et qualité des prédictions. Comparer quantification, élagage, distillation et adaptation de faible rang selon ce que chaque méthode modifie. Concevoir une évaluation de l’inférence compressée tenant compte du matériel, de la qualité, de la latence et de la mémoire.
Une expérience des réseaux de neurones et de l’évaluation est recommandée. Les notions de précision numérique, d’inférence et de mesures matérielles sont utiles ; aucun accélérateur ni environnement particulier n’est requis.
Aux apprenants expérimentés souhaitant approfondir et appliquer des compétences avancées en IA
Aux personnes qui apprennent mieux avec des exemples, des leçons guidées et de la pratique
Aux professionnels, créateurs et développeurs indépendants recherchant une méthode reproductible
La leçon 1 est gratuite
4 leçons · Avancé · Cours complet.
Ce cours utilise du contenu sous licence CC BY attribué à son fournisseur ou à la personne qui l’a mis en ligne. La lecture des leçons est disponible uniquement après authentification et validation des contrôles de publication et de licence.