Inferencia neuronal eficiente: cuantización y compresión

Analiza la cuantización y técnicas relacionadas para una inferencia neuronal eficiente.

¿Buscas tutoriales paso a paso sobre herramientas de IA concretas?

Descripción del curso

Estudia cuantización de redes neuronales, cuantización con tamaño de paso aprendido, eficiencia de inferencia y técnicas más amplias para LLM. Distingue los compromisos de representación y cómputo de los efectos reales del hardware, compara métodos de compresión y diseña controles de calidad y latencia específicos para cada tarea. Los vídeos en inglés se acompañan de orientación analítica original, no de transcripciones copiadas.

Explicar cómo una precisión numérica menor puede cambiar almacenamiento, operaciones y calidad de predicción. Comparar cuantización con poda, destilación y adaptación de bajo rango según qué modifica cada método. Diseñar una evaluación de inferencia comprimida consciente del hardware que informe calidad, latencia, memoria y supuestos de despliegue.

Se recomienda experiencia con redes neuronales y evaluación de modelos. Ayuda conocer precisión numérica, inferencia y medidas básicas de hardware; no se exige un acelerador ni marco concreto.

Personas con experiencia que quieren profundizar y aplicar habilidades avanzadas de IA

Quienes aprenden mejor con ejemplos, lecciones guiadas y práctica

Profesionales, creadores y desarrolladores independientes que buscan un flujo de trabajo repetible

La lección 1 es gratis

4 lecciones · Avanzado · Curso completo.

Contenido de curso con licencia abierta · licencia CC BY · licencia verificada

Este curso utiliza material con licencia CC BY atribuido a su proveedor de contenido o a quien lo publicó. La reproducción de las lecciones solo está disponible tras iniciar sesión y superar las comprobaciones de publicación y licencia.