Diseña un plan de evaluación defendible para resultados lingüísticos y multimodales.
El recorrido avanza desde criterios de calidad hasta los límites de los benchmarks y la evidencia de confianza, y termina con un caso de evaluación multimodal. Una clasificación o una puntuación única no es un veredicto: define el uso previsto, comprueba la adecuación de los datos y la rúbrica, y analiza fallos por grupos. Las actividades combinan pruebas cuantitativas, revisión cualitativa y supervisión humana proporcional.
Elegir criterios medibles acordes con el uso previsto y el coste de los errores. Explicar cómo la contaminación, la saturación y una medición mal planteada debilitan las comparaciones. Combinar pruebas, revisión cualitativa y supervisión humana para tomar una decisión fundamentada.
Se recomienda tener experiencia en evaluación de aprendizaje automático o aplicaciones generativas. Son útiles la precisión, la exhaustividad, el muestreo y las comparaciones estadísticas básicas.
Personas con experiencia que quieren profundizar y aplicar habilidades avanzadas de IA
Quienes aprenden mejor con ejemplos, lecciones guiadas y práctica
Profesionales, creadores y desarrolladores independientes que buscan un flujo de trabajo repetible
La lección 1 es gratis
4 lecciones · Avanzado · Curso completo.
Este curso utiliza material con licencia CC BY atribuido a su proveedor de contenido o a quien lo publicó. La reproducción de las lecciones solo está disponible tras iniciar sesión y superar las comprobaciones de publicación y licencia.