Datos de entrenamiento

De Wiki de TI Responsable

Los datos de entrenamiento son el conjunto de ejemplos, textos, imágenes, sonidos y datos estructurados a partir de los cuales aprende un modelo de inteligencia artificial.

Qué depende de ellos

La calidad, la representatividad y la procedencia de estos datos determinan el rendimiento del modelo y sus defectos. Un modelo no puede ser mejor que los datos con los que se ha entrenado.

Antes de entrenar un modelo o reutilizar uno existente, conviene comprobar:

  • la representatividad: qué poblaciones, idiomas y situaciones están presentes y cuáles faltan (véase Sesgo algorítmico (FR));
  • la procedencia y los derechos: si los contenidos podían utilizarse para esa finalidad;
  • los datos personales (FR): su presencia implica la aplicación del RGPD (FR), incluso cuando un tercero ha entrenado el modelo;
  • la trazabilidad: el Reglamento de Inteligencia Artificial (FR) exige documentar los conjuntos de datos de los modelos de uso general.

Sobriedad en el uso de recursos

Aumentar el volumen de datos no mejora indefinidamente un modelo, pero sí incrementa el coste de entrenamiento. Un conjunto más reducido, mejor compuesto y mejor documentado suele ofrecer mejores resultados que una acumulación indiscriminada.

Véase también