
Andrew Ng, pionero en la aplicación de GPU para el aprendizaje profundo, cofundador de Google Brain y ex director científico de Baidu, discutió la importancia del movimiento de la IA centrada en datos, que considera clave para el desarrollo de sistemas de IA efectivos. Indicó que en la última década, los avances significativos en el aprendizaje profundo se han debido al uso de modelos más potentes que procesan enormes volúmenes de datos. Sin embargo, Ng opina que este enfoque no es universal y no funcionará en industrias donde simplemente no existen grandes conjuntos de datos.
En particular, señaló: «En muchas industrias donde simplemente no existen conjuntos de datos gigantescos, creo que la atención debe cambiar de los grandes datos a los datos de calidad. Tener 50 ejemplos bien pensados puede ser suficiente para explicar a una red neuronal lo que quieres que aprenda». Esta afirmación subraya la importancia de un enfoque cualitativo hacia los datos, en lugar de su cantidad. Ng también menciona que la recopilación de grandes volúmenes de datos puede ser una actividad costosa. «Recopilar más datos a menudo ayuda, pero si intentas recolectar más datos para todo, puede convertirse en una actividad muy costosa», añadió. En este contexto, enfatiza que las empresas deben centrarse en la selección cualitativa de datos, no solo en aumentar su volumen.
También señaló el enorme potencial que ofrece el movimiento de la IA centrada en datos. «Creo que es muy probable que en esta década el cambio más grande esté relacionado con la IA centrada en datos», afirma Ng. Dado que las arquitecturas actuales de redes neuronales han evolucionado significativamente, ahora la nueva paradigma requiere un enfoque sistemático hacia la ingeniería de datos. En el contexto del creciente problema de la responsabilidad y el sesgo en los sistemas de IA, Ng destacó que es importante abordar la calidad de los datos de manera más responsable. En este sentido, elogió las discusiones en el reciente taller de NeurIPS, donde los investigadores intercambiaron ideas sobre cómo la IA centrada en datos puede ser estudiada y aplicada para reducir el sesgo. Mirando hacia el futuro, Ng subrayó que solo a través de un enfoque creativo hacia la ingeniería de datos las empresas podrán desarrollar soluciones de IA confiables y sostenibles que ofrezcan ventajas significativas en los sectores de producción y otros. Concluyó que el movimiento de la IA centrada en datos plantea el desafío de cómo escalar tales soluciones sin contratar a 10,000 especialistas en ML para 10,000 fabricantes.





