Redes neuronales profundas

Deep Learning

Aprendizaje automático con redes de muchas capas que extraen representaciones cada vez más abstractas — de píxeles a conceptos, de fonemas a significado.

¿Qué es el Deep Learning?

El Deep Learning (DL) es un subcampo del Machine Learning que utiliza redes neuronales artificiales con múltiples capas ocultas («profundas»). Cada capa transforma la entrada y pasa una representación más refinada a la siguiente, de forma análoga a cómo distintas áreas del cerebro procesan información en cascada.

A diferencia de modelos clásicos que requieren ingeniería manual de características (por ejemplo, extraer bordes en una imagen a mano), las redes profundas aprenden esas características directamente de los datos cuando hay suficiente volumen y potencia de cómputo.

El auge del DL en la última década se debe a tres factores: grandes conjuntos de datos, GPUs y algoritmos como la retropropagación optimizada que permiten entrenar millones de parámetros de forma estable.

¿Cómo funciona una red profunda?

Una neurona artificial recibe entradas, las combina con pesos aprendibles, aplica una función de activación y transmite el resultado. Apilando miles de neuronas en capas, la red puede aproximar funciones muy complejas.

Retropropagación

Tras cada predicción, el error se propaga hacia atrás capa por capa. Los pesos se ajustan con descenso de gradiente (y variantes como Adam) para reducir la pérdida en el conjunto de entrenamiento.

Representaciones jerárquicas

Las capas inferiores capturan detalles simples (bordes, texturas); las superiores combinan esos detalles en objetos, escenas o categorías semánticas sin programar cada nivel explícitamente.

Técnicas como dropout, normalización por lotes y arquitecturas especializadas (CNN, RNN, Transformers) ayudan a entrenar redes más profundas sin que colapsen o memoricen ruido.

Arquitecturas y dominios

  • CNN (redes convolucionales): diseñadas para datos en cuadrícula, como imágenes y vídeo. Detectan patrones locales con filtros que se desplazan por la imagen.
  • RNN y LSTM: procesan secuencias temporales: audio, series de sensores o texto antes de la era dominante del Transformer.
  • Transformers: usan mecanismos de atención para relacionar cualquier parte de la entrada con cualquier otra. Base de los LLM actuales y de muchos sistemas de visión modernos.
  • GAN y difusión: generan imágenes, música o vídeo sintético aprendiendo la distribución de los datos de entrenamiento.

Aplicaciones que cambian industrias

El reconocimiento facial, la conducción asistida, la traducción neuronal, los asistentes por voz, el diagnóstico por imagen médica y la generación de contenido creativo dependen en gran medida del Deep Learning.

También impulsa sistemas de recomendación avanzados, detección de defectos en líneas de producción y modelos que resumen documentos largos. El coste computacional y energético del entrenamiento es un tema relevante: por eso muchas organizaciones usan modelos preentrenados y los adaptan (fine-tuning) en lugar de entrenar desde cero.

Ejemplo concreto: Tu móvil desbloquea la pantalla con tu rostro gracias a una red convolucional entrenada con millones de rostros. Compara un mapa de características faciales en tiempo real con el patrón guardado de forma segura en el dispositivo — sin enviar la imagen completa a un servidor en cada desbloqueo.

Conceptos relacionados

El Deep Learning se apoya en el Machine Learning y alimenta especialmente el procesamiento del lenguaje y los modelos generativos:

Del modelo al producto real

Descubre cómo estas redes se integran en aplicaciones que usamos cada día o repasa los conceptos generales de la IA.

Ver aplicaciones reales → Volver a ¿Qué es la IA?