Introducción
Los sistemas cognitivos artificiales son sistemas computacionales diseñados para realizar, de manera parcial y orientada a una tarea, capacidades relacionadas con la cognición: percibir regularidades, construir representaciones, aprender de la experiencia, predecir, decidir y adaptar su comportamiento. No reproducen una mente completa ni una copia fiel del cerebro; combinan datos, modelos matemáticos, objetivos de aprendizaje y recursos de cómputo para resolver problemas que requieren interpretar información o elegir acciones.
Este glosario estudia tales sistemas principalmente desde el aprendizaje profundo. Parte de las neuronas artificiales y la retropropagación, continúa con los frameworks y las técnicas prácticas de entrenamiento, y después aborda arquitecturas especializadas: redes convolucionales para visión, representaciones distribuidas para lenguaje, redes recurrentes para secuencias y aprendizaje por refuerzo para decisiones sucesivas. También explica cómo las GPU, el entrenamiento distribuido y la nube permiten escalar el cálculo, y cómo el serving, la validación y la monitorización convierten un modelo entrenado en un sistema confiable en producción.
El recorrido concluye con modelos generativos y metaaprendizaje, que amplían el objetivo desde predecir una etiqueta hasta aprender distribuciones, producir muestras nuevas o mejorar el propio proceso de aprendizaje. En conjunto, el glosario presenta un sistema cognitivo artificial como una cadena completa: los datos se transforman en representaciones, una función de pérdida orienta el aprendizaje, el modelo produce decisiones o contenido y la infraestructura mantiene su funcionamiento en condiciones reales.
Tabla de contenido
Tabla de contenido
- 1. Introducción al aprendizaje profundo
- Inteligencia artificial (IA)
- Aprendizaje automático (machine learning)
- Característica (feature)
- Ingeniería de características (feature engineering)
- Aprendizaje de representaciones (representation learning)
- Aprendizaje profundo (deep learning)
- Neurona artificial o unidad
- Peso (weight)
- Sesgo (bias)
- Función de activación o no linealidad
- Función sigmoide
- Perceptrón multicapa (MLP)
- Capa de entrada, capa oculta y capa de salida
- Red totalmente conectada (fully connected network)
- Red prealimentada (feed-forward network)
- Inspiración biológica
- 2. Entrenamiento de redes neuronales
- MNIST
- Benchmark
- Hiperparámetro
- Función de coste o pérdida (loss)
- Error cuadrático medio (MSE)
- Optimización
- Derivada y derivada parcial
- Gradiente
- Descenso de gradiente (gradient descent)
- Tasa de aprendizaje (learning rate)
- Descenso de gradiente estocástico (SGD)
- Lote y minilote (batch y mini-batch)
- Pase hacia delante (forward pass)
- Regla de la cadena
- Retropropagación (backpropagation)
- Pase hacia atrás (backward pass)
- 3. Frameworks de aprendizaje profundo
- Framework de aprendizaje profundo
- Tensor
- Grafo de computación
- Diferenciación automática
- Grafo estático
- Grafo dinámico
- TensorFlow
- Sesión de TensorFlow
- Ejecución inmediata (eager execution)
- TensorBoard
- Theano
- Torch (Lua)
- PyTorch
- Caffe y Caffe2
- Microsoft Cognitive Toolkit (CNTK)
- Apache MXNet
- Keras
- API secuencial
- API funcional
- Capa densa (Dense)
- Compilación del modelo
- Entropía cruzada categórica
- 4. Entrenamiento práctico: activación, inicialización, optimización y regularización
- Saturación
- Tangente hiperbólica (tanh)
- Unidad lineal rectificada (ReLU)
- ReLU muerta
- Leaky ReLU y PReLU
- ELU
- Maxout
- Ruptura de simetría
- Inicialización aleatoria
- Inicialización Xavier o Glorot
- Inicialización He
- Normalización por lotes (batch normalization)
- Momento (momentum)
- Momento de Nesterov
- AdaGrad
- RMSProp
- Adam
- Decaimiento de la tasa de aprendizaje
- Sobreajuste (overfitting)
- Generalización
- Regularización
- Regularización L2
- Regularización L1
- Regularización por norma máxima (max-norm)
- Dropout
- Parada temprana (early stopping)
- Conjunto de validación
- 5. Redes neuronales convolucionales (CNN)
- Red neuronal convolucional (CNN)
- Clasificación de imágenes
- Recuperación de imágenes (image retrieval)
- Detección de objetos
- Segmentación
- Filtro o kernel convolucional
- Capa convolucional
- Mapa de activación
- Profundidad o canales
- Paso (stride)
- Relleno con ceros (zero-padding)
- Pooling
- Max pooling
- ImageNet e ILSVRC
- LeNet-5
- AlexNet
- VGGNet
- Aumento de datos (data augmentation)
- Aprendizaje por transferencia (transfer learning)
- Congelación de capas
- 6. Representaciones del lenguaje y Word2Vec
- Procesamiento del lenguaje natural (PLN)
- WordNet
- Vocabulario
- Frecuencia de término (term frequency)
- Bolsa de palabras (bag-of-words)
- Representación discreta
- Representación distribuida
- Vector de palabra o embedding
- Corpus
- Contexto y ventana
- Word2Vec
- Verosimilitud (likelihood)
- Similitud coseno
- Softmax
- Muestreo negativo (negative sampling)
- Skip-gram
- Continuous bag-of-words (CBOW)
- Vectores preentrenados
- 7. Redes neuronales recurrentes (RNN)
- Secuencia
- Red neuronal recurrente (RNN)
- Estado oculto (hidden state)
- Paso temporal (time step)
- RNN básica (vanilla RNN)
- Desenrollado de una RNN
- Retropropagación a través del tiempo (BPTT)
- BPTT truncada (TBPTT)
- Modelo del lenguaje
- Muestreo autoregresivo
- Gradiente explosivo
- Recorte de gradiente (gradient clipping)
- Gradiente desvanecido
- LSTM (long short-term memory)
- Estado de celda (cell state)
- Puertas de una LSTM
- GRU (gated recurrent unit)
- RNN apilada
- RNN bidireccional
- 8. Agentes inteligentes y aprendizaje profundo por refuerzo
- Aprendizaje por refuerzo (RL)
- Agente
- Entorno
- Estado
- Acción
- Recompensa (reward)
- Proceso de decisión de Markov (MDP)
- Propiedad de Markov
- Política
- Factor de descuento
- Política óptima
- Función de valor de estado
- Función de valor de acción (Q)
- Ecuación de optimalidad de Bellman
- Iteración de valores
- Q-learning
- Red Q profunda (DQN)
- Memoria de repetición de experiencias
- Red objetivo (target network)
- Episodio
- Compromiso exploración-explotación
- 9. GPU y entrenamiento distribuido
- Unidad de procesamiento gráfico (GPU)
- Unidad central de procesamiento (CPU)
- Ancho de banda de memoria
- CUDA
- cuDNN
- OpenCL
- Cuello de botella de entrada
- Paralelismo de modelo
- Paralelismo de datos
- Trabajador (worker)
- Servidor de parámetros
- Promedio de parámetros
- SGD asíncrono
- Downpour SGD
- Gradiente obsoleto (stale gradient)
- Benchmark de rendimiento
- 10. Nube y puesta en producción de modelos
- Inferencia
- Tiempo de servicio (serving time)
- Servidor de modelos
- Concurrencia
- Latencia y tiempo de ida y vuelta
- Batching de inferencia
- Buffer
- Balanceador de carga
- Versionado y rollback de modelos
- REST y gRPC
- Computación en la nube
- TPU (tensor processing unit)
- API de IA gestionada
- Monitorización
- Métricas offline y online
- Desviación entre entrenamiento y servicio (training-serving skew)
- Comportamiento por subpoblaciones
- Pipeline de entrenamiento continuo
- Validación de datos
- Validación del modelo
- 11. Modelos generativos y metaaprendizaje
- Modelo generativo
- Muestreo
- Estimación explícita de densidad
- Estimación implícita de densidad
- PixelRNN y PixelCNN
- Autoencoder variacional (VAE)
- Red generativa adversarial (GAN)
- Generador
- Discriminador
- Objetivo minimax de una GAN
- Metaaprendizaje (meta-learning)
- Ajuste de hiperparámetros
- Learner y meta-learner
- Aprendizaje de optimizadores
- Búsqueda de arquitecturas neuronales (NAS)
- Controlador y red hija
- Aprendizaje con pocos ejemplos (few-shot learning)
- Metaentrenamiento y metaprueba
- 12. Apéndice: mapa mental global de relaciones
- 13. Referencias
1. Introducción al aprendizaje profundo
mindmap
root((Aprendizaje profundo))
Inteligencia artificial
Aprendizaje automatico
Datos y patrones
Representacion
Features
Feature engineering
Representation learning
Redes neuronales
Neurona
Pesos y bias
Activacion
Capas
Profundidad
Jerarquia de conceptos
MLP
Feed forward
Inteligencia artificial (IA)
Disciplina que construye sistemas capaces de resolver tareas asociadas con la percepción, el lenguaje, la decisión o el razonamiento. Abarca tanto sistemas basados en reglas explícitas como métodos que adquieren regularidades a partir de datos.
Aprendizaje automático (machine learning)
Área de la IA en la que un algoritmo obtiene patrones desde ejemplos o experiencia y los utiliza para predecir, clasificar o estructurar datos nuevos. A diferencia de un sistema de reglas escrito a mano, el conocimiento operativo queda codificado en parámetros aprendidos.
Característica (feature)
Variable utilizada para representar un aspecto relevante de un ejemplo. En una imagen podría ser un píxel, una forma o una textura; en un problema clínico, una medición seleccionada por especialistas. La utilidad del modelo depende en gran medida de que la representación exponga información pertinente.
Ingeniería de características (feature engineering)
Proceso humano de seleccionar, transformar o construir características que faciliten el aprendizaje. Puede ser eficaz, pero exige conocimiento del dominio y resulta difícil cuando los patrones útiles son numerosos, variables o demasiado complejos para describirlos manualmente.
Aprendizaje de representaciones (representation learning)
Enfoque en el que el sistema aprende también la forma de representar los datos, en vez de recibir únicamente características diseñadas por personas. Su objetivo es producir variables internas que hagan más sencilla la tarea final.
Aprendizaje profundo (deep learning)
Subcampo del aprendizaje automático que construye representaciones jerárquicas: las capas iniciales detectan regularidades simples y las posteriores las combinan en conceptos más abstractos. La profundidad suele asociarse con el número de transformaciones o capas, no con un umbral universal.
Neurona artificial o unidad
Unidad de cómputo que combina entradas ponderadas, añade un término independiente y aplica una función de activación. Para una entrada , pesos y sesgo :
Símbolos: es el vector de entrada; , el vector de pesos; indica transposición; es el sesgo; , la combinación lineal; , la función de activación; y , la salida de la unidad.
Peso (weight)
Parámetro que regula cuánto influye una entrada en la salida de una neurona. Entrenar la red consiste, en gran parte, en ajustar sus pesos para reducir el error observado en los ejemplos.
Sesgo (bias)
Parámetro aditivo que permite desplazar la respuesta de la neurona con independencia de sus entradas. Gracias a él, la transformación no queda obligada a pasar por el origen.
Función de activación o no linealidad
Transformación aplicada a la combinación lineal de una unidad. Sin activaciones no lineales, encadenar capas seguiría siendo equivalente a una sola transformación lineal y la red no podría modelar relaciones complejas.
Función sigmoide
Activación que comprime cualquier número real al intervalo , por lo que puede interpretarse como una probabilidad en ciertos modelos:
Símbolos: es la entrada de la activación; , su salida; y , la constante de Euler.
Perceptrón multicapa (MLP)
Red formada por múltiples capas de unidades. Cada capa utiliza la salida de la anterior, lo que permite combinar rasgos simples en representaciones progresivamente más complejas.
Capa de entrada, capa oculta y capa de salida
La capa de entrada recibe la representación del ejemplo; las capas ocultas realizan transformaciones intermedias; y la capa de salida produce la predicción requerida por la tarea.
Red totalmente conectada (fully connected network)
Arquitectura en la que cada unidad de una capa recibe la salida de todas las unidades de la capa precedente. Esta conectividad ofrece flexibilidad, pero puede generar muchos parámetros.
Red prealimentada (feed-forward network)
Red cuyo flujo de información avanza desde la entrada hasta la salida sin ciclos. Se distingue de las redes recurrentes, que realimentan un estado interno para procesar secuencias.
Inspiración biológica
Analogía histórica entre las unidades artificiales y las neuronas biológicas: ambas reciben señales, las integran y producen una salida. El parecido es limitado; las arquitecturas y activaciones del aprendizaje profundo son modelos matemáticos, no reproducciones fieles del cerebro.
2. Entrenamiento de redes neuronales
mindmap
root((Entrenamiento))
Objetivo
Funcion de coste
MSE
Optimizacion
Gradientes
Derivada
Regla de la cadena
Backpropagation
Flujo
Forward pass
Backward pass
Actualizacion
Gradient descent
SGD
Mini batch
Learning rate
MNIST
Conjunto de imágenes pequeñas de dígitos manuscritos utilizado como problema introductorio y benchmark de clasificación. Cada imagen de píxeles puede convertirse en un vector de 784 entradas y la salida suele contener diez clases.
Benchmark
Problema, conjunto de datos y protocolo de evaluación que permiten comparar métodos bajo condiciones comunes. Un resultado de benchmark solo es comparable cuando se mantienen las mismas particiones, métricas y reglas de evaluación.
Hiperparámetro
Valor elegido antes o durante el proceso de entrenamiento que no se aprende como un peso ordinario. Son hiperparámetros, por ejemplo, el número de unidades ocultas, el tamaño del lote y la tasa de aprendizaje.
Función de coste o pérdida (loss)
Función diferenciable que cuantifica la discrepancia entre la salida del modelo y el valor esperado. El entrenamiento busca los parámetros que minimizan el coste promedio:
Símbolos: es el coste promedio; , el conjunto de parámetros del modelo; , el número de ejemplos; , el índice de cada ejemplo; , la predicción para la entrada ; , su valor esperado; y , la pérdida de un ejemplo.
Error cuadrático medio (MSE)
Pérdida que promedia el cuadrado de la diferencia entre predicción y objetivo. Para salidas vectoriales:
Símbolos: es el número de ejemplos; , los parámetros del modelo; , la predicción para ; , el objetivo correspondiente; y , la norma euclídea, cuyo cuadrado mide la magnitud del error.
El cuadrado evita cancelaciones de signo y produce una función diferenciable.
Optimización
Proceso de buscar parámetros que reduzcan una función objetivo. En redes neuronales, el espacio suele tener muchas dimensiones y no se obtiene una solución cerrada, por lo que se emplean métodos iterativos.
Derivada y derivada parcial
La derivada mide la variación local de una función respecto de una variable. Cuando la función depende de varias variables, una derivada parcial cambia una de ellas y mantiene fijas las demás.
Símbolos: es una función de varias variables; , su vector de entrada; , la variable respecto de la cual se deriva; , su índice; y , una perturbación que tiende a cero.
Gradiente
Vector que reúne las derivadas parciales de una función y apunta hacia su mayor incremento local:
Símbolos: es la función objetivo; es el vector de parámetros; son sus componentes; es el gradiente; y indica que las derivadas se organizan como un vector columna.
Descenso de gradiente (gradient descent)
Algoritmo que actualiza los parámetros en la dirección opuesta al gradiente para reducir el coste:
Símbolos: contiene los parámetros en la iteración ; , sus valores actualizados; , la tasa de aprendizaje; , el coste; y , su gradiente respecto de los parámetros actuales.
Tasa de aprendizaje (learning rate)
Hiperparámetro que determina la longitud del paso de optimización. Un valor excesivo puede rebasar regiones útiles o hacer divergir el coste; uno demasiado pequeño vuelve lento el aprendizaje.
Descenso de gradiente estocástico (SGD)
Variante que estima el gradiente con un ejemplo o con un subconjunto aleatorio del conjunto de entrenamiento, en vez de usar todos los datos en cada actualización. Reduce el coste por paso e introduce ruido que puede ayudar a explorar el espacio de parámetros.
Lote y minilote (batch y mini-batch)
Grupo de ejemplos procesados conjuntamente para calcular una actualización. Los minilotes equilibran la estabilidad de una estimación basada en varios ejemplos con la eficiencia de las operaciones vectorizadas.
Pase hacia delante (forward pass)
Evaluación del grafo desde las entradas hasta la salida. Durante el entrenamiento se conservan resultados intermedios que después permiten calcular derivadas.
Regla de la cadena
Regla que permite derivar una composición de funciones. Si y :
Símbolos: es la variable de entrada; , el valor intermedio; , la salida; y cada cociente diferencial expresa la sensibilidad de una variable respecto de otra.
Es la base matemática para propagar la influencia de la pérdida a través de las capas.
Retropropagación (backpropagation)
Algoritmo que recorre el grafo en sentido inverso y aplica repetidamente la regla de la cadena para obtener el gradiente de la pérdida respecto de cada parámetro. Hace viable entrenar redes con grandes cantidades de pesos sin derivar manualmente cada expresión completa.
Pase hacia atrás (backward pass)
Fase en la que los gradientes fluyen desde la pérdida hacia las operaciones anteriores. Cada nodo combina el gradiente recibido con su derivada local y lo entrega a sus entradas.
3. Frameworks de aprendizaje profundo
mindmap
root((Frameworks))
Abstracciones
Tensor
Grafo de computacion
Autodiferenciacion
Ejecucion
Grafo estatico
Grafo dinamico
CPU y GPU
Ecosistema
TensorFlow
PyTorch
Theano
Keras
Caffe y Caffe2
CNTK y MXNet
Modelado
API secuencial
API funcional
Compilacion
Framework de aprendizaje profundo
Biblioteca o conjunto de bibliotecas que proporciona operaciones, capas, optimizadores y herramientas para definir y entrenar redes neuronales. Reduce la necesidad de programar a mano el cálculo vectorial y las derivadas.
Tensor
Arreglo numérico de dimensión arbitraria: un escalar es un tensor de orden cero, un vector de orden uno y una matriz de orden dos. Los frameworks expresan datos, parámetros y resultados intermedios como tensores.
Grafo de computación
Representación dirigida de un cálculo: los nodos son operaciones y las aristas transportan tensores. Permite conocer dependencias, ordenar la ejecución, calcular gradientes y distribuir operaciones entre dispositivos.
Diferenciación automática
Mecanismo que construye derivadas a partir de las operaciones registradas en el grafo. Aplica reglas locales y la regla de la cadena, evitando implementar manualmente el backward pass de cada modelo completo.
Grafo estático
Grafo definido antes de ejecutar los datos. Conocer toda la estructura por adelantado facilita validaciones y optimizaciones globales, aunque puede volver menos natural el código con control dinámico.
Grafo dinámico
Grafo construido a medida que se ejecutan las operaciones. Hace que la definición se parezca al flujo ordinario del programa y permite variar la estructura entre ejemplos o iteraciones.
TensorFlow
Framework de computación numérica orientado especialmente al aprendizaje automático. Su modelo original utilizaba grafos estáticos y sesiones; las versiones modernas adoptaron la ejecución inmediata como comportamiento habitual.
Sesión de TensorFlow
En la API histórica de TensorFlow 1.x, entorno que reservaba recursos y evaluaba las operaciones de un grafo mediante llamadas a run(). Es un concepto relevante para mantener o migrar código antiguo, pero no describe la interfaz principal actual.
Ejecución inmediata (eager execution)
Modo en el que cada operación se evalúa al invocarse, sin requerir una sesión explícita. Facilita la inspección de valores y la depuración interactiva.
TensorBoard
Herramienta de visualización para inspeccionar grafos, métricas, distribuciones y otros datos de un experimento. Ayuda a diagnosticar el entrenamiento y comparar ejecuciones.
Theano
Biblioteca pionera de computación numérica con grafos y aceleración por GPU. Influyó en frameworks posteriores; su desarrollo oficial terminó y actualmente tiene un valor principalmente histórico.
Torch (Lua)
Framework de cálculo científico y aprendizaje profundo cuyo lenguaje principal era Lua. Aportó tensores, módulos neuronales y aceleración mediante CPU o GPU, y constituye el antecedente directo de PyTorch.
PyTorch
Framework que popularizó un estilo imperativo con grafos dinámicos y diferenciación automática. Este enfoque simplifica el código de investigación y la definición de estructuras que dependen de los datos.
Caffe y Caffe2
Caffe fue un framework centrado en visión y despliegue que describía las redes mediante archivos prototxt. Caffe2 amplió esa idea con grafos estáticos, una interfaz de Python y mayor atención a escenarios de producción.
Microsoft Cognitive Toolkit (CNTK)
Framework de Microsoft orientado al entrenamiento distribuido de redes profundas. Permitía expresar modelos como grafos de cómputo y ejecutarlos sobre CPU o GPU.
Apache MXNet
Framework de aprendizaje profundo concebido para ofrecer eficiencia, flexibilidad y escalado distribuido. Mantuvo una asociación histórica con los servicios de AWS.
Keras
API de alto nivel para componer capas, configurar el entrenamiento y ejecutar modelos con menos código. Abstrae operaciones de bajo nivel sin impedir definir arquitecturas más complejas cuando se necesita.
API secuencial
Estilo de Keras que encadena capas en un único recorrido lineal. Es adecuado cuando cada capa tiene exactamente una entrada y una salida dentro de una pila simple.
API funcional
Estilo que conecta explícitamente tensores y capas. Permite ramas, múltiples entradas o salidas, reutilización de capas y topologías que no caben en una secuencia lineal.
Capa densa (Dense)
Capa totalmente conectada que calcula una transformación afín seguida, opcionalmente, de una activación:
Símbolos: es el vector de entrada; , la matriz de pesos; , el vector de sesgos; , la función de activación; y , el vector de salida.
Compilación del modelo
Configuración que asocia al modelo una pérdida, un optimizador y métricas. En APIs de alto nivel también verifica compatibilidad de formas y prepara el procedimiento de entrenamiento.
Entropía cruzada categórica
Pérdida habitual para clasificación multiclase. Si es la etiqueta y la probabilidad predicha para la clase :
Símbolos: es la pérdida; , el número de clases; , el índice de clase; , la etiqueta real para esa clase; y , la probabilidad que el modelo le asigna.
4. Entrenamiento práctico: activación, inicialización, optimización y regularización
mindmap
root((Entrenamiento practico))
Activaciones
Sigmoid y tanh
ReLU y variantes
Maxout
Inicializacion
Ruptura de simetria
Xavier
He
Optimizacion
Momentum
AdaGrad
RMSProp
Adam
Regularizacion
L1 y L2
Dropout
Early stopping
Saturación
Región de una activación donde cambios grandes en la entrada producen variaciones mínimas en la salida. Allí la derivada se acerca a cero y el gradiente que atraviesa la unidad puede debilitarse.
Tangente hiperbólica (tanh)
Activación acotada entre y y centrada en cero:
Símbolos: es la entrada; , la salida de la activación; y , la constante de Euler.
Aunque mejora el centrado respecto de la sigmoide, también se satura para entradas de gran magnitud.
Unidad lineal rectificada (ReLU)
Activación que conserva los valores positivos y anula los negativos:
Símbolos: es la entrada de la unidad y es su salida rectificada.
Es barata de calcular y no se satura en el tramo positivo, cualidades que favorecen el entrenamiento de redes profundas.
ReLU muerta
Unidad ReLU que queda siempre en el tramo negativo y, por tanto, produce salida y gradiente iguales a cero. Actualizaciones demasiado grandes pueden provocar este estado.
Leaky ReLU y PReLU
Variantes que conservan una pendiente pequeña cuando para evitar unidades completamente inactivas:
Símbolos: es la entrada y es la pendiente aplicada en la región negativa; en Leaky ReLU se fija como una constante pequeña y en PReLU se aprende como parámetro.
ELU
Activación lineal para valores positivos y exponencial para negativos. Su rama negativa permite salidas por debajo de cero y suaviza la transición respecto de una ReLU básica.
Maxout
Unidad que devuelve el máximo entre varias transformaciones afines. Puede representar funciones lineales por tramos flexibles, a cambio de incrementar el número de parámetros.
Ruptura de simetría
Necesidad de iniciar unidades equivalentes con pesos diferentes. Si todos los pesos comienzan en cero, unidades de una misma capa reciben gradientes idénticos y aprenden la misma función.
Inicialización aleatoria
Asignación de valores pequeños y distintos a los pesos para romper la simetría. La escala importa: valores extremos pueden saturar activaciones y valores demasiado pequeños pueden debilitar señales en redes profundas.
Inicialización Xavier o Glorot
Estrategia que escala los pesos según el número de entradas y salidas para conservar aproximadamente la varianza entre capas:
Símbolos: es la matriz de pesos; , la varianza buscada para sus valores; y , los números de conexiones de entrada y salida; y , el factor de escala de esta inicialización.
Inicialización He
Escalado pensado para activaciones ReLU, cuya varianza típica es:
Símbolos: es la matriz de pesos; , la varianza buscada; , el número de conexiones de entrada; y , el factor que compensa el efecto de las activaciones ReLU.
Normalización por lotes (batch normalization)
Normaliza activaciones con la media y la varianza del minilote, y después aplica escala y desplazamiento aprendibles:
Símbolos: es la activación del ejemplo ; , el minilote; y , su media y varianza; , una constante pequeña que evita inestabilidad numérica; , la activación normalizada; y , la escala y el desplazamiento aprendibles; y , la salida transformada.
Durante inferencia se emplean estadísticas acumuladas, no las de un lote nuevo.
Momento (momentum)
Extensión de SGD que acumula una velocidad basada en gradientes anteriores. Reduce oscilaciones y mantiene avance en direcciones coherentes:
Símbolos: es la velocidad acumulada en la iteración ; , el coeficiente que conserva parte de la velocidad anterior; , la tasa de aprendizaje; , el coste; , los parámetros actuales; y , su gradiente.
Momento de Nesterov
Variante que calcula el gradiente después de anticipar el desplazamiento asociado con la velocidad. Esta “mirada hacia delante” puede mejorar la corrección del paso.
AdaGrad
Optimizador que adapta una tasa distinta a cada parámetro al dividir el gradiente por la raíz de los cuadrados acumulados. Favorece parámetros con gradientes infrecuentes, pero su tasa efectiva puede disminuir demasiado.
RMSProp
Evita la acumulación ilimitada de AdaGrad usando una media móvil exponencial de los gradientes cuadrados. Así mantiene tasas adaptativas sin detener prematuramente el aprendizaje.
Adam
Optimizador adaptativo que combina una media móvil del gradiente con otra de su cuadrado, junto con correcciones de sesgo. En forma simplificada:
Símbolos: son los parámetros en la iteración ; , la tasa de aprendizaje; , la estimación corregida del promedio del gradiente; , la estimación corregida del promedio de su cuadrado; y , una constante pequeña de estabilidad numérica.
Decaimiento de la tasa de aprendizaje
Reducción programada de durante el entrenamiento. Permite pasos grandes al principio y ajustes más finos cerca de una solución; puede seguir escalones, una curva exponencial u otra agenda.
Sobreajuste (overfitting)
Situación en la que el modelo se adapta demasiado a particularidades del conjunto de entrenamiento y pierde rendimiento en datos no vistos. Se observa cuando el error de entrenamiento sigue bajando mientras el de validación comienza a subir.
Generalización
Capacidad del modelo para conservar un buen desempeño en ejemplos que no participaron en su ajuste. Es el objetivo real del aprendizaje, no la memorización del conjunto de entrenamiento.
Regularización
Conjunto de técnicas que limitan la capacidad efectiva del modelo o introducen restricciones para reducir el sobreajuste.
Regularización L2
Añade a la pérdida una penalización por el cuadrado de los pesos:
Símbolos: es el coste regularizado; es el coste original; , el conjunto de parámetros; , la intensidad de la penalización; y , cada peso penalizado.
Favorece pesos pequeños y distribuidos; normalmente no se aplica a los términos de sesgo.
Regularización L1
Penaliza el valor absoluto de los pesos:
Símbolos: es el coste regularizado; es el coste original; , el conjunto de parámetros; , la intensidad de la penalización; y , cada peso penalizado.
Tiende a producir soluciones dispersas, con numerosos pesos iguales o cercanos a cero.
Regularización por norma máxima (max-norm)
Restringe la norma de los vectores de pesos para que no supere un límite. Tras una actualización, los pesos que exceden ese radio se proyectan de nuevo al conjunto permitido.
Dropout
Durante el entrenamiento desactiva aleatoriamente una fracción de las unidades. Impide dependencias excesivas entre activaciones y puede interpretarse como el entrenamiento de muchas subredes compartiendo parámetros. En inferencia se usa la red completa con el escalado correspondiente.
Parada temprana (early stopping)
Interrumpe el entrenamiento cuando la métrica de validación deja de mejorar. Evita continuar hacia una región que reduce el error de entrenamiento pero empeora la generalización.
Conjunto de validación
Subconjunto separado del entrenamiento que sirve para elegir hiperparámetros, decidir cuándo detener el ajuste y comparar configuraciones. No debe reemplazar al conjunto de prueba final.
5. Redes neuronales convolucionales (CNN)
mindmap
root((CNN))
Tareas de vision
Clasificacion
Deteccion
Segmentacion
Recuperacion
Convolucion
Filtro
Mapa de activacion
Stride
Padding
Arquitectura
ReLU
Pooling
Fully connected
AlexNet y VGG
Datos
ImageNet
Data augmentation
Transfer learning
Red neuronal convolucional (CNN)
Arquitectura que explota la estructura espacial de imágenes u otros datos en rejilla. Usa filtros locales con pesos compartidos, por lo que necesita muchos menos parámetros que una capa totalmente conectada aplicada directamente a todos los píxeles.
Clasificación de imágenes
Tarea de asignar una o varias categorías a una imagen completa. La salida suele ser una distribución de probabilidad sobre las clases.
Recuperación de imágenes (image retrieval)
Búsqueda de imágenes visualmente o semánticamente similares. Puede comparar representaciones internas extraídas por una CNN, en vez de los píxeles sin procesar.
Detección de objetos
Problema que combina clasificación y localización: identifica qué objetos aparecen y estima sus regiones o cajas delimitadoras.
Segmentación
Asignación de una clase a cada píxel o región de la imagen. A diferencia de la clasificación global, conserva explícitamente la distribución espacial de los elementos.
Filtro o kernel convolucional
Pequeño tensor de pesos que recorre el volumen de entrada. En cada posición calcula un producto local y aprende a responder ante patrones como bordes, texturas o formas.
Capa convolucional
Capa que aplica varios filtros compartidos a distintas posiciones del dato. Para una convolución bidimensional simplificada:
Símbolos: es la salida en la posición y el canal ; , el sesgo del filtro ; , su peso en el desplazamiento espacial y el canal de entrada ; y , el valor de entrada cubierto por ese peso.
Cada índice corresponde a un filtro y, por tanto, a un canal de salida.
Mapa de activación
Matriz producida al desplazar un filtro sobre la entrada. Indica dónde y con qué intensidad se detectó el patrón asociado con ese filtro.
Profundidad o canales
Tercera dimensión de una imagen o volumen de activaciones. Una imagen RGB tiene tres canales; una capa convolucional produce tantos canales de salida como filtros tenga.
Paso (stride)
Cantidad de posiciones que avanza el filtro en cada desplazamiento. Un paso mayor reduce las dimensiones espaciales de la salida.
Relleno con ceros (zero-padding)
Adición de ceros alrededor de la entrada para controlar el tamaño de salida y permitir que el filtro procese los bordes. Para entrada , filtro , relleno y paso :
Símbolos: es el tamaño espacial de la entrada; , el tamaño del filtro; , el relleno aplicado a cada lado; , el paso; y , el tamaño espacial resultante.
Pooling
Operación fija que resume regiones vecinas para reducir dimensiones espaciales. No añade pesos y aporta cierta tolerancia a pequeños desplazamientos.
Max pooling
Forma de pooling que conserva el máximo de cada ventana. Puede interpretarse como seleccionar la activación más fuerte de una región.
ImageNet e ILSVRC
ImageNet es un gran conjunto de imágenes etiquetadas; ILSVRC fue una competición de reconocimiento visual construida sobre parte de esos datos. Su uso impulsó comparaciones estandarizadas entre arquitecturas profundas.
LeNet-5
Arquitectura convolucional temprana aplicada al reconocimiento de caracteres y dígitos. Demostró que convolución, reducción espacial y entrenamiento por gradiente podían formar un sistema práctico de visión.
AlexNet
CNN profunda que obtuvo una mejora decisiva en ILSVRC 2012. Combinó convoluciones, ReLU, dropout, aumento de datos y entrenamiento acelerado con GPU.
VGGNet
Familia de CNN profundas basada en bloques repetidos de filtros y pooling. VGG16 y VGG19 muestran cómo filtros pequeños apilados pueden construir campos receptivos mayores, aunque con muchos parámetros.
Aumento de datos (data augmentation)
Generación de ejemplos de entrenamiento mediante transformaciones que preservan la etiqueta, como recortes, reflejos o cambios moderados de brillo. Aumenta la variabilidad observada y actúa como regularizador.
Aprendizaje por transferencia (transfer learning)
Reutilización de un modelo entrenado en una tarea amplia como punto de partida para otra relacionada. Las capas iniciales aportan representaciones generales y las finales se sustituyen o reajustan.
Congelación de capas
Decisión de mantener fijos ciertos pesos durante la transferencia. Reduce el número de parámetros que deben ajustarse y es útil cuando el nuevo conjunto de datos es pequeño.
6. Representaciones del lenguaje y Word2Vec
mindmap
root((Representaciones del lenguaje))
Discretas
Vocabulario
Term frequency
Bag of words
Distribuidas
Word vector
Embedding
Similitud coseno
Word2Vec
Contexto y ventana
Skip gram
CBOW
Negative sampling
Probabilidad
Likelihood
Softmax
Procesamiento del lenguaje natural (PLN)
Área que desarrolla métodos computacionales para analizar o generar lenguaje humano. Su dificultad procede, entre otros factores, de la ambigüedad, el contexto y el cambio continuo de significados.
WordNet
Recurso léxico que agrupa palabras por significado y registra relaciones como sinonimia o antonimia. Representa conocimiento semántico explícito, pero exige mantenimiento manual y no proporciona por sí solo una geometría continua del significado.
Vocabulario
Conjunto finito de unidades lingüísticas reconocidas por un modelo. En las representaciones discretas, cada posición del vector suele corresponder a una palabra del vocabulario.
Frecuencia de término (term frequency)
Número de veces que una palabra aparece en un texto. Produce una representación simple, pero no conserva el orden ni distingue por sí misma la relevancia semántica.
Bolsa de palabras (bag-of-words)
Representación que registra presencia o frecuencia de términos e ignora su orden. Es compacta conceptualmente, aunque pierde información sintáctica y relaciones entre palabras.
Representación discreta
Codificación en la que cada palabra ocupa una dimensión independiente. Dos términos distintos resultan ortogonales aun cuando sus significados sean cercanos.
Representación distribuida
Vector denso en el que el significado se reparte entre múltiples dimensiones aprendidas. Palabras usadas en contextos parecidos tienden a ocupar regiones próximas.
Vector de palabra o embedding
Representación numérica densa de una palabra. Su geometría permite usar similitudes y relaciones semánticas como entrada de otros modelos.
Corpus
Colección de textos usada para obtener estadísticas lingüísticas o entrenar representaciones. La cobertura, calidad y sesgos del corpus afectan directamente a los vectores aprendidos.
Contexto y ventana
El contexto es el conjunto de palabras próximas a un término central; la ventana define cuántas posiciones a cada lado se consideran. Word2Vec aprende a partir de estas coapariciones.
Word2Vec
Familia de modelos que aprende vectores prediciendo palabras relacionadas por contexto. Su supuesto distributivo es que términos usados en entornos lingüísticos semejantes suelen guardar una relación semántica.
Verosimilitud (likelihood)
Medida de qué tan probables son los contextos observados bajo los vectores actuales. En skip-gram, una formulación del objetivo es:
Símbolos: es la verosimilitud; , los parámetros de los vectores; , la longitud de la secuencia; , la posición de la palabra central ; , el radio de la ventana; , el desplazamiento dentro de ella; y , la probabilidad de una palabra de contexto dada la central.
El entrenamiento suele minimizar el logaritmo negativo, que transforma productos en sumas.
Similitud coseno
Mide la orientación compartida por dos vectores, independientemente de su escala:
Símbolos: y son los vectores comparados; es su producto escalar; y y son sus magnitudes euclídeas.
Valores cercanos a 1 indican direcciones similares.
Softmax
Función que convierte una colección de puntuaciones en una distribución de probabilidad:
Símbolos: es la puntuación de la clase ; , el número de clases; , el índice usado para normalizar todas las puntuaciones; , la constante de Euler; y , la probabilidad asignada a la clase .
En Word2Vec, las puntuaciones pueden ser productos escalares entre vectores centrales y de contexto.
Muestreo negativo (negative sampling)
Aproximación que contrasta pares de palabras observados con unos pocos pares elegidos como negativos. Evita normalizar sobre todo el vocabulario en cada paso y acelera el entrenamiento.
Skip-gram
Variante de Word2Vec que predice las palabras del contexto a partir de una palabra central.
Continuous bag-of-words (CBOW)
Variante que combina las palabras del contexto para predecir la palabra central. Invierte la dirección predictiva de skip-gram.
Vectores preentrenados
Embeddings aprendidos previamente con corpus extensos y reutilizados como entrada de otra tarea. Constituyen una forma de transferencia de conocimiento lingüístico.
7. Redes neuronales recurrentes (RNN)
mindmap
root((Redes recurrentes))
Secuencias
Time step
Hidden state
Entradas y salidas variables
Entrenamiento
BPTT
TBPTT
Gradient clipping
Modelos
Vanilla RNN
LSTM
GRU
Lenguaje
Modelo del lenguaje
Muestreo
Secuencia
Colección ordenada de elementos cuya posición o dependencia temporal es relevante. Texto, audio, vídeo y series de sensores son ejemplos de datos secuenciales.
Red neuronal recurrente (RNN)
Red que procesa una secuencia manteniendo un estado interno. En cada paso combina el elemento actual con la memoria acumulada, lo que permite entradas y salidas de longitud variable.
Estado oculto (hidden state)
Vector que resume la información procesada hasta un punto de la secuencia. Para una RNN básica:
Símbolos: es la entrada del paso ; y , los estados ocultos anterior y actual; , la matriz de pesos de entrada a estado; , la matriz recurrente; , el sesgo; y , la activación.
Paso temporal (time step)
Iteración en la que la RNN consume un elemento y actualiza su estado. El término no implica necesariamente tiempo físico: también puede ser la posición de una palabra.
RNN básica (vanilla RNN)
Forma elemental de red recurrente que usa una sola transformación, normalmente tanh, para actualizar el estado. Comparte las mismas matrices de pesos en todos los pasos.
Desenrollado de una RNN
Representación del ciclo recurrente como una cadena de copias a lo largo de la secuencia. Las copias comparten parámetros, pero mantienen estados intermedios distintos.
Retropropagación a través del tiempo (BPTT)
Aplicación de backpropagation sobre la red desenrollada. La pérdida puede recibir aportaciones de varios pasos y el gradiente recorre las dependencias temporales hacia atrás.
BPTT truncada (TBPTT)
Variante que divide secuencias largas y limita cuántos pasos atraviesa el gradiente. Conserva el estado entre fragmentos, pero reduce memoria y coste computacional.
Modelo del lenguaje
Modelo que asigna probabilidad a una secuencia. Mediante la regla del producto:
Símbolos: son los elementos de una secuencia de longitud ; , la posición actual; , la probabilidad de la secuencia completa; y , la probabilidad del elemento actual dado su historial.
Puede puntuar secuencias o generar nuevos elementos de forma autoregresiva.
Muestreo autoregresivo
Procedimiento de generar un elemento desde la distribución predicha y utilizarlo como entrada del paso siguiente. Muestrear, en vez de elegir siempre el máximo, produce secuencias diversas.
Gradiente explosivo
Gradiente cuya magnitud crece de forma descontrolada al multiplicarse repetidamente durante BPTT. Puede producir actualizaciones inestables y valores numéricos inválidos.
Recorte de gradiente (gradient clipping)
Control que reescala el gradiente cuando su norma supera un umbral :
Símbolos: es el vector de gradiente; , la norma máxima permitida; , su norma euclídea; y indica que el gradiente se reemplaza por su versión reescalada.
Mitiga gradientes explosivos, pero no resuelve los que se desvanecen.
Gradiente desvanecido
Gradiente que se aproxima a cero al atravesar muchas operaciones. Impide que los pasos lejanos influyan de forma efectiva en los parámetros iniciales de la secuencia.
LSTM (long short-term memory)
Unidad recurrente con un estado de celda y puertas que regulan qué información olvidar, incorporar y exponer. Su ruta aditiva facilita conservar dependencias más largas que una RNN básica.
Estado de celda (cell state)
Memoria interna de una LSTM. Se actualiza combinando parte de la memoria anterior con nueva información candidata:
Símbolos: y son los estados de celda actual y anterior; , la puerta de olvido; , la puerta de entrada; , la memoria candidata; y , la multiplicación elemento a elemento.
Puertas de una LSTM
Vectores con valores entre cero y uno que funcionan como controles. La puerta de olvido conserva o descarta memoria; la de entrada escribe información; y la de salida regula el estado visible.
GRU (gated recurrent unit)
Unidad recurrente con puertas que combina estado oculto y memoria en un solo vector. Es más simple que una LSTM y también busca preservar dependencias largas.
RNN apilada
Arquitectura profunda donde la secuencia de salidas de una RNN alimenta a otra. Las capas superiores pueden aprender patrones temporales más abstractos.
RNN bidireccional
Arquitectura que procesa la secuencia en ambos sentidos y combina las representaciones. Es útil cuando la predicción puede usar contexto anterior y posterior.
8. Agentes inteligentes y aprendizaje profundo por refuerzo
mindmap
root((Aprendizaje por refuerzo))
Interaccion
Agente
Entorno
Estado
Accion
Recompensa
MDP
Transicion
Politica
Retorno
Descuento
Valor
V
Q
Bellman
Deep Q Learning
Q network
Experience replay
Target network
Exploracion
Aprendizaje por refuerzo (RL)
Paradigma en el que un agente aprende a elegir acciones mediante su interacción con un entorno. No recibe la respuesta correcta para cada estado; recibe recompensas y busca maximizar su acumulación a largo plazo.
Agente
Entidad que observa un estado, selecciona una acción y actualiza su comportamiento según la experiencia.
Entorno
Sistema externo sobre el que actúa el agente. Determina el estado siguiente y la recompensa producida por una acción.
Estado
Representación de la situación relevante para decidir. Puede ser compacta, como posición y velocidad, o de alta dimensión, como varios fotogramas de un videojuego.
Acción
Decisión disponible para el agente en un estado. El conjunto puede ser discreto, continuo o depender del estado.
Recompensa (reward)
Señal escalar inmediata que expresa el resultado local de una transición. Diseñar recompensas adecuadas es crucial, pues el agente optimiza esa señal y no una intención no formalizada.
Proceso de decisión de Markov (MDP)
Modelo matemático definido, en una notación común, por la tupla : estados, acciones, probabilidades de transición, recompensas y factor de descuento.
Propiedad de Markov
Supuesto de que el estado actual contiene toda la información necesaria para modelar la transición siguiente; dado y , el pasado no añade información relevante.
Política
Regla de comportamiento que asigna acciones, o probabilidades sobre acciones, a cada estado.
Factor de descuento
Valor que reduce el peso de recompensas futuras. El retorno desde es:
Símbolos: es el retorno desde el paso ; , la distancia hasta una recompensa futura; , el factor de descuento; y , la recompensa recibida pasos después.
Política óptima
Política que maximiza el retorno esperado. Puede no ser única si varias acciones obtienen el mismo valor.
Función de valor de estado
Retorno esperado al comenzar en y seguir una política :
Símbolos: es el valor del estado bajo la política ; , el retorno desde ; , la variable aleatoria que representa el estado en ese paso; y , la esperanza sobre trayectorias generadas por la política.
Función de valor de acción (Q)
Retorno esperado después de ejecutar en y continuar según :
Símbolos: es el valor de ejecutar la acción en el estado y continuar con la política ; es el retorno; y y son las variables aleatorias de estado y acción en el paso .
Ecuación de optimalidad de Bellman
Relaciona el valor óptimo de una acción con la recompensa inmediata y el mejor valor futuro:
Símbolos: es el valor óptimo de la acción en el estado ; , la recompensa inmediata; , el factor de descuento; , el estado siguiente; , una posible acción en ese estado; y , la esperanza sobre las transiciones posibles.
Iteración de valores
Método que aplica repetidamente una actualización de Bellman hasta aproximar el valor óptimo. Una tabla explícita deja de ser práctica cuando el espacio de estados es enorme.
Q-learning
Algoritmo que aprende valores de acción a partir de transiciones sin exigir que la política seguida sea la misma que se evalúa como óptima.
Red Q profunda (DQN)
Red neuronal que aproxima la función Q en espacios de alta dimensión. Puede recibir el estado y producir un valor por cada acción discreta.
Memoria de repetición de experiencias
Buffer de transiciones del que se extraen minilotes aleatorios. Reduce la correlación entre ejemplos consecutivos y permite reutilizar experiencia.
Red objetivo (target network)
Copia de la Q-network cuyos parámetros se actualizan con menor frecuencia. Estabiliza el objetivo de Bellman evitando que cambie al mismo ritmo que la red entrenada.
Episodio
Trayectoria desde un estado inicial hasta una condición terminal, como una partida completa.
Compromiso exploración-explotación
Equilibrio entre elegir acciones conocidas por su buen rendimiento y probar otras que podrían revelar mejores resultados. Una política -greedy actúa al azar con probabilidad y elige la mejor acción conocida en caso contrario.
9. GPU y entrenamiento distribuido
mindmap
root((Computo a escala))
Hardware
CPU
GPU
Memoria
CUDA y cuDNN
Rendimiento
Paralelismo
Vectorizacion
Cuello de botella
Distribucion
Model parallelism
Data parallelism
Parameter server
Workers
Sincronizacion
Parameter averaging
Asynchronous SGD
Stale gradients
Unidad de procesamiento gráfico (GPU)
Coprocesador con muchos núcleos relativamente simples, diseñado para ejecutar gran cantidad de operaciones numéricas en paralelo. Resulta eficaz para productos de matrices y convoluciones de redes neuronales.
Unidad central de procesamiento (CPU)
Procesador de propósito general con menos núcleos, pero más complejos y rápidos en tareas secuenciales. Suele coordinar la ejecución y preparar datos para el acelerador.
Ancho de banda de memoria
Cantidad de datos transferible por unidad de tiempo entre memoria y procesador. El entrenamiento puede quedar limitado por esta transferencia aunque exista capacidad aritmética disponible.
CUDA
Plataforma de NVIDIA para programación paralela sobre sus GPU. Proporciona el entorno sobre el que funcionan bibliotecas numéricas optimizadas.
cuDNN
Biblioteca de primitivas para redes profundas aceleradas en GPU NVIDIA, como convoluciones, pooling, normalización y operaciones recurrentes. Los frameworks la utilizan sin exponer normalmente su implementación de bajo nivel.
OpenCL
Estándar abierto para cómputo paralelo en diferentes clases de dispositivos. Ofrece una alternativa más general a tecnologías ligadas a un fabricante.
Cuello de botella de entrada
Situación en la que lectura, decodificación o transformación de datos es más lenta que el entrenamiento. Se mitiga con almacenamiento rápido, procesamiento paralelo, buffers y carga anticipada.
Paralelismo de modelo
División de una red entre varios dispositivos o máquinas. Permite ejecutar modelos que no caben en un solo acelerador, pero introduce comunicación entre sus partes.
Paralelismo de datos
Replicación del modelo en varios trabajadores, cada uno con un subconjunto de ejemplos. Los gradientes o parámetros se combinan para mantener un modelo compartido.
Trabajador (worker)
Proceso o máquina que ejecuta una parte del entrenamiento distribuido, normalmente el cálculo de predicciones y gradientes sobre un lote local.
Servidor de parámetros
Componente que almacena los parámetros globales, recibe actualizaciones de los trabajadores y distribuye nuevas versiones del modelo.
Promedio de parámetros
Esquema síncrono en el que cada trabajador entrena una copia y el servidor promedia los parámetros recibidos. La espera al trabajador más lento limita el rendimiento y la tolerancia a fallos.
SGD asíncrono
Entrenamiento en el que los trabajadores envían gradientes sin esperar a los demás. Aumenta utilización y tolerancia a retrasos, pero cada gradiente puede haberse calculado con una versión anterior del modelo.
Downpour SGD
Diseño asíncrono basado en paralelismo de datos y servidores de parámetros. Cada trabajador obtiene parámetros, calcula gradientes y los entrega independientemente para que el servidor actualice el modelo.
Gradiente obsoleto (stale gradient)
Gradiente calculado con parámetros que ya fueron modificados por otros trabajadores. Un retraso excesivo puede deteriorar la convergencia.
Benchmark de rendimiento
Medición controlada del tiempo, rendimiento o uso de recursos de una configuración. Debe especificar hardware, software, modelo, tamaño de lote y precisión numérica para ser interpretable.
10. Nube y puesta en producción de modelos
mindmap
root((Produccion de ML))
Serving
Inferencia
Concurrencia
Batching
Balanceo
Operacion
Versionado
Rollback
Monitorizacion
Nube
Recursos bajo demanda
GPU y TPU
API gestionada
Calidad
Training serving skew
Subpoblaciones
Pipeline continuo
Inferencia
Uso de un modelo entrenado para producir una salida a partir de datos nuevos. Normalmente requiere solo un pase hacia delante, sin retropropagación ni actualización de parámetros.
Tiempo de servicio (serving time)
Etapa operativa en la que el modelo responde solicitudes reales. También se denomina tiempo de predicción o de inferencia y se contrapone al entrenamiento.
Servidor de modelos
Servicio que carga artefactos entrenados y expone una interfaz de predicción. Puede incorporar concurrencia, lotes dinámicos, control de versiones y métricas operativas.
Concurrencia
Capacidad para atender varias solicitudes durante el mismo intervalo. Evita que una predicción lenta bloquee por completo las siguientes.
Latencia y tiempo de ida y vuelta
La latencia es el tiempo hasta obtener una respuesta; el round-trip time incluye el recorrido completo de la solicitud y su respuesta. Un modelo puede ser rápido aisladamente y aun así sufrir latencia por red, colas o preprocesamiento.
Batching de inferencia
Agrupación de solicitudes en un tensor para aprovechar operaciones vectorizadas. Aumenta el rendimiento total, aunque esperar a formar el lote puede elevar la latencia individual.
Buffer
Almacenamiento temporal donde se acumulan solicitudes o datos antes de procesarlos. En serving permite crear lotes, siempre con límites de tiempo y tamaño.
Balanceador de carga
Componente que reparte solicitudes entre réplicas del servicio según disponibilidad o carga. Facilita el escalado horizontal y la tolerancia a fallos.
Versionado y rollback de modelos
Identificación explícita de cada artefacto desplegado y capacidad de volver a una versión anterior. Permite rastrear predicciones y recuperarse si el modelo nuevo empeora el servicio.
REST y gRPC
Formas comunes de exponer predicciones por red. REST suele intercambiar recursos mediante HTTP; gRPC define contratos y llamadas remotas eficientes. La elección depende del ecosistema y los requisitos de interoperabilidad y rendimiento.
Computación en la nube
Provisión bajo demanda de cómputo, almacenamiento y servicios gestionados. Permite ampliar o reducir recursos sin mantener toda la infraestructura física propia.
TPU (tensor processing unit)
Acelerador especializado para operaciones tensoriales de aprendizaje automático. Es un ejemplo de hardware ofrecido mediante ecosistemas de nube para entrenamiento e inferencia.
API de IA gestionada
Servicio listo para tareas como visión, voz, traducción o análisis de texto. Reduce la infraestructura propia, pero introduce dependencia del proveedor y limita el control sobre datos y modelo.
Monitorización
Recopilación de métricas técnicas y del comportamiento del modelo: tráfico, errores, latencia, distribuciones de entrada y calidad de predicción. Debe permitir alertar antes de que la degradación sea grave.
Métricas offline y online
Las métricas offline se calculan con datos retenidos antes del despliegue; las online miden el efecto real del sistema en producción. Un buen resultado offline no garantiza impacto positivo para todos los usuarios.
Desviación entre entrenamiento y servicio (training-serving skew)
Degradación causada por diferencias entre los datos o transformaciones usados al entrenar y al predecir. También aparece cuando cambia la distribución real con el tiempo o entre poblaciones.
Comportamiento por subpoblaciones
Evaluación separada de grupos relevantes. Una métrica agregada puede mejorar mientras un grupo pequeño empeora de forma importante, por lo que conviene definir segmentos y umbrales explícitos.
Pipeline de entrenamiento continuo
Flujo automatizado que ingiere y valida datos, entrena, evalúa y despliega nuevas versiones cuando el dominio exige actualización frecuente.
Validación de datos
Comprobaciones de esquema, valores ausentes, rangos y distribuciones antes de entrenar o servir. Debe detener el pipeline si una anomalía amenaza la validez del modelo.
Validación del modelo
Puerta previa al despliegue que verifica compatibilidad, métricas globales, desempeño por segmentos y ausencia de regresiones frente a la versión vigente.
11. Modelos generativos y metaaprendizaje
mindmap
root((Avances del aprendizaje profundo))
Modelos generativos
Distribucion de datos
Muestreo
Densidad explicita e implicita
GAN
Generador
Discriminador
Juego minimax
Meta learning
Learner
Meta learner
Optimizador aprendido
Busqueda de arquitectura
Few shot learning
Modelo generativo
Modelo que aprende regularidades de la distribución de los datos para producir ejemplos nuevos con propiedades similares a los observados.
Muestreo
Obtención de una realización concreta desde una distribución. En generación, variar la muestra latente permite producir salidas distintas.
Estimación explícita de densidad
Enfoque que representa o aproxima directamente una función de probabilidad sobre los datos. Los modelos autoregresivos y los autoencoders variacionales pertenecen a esta familia.
Estimación implícita de densidad
Enfoque que aprende un procedimiento para generar muestras sin evaluar de forma explícita la densidad de cada dato. Las GAN pertenecen a esta categoría.
PixelRNN y PixelCNN
Modelos autoregresivos de imagen que factorizan la probabilidad conjunta en probabilidades condicionadas de píxeles. PixelRNN emplea recurrencia; PixelCNN usa convoluciones enmascaradas.
Autoencoder variacional (VAE)
Modelo generativo latente que aprende una distribución aproximada para codificar datos y un decodificador para reconstruir o generar ejemplos. Optimiza una cota variacional que combina reconstrucción y regularización del espacio latente.
Red generativa adversarial (GAN)
Sistema con dos redes entrenadas en oposición: el generador produce muestras y el discriminador intenta distinguirlas de los datos reales.
Generador
Red que transforma un vector aleatorio en una muestra sintética . Aprende a producir resultados que el discriminador considere reales.
Discriminador
Red que estima la probabilidad de que una muestra proceda de los datos y no del generador. Su señal de error guía indirectamente el aprendizaje de .
Objetivo minimax de una GAN
Juego de dos participantes en el que el discriminador maximiza la clasificación correcta y el generador intenta engañarlo:
Símbolos: es el generador y , el discriminador; es una muestra real extraída de ; , un vector latente extraído de la distribución ; , la probabilidad asignada a una muestra real; y , la asignada a una muestra generada. representa el promedio esperado sobre cada distribución.
Entrenar ambas redes requiere equilibrio; si una domina demasiado pronto, la otra recibe una señal poco útil.
Metaaprendizaje (meta-learning)
Familia de métodos que optimiza la capacidad de aprender tareas nuevas usando experiencia obtenida en tareas anteriores. Su meta no es solo ajustar un modelo, sino mejorar el propio proceso de adaptación.
Ajuste de hiperparámetros
Búsqueda de configuraciones para un modelo y una tarea concretos. Se relaciona con metaaprendizaje, pero no es equivalente: elegir una configuración no implica aprender una estrategia transferible entre tareas.
Learner y meta-learner
El learner resuelve una tarea particular; el meta-learner modifica cómo se inicializa, actualiza o diseña el primero para que aprenda nuevas tareas con mayor rapidez.
Aprendizaje de optimizadores
Enfoque donde un modelo auxiliar aprende una regla de actualización de parámetros. Puede usar una RNN para aprovechar la historia de gradientes y proponer pasos adaptados a una familia de problemas.
Búsqueda de arquitecturas neuronales (NAS)
Automatización del diseño de redes. Un controlador propone arquitecturas hijas, recibe su rendimiento como señal y mejora sus propuestas sucesivas.
Controlador y red hija
En NAS, el controlador genera descripciones de arquitectura y la red hija se entrena y evalúa. La métrica de la hija proporciona realimentación al controlador.
Aprendizaje con pocos ejemplos (few-shot learning)
Capacidad de adaptarse a una tarea con una cantidad reducida de ejemplos etiquetados. En metaaprendizaje se entrena sobre muchas tareas y se evalúa la adaptación a tareas no vistas.
Metaentrenamiento y metaprueba
El metaentrenamiento usa una distribución de tareas para aprender el mecanismo de adaptación; la metaprueba mide ese mecanismo en tareas separadas, cada una con pocos datos propios.
12. Apéndice: mapa mental global de relaciones
mindmap
root((Sistemas cognitivos artificiales))
Representacion
Features
Deep learning
CNN
Word embeddings
RNN
Aprendizaje
Loss
Backpropagation
Optimizadores
Regularizacion
Meta learning
Decision
Agente
MDP
Politica
Q function
DQN
Escala
GPU
Entrenamiento distribuido
Nube
Serving
Ciclo de vida
Datos
Entrenamiento
Validacion
Despliegue
Monitorizacion
Reentrenamiento
Generacion
Modelo generativo
GAN
Generador
Discriminador
El mapa resume un recorrido común: los datos se convierten en representaciones; una función de pérdida guía el aprendizaje; las arquitecturas se especializan según el tipo de dato o decisión; el hardware permite escalar el cálculo; y el sistema productivo cierra el ciclo mediante validación, monitorización y actualización.
13. Referencias
Apache Software Foundation. (2024). Apache MXNet. The Apache Attic. https://attic.apache.org/projects/mxnet.html
Andrychowicz, M., Denil, M., Gómez, S., Hoffman, M. W., Pfau, D., Schaul, T., Shillingford, B., & de Freitas, N. (2016). Learning to learn by gradient descent by gradient descent. En Advances in Neural Information Processing Systems 29. https://proceedings.neurips.cc/paper_files/paper/2016/hash/fb87582825f9d28a8d42c5e5e5e8b23d-Abstract.html
Berkeley Vision and Learning Center. (s. f.). Caffe: A fast open framework for deep learning [Repositorio de código]. GitHub. Recuperado el 30 de agosto de 2026, de https://github.com/BVLC/caffe
Dean, J., Corrado, G., Monga, R., Chen, K., Devin, M., Mao, M., Ranzato, M. A., Senior, A., Tucker, P., Yang, K., Le, Q. V., & Ng, A. Y. (2012). Large scale distributed deep networks. En Advances in Neural Information Processing Systems 25. https://proceedings.neurips.cc/paper/2012/hash/6aca97005c68f1206823815f66102863-Abstract.html
Finn, C., Abbeel, P., & Levine, S. (2017). Model-agnostic meta-learning for fast adaptation of deep networks. En Proceedings of the 34th International Conference on Machine Learning (Vol. 70, pp. 1126-1135). PMLR. https://proceedings.mlr.press/v70/finn17a.html
Goodfellow, I., Bengio, Y., & Courville, A. (2016). Deep learning. MIT Press. https://www.deeplearningbook.org/
Goodfellow, I. J., Pouget-Abadie, J., Mirza, M., Xu, B., Warde-Farley, D., Ozair, S., Courville, A., & Bengio, Y. (2014). Generative adversarial nets. En Advances in Neural Information Processing Systems 27 (pp. 2672-2680). https://proceedings.neurips.cc/paper_files/paper/2014/hash/f033ed80deb0234979a61f95710dbe25-Abstract.html
Hochreiter, S., & Schmidhuber, J. (1997). Long short-term memory. Neural Computation, 9(8), 1735-1780. https://doi.org/10.1162/neco.1997.9.8.1735
Ioffe, S., & Szegedy, C. (2015). Batch normalization: Accelerating deep network training by reducing internal covariate shift. En Proceedings of the 32nd International Conference on Machine Learning (Vol. 37, pp. 448-456). PMLR. https://proceedings.mlr.press/v37/ioffe15.html
Keras Team. (s. f.). Keras 3. Recuperado el 30 de agosto de 2026, de https://keras.io/keras_3/
KServe Authors. (s. f.). KServe documentation. Recuperado el 30 de agosto de 2026, de https://kserve.github.io/website/docs/intro
Krizhevsky, A., Sutskever, I., & Hinton, G. E. (2012). ImageNet classification with deep convolutional neural networks. En Advances in Neural Information Processing Systems 25. https://proceedings.neurips.cc/paper/2012/hash/c399862d3b9d6b76c8436e924a68c45b-Abstract.html
LeCun, Y., Bengio, Y., & Hinton, G. (2015). Deep learning. Nature, 521, 436-444. https://doi.org/10.1038/nature14539
Mikolov, T., Sutskever, I., Chen, K., Corrado, G. S., & Dean, J. (2013). Distributed representations of words and phrases and their compositionality. En Advances in Neural Information Processing Systems 26. https://proceedings.neurips.cc/paper_files/paper/2013/hash/9aa42b31882ec039965f3c4923ce901b-Abstract.html
Microsoft. (s. f.). Microsoft Cognitive Toolkit (CNTK) [Repositorio de código archivado]. GitHub. Recuperado el 30 de agosto de 2026, de https://github.com/microsoft/CNTK
Mnih, V., Kavukcuoglu, K., Silver, D., Rusu, A. A., Veness, J., Bellemare, M. G., Graves, A., Riedmiller, M., Fidjeland, A. K., Ostrovski, G., Petersen, S., Beattie, C., Sadik, A., Antonoglou, I., King, H., Kumaran, D., Wierstra, D., Legg, S., & Hassabis, D. (2015). Human-level control through deep reinforcement learning. Nature, 518, 529-533. https://doi.org/10.1038/nature14236
NVIDIA. (2026). NVIDIA Triton Inference Server documentation. https://docs.nvidia.com/triton-inference-server/index.html
PyTensor Development Team. (s. f.). Getting started. Recuperado el 30 de agosto de 2026, de https://pytensor.readthedocs.io/en/latest/introduction.html
PyTorch Contributors. (s. f.). Contributing to PyTorch [Documentación del repositorio]. GitHub. Recuperado el 30 de agosto de 2026, de https://github.com/pytorch/pytorch/blob/main/CONTRIBUTING.md
RISELab. (s. f.). Clipper: A low-latency prediction-serving system [Repositorio de código]. GitHub. Recuperado el 30 de agosto de 2026, de https://github.com/ucbrise/clipper
Rumelhart, D. E., Hinton, G. E., & Williams, R. J. (1986). Learning representations by back-propagating errors. Nature, 323, 533-536. https://doi.org/10.1038/323533a0
Sculley, D., Holt, G., Golovin, D., Davydov, E., Phillips, T., Ebner, D., Chaudhary, V., Young, M., Crespo, J.-F., & Dennison, D. (2015). Hidden technical debt in machine learning systems. En Advances in Neural Information Processing Systems 28. https://proceedings.neurips.cc/paper/2015/hash/86df7dcfd896fcaf2674f757a2463eba-Abstract.html
TensorFlow. (s. f.). TensorFlow 1.x vs. TensorFlow 2: Behaviors and APIs. Recuperado el 30 de agosto de 2026, de https://www.tensorflow.org/guide/migrate/tf1_vs_tf2
Torch7 Contributors. (s. f.). Torch7 [Repositorio de código sin desarrollo activo]. GitHub. Recuperado el 30 de agosto de 2026, de https://github.com/torch/torch7
Universidad Internacional de La Rioja. (s. f.). Sistemas cognitivos artificiales [Material didáctico de maestría]. UNIR.
